Cos’è l’HTML
Prima di smontare pagine web, dovete imparare un po’ di HTML. Dovrete anche vedere come accedere ai potenti strumenti di sviluppo del vostro
browser, che renderanno molto più facile estrarre informazioni dal Web.
L’ HyperText Markup Language (HTML) è il formato in cui sono scritte le pagine web. Qui si dà per scontato che abbiate un minimo di esperienza con questo linguaggio, ma, se avete bisogno di un tutorial per iniziare a studiarlo, vi consiglio uno di questi siti:
http://htmldog.com/guides/html/beginner/
HTML & CSS Courses & Tutorials | Codecademy
Un ripasso rapido
Nel caso sia passato un po’ di tempo da quando avete usato HTML, ecco un breve ripasso degli elementi fondamentali. Un file HTML è un file di puro
testo con estensione .html. Il testo in questi file è racchiuso fra tag (marcatori), che sono parole fra parentesi angolari. Il tag dice al browser come formattare la pagina web; un tag di apertura e uno di chiusura racchiudono del testo e l’insieme forma un elemento. Il testo è il contenuto fra tag di apertura e di chiusura.
👉 Cosa sono i Tag
👉 La formattazione di una pagina
Per esempio, il seguente HTML visualizzerà Ciao mondo! nel browser, con Ciao in grassetto,
<strong>Ciao</strong> mondo!
Il tag <strong> di apertura dice che il testo seguente sarà visualizzato in grassetto. Il tag di chiusura </strong> dice al browser dove finisce il testo in grassetto.
HTML consente molti tag diversi, alcuni dei quali hanno proprietà aggiuntive sotto forma di attributi che vengono indicati all’interno delle parentesi angolari.
Per esempio, il tag <a> identifica testo che deve essere un link. L’URL a cui il testo rimanda è determinato dall’attributo href
<a href="https://matematicaoltre.altervista.org/articoli-piu-letti/" >Articoli di matematicaoltre </a>.
👉 I link in HTML
Alcuni elementi hanno un attributo id che viene utilizzato per identificare in modo univoco quell’elemento nella pagina. Spesso si dice al programma di cercare un elemento in base al suo attributo id, perciò stabilire quale sia l’attributo id di un elemento mediante gli strumenti per gli sviluppatori messi a disposizione dal browser è un compito comune nella scrittura di programmi di scraping.
Vedere l’HTML sorgente di una pagina web
Avrete bisogno di esaminare il sorgente HTML delle pagine web con cui lavoreranno i vostri programmi. Per poterlo fare, fate un clic destro (o Ctrl-clic sotto OS X) su una pagina nel vostro browser e selezionate Visualizza sorgente o Visualizza sorgente pagina, per vedere il testo HTML della pagina.

Quello è il testo che il vostro browser riceve effettivamente: il browser sa come visualizzare (o rendere) la pagina web a partire da quell’HTML.
Vi consiglio di esaminare il sorgente HTML di qualcuno dei siti che preferite. Non è importante se non capite del tutto quello che vi si presenta:
non vi servirà una completa padronanza dell’HTML per scrivere semplici programmi di web scraping – in fin dei conti, non dovrete costruire i vostri
siti web. Vi serve capire quel tanto che basta per estrarre dati da un sito esistente.
Dopo aver abilitato o installato gli strumenti per gli sviluppatori nel vostro browser, potete fare un clic destro su qualsiasi parte della pagina web e selezionare Ispeziona elemento dal menu di scelta rapida, per visualizzare il codice HTML a cui si deve quella parte della pagina, il che può essere utile quando inizierete ad analizzare l’HTML per i vostri programmi di web scraping.
Non utilizzate le espressioni regolari per analizzare HTML
Identificare un brano specifico di HTML in una stringa sembrerebbe un compito perfetto per le espressioni regolari, ma vi consiglio di non seguire questa strada. Vi sono molti modi diversi in cui il codice HTML può essere formattato in modo valido, ma cercare di catturare in un’espressione regolare tutte le varianti possibili potrebbe rivelarsi noioso e indurre facilmente in errore.
È meno probabile che provochi errori un modulo sviluppato specificamente per l’analisi di HTML, come Beautiful Soup.
Trovate QUI una breve introduzione a Beautiful Soup ed un primo esempio di web scraping, utilizzando questa libreria.
(141)
Altri articoli nella categoria "Lezioni di Python"
- Break-Even Point nel Franchising: Calcolo Avanzato, Automazione e Royalty (con Modelli in Python)
- Regressione lineare: esercizi progressivi dai minimi quadrati alla regressione multipla
- Microeconomia applicata: choke price, domanda esponenziale, segmentazione e prezzo ottimale – Parte 2
- Microeconomia applicata: choke price, prezzo di riserva massimo e prezzo ottimale
- Quanti Centri Ha una Figura Geometrica? Dal Baricentro al Pentagramma
- Microeconomia Computazionale: Come la Domanda di Mercato Emerge dai Comportamenti Individuali
- Legge di Benford e Data Quality nel Marketing: Guida, Formule ed Esercizi Python
- Microeconomia dell’AI: 6 esercizi matematici su costi, pricing, domanda ed elasticità
- Equazioni trascendenti: come risolverle con Python, dal punto fisso a Newton e Brent
- Equazioni Omogenee Esponenziali: Guida Pratica con Esercizi Svolti e Applicazioni