Webscraping. Le basi.

Cerca nel sito

Altri risultati..

Generic selectors
Exact matches only
Search in title
Search in content
Post Type Selectors

Cerca nelle Categorie

webscraping

 

Cos’è l’HTML

Prima di smontare pagine web, dovete imparare un po’ di HTML. Dovrete anche vedere come accedere ai potenti strumenti di sviluppo del vostro
browser, che renderanno molto più facile estrarre informazioni dal Web.

L’ HyperText Markup Language (HTML) è il formato in cui sono scritte le pagine web. Qui si dà per scontato che abbiate un minimo di esperienza con questo linguaggio, ma, se avete bisogno di un tutorial per iniziare a studiarlo, vi consiglio uno di questi siti:

http://htmldog.com/guides/html/beginner/

HTML & CSS Courses & Tutorials | Codecademy

 

Un ripasso rapido

Nel caso sia passato un po’ di tempo da quando avete usato HTML, ecco un breve ripasso degli elementi fondamentali. Un file HTML è un file di puro
testo con estensione .html. Il testo in questi file è racchiuso fra tag (marcatori), che sono parole fra parentesi angolari. Il tag dice al browser come formattare la pagina web; un tag di apertura e uno di chiusura racchiudono del testo e l’insieme forma un elemento. Il testo è il contenuto fra tag di apertura e di chiusura.

 

👉 Cosa sono i Tag

 

👉 La formattazione di una pagina

Per esempio, il seguente HTML visualizzerà Ciao mondo! nel browser, con Ciao in grassetto,

<strong>Ciao</strong> mondo!

Il tag <strong> di apertura dice che il testo seguente sarà visualizzato in grassetto. Il tag di chiusura </strong> dice al browser dove finisce il testo in grassetto.

HTML consente molti tag diversi, alcuni dei quali hanno proprietà aggiuntive sotto forma di attributi che vengono indicati all’interno delle parentesi angolari.

Ti potrebbe interessare anche:  Vuoi imparare Python in.........123 minuti?

Per esempio, il tag  <a> identifica testo che deve essere un link. L’URL a cui il testo rimanda è determinato dall’attributo href

Ecco un esempio:

<a href="https://matematicaoltre.altervista.org/articoli-piu-letti/" >Articoli di matematicaoltre </a>.

 

👉 I link in HTML

Alcuni elementi hanno un attributo id che viene utilizzato per identificare in modo univoco quell’elemento nella pagina. Spesso si dice al programma di cercare un elemento in base al suo attributo id, perciò stabilire quale sia l’attributo id di un elemento mediante gli strumenti per gli sviluppatori messi a disposizione dal browser è un compito comune nella scrittura di programmi di scraping.

 

Vedere l’HTML sorgente di una pagina web

Avrete bisogno di esaminare il sorgente HTML delle pagine web con cui lavoreranno i vostri programmi. Per poterlo fare, fate un clic destro (o Ctrl-clic sotto OS X) su una pagina nel vostro browser e selezionate Visualizza sorgente o Visualizza sorgente pagina, per vedere il testo HTML della pagina.

webscraping

Quello è il testo che il vostro browser riceve effettivamente: il browser sa come visualizzare (o rendere) la pagina web a partire da quell’HTML.

Vi consiglio di esaminare il sorgente HTML di qualcuno dei siti che preferite. Non è importante se non capite del tutto quello che vi si presenta:
non vi servirà una completa padronanza dell’HTML per scrivere semplici programmi di web scraping – in fin dei conti, non dovrete costruire i vostri
siti web. Vi serve capire quel tanto che basta per estrarre dati da un sito esistente.

Dopo aver abilitato o installato gli strumenti per gli sviluppatori nel vostro browser, potete fare un clic destro su qualsiasi parte della pagina web e selezionare Ispeziona elemento dal menu di scelta rapida, per visualizzare il codice HTML a cui si deve quella parte della pagina, il che può essere utile quando inizierete ad analizzare l’HTML per i vostri programmi di web scraping.

Ti potrebbe interessare anche:  Python: approfondiamo le funzioni

Non utilizzate le espressioni regolari per analizzare HTML

Identificare un brano specifico di HTML in una stringa sembrerebbe un compito perfetto per le espressioni regolari, ma vi consiglio di non seguire questa strada. Vi sono molti modi diversi in cui il codice HTML può essere formattato in modo valido, ma cercare di catturare in un’espressione regolare tutte le varianti possibili potrebbe rivelarsi noioso e indurre facilmente in errore.
È meno probabile che provochi errori un modulo sviluppato specificamente per l’analisi di HTML, come Beautiful Soup. 

Trovate QUI una breve introduzione a Beautiful Soup ed un primo esempio di web scraping, utilizzando questa libreria.

 

 

(141)

PubblicitàPubblicità