Un garage, uno chef e l’autorevolezza

Cerca nel sito

Altri risultati..

Generic selectors
Exact matches only
Search in title
Search in content
Post Type Selectors

Cerca nelle Categorie

Google PageRank

” Il computer di Star Trek non sembra tanto interessante.
Gli chiedono delle cose a caso, lui ci pensa per un po’.
Penso che possiamo fare di meglio.”

Larry Page (cofondatore di Google)

Dal punto di vista architettonico, il garage è una struttura normalmente modesta, ma nella Silicon Valley i garage hanno un significato imprenditoriale speciale: molte fra le grandi aziende di tecnologia della “valle del silicio” sono nate, o almeno hanno avuto la loro fase di incubazione, in un garage.

E non è una tendenza iniziata con il boom delle dot.com negli anni novanta: oltre 50 anni prima, nel 1939, quando l’economia mondiale ancora cercava di riprendersi dalla Grande depressione, la Hewlett-Packard ha mosso i suoi primi passi nel garage di Dave Hewlett a Palo Alto in California.

Parecchi decenni più tardi, nel 1976, Steve Jobs e Steve Wozniak si sono messi a lavorare nel garage di Jobs a Los Altos, sempre in California, dopo aver fondato la loro azienda, quella Apple che oggi è diventata leggendaria. (Anche se le leggende popolari vorrebbero che la Apple sia stata fondata nel garage, Jobs e Wozniak in realtà hanno cominciato a lavorare in una camera da letto, ma sono rimasti in fretta a corto di spazio e hanno dovuto trasferirsi nel garage.) Forse ancor più degno di nota dei primi passi di HP e Apple è il lancio di un motore di ricerca, chiamato Google, che era in funzione in un garage di Menlo Park in California, quando l’azienda è stata ufficialmente fondata nel 1998.

PageRank: la tecnologia che ha lanciato Google

In quel momento Google aveva già attivato il suo servizio di ricerca per il Web da oltre un anno, inizialmente dai server della Stanford University, dove entrambi i soci fondatori erano studenti di dottorato. Solo quando l’ampiezza di banda necessaria per la crescente popolarità del servizio divenne eccessiva per Stanford i due studenti, Larry Page e Sergey Brin, spostarono la loro sede operativa nel garage, oggi famoso, di Menlo Park.

Devono aver fatto proprio le cose per bene, perché solo tre mesi dopo la costituzione legale della società Google è stato indicato da PC Magazine come uno dei 100 migliori siti del 1998.

E qui comincia davvero la nostra storia: secondo le parole di PC Magazine, Google si era meritato quel posto in classifica per la sua “infallibile capacità di restituire risultati estremamente pertinenti”.

I primi motori di ricerca commerciali erano stati lanciati quattro anni prima, nel 1994: come ha fatto Google dal suo garage a compensare questo ritardo di quattro anni, saltando a piè pari davanti ai già diffusi Lycos e AltaVista per quel che riguarda la qualità delle ricerche?

La domanda non ammette una risposta semplice, ma uno dei fattori più importanti, in particolare in quei primi tempi, è stato l’algoritmo innovativo utilizzato da Google per ordinare i risultati delle ricerche: un algoritmo noto con il nome di PageRank.

È un po’ un gioco di parole: è un algoritmo che ordina pagine (page, in inglese), ma è anche l’algoritmo di ordinamento di Larry Page, il suo principale inventore.

Page e Brin hanno reso pubblico l’algoritmo nel 1998, in un saggio di un convegno accademico, “The Anatomy of a Large-scale Hypertextual Web Search Engine”. Come fa pensare già il titolo, il saggio fa molto di più che descrivere PageRank: è a tutti gli effetti una descrizione completa del sistema Google, allo stato in cui era nel 1998. Sepolta fra i particolari tecnici del sistema c’è una descrizione di quella che può ben essere considerata la prima gemma algoritmica destinata a emergere nel ventunesimo secolo: l’algoritmo PageRank.

L’algoritmo PageRank

Proveremo, dunque, a capire come e perché questo algoritmo è in grado di trovare aghi nei pagliai, fornendo coerentemente i risultati più pertinenti come top hit di una interrogazione di ricerca.

Evoluzione dell’algoritmo di Google e E-E-A-T:

L’algoritmo di Google è in continua evoluzione. Sebbene PageRank abbia gettato le basi, oggi Google considera molti altri fattori. Uno dei più importanti è il concetto di E-E-A-T (Esperienza, Expertise, Autorevolezza, Affidabilità). Google vuole premiare i contenuti creati da esperti con esperienza, che dimostrino autorevolezza nel loro campo e che siano affidabili. Questo significa che, oltre ai link, la qualità dei contenuti, la reputazione dell’autore e la credibilità del sito web sono fondamentali.

Cos’è un  collegamento ipertestuale

Probabilmente sapete già che cos’è un collegamento ipertestuale o hyperlink: è un’espressione contenuta in una pagina web che porta a un’altra pagina web quando viene attivata (con un clic del mouse o qualche altro metodo).

Tuttavia, potete non sapere che quella dei collegamenti ipertestuali è un’idea sorprendentemente vecchia.

Nel 1945, più o meno contemporaneamente ai primi sviluppi dei computer elettronici stessi, l’ingegnere americano Vannevar Bush pubblicava un saggio visionario, “As We May Think”. In quel saggio di ampia portata, Bush descriveva una serie di potenziali nuove tecnologie, fra cui una macchina che chiamava memex.

Ti potrebbe interessare anche:  Gli Antenati dei motori di ricerca e della SEO

Un memex avrebbe memorizzato documenti e li avrebbe automaticamente indicizzati, ma avrebbe fatto anche molto di più. Avrebbe consentito “l’indicizzazione associativa … per cui qualsiasi elemento si può fare in modo che a comando ne selezioni immediatamente e automaticamente un altro”, in altre parole, una forma rudimentale di collegamento ipertestuale!

I collegamenti ipertestuali hanno fatto molta strada dal 1945. Sono uno degli strumenti più importanti utilizzati dai motori di ricerca per effettuare l’ordinamento e sono fondamentali per la tecnologia PageRank di Google, che ora cominceremo a esplorare seriamente.

Il primo passo per capire PageRank è un’idea semplice, che chiameremo trucco del collegamento ipertestuale.

Il modo migliore di spiegarlo è con un esempio.

Supponiamo siate interessati a scoprire come si preparano le uova strapazzate e facciate una ricerca nel Web su questo argomento. Qualsiasi ricerca nel Web reale produrrebbe milioni di risultati, ma, per semplicità, supponiamo che escano solo due pagine, una che si chiama “La ricetta delle uova strapazzate di Ernie”, mentre l’altra è “La ricetta delle uova strapazzate di Bert”.

Supponiamo anche che esistano alcune altre pagine web che hanno collegamenti ipertestuali o alla ricetta di Bert o a quella di Ernie. Per semplicità (ancora), immaginiamo che le  pagine mostrate siano quattro e che siano le uniche pagine in tutto il Web che hanno un collegamento all’una o all’altra ricetta. Per la precisione tre di queste hanno un collegamento alla pagina di Bert ed una sola a quella di Ernie.

La domanda è: quale dei due risultati deve occupare il primo posto in classifica, la ricetta di Bert o la ricetta di Ernie?

Da esseri umani, non faremmo molta fatica a leggere le pagine che si collegano alle due ricette e a farci una nostra valutazione. Sembra che entrambe le ricette siano buone, ma le persone mostrano molto più entusiasmo per la ricetta di Bert che per quella di Ernie.

In mancanza di ulteriori informazioni, quindi, probabilmente ha più senso che Bert stia in classifica prima di Ernie.

Purtroppo i computer non sono molto bravi a capire il significato effettivo di una pagina web, perciò un motore di ricerca non può esaminare le quattro pagine che si collegano ai due risultati e valutare con quanto entusiasmo ciascuna ricetta venga consigliata.

I computer però eccellono nel contare, perciò un metodo semplice è quello di contare quante pagine si collegano a ciascuna delle ricette (in questo caso sono una per Ernie e tre per Bert) e ordinare le ricette in base al numero dei collegamenti in entrata. Ovviamente questo metodo non ha la stessa precisione che potrebbe avere un essere umano che leggesse tutte le pagine e determinasse l’ordinamento manualmente, ma è comunque una tecnica utile.

Importanza dei link oggi:

Nonostante i cambiamenti, i link rimangono un segnale importante per Google. I link da siti web autorevoli sono visti come un voto di fiducia, indicando che il tuo sito è considerato una risorsa valida. Tuttavia, la qualità dei link è più importante della quantità. Google penalizza i link artificiali o manipolativi, quindi è essenziale concentrarsi sull’ottenimento di link naturali da siti web pertinenti.

Quando un sito è “autorevole” ?

Statisticamente, in assenza di altre informazioni, il numero dei collegamenti in ingresso può essere un buon indicatore di quanto è probabile che la pagina sia utile, ovvero “autorevole”.

In questo caso il punteggio è Bert 3, Ernie 1, perciò la pagina di Bert finisce più in alto in classifica quando il motore di ricerca presenta i suoi risultati all’utente.

Probabilmente avrete già ravvisato qualche possibile problema nella classifica basata sui collegamenti ipertestuali. Una questione ovvia è che a volte i collegamenti sono utilizzati per giudizi negativi anziché positivi. Per esempio, immaginatevi una pagina web con un collegamento alla ricetta di Ernie e che dica “Ho provato la ricetta di Ernie, ed è terribile”. Collegamenti come questo, che criticano una pagina anziché consigliarla, fanno effettivamente in modo che il criterio del collegamento ipertestuale attribuisca a certe pagine un posto migliore in classifica di quel che meriterebbero. Ma nella pratica si dà il caso che i collegamenti ipertestuali siano più spesso consigli anziché critiche, perciò il trucco rimane utile nonostante quest’ovvia debolezza.

Il criterio dell’autorevolezza

Forse vi sarete già chiesti perché i collegamenti in ingresso a una pagina debbano essere trattati tutti allo stesso modo. Una raccomandazione da parte di un esperto non vale di più di quella di chi è alle prime armi? Torniamo all’esempio precedente delle uova strapazzate, ma ora con un diverso insieme di collegamenti in ingresso.

Ti potrebbe interessare anche:  Python: Guida alle espressioni regolari: le funzioni re.search, re.findall e re.finditer

Ecco la nuova situazione: le pagine di Bert e Ernie ora hanno lo stesso numero di collegamenti in ingresso (solo uno), ma quello che va a Ernie parte dalla  pagina di un tale Augusto Giovinelli, mentre quello di Bert arriva dal famoso chef Cracco.

In assenza di altre informazioni, quale ricetta scegliereste? Ovviamente, è meglio scegliere quella consigliata da un famoso chef, anziché quella consigliata da uno “sconosciuto”.

Questo principio di base è quello che chiameremo il “criterio dell’autorevolezza”: i collegamenti che arrivano da pagine con elevata “autorevolezza” contribuiranno a un avanzamento in classifica più di quelli che arrivano da pagine con minore autorevolezza.

Il principio è ottimo, ma in questa forma è del tutto inservibile per i motori di ricerca. Come fa un computer a stabilire automaticamente che l’autorevolezza di  chef Cracco quando parla di uova strapazzate è molto maggiore di quella di Augusto? Ecco un’idea che potrebbe aiutarci: combiniamo il criterio del collegamento ipertestuale con quello dell’autorevolezza.

Tutte le pagine inizialmente hanno autorevolezza 1, ma se una pagina ha collegamenti ipertestuali in ingresso, la sua autorevolezza si calcola sommando l’autorevolezza di tutte le pagine che hanno un collegamento ad essa. In altre parole, se le pagine X e Y hanno collegamenti alla pagina Z, l’autorevolezza di Z è la somma dell’autorevolezza di X e di quella di Y.

Il ciclo dei collegamenti ipertestuali

La nostra definizione di “valore (o punteggio) di autorevolezza” (che combina il trucco del collegamento ipertestuale e quello dell’autorevolezza) finisce in guai seri ogni volta che c’è un ciclo.

Vediamo che cosa succede in questo particolare esempio. Google PageRank il ciclo di collegamenti ipertestuali

Google PageRank il ciclo di collegamenti ipertestuali

Le pagine C e D non hanno collegamenti in ingresso, perciò la loro autorevolezza è 1. C e D hanno entrambi un collegamento ad A, perciò il punteggio di A è la somma di quelli di C e D, ovvero 1 + 1 = 2. Poi B riceve il punteggio 2 da A, E riceve il punteggio 2 da B. (La situazione fin qui è riassunta nella parte sinistra della figura.) Ma a questo punto A non è più aggiornato: riceve ancora 1 sia da C sia da D, ma riceve anche un 2 da E, per un totale di 4. Ma ora non è più aggiornato B: riceve un 4 da A. Ma poi bisogna aggiornare anche E, che prende un 4 da B. (Ora siamo alla situazione della parte destra della figura.) E così via: ora A è 6, perciò B è 6 ed E è 6, ma allora A è 8, …

Avete sicuramente afferrato l’idea.

Continueremmo all’infinito, con i punteggi che continuano ad aumentare a ogni ciclo.

Se si calcola l’autorevolezza in questo modo, si finisce in un problema “uovo o gallina”. Se si conosce l’autorevolezza di A, si può calcolare quella di B ed E; e se si conosce l’autorevolezza di B ed E, si può calcolare quella di A. Ma siccome ciascuna dipende dalle altre, il problema sembra insolubile.

Il criterio del “navigatore casuale”

Per fortuna il problema si può risolvere con una tecnica che chiameremo ” del navigatore casuale.

Fate attenzione: la descrizione iniziale di questo criterio non ha alcuna somiglianza con quelli del collegamento ipertestuale e dell’autorevolezza di cui abbiamo parlato fin qui. Una volta che avremo visto i meccanismi fondamentali del criterio del navigatore casuale, analizzeremo le sue notevoli proprietà: in effetti, combina i tratti positivi degli altri due, ma funziona anche quando sono presenti cicli di collegamenti ipertestuali.

Immaginiamo una persona che navighi a caso in Internet. Per essere più precisi, il nostro navigatore parte da una pagina scelta a caso da tutto il World Wide Web. Poi esamina tutti i collegamenti ipertestuali che partono da quella pagina, ne sceglie uno a caso e ci fa clic sopra. Poi esamina la nuova pagina e sceglie a caso uno dei suoi collegamenti ipertestuali. Il procedimento continua, e ogni nuova pagina viene scelta a caso facendo un clic su un collegamento ipertestuale nella pagina precedente.

Google PageRank

La Figura mostra un esempio, in cui immaginiamo che tutto il World Wide Web sia costituito da 16 pagine soltanto. I rettangoli rappresentano pagine web, le frecce rappresentano collegamenti ipertestuali fra le pagine. Ci sono quattro pagine identificate come A, B, C, D, per semplificare i ragionamenti successivi. Le pagine visitate dal navigatore sono in grigio più scuro, i collegamenti che segue sono in nero e le frecce tratteggiate rappresentano ripartenze casuali, di cui diremo fra poco.

C’è una particolarità nel procedimento: ogni volta che viene visitata una pagina, c’è una probabilità di ripartenza costante (poniamo il 15%) che il navigatore non faccia clic su uno dei collegamenti ipertestuali disponibili ma riavvii il procedimento scegliendo un’altra pagina a caso da tutto il Web. Potete pensare che c’è un 15% di probabilità che il navigatore si annoi, data una qualsiasi pagina, e che decida di seguire una nuova catena di collegamenti. Per qualche esempio, esaminate meglio la figura. Questo particolare navigatore è partito dalla pagina A e ha seguito tre collegamenti ipertestuali a caso prima di arrivare alla pagina B, annoiarsi e ripartire dalla pagina C. Dopo aver seguito due altri collegamenti a caso, una nuova ripartenza. (Incidentalmente, tutti gli esempi di navigatori casuali  utilizzano una probabilità di ripartenza del 15%, che è la stessa utilizzata dai due fondatori di Google, Page e Brin, nell’articolo originale che descriveva il prototipo del loro motore di ricerca.)

Ti potrebbe interessare anche:  Metodo Monte Carlo: Risolvere l'Impossibile con la Potenza del Caso

Qual è il legame fra il nostro modello del visitatore casuale e il trucco dell’autorevolezza che vorremmo utilizzare per ordinare le pagine web?

Definiamo allora punteggio di autorevolezza del navigatore di una pagina web come la percentuale del tempo che un navigatore casuale dedicherebbe a visitare quella pagina. Cosa notevole, il punteggio di autorevolezza del navigatore incorpora entrambi i nostri trucchi precedenti per ordinare per importanza le pagine web. Li esamineremo uno alla volta.

Innanzitutto, avevamo il trucco del collegamento ipertestuale: l’idea di fondo qui è che una pagina con molti collegamenti in ingresso debba avere una posizione migliore. Questo è vero anche nel modello del navigatore casuale, perché una pagina con molti collegamenti in ingresso ha molte probabilità di essere visitata. La pagina D nella parte inferiore della figura nella pagina seguente è un buon esempio: ha cinque collegamenti in ingresso, più di ogni altra pagina nella simulazione, e finisce per avere il punteggio di autorevolezza del navigatore più alto (15%).

Punteggi di autorevolezza del navigatore casuale per l’esempio precedente con un ciclo di collegamenti ipertestuale. Il criterio del navigatore casuale non ha difficoltà a calcolare punteggi appropriati, nonostante la presenza di un ciclo (A→ B → E → A).

 

Val la pena anche di notare che i motori di ricerca determinano i loro ordinamenti utilizzando molto di più di un semplice algoritmo di ordinamento basato sui collegamenti come PageRank. Già nella loro descrizione di Google nel 1998, i suoi due fondatori citavano parecchie altre caratteristiche che contribuivano all’ordinamento dei risultati delle ricerche. Come potete immaginare, la tecnologia è andata avanti: attualmente, il sito web di Google dichiara che, per valutare l’importanza di una pagina, vengono utilizzati “oltre 500 segnali”.

Nonostante le molte complessità dei motori di ricerca moderni, la bella idea al cuore di PageRank, cioè che le pagine autorevoli possano conferire autorevolezza ad altre pagine attraverso i collegamenti ipertestuali, rimane valida. Questa idea ha aiutato Google a detronizzare AltaVista, trasformandola da piccola startup a regina delle ricerche in pochi mesi.

Senza l’idea centrale di PageRank, la maggior parte delle interrogazioni annegherebbero in un mare di pagine web irrilevanti. PageRank è in effetti una gemma algoritmica grazie alla quale un ago può salire senza fatica in cima al suo pagliaio.

Come migliorare l’autorevolezza del sito:

I webmaster possono migliorare l’autorevolezza del loro sito web in diversi modi:

Creando contenuti di alta qualità, originali e informativi, che rispondano alle esigenze degli utenti.

Ottenendo link da siti web autorevoli e pertinenti al proprio settore.

Migliorando l’esperienza utente del sito web, rendendolo facile da navigare e veloce da caricare.

Costruendo la propria reputazione online, partecipando a discussioni del settore e interagendo con gli utenti sui social media.

Migliorando i fattori E-E-A-T, dimostrando esperienza, competenza, autorevolezza ed affidabilità.

 

 

(103)

PubblicitàPubblicità