211service.com
Come Google classifica i tweet
Per fornire risultati di ricerca utili dal cosiddetto Web in tempo reale, come i tweet di Twitter vecchi di pochi secondi che segnalano ingorghi, Google ha adattato la sua tecnologia di pageranking e sviluppato nuovi trucchi e filtri algoritmici per mantenere i ritorni pertinenti, secondo un importante Ingegnere di Google.

Amit Singhal, Google Fellow
Google ha lanciato la tecnologia di ricerca in tempo reale il mese scorso, per offrire agli utenti l'accesso a nuovissimi post di blog e notizie molto più velocemente dei cinque o 15 minuti che in precedenza impiegavano i crawler Web di Google per scoprire gli elementi appena creati.
Bing, Cuil e altri motori di ricerca forniscono anche vari tipi di risultati in tempo reale. Sia Google che Bing hanno anche stretto importanti accordi con Twitter per ottenere l'accesso in tempo reale ai tweet, quei post di microblog di 140 caratteri inviati dai membri di Twitter. Ma Google afferma di offrire i risultati in tempo reale più completi scansionando titoli di notizie, blog e feed da Facebook, MySpace, Twitter e altre fonti.
I tweet sono un pilastro dei risultati in tempo reale di Google, ma Google non ha discusso in precedenza di come li classifica. Una strategia fondamentale di Google per identificare la pertinenza dei tweet è analoga a quella utilizzata dalla tecnologia PageRank di Google, che aiuta a trovare pagine Web pertinenti con la ricerca Web tradizionale. Sotto PageRank, Google giudica l'importanza delle pagine contenenti una determinata parola chiave di ricerca in parte osservando la struttura dei collegamenti delle pagine. Più pagine si collegano a una pagina e più pagine si collegano ai linker, più pertinente è la pagina originale.
Nel caso dei tweet, la chiave è identificare i follower rinomati, afferma Amit Singhal, un Google Fellow, che ha guidato lo sviluppo della ricerca in tempo reale. (Gli utenti di Twitter seguono i commenti di altri utenti di Twitter che hanno selezionato e sono essi stessi seguiti.)
Guadagni reputazione e poi dai reputazione. Se molte persone ti seguono e poi tu segui qualcuno, anche se questa [nuova persona] non ha molti follower, il suo tweet è considerato prezioso perché i suoi follower sono a loro volta ampiamente seguiti, afferma Singhal. È decisamente, decisamente più di un concorso di popolarità, aggiunge.
Un utente che segue un altro nei social media è analogo a una pagina che si collega a un'altra sul Web. Entrambi sono una forma di raccomandazione, dice Singhal. Poiché le pagine di alta qualità si collegano a un'altra pagina sul Web, la qualità della pagina collegata aumenta. Allo stesso modo, nei social media, poiché gli utenti consolidati seguono un altro utente, anche la qualità dell'utente seguito aumenta.
Ma i trucchi del social ranking di Google non sono certo l'unico metodo utilizzato dal gigante della ricerca per estrarre la pertinenza dai tweet. Google ha anche sviluppato nuovi modi per scegliere quali (se presenti) tweet emergono per termini comuni come Obama, e per evitare spam o tweet di bassa qualità, il tutto in pochi secondi.
Un problema con i tweet è che le persone spesso li riempiono di cosiddetti hashtag. Si tratta di simboli che iniziano con un cancelletto (#) seguito da una parola che rappresenta un argomento di attualità molto in voga, come Nexus One o Terremoto o quant'altro possa essere un argomento di tendenza in questo momento. Quando un hashtag è incluso in un tweet, il tweet risultante verrà visualizzato quando altri utenti di Twitter fanno clic sulla parola dell'argomento dell'hashtag in un altro punto del sito.
Sebbene tali tag possano massimizzare utilmente l'esposizione di un tweet, possono anche fungere da campanelli d'allarme per abbassare la qualità del tweet e attirare contenuti simili a spam, afferma Singhal. Anche se non entrerebbe nei dettagli, ha affermato che Google ha modellato questo comportamento di hashtagging in modi che tendono a ridurre l'esposizione dei tweet di bassa qualità. Avevamo bisogno di modellare quel comportamento [di hashtagging]. Questa è la sfida tecnica che abbiamo affrontato con i nostri approcci alla modellazione, afferma Singhal.
Un altro problema: come, se qualcuno sta cercando Obama, setacciare i tweet della stampa della Casa Bianca e migliaia di altri per trovare le informazioni più tempestive e attuali. Google scansiona i tweet per trovare il segnale nel rumore, dice. Un tale segnale potrebbe includere un nuovo assalto di tweet e altri blog che menzionano la polizia di Cambridge o Harry Reid quasi menzioni di Obama. Cercando tali segnali, Google è in grado di fornire risultati in tempo reale che contengono l'argomento più fresco anche per termini di ricerca molto comuni.
In futuro, sia Twitter che Google sperano di migliorare la pertinenza dei risultati di ricerca in tutti i contesti aggiungendo dati di geolocalizzazione, che possono essere aggiunti ai post inviati dagli smartphone. In generale, la ricerca in tempo reale si sta evolvendo, afferma Dylan Casey, product manager di Google per la ricerca in tempo reale. Parlo regolarmente con i ragazzi di Twitter per sapere dove sta andando la funzione. Riceviamo feedback da loro, diamo loro feedback e i nostri ingegneri collaborano. È veramente simbiotico.
Singhal ha aggiunto che Twitter non è certo l'unica fonte di informazioni in tempo reale. Twitter è davvero una componente molto importante del Web in tempo reale. Tuttavia, ciò che stiamo osservando è che è solo uno dei componenti. C'è molto valore nelle notizie, nei blog e nelle pagine Web che vengono generate in tempo reale, perché le organizzazioni di notizie lavorano molto duramente per portare la qualità a un certo livello, dice. Twitter è davvero utile perché è un contenuto di breve durata. Tuttavia, stiamo scoprendo che il Web in tempo reale è molto più grande.