Un database gratuito dell'intero Web potrebbe generare il prossimo Google

È noto che Google ha iniziato come poco più di un algoritmo più efficiente per il ranking delle pagine Web. Ma l'azienda ha anche costruito il suo successo sulla scansione del Web, utilizzando un software che visita ogni pagina per creare un vasto indice di contenuti online.





Un'organizzazione senza scopo di lucro chiamata Scansione comune ora utilizza il proprio crawler Web e crea una copia gigante del Web che rende accessibile a chiunque. L'organizzazione offre oltre cinque miliardi di pagine Web, disponibili gratuitamente in modo che ricercatori e imprenditori possano provare cose altrimenti possibili solo per coloro che hanno accesso a risorse sulla scala di Google.

Il Web rappresenta, per quanto ne so, il più grande accumulo di conoscenza, e c'è così tanto che puoi costruire su di esso, afferma l'imprenditore Gilad Elbaz, che ha fondato Common Crawl. Ma semplicemente fare l'enorme quantità di lavoro necessaria per ottenere tutte quelle informazioni è un grande ostacolo; poche organizzazioni... hanno avuto le risorse per farlo.

I nuovi motori di ricerca sono solo una delle cose che possono essere costruite utilizzando un indice del Web, afferma Elbaz, che sottolinea che il software di traduzione di Google è stato addestrato utilizzando testo online disponibile in più lingue. L'unico modo in cui potevano farlo era iniziare con una scansione massiccia. Questo li ha messi sulla buona strada per costruire il Star Trek traduttore, dice. Avere un corpus aperto e condiviso di conoscenza umana è semplicemente un modo per democratizzare l'accesso alle informazioni che è fondamentale per l'innovazione.



Elbaz afferma di aver notato circa cinque anni fa che i ricercatori con nuove idee su come utilizzare i dati Web si sentivano in dovere di accettare lavori presso Google perché era l'unico posto in cui potevano testare quelle idee. Dice che i dati di Common Crawl renderanno più facile per nuove idee ottenere trazione, sia nel mondo delle startup che nella ricerca accademica.

Elbaz è il fondatore e CEO della società di big data Effettivo , e prima ancora ha fondato una società acquistata da Google per essere la base della sua attività pubblicitaria per le pagine Web. Common Crawl ha anche il direttore della ricerca di Google, Pietro Norvigo e direttore del MIT Media Lab Joi Ito nel suo comitato consultivo.

Finora Common Crawl ha indicizzato più di cinque miliardi di pagine, aggiungendo fino a 81 terabyte di dati, resi disponibili tramite il servizio di cloud computing di Amazon. Per circa $ 25 un programmatore potrebbe creare un account con Amazon e mettersi al lavoro elaborando i dati di Common Crawl, afferma Lisa Green, direttore di Common Crawl. Il Archivio Internet , un'altra no-profit, compila anche una copia del Web e offre un servizio chiamato il Macchina del ritorno che può mostrare vecchie versioni di una determinata pagina. Tuttavia, non consente a nessuno di analizzare tutti i suoi dati contemporaneamente in questo modo.



Common Crawl ha già ispirato o aiutato alcune nuove startup Web. TinEye , un motore di ricerca inversa che trova immagini simili a quella fornita dall'utente, ha utilizzato i primi dati di Common Crawl per iniziare. Il progetto personale di un programmatore che utilizza i dati di Common Crawl per misurare quante pagine del Web si connettono a Facebook— circa il 22 per cento, ha concluso —ha portato a ottenere finanziamenti per una startup, Ostrica fortunata , basato sull'aiutare le persone a trovare informazioni utili nei propri dati social.

Altre idee abilitate dal progetto sono emerse da un concorso lanciato lo scorso anno che ha assegnato premi per il i migliori casi d'uso . Uno dei vincitori ha utilizzato i link di Wikipedia nei dati di scansione per costruire un servizio in grado di definire i significati delle parole; un altro ha cercato di determinare atteggiamenti pubblici nei confronti della legislazione del Congresso analizzando il contenuto delle discussioni online sulle nuove leggi.

Rich Skrenta, cofondatore e CEO della startup dei motori di ricerca Blekko (vedi As Google Tinkers With Search, Upstarts Gain Ground ), afferma che i dati di Common Crawl soddisfano un'esigenza precisa nella comunità delle startup. Dice che Blekko è stata contattata da startup con tecnologia che necessitano di accesso a grandi raccolte di dati online. Questo tipo di dati è ora facilmente disponibile da Common Crawl, afferma Skrenta, la cui azienda ha contribuito con alcuni dei propri dati al progetto nel dicembre 2012. Blekko ha condiviso informazioni dal suo sistema che classifica le pagine Web in base al contenuto, ad esempio etichettando se contengono materiale pornografico. o spam.



Ben Zhao , un professore associato presso l'Università della California, Santa Barbara, che utilizza grandi raccolte di dati Web per la ricerca sull'attività sui siti social (vedi Hidden Industry Dupes Social Media Users ), afferma che i dati di Common Crawl sono probabilmente unici. Le scansioni recenti e su larga scala sono piuttosto rare e non sono personalmente a conoscenza di luoghi in cui ottenere dati di scansione di grandi dimensioni sul Web, afferma.

Tuttavia, Zhao nota che alcune delle parti più interessanti e preziose del Web non saranno ben rappresentate nei dati di Common Crawl: i siti social sono piuttosto sensibili al loro contenuto in questi giorni e molti implementano meccanismi anti-crawling per limitare la velocità a chiunque possono accedere al loro contenuto.

Per accedere a questi dati, i ricercatori devono allacciare relazioni con le aziende e fare affidamento su qualunque cosa rilasceranno, un percorso meno disponibile per le startup che possono essere viste come concorrenza.

nascondere