211service.com
Una ragnatela per tutti
Poiché la quantità di informazioni su Internet continua a crescere, aumenta anche la domanda su come elaborarle tutte e renderle utili. Una startup chiamata 80 gambe , con sede a Houston, TX, spera che un servizio di scansione Web distribuito e poco costoso possa aiutare le startup a estrarre informazioni dal Web senza dover creare le gigantesche server farm utilizzate dai principali motori di ricerca. L'azienda ha lanciato questa settimana a DEMO, una conferenza a San Diego che mette in mostra le nuove aziende.
I web crawler, o spider, sono software che visitano automaticamente le pagine su Internet e possono essere utilizzati per indicizzarle e raccogliere bit di informazioni da pagine diverse. I crawler vengono utilizzati dai motori di ricerca, ad esempio, per monitorare la posizione delle informazioni sul Web. Ma la portata del Web significa che la scansione completa consuma molta potenza di elaborazione, il che in genere significa costruire enormi data center per alimentare il software.
80legs spera di rendere questa tecnologia più accessibile alle piccole aziende e ai privati consentendo l'accesso al leasing e consentendo ai clienti di pagare solo per ciò che scansionano.
La tecnologia di scansione del Web è fondamentale anche per i siti ei servizi semantici progettati per elaborare le query in linguaggio naturale. Mentre 80legs si aspetta di vedere utenti interessati alla ricerca e alle applicazioni semantiche, il CEO Shion Deysarkar afferma che coloro che hanno testato il servizio includevano anche clienti con interessi meno tecnici. Alcuni ricercatori di mercato, ad esempio, utilizzano 80legs per scoprire menzioni di aziende o argomenti specifici sul Web.
Un utente può avviare una scansione Web tramite l'interfaccia basata sul Web di 80legs. Il modulo sul sito dell'azienda consente loro di impostare i parametri per il progetto e caricare il codice personalizzato necessario per controllare come il crawler svolge il proprio lavoro. Ad esempio, un utente potrebbe volere che il crawler trovi le immagini e le controlli in un database di quelle protette da copyright. Deysarkar afferma che i crawler della sua azienda sono in grado di elaborare fino a due miliardi di pagine al giorno. La società addebita $ 2 per ogni milione di pagine scansionate, più una commissione di tre centesimi per ogni ora di elaborazione utilizzata.
Molte startup faticano a trovare i fondi necessari per costruire grandi data center, ma non è questo l'approccio adottato da 80legs per costruire la sua infrastruttura di scansione del Web. L'azienda invece esegue il suo software su una rete distribuita di personal computer, molto simili a quelli utilizzati per progetti comeSETI @ home. La rete di calcolo distribuito è messa insieme da Plura Processing, che la affitta a 80legs. Plura consente agli utenti di computer di fornire potenza di elaborazione inutilizzata in cambio dell'accesso a giochi, donazioni a enti di beneficenza e altri premi.
Deysarkar afferma che l'approccio riduce significativamente i costi per 80legs, consentendo all'azienda di offrire il proprio servizio a molto meno di quanto sarebbe possibile se utilizzasse un data center o persino un servizio di cloud computing come Amazon Web Services.
Daniel Tunkelang, cofondatore della società di ricerca Endeca , con sede a Cambridge, MA, afferma che un buon servizio di scansione del Web potrebbe essere utile per le startup che desiderano concentrarsi sulla costruzione dell'esperienza di ricerca piuttosto che sulla raccolta dei dati. Ma Tunkelang afferma che il successo di 80legs può dipendere da quanto sia facile per gli utenti personalizzare la scansione. La grande domanda è: quanto è adattabile e programmabile la scansione? lui dice.
Tunkelang osserva inoltre che è importante per un crawler Web acquisire quante più informazioni possibili. Ad esempio, il percorso seguito da un crawler per arrivare a una determinata pagina può fornire a una società di ricerca informazioni utili sui contenuti di quella pagina.
Un servizio come 80legs potrebbe essere utile anche per i ricercatori universitari. La scansione su larga scala è davvero un costoso ostacolo da superare per i progetti di ricerca sperimentali nel mondo accademico, che spesso mancano di infrastrutture su larga scala, afferma Kevin Chang , professore associato di informatica presso l'Università dell'Illinois a Urbana-Champaign.
Chang pensa che la natura distribuita di 80legs sia una direzione interessante e sembra promettente [per abbassare] il costo del gattonare. Allo stesso tempo, concorda sul fatto che molto dipende dall'efficienza del sistema operativo e dall'efficacia con cui gli utenti possono personalizzare i dati che desiderano elaborare.
80legs prevede di lanciare un mercato in cui gli utenti non tecnici potranno acquistare applicazioni in grado di controllare il funzionamento di un crawler. Le aziende partner potranno anche vendere l'accesso alle applicazioni che controllano i crawler di 80legs.