Prepararsi per il Diluvio di Dati

Da Facebook al Dipartimento dell'Autoveicolo, il mondo è catalogato in banche dati. Nessuno lo sa meglio del professore a contratto e imprenditore del MIT Michael Stonebraker , che ha trascorso gli ultimi 25 anni a sviluppare la tecnologia che lo ha reso tale. Ha ottenuto la sua grande occasione inventando e commercializzando la tecnologia che è alla base della maggior parte dei database, noti come database relazionali, che regolano oggi. Ma Stonebraker ora definisce felicemente le sue precedenti invenzioni in gran parte obsolete. Sta lavorando a una nuova generazione di tecnologia di database in grado di gestire il flusso di dati digitali che sta iniziando a sopraffare i metodi consolidati.





I database relazionali sono onnipresenti come soluzione per i dati aziendali. Hanno avuto un successo favoloso, dice Stonebraker. Ma dice che i più grandi fornitori di database, tra cui Oracle, IBM e Microsoft, vendono ancora tali prodotti come appropriati per qualsiasi attività commerciale. Stonebraker ha una visione diversa: che sono necessarie nuove tecnologie di database per gestire gli aumenti esponenziali delle informazioni che le aziende devono gestire. Stonebraker, 67 anni, sta già trovando successo con molti dei suoi nuovi approcci.

Uno è un sistema di database chiamato C-Store . A differenza della maggior parte dei sistemi oggi in uso, memorizza i dati sul disco colonna per colonna, non riga per riga. Questa semplice modifica ha richiesto una riscrittura completa del funzionamento dei database, ma si integra perfettamente sia con il modo in cui funziona la memoria del computer sia con il modo in cui si accede ai database. Ciò produce prestazioni molto più veloci e dati più compressi.

Quel ritocco e altri fatti da Stonebraker e dai colleghi del MIT, Brown, Brandeis, Yale e l'Università del Massachusetts hanno permesso il lancio di Vertica , una società che ha commercializzato C-Store e ha aiutato i clienti a interrogare database di grandi dimensioni quasi in tempo reale. Vertica è stata acquisita da Hewlett-Packard a febbraio e vanta clienti tra cui Comcast, che lo utilizza per monitorare i milioni di dispositivi che compongono le sue reti TV e Internet, e Groupon, che lo utilizza per analizzare le azioni dei suoi milioni di abbonati.



Un sistema correlato di Stonebraker e alcuni degli stessi colleghi accademici, H-Store , si basa sulle stesse idee con ulteriori miglioramenti come l'esecuzione interamente nella memoria di un computer, non su disco; questo metodo è particolarmente utile nell'elaborazione delle transazioni online. Il codice di H-Store è open source, ma la tecnologia viene commercializzata da venture-backed VoltDB , con Stonebraker come CTO. Sostiene che questo tipo di sistema di database specifico per l'uso e costruito per la velocità è ciò che la maggior parte delle aziende dovrà adottare prima piuttosto che dopo per far fronte al flusso di dati digitali.

Alcune organizzazioni sono già intrappolate in quell'alluvione. Considera Facebook. Facebook già ospita più foto digitali di qualsiasi altra azienda, Facebook sta costruendo una nuova infrastruttura di archiviazione ed elaborazione il più velocemente possibile. Eppure sta spingendo al limite la tecnologia di database che sta utilizzando, suddividendo il suo famoso social graph in 4.000 database che devono funzionare tutti insieme come uno, afferma Stonebraker. Stanno morendo sotto il carico del livello di gestione necessario per mantenere attivo questo sistema, dice. Hanno il problema di database più difficile del pianeta e non esiste un sistema attuale in grado di soddisfare le loro esigenze.

Le soluzioni che Stonebraker sta costruendo per un settore molto diverso che sta già affogando nei dati potrebbero eventualmente aiutare. Alcuni anni fa, ha sentito parlare dei problemi che affliggono il Telescopio sinottico di grandi dimensioni in costruzione in Cile. Sta per assemblare 100 petabyte di dati grezzi e dati derivati, dice Stonebraker, e non avevano idea di cosa farne.



Stonebraker e il collaboratore David DeWitt, affiliato con l'Università del Wisconsin-Madison, hanno creato un sistema di database unico chiamato SciDB . Il progetto open source ora ha il sostegno di un'impresa e una vasta comunità di volontari all'interno della scienza. Ma Stonebraker pensa che le funzionalità di SciDB alla fine troveranno favore al di là del mondo accademico.

Tutti i dati scientifici sono incerti e hanno barre di errore, a differenza dei dati in un database degli stipendi, quindi SciDB può prestare attenzione all'incertezza. Inoltre, non può sovrascrivere, perché i ragazzi della scienza non vogliono mai buttare via nulla, dice. Queste funzionalità non sono così diverse dalla necessità di analisi o scienza dei dati ad alta potenza e ad alto contenuto statistico che sono sempre più al centro di aziende di successo guidate dalla tecnologia. Un esempio è il posizionamento degli annunci online: prendere di mira ogni persona individualmente richiede un'analisi computazionalmente intensa per raggruppare persone simili insieme.

Tuttavia, Stonebraker non afferma che i nuovi sistemi di database come quelli su cui sta lavorando possano essere una panacea per le aziende che imparano improvvisamente i limiti di tecnologie più consolidate. La crescente importanza dell'archiviazione e dell'elaborazione dei dati per le aziende di ogni tipo richiederà loro di considerare entrambi una priorità aziendale. Se gestisci un'azienda, devi progettare su larga scala fin dall'inizio, dice, perché non c'è dubbio che ne avrai bisogno in seguito.



nascondere