211service.com
Twitter Data Scientist assume l'intero menu di McDonald's, sopravvive
Edwin Chen è un data scientist di Twitter che condivide gli arcani segreti della sua arte oscura, il che è una buona cosa considerando che probabilmente è il campo in più rapida crescita negli Stati Uniti

Mmm, scienza dei dati. (cc Evan Blaser )
(Di seguito, ho incluso l'intera intervista via e-mail che ho condotto con Chen, a cui potresti voler saltare se stai cercando una panoramica generale del suo lavoro. Rivela, tra le altre cose, che ha considerato l'estrazione di Twitter dati per vedere se le persone mangiano o meno al fast food quando sono tristi.)
La scienza dei dati è così nuova che non ci sono libri di testo sull'argomento e nessun curriculum universitario progettato per produrre scienziati dei dati. Eppure è parte integrante di tutto, dal trading quantitativo a Wall Street al targeting degli annunci sul Web e all'ottimizzazione delle catene di approvvigionamento del mondo reale.
Prima di estrarre terabyte di tweet alla ricerca di informazioni che potessero essere trasformate in visualizzazioni interattive, Chen ha affinato le sue abilità studiando linguistica e matematica pura al MIT. Questo è tipicamente atipico per uno scienziato dei dati, che ha un background in discipline matematicamente rigorose, qualunque esse siano. (Su Twitter, ad esempio, tutti i data scientist devono avere almeno un master in un campo correlato .)
Ecco uno degli esempi più stravaganti della versatilità della scienza dei dati, dal blog di Chen. In un post dal titolo travolgente Modelli a miscela infinita con baye non parametrici e processo di Dirichlet , Chen approfondisce il problema del clustering. Cioè, come si prende una massa di dati e la si ordina in gruppi di elementi correlati? È un problema difficile: quanti gruppi dovrebbero esserci? quali sono i criteri per ordinarli? – e i dettagli di come lo affronta sono al di là di coloro che non hanno un background in questo tipo di analisi.
Per il resto di noi, Chen fornisce un esempio concreto e accessibile: McDonald's
Scaricando l'intero menu di McDonald's nella sua scatola di smistamento matematica, Chen scopre, ad esempio, che non tutte le salse di McDonald's sono uguali. Hot Mustard e Spicy Buffalo non rientrano nello stesso gruppo di Creamy Ranch, che ha più in comune con McDonald's Iced Coffee with Sugar Free Vanilla Syrup che con la Newman's Low Fat Balsamic Vinaigrette.
Appaiono altri gruppi, inclusi tutti gli articoli a base di hamburger, cibi per la colazione e bevande zuccherate. Finora, non così sorprendente, fino a quando non arrivi all'unico cluster nel menu di McDonald's che contiene solo un elemento.
Cosa c'è di così speciale nella farina d'avena McDonald's Fruit & Maple? Probabilmente è il suo contenuto di fibre, livelli relativamente alti (sottolineo relativamente) di nutrienti e livelli più bassi di zucchero, grassi trans e colesterolo.
In altre parole, quando uno dei più recenti data scientist di Twitter applica la sua arte al menu di McDonald's, il suo algoritmo estrae automaticamente l'unico cibo su di esso che probabilmente qualcuno di noi dovrebbe considerare di mangiare. Farina d'avena: da McDonald's è davvero una classe a parte.
Ecco l'intervista completa a Chen:
1. Da quanto tempo sei un data scientist in Twitter?
Sono su Twitter da circa quattro mesi.
2. Cosa fa un data scientist di Twitter?
Lavoriamo su qualsiasi cosa, dalla creazione di modelli di apprendimento automatico al miglioramento dei nostri framework di elaborazione dati su larga scala, alla creazione di visualizzazioni di dati, all'esecuzione di analisi statistiche e alla ricerca di modi migliori per comprendere i nostri utenti e il grafico di Twitter. C'è molta varietà e dipende davvero dalle capacità e dagli interessi di ogni persona.
In un dato momento, ad esempio, è probabile che sperimenterò nuovi algoritmi di targeting degli annunci, scrivendo lavori MapReduce per estrarre terabyte di tweet (usando Scalding, il nostro linguaggio MapReduce interno), costruendo visualizzazioni interattive per far emergere informazioni in tutti i dati che raccogliamo, scrivendo un rapporto per spiegare alcune nuove scoperte, eseguendo un esperimento su Mechanical Turk e molto altro.
3. Il tuo ultimo post (sul clustering) è stato ispirato da qualcosa su cui stai lavorando su Twitter (di cui puoi discutere)?
Ho lavorato per raggruppare i nostri utenti e inserzionisti, dedurre automaticamente le categorie di argomenti nel testo e pensare a cosa possiamo imparare dal cibo su Twitter (ad esempio, uomini e donne, o san francescani e newyorkesi, differiscono per cosa mangiano? c'è qualche relazione tra ciò che le persone mangiano e ciò che twittano, ad esempio, è più probabile che le persone mangino cibo spazzatura quando sono tristi?). Quindi, anche se il post non è stato direttamente ispirato da ciò su cui sto lavorando su Twitter, è sicuramente correlato.
4. La scienza dei dati è una cosa ormai, ma (mi è stato detto) il campo è così nuovo che non ci sono libri di testo o corsi universitari specifici ad esso. Sei d'accordo/non sei d'accordo?
Sono d'accordo, ma dipende dalla tua definizione di data science (su cui molte persone non sono d'accordo!). Per me, la scienza dei dati è un mix di tre cose: analisi quantitativa (per il rigore necessario a comprendere i tuoi dati), programmazione (in modo che tu possa elaborare i tuoi dati e agire sulle tue intuizioni) e narrazione (per aiutare gli altri a capire quale sia il mezzi dati). Quindi competenze utili per uno scienziato dei dati potrebbero includere:
* Statistiche, machine learning (dal lato dell'analisi quantitativa). Ad esempio, è impossibile estrarre un significato dai tuoi dati se non sai come distinguere i tuoi segnali dal rumore. (Sottolineerò, tuttavia, che credo che qualsiasi tipo di forte capacità quantitativa vada bene - il mio background era originariamente in pura matematica e linguistica, e molte delle altre persone qui provengono da campi come la fisica e la chimica. Puoi sempre scegliere gli strumenti specifici di cui avrai bisogno.)
* Capacità di programmazione generale, oltre alla conoscenza di aree specifiche come MapReduce/Hadoop e database. Ad esempio, un modello comune per me è che codificherò un lavoro MapReduce in Scala, eseguirò alcune semplici operazioni da riga di comando sui risultati, passerò i dati a Python o R per ulteriori analisi, estrarrò da un database per ottenere qualcosa in più campi e così via, spesso integrando ciò che trovo in alcuni modelli di apprendimento automatico alla fine.
* Programmazione web, visualizzazione dati (lato storytelling). Ad esempio, trovo estremamente utile essere in grado di creare un'app Web rapida o un dashboard che consenta ad altre persone (me compreso!) Di interagire con i dati: quando si comunica con persone tecniche e non tecniche, una buona visualizzazione dei dati è spesso molto più utile e perspicace di un numero astratto.
Sebbene non ci siano molti libri di testo o corsi che coprano tutte e tre le aree (un'eccezione potrebbe essere il corso di Jeff Hammerbacher e Mike Franklin a Berkeley: http://datascienc.es/ ), ci sono ovviamente risorse che coprono ogni singola abilità. (La visualizzazione dei dati sembra continuare a essere un'abilità sottovalutata, quindi le classi in quell'area sono più rare.)