Quali sono le prospettive per gli algoritmi di Netflix?

Quando il Premio Netflix è stato assegnato il mese scorso, ha concluso tre anni di intensa competizione volta a trovare un algoritmo migliore per prevedere le preferenze cinematografiche degli utenti.





La squadra vincente, Il caos pragmatico di BellKor , è stato il primo a prevedere le valutazioni dei film dei clienti Netflix con una precisione del 10% migliore rispetto al sistema interno dell'azienda, un'impresa che molti esperti ritenevano impossibile quando è stato annunciato il premio di un milione di dollari. Netflix prevede di offrire a secondo premio , questa volta per algoritmi che prevedono le preferenze sui film utilizzando più informazioni sull'utente, come sesso, età e codice postale. Ma gli esperti dicono che la vera sfida è trovare modi per applicare le lezioni apprese attraverso la sfida originale di Netflix ad altri sistemi di raccomandazione.

Alla fine di ottobre, gli esperti del settore si incontreranno al Conferenza ACM sui sistemi di raccomandazione a New York City per chiedere, tra l'altro, cosa si è appreso dal Premio Netflix.

I partecipanti al concorso originale di Netflix hanno addestrato i loro algoritmi utilizzando un'enorme raccolta di dati: oltre 100 milioni di valutazioni che coprono quasi 18.000 titoli da quasi mezzo milione di abbonati. Per testare i loro risultati, i loro algoritmi sono stati testati su una serie di dati gestiti da Netflix e tenuti segreti dai concorsi per prevenire imbrogli.

I dati di Netflix hanno presentato diversi ostacoli formidabili, spiega Nicholas Ampazis , un assistente professore nel dipartimento di ingegneria finanziaria e gestionale dell'Università dell'Egeo in Grecia, il cui team, L'ensemble , ha concluso il concorso al secondo posto. Il set di dati era enorme, ma era anche scarso, il che significa che i clienti in genere valutavano circa l'1% dei film che guardavano. Infrangere la barriera del 10 percento significava quindi spingere i limiti delle tecniche di modellazione esistenti in misura significativa, afferma Ampazis.

Ma le sfide presentate dai dati di Netflix hanno anche reso la concorrenza molto preziosa, secondo Questi Bertino , un altro membro dell'Ensemble. I ricercatori di solito hanno il lusso di scegliere i set di dati e di avere più informazioni su quei dati. Nel concorso Netflix, i concorrenti sono stati costretti ad applicare tutti gli algoritmi allo stesso insieme di dati del mondo reale frustrantemente irregolari. Poiché le persone dovevano utilizzare un set di dati fisso, dovevano affrontare non solo i vantaggi di un particolare metodo, ma anche i punti deboli di esso, afferma Bertino. Non potevi sfuggirgli.

Gavin Potter , che ha ottenuto il riconoscimento per essere entrato nella top 10 del premio Netflix nel 2008 con il nome Just a guy in a garage, afferma che alcune realizzazioni chiave hanno permesso agli algoritmi vincenti di raggiungere l'obiettivo. Innanzitutto, è stato semplificato un potente algoritmo per la ricerca di modelli nei set di dati, una tecnica nota come filtraggio collaborativo, in modo da poter essere utilizzato sul grande set di dati di Netflix. In secondo luogo, i partecipanti hanno imparato a prestare attenzione a determinati nuovi tipi di dettagli, ad esempio il fatto che ordinare un film indica una preferenza per esso, anche se il cliente non lo ha valutato. Anche le informazioni su data e ora si sono rivelate significative. Ma la più grande realizzazione, nota Potter, è stata che la fusione di una varietà di approcci ha prodotto i migliori risultati.

La fusione di diversi approcci ha ricevuto molta attenzione nei post-mortem della competizione, ma John Riedl , un professore di informatica all'Università del Minnesota, dice di avere sentimenti contrastanti a riguardo. Le persone come me sono alla ricerca di idee che ci dessero un'idea della struttura della soluzione, dice, dove capiamo davvero qualcosa di nuovo non solo su ciò che la soluzione funziona bene, ma perché è che funziona bene.

I modelli vincitori, tuttavia, non hanno prodotto tale intuizione. Quello che suggeriscono, secondo Riedl, è che combinare molti algoritmi con tecniche di apprendimento automatico potrebbe essere un buon approccio alla gestione di grandi set di dati in generale. Tuttavia, anche questo resta da dimostrare. Molti di noi sono preoccupati che questo approccio possa non essere altrettanto fruttuoso altrove, aggiunge.

Ciò che è chiaro è che molte industrie potrebbero trarre vantaggio dai tipi di modelli costruiti per la concorrenza. Oltre ad altri sistemi di raccomandazione online, Ampazis suggerisce che tali algoritmi potrebbero essere applicati nel trading di mercato, nel rilevamento delle frodi, nella lotta allo spam e nella sicurezza informatica. Bertino afferma che i membri dell'Ensemble stanno attualmente valutando come utilizzare al meglio la tecnologia che hanno generato nel corso della competizione.

Potter sta lavorando per applicare la propria ricerca per il premio al sito di incontri online SìNoMaggioB , che utilizza algoritmi di raccomandazione bidirezionali per trovare utenti che potrebbero volersi incontrare. In particolare, spera di utilizzare le intuizioni del Premio Netflix per fare previsioni basate sulle preferenze implicite degli utenti, come le pagine che caricano.

Il Premio Netflix ha focalizzato molta attenzione sui sistemi di raccomandazione e ha prodotto enormi progressi nel campo. La seconda competizione sembra probabile che faccia lo stesso. Ma Riedl pensa che altri componenti dei sistemi di raccomandazione possano essere lasciati indietro nel processo. Ora è tempo per noi come campo di pensare a quali altri aspetti potrebbero essere stati trascurati, dice, e come i ricercatori possono fare progressi su quegli aspetti in un modo che ha implicazioni per l'industria.

Ad esempio, Riedl vede la necessità di algoritmi che consentano ai sistemi di raccomandazione di utilizzare set di dati sempre più grandi, sistemi che spieghino a un utente perché è stata fatta una particolare raccomandazione e interfacce utente migliori. Nota inoltre che, mentre la concorrenza di Netflix ha compiuto notevoli progressi nell'interpretazione dei dati sparsi, in alcuni casi può avere senso imparare a progettare siti per incoraggiare gli utenti a fornire più dati. Spera che il prossimo incontro a New York aiuti a definire una serie più ampia di domande da affrontare per i ricercatori.

nascondere