Visione artificiale nell'intelligenza artificiale: i dati necessari per avere successo

Fornito da Allegione





Lo sviluppo della capacità di annotare enormi volumi di dati mantenendo la qualità è una funzione del ciclo di vita di sviluppo del modello che le aziende spesso sottovalutano. È ad alta intensità di risorse e richiede competenze specializzate.

Al centro di qualsiasi iniziativa di successo di machine learning/intelligenza artificiale (ML/AI) c'è l'impegno a fornire dati di formazione di alta qualità e un percorso verso dati di qualità comprovato e ben definito. Senza questa pipeline di dati di qualità, l'iniziativa è destinata a fallire.



I team di computer vision o di scienza dei dati spesso si rivolgono a partner esterni per sviluppare la loro pipeline di formazione sui dati e queste partnership guidano le prestazioni del modello.

Non esiste una definizione di qualità: la qualità dei dati dipende completamente dallo specifico progetto di computer vision o machine learning. Tuttavia, esiste un processo generale che tutti i team possono seguire quando lavorano con un partner esterno e questo percorso verso la qualità dei dati può essere suddiviso in quattro fasi prioritarie.

Criteri di annotazione e requisiti di qualità

La qualità dei dati di formazione è una valutazione dell'idoneità di un set di dati a soddisfare il suo scopo in un determinato caso d'uso di ML/AI.



Il team di visione artificiale deve stabilire un insieme univoco di regole che descrivano cosa significa qualità nel contesto del loro progetto. I criteri di annotazione sono la raccolta di regole che definiscono quali oggetti annotare, come annotarli correttamente e quali sono gli obiettivi di qualità.

Gli obiettivi di accuratezza o qualità definiscono il risultato più basso accettabile per le metriche di valutazione come accuratezza, richiamo, precisione, punteggio F1, ecc. Tipicamente, un team di visione artificiale avrà obiettivi di qualità per quanto accuratamente sono stati classificati gli oggetti di interesse, quanto accuratamente sono stati localizzati gli oggetti e quanto accuratamente sono state identificate le relazioni tra gli oggetti.

Formazione della forza lavoro e configurazione della piattaforma n

Configurazione della piattaforma. La progettazione delle attività e l'impostazione del flusso di lavoro richiedono tempo e competenze e un'annotazione accurata richiede strumenti specifici per le attività. In questa fase, i team di data science hanno bisogno di un partner esperto che li aiuti a determinare il modo migliore per configurare strumenti di etichettatura, tassonomie di classificazione e interfacce di annotazione per accuratezza e velocità effettiva.



Test e punteggio dei lavoratori. Per etichettare accuratamente i dati, gli annotatori necessitano di un programma di formazione ben progettato in modo da comprendere appieno i criteri di annotazione e il contesto del dominio. La piattaforma di annotazione o il partner esterno dovrebbero garantire l'accuratezza monitorando attivamente la competenza dell'annotatore rispetto alle attività relative ai dati importanti o quando un giudizio viene modificato da un lavoratore o amministratore più qualificato.

Verità di base o dati d'oro. I dati sulla verità di base sono cruciali in questa fase del processo come linea di base per valutare i lavoratori e misurare la qualità dell'output. Molti team di visione artificiale stanno già lavorando con un set di dati di base.

Fonti di autorità e garanzia di qualità

Non esiste un approccio unico per l'assicurazione della qualità (QA) che soddisfi gli standard di qualità di tutti i casi d'uso di ML. Obiettivi aziendali specifici, nonché il rischio associato a un modello con prestazioni insufficienti, guideranno i requisiti di qualità. Alcuni progetti raggiungono la qualità target utilizzando più annotatori. Altri richiedono revisioni complesse rispetto a dati di base o flussi di lavoro di escalation con verifica da parte di un esperto in materia.



Esistono due fonti primarie di autorità che possono essere utilizzate per misurare la qualità delle annotazioni e che vengono utilizzate per assegnare un punteggio ai lavoratori: dati sull'oro e revisione di esperti.

  • Dati oro: i dati oro o l'insieme di registrazioni della verità di base possono essere utilizzati sia come strumento di qualificazione per testare e valutare i lavoratori all'inizio del processo sia anche come misura per la qualità dell'output. Quando utilizzi i dati gold per misurare la qualità, confronti le annotazioni dei lavoratori con le annotazioni degli esperti per lo stesso set di dati e la differenza tra queste due risposte cieche indipendenti può essere utilizzata per produrre misurazioni quantitative come accuratezza, richiamo, precisione e punteggi F1 .
  • Revisione di esperti: questo metodo di garanzia della qualità si basa sulla revisione di esperti da parte di un lavoratore altamente qualificato, un amministratore o da un esperto lato cliente, a volte tutti e tre. Può essere utilizzato in combinazione con il controllo qualità dei dati sull'oro. Il revisore esperto esamina la risposta data dal lavoratore qualificato e la approva o apporta le correzioni necessarie, producendo una nuova risposta corretta. Inizialmente, può aver luogo una revisione di esperti per ogni singola istanza di dati etichettati, ma nel tempo, con il miglioramento della qualità dei lavoratori, la revisione di esperti può utilizzare il campionamento casuale per il controllo di qualità continuo.

Iterazione sul successo dei dati

Una volta che un team di visione artificiale ha avviato con successo una pipeline di dati di formazione di alta qualità, può accelerare il progresso verso un modello pronto per la produzione. Attraverso il supporto continuo, l'ottimizzazione e il controllo della qualità, un partner esterno può aiutarli a:

  • Traccia la velocità: per scalare in modo efficace, è utile misurare la velocità effettiva delle annotazioni. Quanto tempo impiegano i dati per spostarsi attraverso il processo? Il processo sta diventando più veloce?
  • Ottimizzare la formazione dei lavoratori: man mano che le dimensioni del progetto, l'etichettatura e i requisiti di qualità possono evolversi. Ciò richiede una formazione continua della forza lavoro e un punteggio.
  • Addestramento su casi limite: nel tempo, i dati di addestramento dovrebbero includere un numero sempre maggiore di casi limite per rendere il modello il più accurato e robusto possibile.

Senza dati di formazione di alta qualità, anche i progetti ML/AI più ambiziosi e finanziati non possono avere successo. I team di visione artificiale hanno bisogno di partner e piattaforme di cui potersi fidare per fornire la qualità dei dati di cui hanno bisogno e per alimentare modelli ML/AI che cambiano la vita nel mondo.

Alegion è il partner collaudato per creare la pipeline di dati di addestramento che alimenterà il tuo modello durante tutto il suo ciclo di vita. Contatta Alegione a [email protected] .

Questo contenuto è stato prodotto da Alegion. Non è stato scritto dalla redazione del MIT Technology Review.

nascondere