211service.com
I robot ottengono un pulsante 'Annulla' che potrebbe aiutarli a imparare più velocemente
Categoria: Non categorizzato Inserito 27 novembreL'apprendimento per rinforzo profondo funziona in modo molto simile a un bambino che impara un'abilità: la pratica rende perfetti. Per un agente autonomo come un robot, tuttavia, il suo ambiente deve essere ripristinato al suo stato originale tra un tentativo e l'altro, un compito che può richiedere ore mentre gli umani si affrettano a sostituire oggetti, ad esempio.
Una nuova carta arXiv da ricercatori con Google Brain, l'Università di Cambridge, il Max Planck Institute for Intelligent Systems e l'UC Berkeley descrive in dettaglio un metodo che può insegnare a un agente a ripristinare l'ambiente per il prossimo tentativo, oltre a impedirgli di eseguire azioni che sarebbero irreversibile.
Il loro avanzamento consisteva nel fornire agli agenti una politica avanzata e reimpostata che funzionasse insieme. Mentre la policy forward ha il compito di apprendere un'abilità, premere reset costringe un agente a imparare come non lasciare traccia, riavvolgendo efficacemente un'azione. Le azioni che il robot ritiene irreversibili vengono interrotte il prima possibile.
I ricercatori scrivono che hanno cercato di dare ai loro agenti l'intuizione di classificare tutto ciò che è reversibile come sicuro, poiché è possibile tornare allo stato originale. Attraverso tentativi ed errori, l'agente scopre che sempre più azioni sono reversibili, consentendogli di esplorare in sicurezza.
L'apprendimento per rinforzo profondo viene spesso eseguito nella simulazione, e soprattutto quando gli ambienti del mondo reale perdonano meno gli errori, come un'auto autonoma che guida su un dirupo. Anche per le situazioni più sicure, l'attesa di reimpostazioni manuali può diventare un collo di bottiglia per la raccolta dei dati. Per questo motivo, il lavoro del team è stato confinato in ambienti virtuali. Alla fine, tuttavia, è necessario eseguire test nel mondo reale e questa ricerca potrebbe renderlo più veloce e sicuro.
Come fa notare Jack Clark nel suo Importa IA newsletter , questo documento fa eco al lavoro delineato in un altro foglio (PDF) da Facebook AI Research il mese scorso, in cui un singolo agente ha due modalità separate, soprannominate Alice e Bob, una delle quali cerca di invertire il compito che l'altro ha tentato di completare. Questo tipo di lavoro per rendere l'IA in grado di pianificare in anticipo potrebbe salvare lei (e noi) da errori disastrosi in futuro.