Quando un agente AI si incaponisce arXiv:2609.28416 Dialogo scritto per podcast; voci generate con AI. CONDUTTRICE: Immagina un assistente AI che deve capire perché un'app non parte. Vede un errore di autenticazione e pensa: sarà la chiave API. La verifica, scopre che funziona, ma continua a proporre di rigenerarla. Ti è mai capitato di vedere un agente restare agganciato alla prima idea? OSPITE: Sì, ed è il problema da cui parte questo paper. Gli autori lo chiamano task-state contamination: una supposizione prematura entra nella storia del compito e influenza le mosse successive, anche quando arrivano prove contrarie. L'errore iniziale non è l'unico guaio. Il guaio è che diventa la lente con cui l'agente interpreta il resto. CONDUTTRICE: Il titolo parla di world model. Io penso a un modello che prevede il mondo: faccio una ricerca e lui immagina quali risultati otterrò. Qui è diverso? OSPITE: Esatto. Se l'agente può usare davvero il browser o il terminale, non serve indovinare il risultato dello strumento. AEWM valuta invece la decisione proposta prima di eseguirla: date la storia, il ragionamento e l'azione, questo passo aiuta il compito? È un cambio di prospettiva: controllare la traiettoria dell'agente, non simulare ogni risposta dell'ambiente. CONDUTTRICE: E come distingue una buona deviazione da una perdita di tempo? In una ricerca vera bisogna anche esplorare. OSPITE: Il componente Action Judge usa tre etichette. Critical: il passo serve direttamente per andare avanti. Exploratory: riduce un'incertezza reale, anche se non dà subito la risposta. Noisy: ripete una mossa, segue una pista irrilevante o dipende da una premessa che i dati non sostengono. Per esempio, leggere il log del servizio che fallisce è esplorativo o persino critico; rigenerare ancora la chiave già verificata è probabilmente noisy. CONDUTTRICE: Quando trova una mossa noisy, quindi, mostra un avviso? OSPITE: Fa di più. State Revision propone un nuovo ragionamento e una nuova azione usando la stessa storia osservata. Poi EditAct esegue la mossa scelta e registra la risposta reale. Così anche la storia futura cambia. Gli autori sperimentano inoltre un addestramento, AEWM-RFT, su traiettorie corrette e verificate: l'obiettivo è far sì che l'agente impari a correggersi senza avere sempre il supervisore online. CONDUTTRICE: Ci sono dati che mostrano un vantaggio, oppure è solo un'idea elegante? OSPITE: Nel benchmark degli autori ci sono tremila decisioni fra ricerca, terminale e sviluppo software. Il giudice ottiene il 70,5 per cento di macro-F1, 10,6 punti sopra il migliore dei confronti riportati. Quando AEWM entra nel ciclo dell'agente, il punteggio medio su sei benchmark cresce di 3,2 fino a 6,7 punti, a seconda della dimensione dell'agente. Sono risultati nei test del paper, non una garanzia universale. CONDUTTRICE: Dove lo useresti, con prudenza? OSPITE: In attività lunghe di ricerca, debugging e automazione, soprattutto quando una nuova prova contraddice il piano. Però il giudice può sbagliare: potrebbe bloccare un'esplorazione utile o proporre una correzione peggiore. C'è anche un costo aggiuntivo per ogni controllo. La lezione pratica è semplice: prima di agire su una vecchia ipotesi, chiediamoci quale prova la sostiene ancora.