La palla sparisce. Il video capisce la fisica? arXiv:2609.28654 Dialogo scritto per podcast; voci generate con AI. CONDUTTRICE: Ho visto video generati dall'AI bellissimi, ma poi una palla sparisce dietro una scatola e non riappare. A volte torna dall'altra parte in un punto impossibile. È solo un difetto visivo? OSPITE: È un difetto più profondo della singola immagine. Quando la palla è nascosta, dovrebbe continuare a esistere: si chiama permanenza dell'oggetto. Se incontra una parete solida, non dovrebbe attraversarla: è la solidità. WROP costruisce prove mirate per vedere se i modelli video mantengono queste regole quando continuano una scena. CONDUTTRICE: Mi fai un esempio di prova? OSPITE: Il modello vede l'inizio di una clip in cui una sfera rotola verso un pannello. Deve generare la parte successiva. La sfera può scomparire temporaneamente perché il pannello la nasconde, ma deve riemergere in una posizione coerente con velocità e percorso. In altre clip cade su una superficie, urta un ostacolo o perde il supporto. Il momento decisivo avviene dopo il tratto iniziale che il modello ha visto. CONDUTTRICE: Come fanno a evitare che il test sia un unico trucco ripetuto? OSPITE: Gli autori costruiscono 150 generatori di scene 3D in Blender. Variano luce, angolo della camera e velocità mantenendo costante la domanda fisica. Organizzano le scene in sei famiglie: tre sulla permanenza, come occlusione e oggetti in contenitori, e tre sulla solidità, come ostacoli, rimozione del supporto e collisioni. Il corpus ha 1,5 milioni di esempi di training e un esame fisso di 300 domande. CONDUTTRICE: Una metrica automatica sui pixel non basterebbe per dare il voto? OSPITE: Non sempre. Un video può conservare bene colori e sfondo, quindi sembrare simile al riferimento, e sbagliare proprio l'evento che vogliamo misurare. Per la valutazione principale gli autori usano confronti ciechi fra coppie di video da parte di persone. Le metriche automatiche sono un complemento, non sostituiscono quel giudizio. CONDUTTRICE: Cosa ottengono dopo l'addestramento mirato? OSPITE: Addestrano ulteriormente un modello di continuazione da 16 miliardi di parametri, chiamato PWM-WROP. Nei confronti umani si colloca primo tra i veri modelli di continuazione video e terzo fra tutti i quattordici sistemi confrontati. Il risultato è promettente, ma la valutazione principale comprende 361 giudizi a coppie di venti persone; per alcune posizioni gli intervalli di confidenza si sovrappongono. CONDUTTRICE: Perché distingui i veri modelli di continuazione dagli altri? OSPITE: Perché le interfacce non sono uguali. Alcuni sistemi continuano il filmato esistente, altri generano da un'immagine di riferimento o modificano la scena. Chi può rigenerare di più potrebbe superare certi test, ma conservare meno fedelmente l'identità degli oggetti già visti. Inoltre le scene sono sintetiche e controllate, e il modello è addestrato su compiti della stessa struttura dell'esame. CONDUTTRICE: Quindi non possiamo dire che abbia imparato la fisica del mondo? OSPITE: Esatto. Possiamo dire che l'addestramento mirato migliora queste prove definite dagli autori. Per simulazioni aperte e robot reali serve altra evidenza. Il valore pratico del paper è separare la bellezza di un video dalla coerenza degli eventi: quando un oggetto si nasconde o incontra una barriera, osserviamo che cosa accade davvero.