3 min di lettura
FLUX 3: quando l’immagine impara a prevedere il movimento
Immagina di scattare una foto e che quella foto, invece di restare ferma, sapesse già come si muoverà l’attimo dopo. È più o meno quello che Black Forest Labs, il team dietro FLUX, ha appena iniziato a rilasciare: una nuova architettura che non genera solo immagini, ma capisce l’azione dentro l’immagine.
Il pezzo che conta di più si chiama FLUX 3 Action: 7 miliardi di parametri, open weight (quindi scaricabile e ispezionabile, non chiuso in un’app), addestrato non solo a generare pixel ma a prevedere cosa succede dopo. In parallelo arriva anche il comparto Video, che ora genera audio nativo e sincronizza il labiale, quindi meno passaggi esterni per animare un volto che parla.
La differenza rispetto a prima è tutta in un concetto: predizione dell’azione.
FLUX 3 Action utilizza l’addestramento multimodale per fare “action prediction” e simulare flussi di interazione fisica e robotica.
Da generatore di immagini a motore fisico
Fino a oggi un modello come FLUX serviva a produrre un’immagine statica: bella, coerente, ma ferma nel tempo. Con l’addestramento multimodale, il modello impara anche la fisica implicita nelle immagini: come cade un oggetto, come si piega un braccio, come una mano afferra una tazza. Non è più solo “disegna questo”, è “prevedi cosa viene dopo questo”.
Per capirci con un paragone fotografico: è la differenza tra uno scatto singolo e una sequenza a raffica dove il modello sa già indovinare i fotogrammi 2, 3 e 4 senza che tu li scatti davvero.
Tre punti tecnici che vale la pena isolare:
- 7 miliardi di parametri per FLUX 3 Action, taglia gestibile anche fuori dai data center giganti.
- Open weight: chi fa ricerca robotica può scaricarlo e modificarlo, non solo chiamarlo via API.
- Audio e lipsync nativi nel comparto Video, un passaggio in meno rispetto a prima (niente più tool esterni per far “parlare” un volto generato).
Un caso concreto, quello che secondo me spiega meglio la portata della cosa: un laboratorio di robotica che vuole insegnare a un braccio meccanico ad afferrare oggetti diversi non ha bisogno solo di sensori e telecamere, ha bisogno anche di simulare migliaia di tentativi prima di romperli nel mondo reale. Un modello che prevede l’azione a partire da immagini diventa un motore di simulazione economico: genera scenari plausibili di “cosa succede se afferro qui” prima ancora di muovere un motore vero.
La vera svolta è come i modelli generativi di immagini e video si stiano evolvendo per diventare veri e propri motori fisici per i robot del futuro.
Tre cose che mi porto via
- Il confine tra “generare immagini” e “simulare il mondo” si sta assottigliando: non stiamo più parlando solo di estetica, ma di previsione.
- L’open weight su un modello con capacità di action prediction è un segnale forte: la ricerca robotica indipendente guadagna uno strumento che prima restava dentro pochi laboratori.
- Per chi lavora con immagini e video oggi (noi, i creativi), l’audio e il lipsync nativi di FLUX 3 Video tolgono un pezzo di catena di montaggio: meno tool da incastrare, più output diretto.
Se FLUX 1 e 2 erano macchine fotografiche che sapevano disegnare, FLUX 3 comincia a somigliare a un occhio che capisce anche dove sta andando la mano. Non è ancora un robot, ma è il tipo di mattone su cui i robot del futuro impareranno a muoversi prima di farlo davvero.
Non serve correre a scaricare pesi e configurare pipeline stamattina. Ma se lavori vicino a robotica, simulazione o anche solo animazione facciale, tieni d’occhio questo rilascio: è il tipo di cambio di paradigma che poi ritrovi, con qualche mese di ritardo, dentro gli strumenti che usi tutti i giorni.
Fonte: bfl.ai/models/flux-3
✍️ Articolo firmato da “La Redazione”: sistema editoriale multi-agente (AI) orchestrato con Claude Code e supervisionato da Luca Cazzaniga · lucacazzaniga.it
Creatività Aumentata
Analisi di approfondimento direttamente nella tua casella di posta.