3 min di lettura
GPT-6 impara a non ‘rileggere’ tutto ogni volta, e tu risparmi il 90%
Insieme a Sol e Luna, OpenAI ha lanciato un sistema di prompt caching molto più aggressivo. Detto senza gergo: se chiedi più cose di seguito basate sullo stesso contesto (lo stesso documento, lo stesso codice, la stessa conversazione), il modello smette di “rileggere tutto da capo” ogni volta e riusa quello che ha già visto. Il risparmio arriva fino al 90% sui token di input riciclati, per una finestra di 30 minuti.
Pensa a come lavori con un cliente in un editing lungo: la prima volta studi tutto lo shooting, capisci lo stile, il taglio, la luce. Dalla seconda foto in poi non riparti da zero, applichi quello che hai già imparato su quello specifico set. Il prompt caching fa la stessa cosa per l’AI: la prima “occhiata” al contesto costa il prezzo pieno, tutte le successive costano una frazione.
“Non stiamo rendendo il modello più intelligente in questo annuncio, stiamo rendendo la sua memoria di breve termine molto più economica da usare.”
A chi serve davvero
Questo aggiornamento non parla a chi fa una domanda isolata ogni tanto. Parla a chi usa l’AI in modo continuativo, a raffica, sullo stesso materiale.
- Assistenti AI che lavorano dentro un progetto (tipo GitHub Copilot) e interrogano il modello decine di volte sullo stesso codice.
- Automazioni che rileggono lo stesso documento lungo (un contratto, un brief creativo) per fare più passaggi diversi su di esso.
- Chatbot aziendali che mantengono la stessa conversazione aperta per ore con lo stesso cliente.
I numeri chiave dell’annuncio:
- 90%: lo sconto massimo sui token di input riusati dalla cache.
- 30 minuti: la finestra entro cui il contesto resta “caldo” e riutilizzabile a prezzo scontato.
- Default: l’hit rate più alto è attivo di serie, non va configurato a mano dagli sviluppatori.
Un caso concreto: immagina un tool che ti aiuta a scrivere didascalie e post per un intero shooting, foto dopo foto, mantenendo lo stesso brief creativo aperto. Prima, ogni richiesta pagava per “rispiegare” il contesto al modello. Ora solo la prima richiesta costa per intero: le successive, finché resti dentro la mezz’ora, costano una frazione. Per chi usa l’AI a raffica sullo stesso progetto, la bolletta cambia forma.
“L’efficienza non sta più solo nel modello, sta in come il sistema ricorda quello che gli hai già chiesto.”
Tre cose che mi porto via
- Il vero terreno di competizione tra OpenAI, Google e Anthropic non è più solo “chi è più intelligente”, ma “chi ti fa pagare meno per usarlo tanto”.
- Se usi strumenti AI in sessioni lunghe e ripetute sullo stesso materiale (editing, scrittura, codice), questo aggiornamento ti tocca da vicino anche se non lo vedi direttamente.
- La finestra dei 30 minuti è un dettaglio pratico da ricordare: se lasci “raffreddare” la conversazione troppo a lungo, perdi lo sconto.
È come se il tuo laboratorio di sviluppo smettesse di richiedere una nuova chimica ogni volta che stampi una foto della stessa serie: la prima stampa prepara il bagno, le altre lo riusano. Meno spreco, stessa qualità.
A presto.
Fonte: openai.com/index/better-prompt-caching-for-gpt-6
✍️ Articolo firmato da “La Redazione”: sistema editoriale multi-agente (AI) orchestrato con Claude Code e supervisionato da Luca Cazzaniga · lucacazzaniga.it
Creatività Aumentata
Analisi di approfondimento direttamente nella tua casella di posta.