3 min di lettura
Il modello di mezzo ha superato il campione
Immagina di avere due macchine fotografiche nella borsa: una ammiraglia pesantissima e costosa, che tiri fuori solo per lo scatto importante, e una più leggera ed economica che usi tutti i giorni. Poi scopri che quella leggera, nei tuoi soggetti preferiti, scatta foto più nitide della pesante. È più o meno quello che è appena successo in casa Anthropic.
Hanno presentato Claude Sonnet 5.5, il secondo modello della nuova famiglia 5.5. Doveva essere il fratello di mezzo, quello pensato per il bilanciamento tra potenza e velocità, non per primeggiare. Invece nei test di programmazione autonoma ha scavalcato l’ammiraglia Claude Opus 5.5, quella che dovrebbe essere la più brava di tutte.
Tradotto per chi non scrive codice tutto il giorno: pensa a un assistente a cui chiedi di “sistemare la cucina” da solo. Il modello di mezzo non solo lo fa, ma lo fa più in fretta, spende meno energia, e il risultato finale è più pulito di quello che avrebbe fatto l’assistente “di lusso” che costava il doppio e che fino a ieri sceglievi quasi per riflesso.
Il modello di fascia media supera l’ammiraglia nei compiti di coding agentico.
Cosa cambia davvero
Il punto non è la gara interna tra due nomi della stessa famiglia. È che la gerarchia “più caro uguale più bravo”, su cui ci siamo basati per due anni per scegliere quale AI usare, si sta incrinando, almeno per certi lavori specifici:
- Sonnet 5.5 è più veloce di oltre il 30% rispetto al predecessore Sonnet 5
- I costi effettivi per singolo task scendono fino al 30%
- Nel benchmark Terminal-Bench 4.0, che misura quanto un agente sa cavarsela da solo in un terminale (scrivere codice, eseguirlo, leggere l’errore, correggerlo), il punteggio è notevole
I numeri che contano
- 70,6% il punteggio di Sonnet 5.5 su Terminal-Bench 4.0
- 66,4% il punteggio di Opus 5.5, il modello ammiraglia e più costoso della famiglia
- 30% il taglio sui costi per task rispetto alla generazione precedente
Un caso concreto: se oggi gestisci un workflow dove un agente deve aprire un terminale, scrivere uno script di automazione (penso a chi smista immagini in batch, o a chi fa girare pipeline di editing), lanciarlo e correggere da solo gli errori che trova, fino a ieri la scelta “sicura” era puntare sul modello più potente disponibile, costi permettendo. Da oggi quella scelta non è più scontata: il modello di mezzo fa lo stesso lavoro, più veloce, e costa meno.
Non vince la potenza bruta, vince l’efficienza nel compito specifico.
Tre cose che mi porto via
- Il prezzo non è più un indicatore affidabile della qualità del risultato: va verificato caso per caso, non dato per scontato.
- Per chi usa agenti AI nei flussi quotidiani, conviene ritestare i propri workflow con il modello “economico” prima di pagare per quello “premium” per abitudine.
- La competizione tra i grandi laboratori si sta spostando dal “chi è più grande” al “chi è più specializzato per quel compito preciso”.
Alla fine è come scoprire che l’obiettivo da 300 euro restituisce scatti più nitidi di quello da 2000, almeno per i soggetti che fotografi davvero. Vale la pena controllare prima di comprare d’istinto il pezzo più caro dello scaffale.
Fonte: https://www.anthropic.com/news/introducing-claude-sonnet-5-5
✍️ Articolo firmato da “La Redazione”: sistema editoriale multi-agente (AI) orchestrato con Claude Code e supervisionato da Luca Cazzaniga · lucacazzaniga.it
Creatività Aumentata
Analisi di approfondimento direttamente nella tua casella di posta.