Prodotto · 2 ottobre 2026

Pubblicato anche in Français, Deutsch, Português (Brasil)

Anthropic lancia Claude Sonnet 5.5 con miglioramenti in programmazione e analisi visiva

Messy workspace with desk, papers, lamps, and photos on wall
C. Stone / Unsplash

Anthropic ha lanciato Claude Sonnet 5.5, il secondo modello della famiglia Claude 5.5 dopo Opus 5.5.

Techsauce ha riportato che il nuovo modello è più veloce di oltre il 30% rispetto a Claude Sonnet 5 e riduce i costi per operazione fino al 30% nella maggior parte dei compiti. Mentre Opus 5.5 è destinato a lavori complessi che richiedono un giudizio accurato, Sonnet 5.5 è ottimizzato per attività quotidiane con perimetri definiti, correzione di errori, documentazione, presentazioni e fogli di calcolo. Il modello Claude Haiku 5.5, rivolto a volumi di lavoro elevati con costi controllati, è atteso nelle prossime settimane.

Il modello ha mostrato progressi significativi nei test di programmazione agentica. Nel Terminal-Bench 4.0, che misura operazioni multi-step sull'interfaccia a riga di comando, ha raggiunto il 70,6%, superando il 66,4% di Opus 5.5. Su CursorBench 4.0 ha ottenuto il 55,5%, rispetto al 34,1% di Sonnet 5, posizionandosi vicino al 57,8% di Opus 5.5. In FrontierCode 1.1, al massimo livello di sforzo, ha registrato il 46,2%, contro il 54,4% di Opus 5.5 e il 52,1% di GPT-6 Sol.

Per quanto riguarda il lavoro di conoscenza, Sonnet 5.5 ha ottenuto 1844 punti su GDPval-AA v2.1, quasi eguagliando i 1846 di Opus 5.5. In AA-Briefcase v1.1 ha raggiunto 1811 punti, superando Sonnet 5 (1359) e GPT-6 Sol (1483). Nelle capacità di utilizzo del computer su OSWorld 2.1, ha segnato l'80,1%, avvicinandosi all'81,8% di Opus 5.5. In Chartography ha ottenuto il 61,6%, superando GPT-6 Sol (53,6%), mentre in Humanity's Last Exam ha raggiunto il 64,5%. È inoltre il primo modello Sonnet capace di completare il gioco Pokémon Red basandosi esclusivamente su screenshot.

I prezzi rimangono invariati rispetto a Sonnet 5: 2 dollari per 1 milione di token in ingresso, 10 dollari per 1 milione di token in uscita, 0,20 dollari per le letture della cache e 2,50 dollari per la scrittura della cache. La riduzione dei costi per operazione deriva dall'utilizzo di meno token per compito. Gli utenti possono regolare il livello di sforzo tra basso, medio e alto per bilanciare velocità, costo e qualità.

Anthropic ha precisato che, nonostante i risultati nei test, Opus 5.5 rimane più solido in compiti aperti e complessi che richiedono un giudizio continuo. Sul piano della sicurezza, la valutazione dell'allineamento si è concentrata sui rischi comuni a tutti i modelli, come l'agire contro gli interessi dell'utente o la collaborazione in utilizzi impropri ad alto impatto.