Anthropic lancia Claude Opus 5, il suo quarto modello in due mesi, e supera Fable 5 nella maggior parte dei benchmark.
TL;DRClaude Opus 5 supera Fable 5 nella maggior parte dei benchmark a metà prezzo del token ed è il modello più allineato di Anthropic fino ad oggi
Anthropic giovedì ha rilasciato Claude Opus 5, un modello che eguaglia o supera il suo modello di punta Fable 5 nella maggior parte dei benchmark di codifica e lavoro conoscitivo a metà prezzo del token. Il modello è il quarto che Anthropic ha lanciato in meno di due mesi, dopo Fable 5 all'inizio di giugno, Sonnet 5 alla fine di giugno e ora Opus 5 il 24 luglio. Costa $5 per milione di token di input e $25 per milione di token di output, lo stesso prezzo del suo predecessore.
Su Frontier-Bench, una valutazione di codifica che misura se i modelli possono costruire software funzionante a partire da disegni ingegneristici, Opus 5 più che raddoppia il punteggio del suo predecessore e supera ogni modello concorrente, incluso Fable 5. Su ARC-AGI 3, che testa la risoluzione di problemi innovativi, Opus 5 ottiene un punteggio circa tre volte superiore rispetto al modello successivo migliore. Su Zapier AutomationBench, che misura se i modelli possono completare compiti aziendali reali dall'inizio alla fine, Opus 5 supera più compiti di qualsiasi rivale anche nella sua impostazione di sforzo più bassa.
Anthropic afferma che Opus 5 è anche il suo modello più allineato fino ad oggi, con il tasso più basso di comportamento ingannevole registrato nel suo audit di sicurezza automatizzato. Il suo predecessore ha fissato un nuovo standard di onestà quando è stato lanciato a fine maggio, e Opus 5 spinge ulteriormente quel limite pur rimanendo dietro Mythos 5 nei compiti di cybersecurity offensiva. Anthropic afferma di aver intenzionalmente evitato di addestrare il modello su lavori informatici, anche se ha migliorato in quei compiti come effetto collaterale di diventare più capace in generale.
Il modello è disponibile oggi come nuovo predefinito su Claude Max e il modello più potente su Claude Pro. Gli sviluppatori possono accedervi tramite l'API, Amazon Bedrock, Google Cloud e Microsoft Foundry. Una modalità Veloce funziona a due volte e mezzo la velocità predefinita per il doppio del prezzo base, e due nuove funzionalità API vengono lanciate insieme ad essa: cambiamenti degli strumenti a metà conversazione che consentono agli sviluppatori di scambiare strumenti senza interrompere la cache dei prompt, e fallback automatici che reindirizzano le richieste contrassegnate a un modello diverso invece di bloccarle.
Il ritmo di rilascio racconta una storia più ampia su dove sta andando il mercato dei modelli AI. Anthropic è passata dal lanciare un modello di punta per trimestre a quattro modelli in circa otto settimane, ciascuno mirato a un diverso slot di prezzo-prestazioni. Opus 5 colma il divario tra il costoso livello Fable e il livello economico Sonnet, offrendo intelligenza quasi di frontiera per la codifica quotidiana e il lavoro conoscitivo senza le restrizioni di cybersecurity che limitano Fable o le restrizioni di accesso che tengono Mythos dietro porte chiuse.
Iscriviti alla newsletter TNW
Ricevi le notizie tecnologiche più importanti nella tua casella di posta ogni settimana.
Altri articoli
Anthropic lancia Claude Opus 5, il suo quarto modello in due mesi, e supera Fable 5 nella maggior parte dei benchmark.
Claude Opus 5 stabilisce nuovi record su Frontier-Bench e ARC-AGI a $5 per milione di token di input, metà del costo di Fable 5, ed è il modello più allineato di Anthropic.
