DeepSeek lancia un modello multimodale sperimentale per competere con Anthropic

DeepSeek lancia un modello multimodale sperimentale per competere con Anthropic

      DeepSeek ha rilasciato un modello multimodale sperimentale venerdì e ha dichiarato che le prestazioni del suo agente sono vicine a quelle di Opus-4.8 di Anthropic. Nella tabella pubblicata da DeepSeek, supera quel modello in tre benchmark su undici.

      DeepSeek-V4-Flash-Vision-Exp è attivo sulla piattaforma API dell'azienda. Prende il V4-Flash solo testo e aggiunge la capacità di leggere immagini e screenshot. Può quindi agire su ciò che vede. L'azienda di Hangzhou ha anche rilasciato la versione 0.1.1 della sua imbracatura per agenti, con supporto integrato.

      “Questo modello multimodale sperimentale eguaglia DeepSeek-V4-Flash nelle capacità testuali, inclusi agenti, ragionamento e conoscenza del mondo,” ha scritto DeepSeek su X. Nei benchmark per agenti multimodali “fa un grande balzo rispetto a V4-Flash, portando le prestazioni degli agenti multimodali vicino a Opus-4.8”.

      Quale Opus, e perché è meno importante di quanto sembri

      Opus-4.8 è arrivato a maggio. Anthropic ha introdotto Claude Opus 5 il 24 luglio, e TNW ha riportato allora che Opus 5 eguagliava Fable nella codifica per metà costo.

      Opus-4.8 non è scomparso. La pagina di deprecazione del modello di Anthropic lo elenca come Attivo, uno stato che l'azienda definisce come completamente supportato e raccomandato per l'uso, senza pensionamento prima di maggio 2027. Cinque modelli Opus portano quel status contemporaneamente.

      Quindi DeepSeek ha scelto un concorrente attuale e supportato piuttosto che uno abbandonato. Ciò che la tabella non riporta è una colonna per Opus 5, e nessun altro ha pubblicato quella comparazione. Come V4-Flash-Vision-Exp si misura rispetto al più recente Opus di Anthropic è semplicemente sconosciuto, e il rilascio non afferma il contrario.

      Bloomberg ha riportato il rilascio venerdì, descrivendo Opus 4.8 come un modello avanzato di Anthropic.

      Cosa dicono realmente i numeri

      DeepSeek ha pubblicato undici risultati di benchmark. Il suo nuovo modello supera Opus-4.8 in tre di essi.

      Vince DeepSWE di 1.3 punti, l'Ultimo Esame degli Agenti di 1.6 e ZeroBench di 1.0. Negli altri otto è in ritardo. In due di questi il margine è ampio. NL2Repo ha DeepSeek a 57.7 contro 69.7, un divario di 12 punti. DSBench-Hard lo ha a 63.6 contro 71.7.

      I risultati ravvicinati sono genuinamente vicini. Toolathlon-Verified si divide 75.9 a 76.2. Chartography si divide 64.3 a 65.0. Terminal Bench 2.1 è 83.9 contro 85.0.

      Un numero vale la pena notare per ciò che dice sul campo piuttosto che sulla competizione. Su AutomationBench, tutti e tre i modelli ottengono punteggi nella fascia media venti: 25.7, 25.1 e 27.2. Qualunque cosa gli agenti siano ora bravi a fare, quel benchmark non è essa.

      Il balzo multimodale ha un asterisco, e DeepSeek lo ha fornito

      L'affermazione principale è il salto nelle prestazioni degli agenti multimodali rispetto a V4-Flash. Su ApexBench è 36.5 contro 26.2, e su Ultimo Esame degli Agenti 27.3 contro 25.2.

      La nota a piè di pagina di DeepSeek spiega parte del divario. In quelle due valutazioni, dice, il V4-Flash basato su testo “ignora gli elementi multimodali contenuti in esso”. Il modello più vecchio viene valutato su test contenenti immagini che non può vedere.

      Ciò non rende sbagliati i punteggi del nuovo modello. Significa solo che il salto è in parte una misurazione di ciò che accade quando si dà a un modello cieco un test della vista. DeepSeek lo ha rivelato nella tabella piuttosto che lasciarlo da scoprire, il che è più di quanto facciano molti laboratori.

      DeepSeek sta sottovalutando un risultato

      L'azienda afferma che il modello visivo “eguaglia” V4-Flash nel testo. Sui propri dati fa meglio di così.

      Su sette benchmark testuali, la variante visiva supera il modello solo testo in sei. Toolathlon-Verified migliora di 5.6 punti, DeepSWE di 4.9, DSBench-Hard di 4.0. Cybergym è l'eccezione. Lì il modello visivo ottiene 75.3 contro 76.7, quindi aggiungere la vista gli è costato 1.4 punti su un benchmark di sicurezza.

      Ognuno di questi numeri proviene da DeepSeek. L'azienda afferma di aver valutato i propri modelli utilizzando la propria imbracatura in modalità minima, con temperatura a 1.0 e top_p a 0.95. I benchmark dei fornitori sono normali e le impostazioni sono divulgate. Rimangono comunque del fornitore.

      Perché il confronto è commercialmente importante

      Il motivo per cui tutto ciò ha rilevanza è il prezzo. Una ricerca di questo mese ha trovato che V4-Flash è il modello ben noto più economico da eseguire. Un milione di parole costa circa 87 centesimi da DeepSeek contro circa 50 dollari da Anthropic, un divario che gli acquirenti aziendali hanno già notato.

      Contro quel divario, essere in ritardo di un punto o due è un argomento commerciale piuttosto che una sconfitta. Perdere NL2Repo di 12 punti è un'altra questione. Il lavoro su scala repository è esattamente ciò per cui le imprese stanno acquistando agenti.

      DeepSeek ha confermato separatamente sul proprio sito che la versione ufficiale di V4-Pro è stata spedita, con quelle che chiama capacità degli agenti significativamente migliorate, supporto per Responses API e integrazione Codex. Questo è il modello che la maggior parte degli acquirenti aziendali starebbe effettivamente considerando, e non è nemmeno nella tabella di venerdì.

      Leggi l'affermazione, poi leggi la tabella

      Niente di tutto ciò è insolito. I laboratori scelgono baseline favorevoli. La scrivania è stata qui di recente, quando Alibaba ha chiamato Qwen il modello open più scaricato al mondo, il che era vero con un margine più ridotto di quanto affermato.

      L'affermazione di DeepSeek è difendibile nei propri termini. Ha detto vicino a Opus-4.8, e su diversi benchmark è vicino a Opus-4.8. Non ha detto vicino al modello più recente di Anthropic, e non ha affermato di essere in testa nel set.

      Il test che risolverebbe la questione ha un nome e nessun risultato. Qualcuno deve eseguire V4-Flash-Vision-Exp contro Opus 5 sulla stessa imbracatura. Fino ad allora, il riassunto onesto è più ristretto rispetto ai titoli. Un modello multimodale sperimentale cinese si trova entro pochi punti da un modello americano supportato su gran parte di un insieme di benchmark, vince tre su undici, costa una frazione in più e perde di dodici punti sul compito più difficile in esso.

Altri articoli

Samsung approva un ritorno record di $80 miliardi per gli azionisti, e il titolo scende Samsung approva un ritorno record di $80 miliardi per gli azionisti, e il titolo scende Samsung restituirà fino a 80 miliardi di dollari agli azionisti, un record coreano. Il titolo è sceso del 2,6%, poiché il piano di riacquisto è ancora sconosciuto. YouTube aumenta i prezzi di Premium in tutta Europa con una scadenza per l'adesione. YouTube aumenta i prezzi di Premium in tutta Europa con una scadenza per l'adesione. I prezzi di YouTube Premium stanno aumentando in tutta Europa. Un avviso visto da TNW mostra che gli abbonati devono accettare attivamente, o perderanno il servizio. Google Home finalmente risolve i suoi goffi comandi vocali, ma la maggior parte degli utenti non può ancora utilizzarli. Google Home finalmente risolve i suoi goffi comandi vocali, ma la maggior parte degli utenti non può ancora utilizzarli. Google Home può ora impostare le tue luci su un valore di kelvin esatto con la tua voce, anche se quella funzione e altre due sono in un programma di accesso anticipato. Nvidia paga a Poolside 6 miliardi di dollari per licenziare la sua fabbrica di modelli e assumere 109 dipendenti. Nvidia paga a Poolside 6 miliardi di dollari per licenziare la sua fabbrica di modelli e assumere 109 dipendenti. Nvidia sta pagando a Poolside 6 miliardi di dollari per licenziare il suo software di costruzione di modelli e assumere 109 dipendenti. La lettera insiste sul fatto che non si tratta di un'acquisizione. ChatGPT può ora leggere le tue chat di Apple Messages su Mac ChatGPT può ora leggere le tue chat di Apple Messages su Mac L'ultimo aggiornamento di ChatGPT per Mac aggiunge l'integrazione di Apple Messages, consentendo agli utenti di portare le conversazioni dall'app di messaggistica di Apple nell'assistente AI. Mark Zuckerberg ha comprato un castello, mentre il resto di noi ne riceve uno di sabbia, una volta all'anno. Mark Zuckerberg ha comprato un castello, mentre il resto di noi ne riceve uno di sabbia, una volta all'anno. Mark Zuckerberg ha acquistato un'azienda irlandese di 440 acri nella settimana in cui Meta è andata a processo per i bambini. Tuttavia, il castello non è il problema.

DeepSeek lancia un modello multimodale sperimentale per competere con Anthropic

Il modello multimodale sperimentale di DeepSeek vince tre degli undici benchmark contro Opus-4.8 di Anthropic, nella tabella pubblicata da DeepSeek.