La rivoluzione dell'IA sta ottimizzando per le cose sbagliate

La rivoluzione dell'IA sta ottimizzando per le cose sbagliate

      TL;DR I modelli AI di frontiera stanno migliorando nel coding e nei compiti agentici, ma peggiorando nella scrittura generale. Il fondatore di Wizard Labs, Maz Ahmadi, riporta una regressione misurabile sui benchmark di prosa specifici per i clienti attraverso gli aggiornamenti dei modelli. Con il 44% delle organizzazioni che scala l'AI a livello aziendale, ma solo il 37% che vede un impatto sull'EBIT (McKinsey), il divario tra implementazione e valore si sta ampliando. La sua prescrizione: costruire suite di valutazione personalizzate prima dell'inizio dello sviluppo e smettere di selezionare modelli basati su benchmark pubblici. Ogni grande modello di linguaggio esistente oggi sta peggiorando nella scrittura, e quasi nessuno lo sta misurando. L'industria continua a chiedere quale modello sia il più intelligente, ma la domanda più grande è: intelligente in cosa? Mentre i giganti della tecnologia inseguono contratti aziendali redditizi, stanno ottimizzando i modelli di frontiera per il coding, la logica e i flussi di lavoro degli agenti autonomi. Nel processo, la prosa generale è diventata un pensiero secondario. Sui nostri benchmark specifici per i clienti, il mio team ha notato una regressione che dovrebbe allarmare chiunque utilizzi l'AI per la comunicazione. Con gli aggiornamenti dei modelli, le loro prestazioni di scrittura stanno attivamente diminuendo. Questo potrebbe sembrare un problema esoterico per ingegneri e team di contenuti. Non lo è. L'AI ora è parte del lavoro quotidiano di milioni di persone. Quasi nove aziende su dieci ora utilizzano regolarmente l'AI in una funzione aziendale: redazione di rapporti, risposta ai clienti, preparazione di documenti legali, scrittura di codice, analisi di ricerche e presa di decisioni. Se i modelli sottostanti vengono ottimizzati per una definizione diversa di prestazione, tutti ereditano le conseguenze. L'ultimo dibattito sul watermarking del testo AI rende tutto ciò ancora più interessante. Anthropic ha annunciato questo mese che i futuri modelli Claude watermarkeranno il testo generato per conformarsi alla legge sull'AI dell'UE. La tecnica utilizza schemi statistici nella selezione dei token in modo che il testo generato possa essere successivamente identificato come probabilmente coinvolto Claude. Anthropic insiste sul fatto che il suo metodo non ha effetti pratici sulla qualità, creatività o leggibilità, e fa riferimento alla ricerca dietro l'approccio. Tuttavia, gli utenti aziendali dovrebbero chiedersi cosa succede quando un modello viene contemporaneamente ottimizzato attorno ai requisiti normativi, alle prestazioni agentiche, al coding e al ragionamento. Ho già visto prove nel nostro lavoro che gli aggiornamenti dei modelli possono produrre risultati peggiori per compiti di scrittura specifici. Il watermarking potrebbe rivelarsi innocuo in isolamento; non affermerei il contrario. Ma la tendenza più ampia merita attenzione. Se i laboratori di frontiera ottimizzano attorno ai benchmark che guidano l'adozione e le entrate, un modello può diventare oggettivamente migliore mentre diventa peggiore per un particolare business. Questo è il paradosso che le aziende stanno iniziando a incontrare. Il 44% delle organizzazioni riporta ora che l'AI si sta espandendo a livello aziendale, rispetto al 38% di un anno fa. Eppure solo il 37% riporta un impatto sull'EBIT a livello aziendale dall'AI, mentre l'80% afferma che l'AI ha migliorato la produttività individuale. La tecnologia si sta diffondendo più velocemente del valore. Vedo lo stesso errore ripetutamente. Un'azienda chiede: "Qual è il modello migliore?" Seleziona il modello che domina i benchmark pubblici, costruisce un sistema attorno ad esso e si aspetta che il progetto si comporti come lo sviluppo software convenzionale. L'AI non funziona in questo modo. Un modello che è il migliore modello di linguaggio di grandi dimensioni generalizzato potrebbe essere mediocre nel flusso di lavoro particolare di un'azienda. L'unico test significativo è il compito stesso. Ciò significa sviluppare suite di valutazione personalizzate prima dell'inizio dello sviluppo, misurare i modelli rispetto ai requisiti reali dell'azienda e poi testare continuamente quei risultati man mano che i modelli cambiano. Qui è dove l'AI aziendale ha bisogno di una nuova disciplina. Inizia con il problema aziendale, testa la tecnologia contro le prestazioni nel mondo reale e continua a perfezionarla fino a quando l'economia e il flusso di lavoro hanno senso, assicurandoti che la tecnologia supporti il modo in cui l'azienda funziona realmente prima di essere scalata in tutta l'organizzazione. Un futuro più forte può esistere, dove le aziende costruiscono l'AI attorno ai propri dati e competenze, fornendo ai dipendenti sistemi di supporto decisionale che possono estendere la conoscenza specializzata in tutta l'organizzazione. Il pericolo risiede nel delegare il giudizio critico a sistemi generici, trattando i punteggi dei benchmark come prova di competenza e scoprendo troppo tardi che la tecnologia è stata ottimizzata per la definizione di successo di qualcun altro. Credo che il primo futuro appartenga alle aziende disposte a mettere in discussione i predefiniti. Ciò potrebbe anche significare riconsiderare l'assunzione che ogni azienda dovrebbe fare affidamento sul modello proprietario più grande. I modelli a peso aperto stanno diventando sempre più capaci e possono essere ospitati all'interno dell'infrastruttura scelta da un'organizzazione. La domanda che sento dalle aziende riguardo se i modelli sviluppati in Cina siano intrinsecamente non sicuri è spesso formulata come una questione geopolitica. Tecnicamente, la domanda più importante è dove viene eseguito il modello, chi controlla l'infrastruttura, quali dati lasciano l'ambiente e quale architettura di sicurezza lo circonda. Il vantaggio competitivo deriverà dal prendere quelle scelte in modo intenzionale. La natura della rivoluzione AI è cambiata da una corsa per l'intelligenza grezza a una disciplina di ingegneria adatta. I futuri leader di mercato non vinceranno semplicemente implementando i modelli fondamentali più recenti. Invece, il successo favorirà le organizzazioni che definiscono esigenze operative precise, applicano benchmark rigorosi e mantengono la chiarezza strategica per sostituire un modello esaltato e celebrato quando un'alternativa meno glamour offre risultati superiori. I dirigenti dovrebbero smettere di chiedere ai loro fornitori di AI quale modello sia il migliore. Dovrebbero chiedere loro di dimostrare quale modello sia il migliore per il loro business. Questo singolo cambiamento trasformerebbe l'AI da un esercizio di approvvigionamento tecnologico in ciò che è realmente: un test a lungo termine di sopravvivenza competitiva.

Altri articoli

JPMorgan guida un pacchetto di debito da 5 miliardi di dollari per l'espansione del centro dati AI di Volta JPMorgan guida un pacchetto di debito da 5 miliardi di dollari per l'espansione del centro dati AI di Volta JPMorgan sta sondando i finanziatori per un pacchetto da 5 miliardi di dollari per finanziare Volta, il cui primo edificio è un campus alimentato da energia idroelettrica norvegese affittato da un minatore di bitcoin. Nvidia sarebbe in trattative per acquistare Hugging Face per 12,9 miliardi di dollari. Nvidia sarebbe in trattative per acquistare Hugging Face per 12,9 miliardi di dollari. Nvidia è stata in trattative per acquisire Hugging Face a una valutazione superiore ai 13 miliardi di dollari, tre anni dopo che l'hub dei modelli aperti ha rifiutato il suo investimento. PlayStation Plus sta per ricevere Sniper Elite: Resistance, oltre a un JRPG che vale il tuo tempo. PlayStation Plus sta per ricevere Sniper Elite: Resistance, oltre a un JRPG che vale il tuo tempo. PlayStation Plus sta per ricevere Sniper Elite: Resistance, Chained Echoes, MLB The Show 26 e Wobbly Life come giochi mensili di settembre. La prossima frontiera nel fintech è comprendere la persona dietro i dati. La prossima frontiera nel fintech è comprendere la persona dietro i dati. Il fondatore di Neumetria, Amr Mohamed, sostiene che il fintech ha bisogno di uno strato di comprensione comportamentale che interpreti il motivo per cui avvengono le transazioni, non solo cosa siano. Con gli agenti di intelligenza artificiale che si avvicinano ai sistemi finanziari, il contesto diventa infrastruttura. Cyberpunk 2077 sta dando un impulso necessario al monitor da gioco 3D senza occhiali di Samsung. Cyberpunk 2077 sta dando un impulso necessario al monitor da gioco 3D senza occhiali di Samsung. Cyberpunk 2077 sta ricevendo supporto dedicato per il monitor 3D Odyssey di Samsung, offrendo all'azienda una grande vetrina mentre cerca di dimostrare che il gioco 3D senza occhiali può essere più di una novità. Samsung ha costruito un monitor da gioco da 1.100Hz perché apparentemente 600Hz non era abbastanza veloce. Samsung ha costruito un monitor da gioco da 1.100Hz perché apparentemente 600Hz non era abbastanza veloce. Il nuovo monitor da gioco Odyssey G6 di Samsung può raggiungere 1.100Hz a risoluzione HD, leggermente sopra il massimo di 1.040Hz precedentemente annunciato, mentre la sua modalità QHD a 600Hz potrebbe rivelarsi più pratica.

La rivoluzione dell'IA sta ottimizzando per le cose sbagliate

Man mano che i laboratori di frontiera si ottimizzano per la codifica e gli agenti, la qualità della prosa generale sta diminuendo. Il fondatore di Wizard Labs, Maz Ahmadi, sostiene che le imprese dovrebbero smettere di chiedere quale modello sia il migliore e iniziare a dimostrare quale sia il migliore per il loro business.