OpenAI's GPT-Live: ChatGPT voce che ascolta e parla

      OpenAI vuole che tu parli con ChatGPT, non che ci scriva. L'8 luglio ha lanciato GPT-Live, una nuova generazione di modelli vocali. L'azienda afferma che rendono parlare con l'IA molto più simile a una conversazione reale. Due versioni, GPT-Live-1 e un più piccolo GPT-Live-1 mini, raggiungono gli utenti di ChatGPT in tutto il mondo a partire da oggi.

      Il cambiamento principale risiede nell'architettura. GPT-Live funziona in “full-duplex”, quindi può ascoltare e parlare contemporaneamente. Può inserire un “mhmm” o un “capito”, scambiare veloci battute, o aspettare mentre pensi. I vecchi modelli vocali dovevano aspettare che tu smettessi di parlare prima. Questo spesso li portava a intervenire nel momento sbagliato.

      Pensa in sottofondo, continua a parlare

      Il secondo cambiamento è la delega. Quando una domanda richiede una ricerca sul web o un ragionamento più complesso, GPT-Live la affida a un modello più potente in background. Quel modello è GPT-5.5 al lancio. GPT-Live continua a chiacchierare mentre aspetta, poi reinserisce la risposta.

      “Questo è esattamente come gli esseri umani interagiscono tra loro,” ha detto ai giornalisti Atty Eleti, responsabile del prodotto vocale di ChatGPT, secondo CNET. “Manteniamo la conversazione attiva mentre pensiamo in sottofondo.”

      Una demo ha attirato l'attenzione. Nelle conferenze stampa, il modello ha gestito la traduzione simultanea in tempo reale, fornendo una traduzione continua mentre il presentatore parlava. TechRadar, che ha visto la funzionalità, l'ha definita genuinamente utile. Il modello risponde anche a una parola di attivazione, con il personale di OpenAI che usa “Hey Chat” nella demo.

      Più intelligente e gratuito per tutti

      OpenAI definisce GPT-Live il suo modello vocale più intelligente finora. Gli utenti possono scegliere un livello di ragionamento: Immediato, Medio o Alto. La voce può ora mostrare schede visive per cose come meteo, azioni e sport. L'azienda afferma che GPT-Live-1 e il mini superano il vecchio Modello Vocale Avanzato in conversazioni di prova di cinque-dieci minuti. Riporta anche grandi guadagni nei benchmark per il ragionamento scientifico e la ricerca web agentica.

      Più di 150 milioni di persone già utilizzano la Voce e la Dettatura di ChatGPT ogni settimana, afferma OpenAI. GPT-Live-1 diventa il predefinito per gli abbonati Go, Plus e Pro, mentre gli utenti gratuiti ottengono il mini. Raggiunge iOS, Android e il web, anche se il rollout potrebbe richiedere alcuni giorni.

      Il problema del suono umano

      Suonare umano ha i suoi pro e contro. OpenAI afferma di aver aggiunto formazione specifica sulla sicurezza vocale e salvaguardie in tempo reale. Queste possono orientare una risposta, fornire risorse in caso di crisi o terminare una conversazione in casi ad alto rischio, con protezioni aggiuntive per gli adolescenti. Sottolinea anche che GPT-Live utilizza voci preimpostate e non imiterà una persona reale.

      Questa cautela è importante. Un modello che suona come un amico guadagna fiducia più facilmente, e inganna più facilmente anche. Critici come Meredith Whittaker di Signal hanno avvertito che i chatbot “non sono i tuoi amici.” Il campo rimane affollato. Rivali come ElevenLabs e una serie di startup di agenti vocali inseguono lo stesso premio. La corsa più ampia degli assistenti ha spinto Amazon a ricostruire Alexa.

      Perché è importante

      Questo avviene lo stesso giorno in cui OpenAI ha proseguito con un ampio rollout di GPT-5.6, parte di un ritmo di rilascio veloce. Per anni, la voce è stata un extra conveniente, non il modo principale in cui le persone usano ChatGPT. Con GPT-Live, OpenAI sta scommettendo che parlare, non digitare, diventi il predefinito. Se le persone vogliono un'IA che non smette mai di ascoltare è la domanda aperta.

Altri articoli

Il CEO di ElevenLabs sui 600 milioni di dollari di fatturato e i laboratori di intelligenza artificiale Il CEO di ElevenLabs sui 600 milioni di dollari di fatturato e i laboratori di intelligenza artificiale Al RAISE Summit di Parigi, il CEO di ElevenLabs Mati Staniszewski ha dettagliato un percorso verso un fatturato riportato di 600 milioni di dollari e come la startup vocale intende superare i laboratori di intelligenza artificiale. Il server AI gratuito di ZML funziona su qualsiasi chip principale. Il server AI gratuito di ZML funziona su qualsiasi chip principale. ZML di Francia rilascia ZML/LLMD, un server di inferenza gratuito che esegue AI open-source su chip Nvidia, AMD, Google, Intel e Apple alla massima velocità. Il server AI gratuito di ZML funziona su qualsiasi chip principale. Il server AI gratuito di ZML funziona su qualsiasi chip principale. ZML di Francia rilascia ZML/LLMD, un server di inferenza gratuito che esegue AI open-source su chip Nvidia, AMD, Google, Intel e Apple alla massima velocità. La NATO sceglie Accenture e Leonardo per un cloud sicuro da 200 milioni di euro La NATO sceglie Accenture e Leonardo per un cloud sicuro da 200 milioni di euro La NATO firma un contratto di ~200 milioni di euro, della durata di sette anni, con Accenture e Leonardo per costruire una rete cloud sicura, il Protected Business Network, per l'Alleanza. GPT-Live di OpenAI: ChatGPT voce che ascolta e parla OpenAI ha lanciato GPT-Live, una voce ChatGPT a doppio verso che ascolta e parla contemporaneamente, con traduzione in tempo reale. Viene distribuito a tutti gli utenti, anche a quelli gratuiti. Il nuovo standard video di Android 17 risolve uno dei maggiori problemi dell'HDR. Il nuovo standard video di Android 17 risolve uno dei maggiori problemi dell'HDR. Android 17 introduce un nuovo standard HDR chiamato Eclipsa Video che promette una riproduzione HDR coerente e confortevole su ogni schermo.

OpenAI's GPT-Live: ChatGPT voce che ascolta e parla

OpenAI ha lanciato GPT-Live, una voce ChatGPT a pieno duplex che ascolta e parla contemporaneamente, con traduzione in tempo reale. Viene distribuito a tutti gli utenti, anche a quelli gratuiti.