OpenAI lanza nuevos modelos de voz para conversaciones más naturales en tiempo real
Tecnología

OpenAI lanza nuevos modelos de voz para conversaciones más naturales en tiempo real

OpenAI presentó hoy dos nuevos modelos de conversación denominados GPT-Live-1 y GPT-Live-1 mini, que prometen sonar más naturales y manejar mejor los turnos de palabra en diálogos. Estos modelos de dúplex completo permiten que la inteligencia artificial hable y escuche simultáneamente, lo que facilita interrupciones naturales y características como traducción en vivo. La compañía reemplazará su actual Modo de Voz Avanzado en ChatGPT con GPT-Live-1 mini de forma predeterminada, mientras que los usuarios de planes pagos accederán al modelo más grande GPT-Live-1.

TECNOLOGÍA9 JUL 2026

OpenAI anunció el lanzamiento de sus nuevos modelos de voz conversacional en una sesión informativa con la prensa. Los modelos GPT-Live-1 y GPT-Live-1 mini representan un avance significativo en la tecnología de interacción por voz, abordando limitaciones críticas del sistema anterior.

El modelo anterior funcionaba mediante una arquitectura de tres componentes: un modelo de conversión de voz a texto que transcribía el habla, un modelo de lenguaje grande que generaba respuestas, y un modelo de conversión de texto a voz que entregaba la respuesta final. Esta estructura secuencial generaba problemas específicos que OpenAI identificó durante el desarrollo de sus nuevas soluciones.

Según la compañía, los nuevos modelos resuelven problemas fundamentales como la interrupción de usuarios mientras hablan y la falta de inteligencia suficiente para responder preguntas complejas. La arquitectura de dúplex completo permite que el sistema hable y escuche al mismo tiempo, eliminando la necesidad de esperar a que termine de hablar para procesar información. Los nuevos modelos envían consultas a los últimos modelos de texto de OpenAI, como GPT-5.5, para búsqueda, razonamiento o capacidades de agentes autónomos, mientras continúan la conversación sin interrupciones.

Una característica notable es la capacidad del modelo de permanecer en silencio durante períodos prolongados, absorbiendo el contexto de la conversación hasta que sea invocado. Además, como el nuevo modo de voz tiene acceso a modelos GPT más recientes, puede presentar información en formato visual, una característica que también están explorando otras empresas emergentes como Monogram, que recaudó 40 millones de dólares en financiamiento de semilla de DST y Lux Capital.

OpenAI diseñó el nuevo modo de voz en ChatGPT para mantener conversaciones más largas. Durante la sesión informativa, Atty Eleti, líder de producto del Modo de Voz de ChatGPT, reveló que ha mantenido conversaciones de 30 a 40 minutos con la función de voz durante caminatas. La compañía considera que la voz podría convertirse en la interfaz principal para la computación en trabajos complejos.

"Con el tiempo, creemos que esto también desbloqueará la capacidad de usar la voz como una especie de interfaz principal para la computación y para gestionar trabajos de agentes cada vez más complejos y de larga duración. Creemos que la voz puede ser la interfaz futura para todo tipo de trabajo", afirmó Eleti.

OpenAI ha trabajado durante varios años en fortalecer las características basadas en voz para que el modo de voz de ChatGPT suene más natural. La compañía informó que más de 150 millones de personas hablan con ChatGPT utilizando características como Voz y Dictado.

La competencia también se mueve en la misma dirección. Tanto Apple como Amazon han actualizado sus asistentes para ser más conversacionales con mejor manejo del contexto. Empresas emergentes como Sesame, fundada por el cofundador de Oculus Brendan Iribe y Ankit Kumar, también lanzaron asistentes de inteligencia artificial con conversación más natural mientras completan tareas en segundo plano.

OpenAI se enfoca en permitir que los usuarios hablen con su asistente sin manos libres durante períodos más prolongados. A pesar de su afirmación de que el nuevo modo de voz suena más natural, la compañía enfatizó que no pretende crear un compañero de inteligencia artificial. Señaló que los nuevos modelos tienen salvaguardas integradas para proporcionar respuestas apropiadas para la edad a adolescentes y ofrecer recursos si la conversación se desvía hacia temas como el autolesionismo.

Sin embargo, el nuevo modo de voz aún requiere mejoras. Durante la demostración, cuando la compañía mostró su función de traducción en vivo en hindi, el asistente tenía un acento estadounidense marcado y hablaba hindi de manera poco natural con un tono ligeramente académico. OpenAI indicó que el nuevo modo está optimizado para "la mayoría de idiomas hablados" pero no especificó cuáles son exactamente.

La compañía ha sugerido en reportes previos que podría lanzar unos auriculares con capacidades de inteligencia artificial este año, aunque no proporcionó información sobre productos de hardware durante el anuncio de hoy.

OpenAI reemplazará su Modo de Voz Avanzado actual en ChatGPT con GPT-Live-1 mini de forma predeterminada para todos los usuarios. Los suscriptores de planes pagos tendrán acceso al modelo más grande GPT-Live-1, que ofrece capacidades mejoradas para conversaciones más complejas y prolongadas.

Este movimiento refleja la estrategia más amplia de OpenAI de posicionar la voz como una interfaz fundamental para la interacción humano-máquina, especialmente para tareas complejas que requieren contexto prolongado y razonamiento sofisticado. La capacidad de mantener conversaciones naturales y prolongadas podría transformar cómo los usuarios interactúan con sistemas de inteligencia artificial en el futuro.

SIGUE LEYENDO
MÁS DE TECNOLOGÍA
ColGlobal
OpenAI lanza nuevos modelos de voz para conversaciones más naturales en tiempo real
Tecnología

OpenAI lanza nuevos modelos de voz para conversaciones más naturales en tiempo real

OpenAI presentó hoy dos nuevos modelos de conversación denominados GPT-Live-1 y GPT-Live-1 mini, que prometen sonar más naturales y manejar mejor los turnos de palabra en diálogos. Estos modelos de dúplex completo permiten que la inteligencia artificial hable y escuche simultáneamente, lo que facilita interrupciones naturales y características como traducción en vivo. La compañía reemplazará su actual Modo de Voz Avanzado en ChatGPT con GPT-Live-1 mini de forma predeterminada, mientras que los usuarios de planes pagos accederán al modelo más grande GPT-Live-1.

9 jul 2026
Tamaño de texto

OpenAI anunció el lanzamiento de sus nuevos modelos de voz conversacional en una sesión informativa con la prensa. Los modelos GPT-Live-1 y GPT-Live-1 mini representan un avance significativo en la tecnología de interacción por voz, abordando limitaciones críticas del sistema anterior.

El modelo anterior funcionaba mediante una arquitectura de tres componentes: un modelo de conversión de voz a texto que transcribía el habla, un modelo de lenguaje grande que generaba respuestas, y un modelo de conversión de texto a voz que entregaba la respuesta final. Esta estructura secuencial generaba problemas específicos que OpenAI identificó durante el desarrollo de sus nuevas soluciones.

Según la compañía, los nuevos modelos resuelven problemas fundamentales como la interrupción de usuarios mientras hablan y la falta de inteligencia suficiente para responder preguntas complejas. La arquitectura de dúplex completo permite que el sistema hable y escuche al mismo tiempo, eliminando la necesidad de esperar a que termine de hablar para procesar información. Los nuevos modelos envían consultas a los últimos modelos de texto de OpenAI, como GPT-5.5, para búsqueda, razonamiento o capacidades de agentes autónomos, mientras continúan la conversación sin interrupciones.

Una característica notable es la capacidad del modelo de permanecer en silencio durante períodos prolongados, absorbiendo el contexto de la conversación hasta que sea invocado. Además, como el nuevo modo de voz tiene acceso a modelos GPT más recientes, puede presentar información en formato visual, una característica que también están explorando otras empresas emergentes como Monogram, que recaudó 40 millones de dólares en financiamiento de semilla de DST y Lux Capital.

OpenAI diseñó el nuevo modo de voz en ChatGPT para mantener conversaciones más largas. Durante la sesión informativa, Atty Eleti, líder de producto del Modo de Voz de ChatGPT, reveló que ha mantenido conversaciones de 30 a 40 minutos con la función de voz durante caminatas. La compañía considera que la voz podría convertirse en la interfaz principal para la computación en trabajos complejos.

"Con el tiempo, creemos que esto también desbloqueará la capacidad de usar la voz como una especie de interfaz principal para la computación y para gestionar trabajos de agentes cada vez más complejos y de larga duración. Creemos que la voz puede ser la interfaz futura para todo tipo de trabajo", afirmó Eleti.

OpenAI ha trabajado durante varios años en fortalecer las características basadas en voz para que el modo de voz de ChatGPT suene más natural. La compañía informó que más de 150 millones de personas hablan con ChatGPT utilizando características como Voz y Dictado.

La competencia también se mueve en la misma dirección. Tanto Apple como Amazon han actualizado sus asistentes para ser más conversacionales con mejor manejo del contexto. Empresas emergentes como Sesame, fundada por el cofundador de Oculus Brendan Iribe y Ankit Kumar, también lanzaron asistentes de inteligencia artificial con conversación más natural mientras completan tareas en segundo plano.

OpenAI se enfoca en permitir que los usuarios hablen con su asistente sin manos libres durante períodos más prolongados. A pesar de su afirmación de que el nuevo modo de voz suena más natural, la compañía enfatizó que no pretende crear un compañero de inteligencia artificial. Señaló que los nuevos modelos tienen salvaguardas integradas para proporcionar respuestas apropiadas para la edad a adolescentes y ofrecer recursos si la conversación se desvía hacia temas como el autolesionismo.

Sin embargo, el nuevo modo de voz aún requiere mejoras. Durante la demostración, cuando la compañía mostró su función de traducción en vivo en hindi, el asistente tenía un acento estadounidense marcado y hablaba hindi de manera poco natural con un tono ligeramente académico. OpenAI indicó que el nuevo modo está optimizado para "la mayoría de idiomas hablados" pero no especificó cuáles son exactamente.

La compañía ha sugerido en reportes previos que podría lanzar unos auriculares con capacidades de inteligencia artificial este año, aunque no proporcionó información sobre productos de hardware durante el anuncio de hoy.

OpenAI reemplazará su Modo de Voz Avanzado actual en ChatGPT con GPT-Live-1 mini de forma predeterminada para todos los usuarios. Los suscriptores de planes pagos tendrán acceso al modelo más grande GPT-Live-1, que ofrece capacidades mejoradas para conversaciones más complejas y prolongadas.

Este movimiento refleja la estrategia más amplia de OpenAI de posicionar la voz como una interfaz fundamental para la interacción humano-máquina, especialmente para tareas complejas que requieren contexto prolongado y razonamiento sofisticado. La capacidad de mantener conversaciones naturales y prolongadas podría transformar cómo los usuarios interactúan con sistemas de inteligencia artificial en el futuro.

FUENTES
SIGUE LEYENDO