GPT-Live-1 llega a la API de OpenAI a $0.05 por minuto

⏱ Tiempo de lectura: 3 min
OpenAI lanzó GPT-Live-1 en su API el 10 de septiembre de 2026, permitiendo a desarrolladores acceder a su modelo de voz full-duplex por $0.05 por minuto en la capa de voz frontal. El modelo extiende el sistema conversacional detrás de ChatGPT Voice a aplicaciones de terceros y flujos empresariales, capaz de escuchar y hablar simultáneamente mientras delega razonamiento más profundo a modelos y herramientas complementarias.
GPT-Live-1: un modelo único para escuchar y hablar
A diferencia de agentes de voz tradicionales que encadenan reconocimiento de voz, modelo de razonamiento y síntesis de texto —introduciendo latencia en cada transición—, GPT-Live-1 maneja ambas tareas en un único modelo que razona sobre audio entrante y saliente simultáneamente. Responde a interrupciones y reconocimientos en tiempo real mientras delega trabajo más complejo al servidor, permitiendo que la conversación continúe en segundo plano. Los desarrolladores seleccionan los modelos, herramientas y arquitectura detrás de la conversación, combinando GPT-Live-1 con modelos como Luna para tareas de alto volumen o Astra para problemas complejos que requieren razonamiento avanzado.
Rendimiento, precios y capacidades confirmadas
OpenAI reporta que GPT-Live-1 mejora el desempeño en Full Duplex Bench un 30 puntos porcentuales sobre GPT-Realtime-2.1, con ganancias significativas en latencia de turnos y comportamiento interactivo. En tareas de servicio al cliente (Tau3 Voice Intelligence), logra 86.2% de éxito en Pass@1 frente a 45.7% de GPT-Realtime-2.1 y 42.4% de GPT-Realtime-2. En conocimiento bancario (Tau Banking Voice), alcanza 32.0% versus 12.4% y 10.3%. El modelo maneja gestión de contexto silenciosa, ruido de fondo, retención de contexto en sesiones extendidas y soporte de telefonía para agentes full-duplex en llamadas. Proporciona transcripciones ASR, texto de respuesta, sesgo de palabras clave y detección de turnos. Desarrolladores personalizan tono, ritmo y estilo conversacional mediante el prompt del sistema. El modelo alcanza 0.798 segundos de latencia en turnos frente a 1.41 y 1.63 segundos, y 97.3% en puntuación de dinámica conversacional de Artificial Analysis. Fuente: www.unite.ai
Qué falta por confirmar
Aunque OpenAI reporta mejoras sustanciales, la disponibilidad regional para mercados hispanohablantes, la integración con idiomas no ingleses y detalles sobre límites de sesión o manejo de accents regionales permanecen sin especificarse. El modelo está disponible solo mediante API, no como producto de consumidor directo fuera de ChatGPT Voice.
| Dato | Detalle |
|---|---|
| Modelo | GPT-Live-1 (full-duplex voice) |
| Lanzamiento API | 10 de septiembre de 2026 |
| Precio | $0.05 por minuto (capa de voz frontal) |
| Capacidades principales | Escucha y habla simultáneas, manejo de contexto silencioso, soporte telefonía, detección de turnos, transcripciones ASR |
| Latencia de turnos | 0.798 segundos (vs. 1.41s y 1.63s de versiones anteriores) |
| Éxito en servicio al cliente (Tau3) | 86.2% Pass@1 (vs. 45.7% GPT-Realtime-2.1 y 42.4% GPT-Realtime-2) |
| Clientes tempranos reportados | Yelp, Speak, Fin, Cognition, OpenAI Presence (enterprise) |
| Disponibilidad de voces | Voces en múltiples acentos y idiomas; acceso a voces personalizadas requiere contactar a ventas de OpenAI |
Preguntas frecuentes sobre GPT-Live-1
¿Cuál es la diferencia con GPT-Realtime-2.1?
GPT-Live-1 mejora latencia de turnos, precisión en tareas conversacionales complejas y manejo natural de interrupciones. En benchmarks de inteligencia de agentes de voz, supera versiones anteriores con márgenes significativos: 86.2% versus 45.7% en éxito de tareas de servicio al cliente.
¿Desde cuándo está disponible en la API?
OpenAI lanzó GPT-Live-1 en la API el 10 de septiembre de 2026. El acceso requiere registro como desarrollador y uso de la API de OpenAI con autenticación.
¿Está disponible en español?
OpenAI anunció expansión a más idiomas y acentos, pero el texto fuente recibido no especifica disponibilidad de español ni calendario de lanzamiento regional. Se recomienda consultar documentación oficial de la API.
El punto clave para la comunidad tech
GPT-Live-1 representa un cambio en la arquitectura de agentes de voz: un modelo único en lugar de cadenas de componentes separados reduce latencia crítica y mejora la naturalidad de conversaciones en tiempo real. Empresas como Yelp y Cognition ya reportan mejoras tangibles en manejo de llamadas y calidad de interacción.
En Inteligencia Artificial creemos que los $0.05 por minuto posicionan esta capacidad para casos de uso empresariales significativos, aunque el costo acumulativo en sesiones largas requiere evaluación cuidadosa. ¿Cuál es el caso de uso de voz en tiempo real más relevante para tu trabajo?
Fuente: www.unite.ai

Deja una respuesta
Lo siento, debes estar conectado para publicar un comentario.