GPT-Live-1 llega a la API de OpenAI a $0.05 por minuto

GPT-Live-1 llega a la API de OpenAI a $0.05 por minuto

⏱ Tiempo de lectura: 3 min

OpenAI lanzó GPT-Live-1 en su API el 10 de septiembre de 2026, permitiendo a desarrolladores acceder a su modelo de voz full-duplex por $0.05 por minuto en la capa de voz frontal. El modelo extiende el sistema conversacional detrás de ChatGPT Voice a aplicaciones de terceros y flujos empresariales, capaz de escuchar y hablar simultáneamente mientras delega razonamiento más profundo a modelos y herramientas complementarias.

GPT-Live-1: un modelo único para escuchar y hablar

A diferencia de agentes de voz tradicionales que encadenan reconocimiento de voz, modelo de razonamiento y síntesis de texto —introduciendo latencia en cada transición—, GPT-Live-1 maneja ambas tareas en un único modelo que razona sobre audio entrante y saliente simultáneamente. Responde a interrupciones y reconocimientos en tiempo real mientras delega trabajo más complejo al servidor, permitiendo que la conversación continúe en segundo plano. Los desarrolladores seleccionan los modelos, herramientas y arquitectura detrás de la conversación, combinando GPT-Live-1 con modelos como Luna para tareas de alto volumen o Astra para problemas complejos que requieren razonamiento avanzado.

Rendimiento, precios y capacidades confirmadas

OpenAI reporta que GPT-Live-1 mejora el desempeño en Full Duplex Bench un 30 puntos porcentuales sobre GPT-Realtime-2.1, con ganancias significativas en latencia de turnos y comportamiento interactivo. En tareas de servicio al cliente (Tau3 Voice Intelligence), logra 86.2% de éxito en Pass@1 frente a 45.7% de GPT-Realtime-2.1 y 42.4% de GPT-Realtime-2. En conocimiento bancario (Tau Banking Voice), alcanza 32.0% versus 12.4% y 10.3%. El modelo maneja gestión de contexto silenciosa, ruido de fondo, retención de contexto en sesiones extendidas y soporte de telefonía para agentes full-duplex en llamadas. Proporciona transcripciones ASR, texto de respuesta, sesgo de palabras clave y detección de turnos. Desarrolladores personalizan tono, ritmo y estilo conversacional mediante el prompt del sistema. El modelo alcanza 0.798 segundos de latencia en turnos frente a 1.41 y 1.63 segundos, y 97.3% en puntuación de dinámica conversacional de Artificial Analysis. Fuente: www.unite.ai

Qué falta por confirmar

Aunque OpenAI reporta mejoras sustanciales, la disponibilidad regional para mercados hispanohablantes, la integración con idiomas no ingleses y detalles sobre límites de sesión o manejo de accents regionales permanecen sin especificarse. El modelo está disponible solo mediante API, no como producto de consumidor directo fuera de ChatGPT Voice.

Dato Detalle
Modelo GPT-Live-1 (full-duplex voice)
Lanzamiento API 10 de septiembre de 2026
Precio $0.05 por minuto (capa de voz frontal)
Capacidades principales Escucha y habla simultáneas, manejo de contexto silencioso, soporte telefonía, detección de turnos, transcripciones ASR
Latencia de turnos 0.798 segundos (vs. 1.41s y 1.63s de versiones anteriores)
Éxito en servicio al cliente (Tau3) 86.2% Pass@1 (vs. 45.7% GPT-Realtime-2.1 y 42.4% GPT-Realtime-2)
Clientes tempranos reportados Yelp, Speak, Fin, Cognition, OpenAI Presence (enterprise)
Disponibilidad de voces Voces en múltiples acentos y idiomas; acceso a voces personalizadas requiere contactar a ventas de OpenAI

Preguntas frecuentes sobre GPT-Live-1

¿Cuál es la diferencia con GPT-Realtime-2.1?

GPT-Live-1 mejora latencia de turnos, precisión en tareas conversacionales complejas y manejo natural de interrupciones. En benchmarks de inteligencia de agentes de voz, supera versiones anteriores con márgenes significativos: 86.2% versus 45.7% en éxito de tareas de servicio al cliente.

¿Desde cuándo está disponible en la API?

OpenAI lanzó GPT-Live-1 en la API el 10 de septiembre de 2026. El acceso requiere registro como desarrollador y uso de la API de OpenAI con autenticación.

¿Está disponible en español?

OpenAI anunció expansión a más idiomas y acentos, pero el texto fuente recibido no especifica disponibilidad de español ni calendario de lanzamiento regional. Se recomienda consultar documentación oficial de la API.

El punto clave para la comunidad tech

GPT-Live-1 representa un cambio en la arquitectura de agentes de voz: un modelo único en lugar de cadenas de componentes separados reduce latencia crítica y mejora la naturalidad de conversaciones en tiempo real. Empresas como Yelp y Cognition ya reportan mejoras tangibles en manejo de llamadas y calidad de interacción.

En Inteligencia Artificial creemos que los $0.05 por minuto posicionan esta capacidad para casos de uso empresariales significativos, aunque el costo acumulativo en sesiones largas requiere evaluación cuidadosa. ¿Cuál es el caso de uso de voz en tiempo real más relevante para tu trabajo?

Fuente: www.unite.ai

Deja una respuesta

Subir