Gemini 3.5 Transcribe: Google lanza modelo de voz con 2.6% WER

⏱ Tiempo de lectura: 3 min
Google ha presentado Gemini 3.5 Transcribe, un modelo de conversión de voz a texto que se distribuye en dos endpoints separados según el caso de uso. El endpoint de transmisión entrega transcripción en menos de un segundo, pero sacrifica diarización de hablantes y marcas de tiempo. El endpoint por lotes conserva ambas características con un costo 50% menor. Google reporta una tasa de error de palabras del 4.0% en transmisión y 2.6% sin transmisión, con finalización 70% más rápida que Chirp 3, y cobertura de más de 85 idiomas.
Dos endpoints para dos flujos de trabajo diferentes
La arquitectura dual de Gemini 3.5 Transcribe refleja una decisión de diseño clara: priorizar la velocidad en tiempo real para agentes de voz, pero mantener funcionalidad completa para pipelines de procesamiento por lotes. El endpoint streaming procesa audio con latencia mínima, ideal para asistentes conversacionales y transcripción en vivo. El endpoint batch agrega identificación automática de quién habla y timestamps de palabras, esencial para análisis de contenido, cumplimiento normativo y edición editorial. Esta bifurcación permite que desarrolladores elijan precisamente qué necesitan sin pagar por características innecesarias.
Rendimiento, cobertura y disponibilidad de API
Google reporta que Gemini 3.5 Transcribe alcanza 2.6% de tasa de error promedio en modo no-streaming, 70% más rápido en finalización respecto a Chirp 3, y funciona en 85+ idiomas con pesos similares de precisión. El modelo se accede únicamente a través de API; Google no ha confirmado interfaz web, aplicación móvil nativa o acceso a través de Google Cloud Console en su anuncio inicial. La disponibilidad regional, precios específicos por endpoint, límites de uso, y si hay tier gratuito o solo pago, no se especifican en el texto fuente recibido. Este avance refuerza el enfoque de Google en modelos de lenguaje multimodales capaces de procesar múltiples formas de entrada.
Qué falta por confirmar
Aunque Google destaca la velocidad y cobertura de idiomas, la diferencia de 1.4 puntos porcentuales entre streaming y batch invita a pruebas independientes para validar si ese trade-off de funcionalidad justifica el costo. Para agentes de voz en español y otros idiomas de uso creciente, la precisión será crítica. Tampoco está claro si Google planea actualizar productos como Google Meet, Voice Typing o Google Translate con este modelo, ni cuándo estará disponible en regiones específicas.
| Característica | Detalle |
|---|---|
| Modelo | Gemini 3.5 Transcribe |
| Tipo de endpoint | Streaming (latencia <1s) y Batch (completo, 50% más barato) |
| WER streaming | 4.0% |
| WER no-streaming | 2.6% |
| Cobertura de idiomas | 85+ |
| Velocidad vs Chirp 3 | 70% más rápido en finalización |
| Diarización y timestamps | Streaming: no incluye. Batch: sí incluye |
| Acceso | API únicamente. Precio, tier gratuito y disponibilidad regional no especificados |
Preguntas frecuentes sobre Gemini 3.5 Transcribe
¿Cuál es la diferencia clave entre los dos endpoints?
Streaming prioriza baja latencia para conversaciones en tiempo real, pero pierde diarización (quién habla) y marcas de tiempo de palabras. Batch mantiene todas las características con costo reducido, pero procesa en lotes, no en directo.
¿Cuándo estará disponible y cuál es el precio?
Google no ha confirmado fecha de lanzamiento exacta ni estructura de precios en el anuncio. El acceso será únicamente a través de API.
¿Funciona bien en español y otros idiomas no anglosajones?
Google reporta cobertura de 85+ idiomas y pesos similares de precisión, pero no detalla rendimiento específico por idioma. Pruebas de terceros serán necesarias para validar WER en español y otros idiomas de mercados emergentes.
La lectura para quienes usan IA a diario
Gemini 3.5 Transcribe representa un cambio de estrategia en Google: flexibilidad según el caso de uso en lugar de un modelo único. Para desarrolladores de chatbots y asistentes en español, la velocidad streaming y el precio batch competitivo podrían reducir costos operativos significativamente, si la precisión en no-inglés se sostiene.
En Inteligencia Artificial esperamos que Google publique benchmarks independientes de WER por idioma y detalles de acceso para el mercado hispanohablante. ¿Cuál es tu prioridad: latencia ultra baja o funcionalidad completa a menor costo?
Fuente: www.marktechpost.com

Deja una respuesta
Lo siento, debes estar conectado para publicar un comentario.