OpenAI presentó GPT-Live-Transcribe y GPT-Transcribe, modelos de inteligencia artificial orientados a la transcripción de conversaciones en tiempo real y al procesamiento por lotes de archivos de audio.
OpenAI anunció el lanzamiento de dos nuevos modelos de inteligencia artificial (IA) para transcripción de voz: GPT-Live-Transcribe y GPT-Transcribe. El primero está diseñado para la transcripción en tiempo real con baja latencia, mientras que el segundo está optimizado para archivos de audio completos y procesamiento por lotes asíncrono.
Según informó la compañía en su cuenta oficial para desarrolladores en X (antes Twitter), ambos modelos comprenden mejor el contexto de las conversaciones y ofrecen transcripciones de mayor calidad, incluso en condiciones de ruido de fondo, acentos diversos y términos especializados. GPT-Live-Transcribe utiliza automáticamente textos transcritos previamente como contexto.
En la prueba de ASR con reconocimiento de contexto (Context Aware ASR) de OpenAI, GPT-Live-Transcribe mejoró su precisión semántica del 38,5% al 44,6% al añadir contexto, mientras que GPT-Transcribe pasó del 41,6% al 45,2%.
En audios del mundo real, GPT-Live-Transcribe registró una tasa de error del 9,60%, frente al 11,65% de su predecesor GPT-Realtime-Whisper. GPT-Transcribe alcanzó un 8,98% de error, frente al 15,21% de Whisper-1. El laboratorio independiente Artificial Analysis reportó una tasa de error de palabras del 3,31% para GPT-Transcribe.
GPT-Transcribe se ubica ligeramente por detrás de alternativas como Voxtral Small (Mistral) y Gemini 3.1 Pro (Google), ambas con un 2,8% de error. OpenAI fijó el precio de GPT-Transcribe en 4,50 dólares por cada mil minutos de audio procesado.
