El clip que mi amigo me envió ayer a las 8:14 a.m. duró 91 segundos. Un hablante de francés a la izquierda, un hablante de inglés a la derecha, ambos hablando entre sí como lo hacen los humanos reales, ambos escuchando a la otra persona en su propio idioma con tal vez medio segundo de retraso. A mitad de camino, el hablante de francés pasó al alemán durante una frase completa y luego volvió al francés. La traducción al inglés manejó limpiamente el alemán, mantuvo las mismas características de voz, no tartamudeó, no insertó una etiqueta aclaratoria de "el hablante ha cambiado de idioma" como cualquier otro sistema que he probado. Simplemente siguió adelante.
Lo volví a ver tres veces antes de abrir el anuncio OpenAI. Luego abrí la consola API. Luego cancelé mis reuniones matutinas.
Lo que OpenAI se envió el 7 de mayo de 2026 son dos cosas que he estado esperando durante dos años. GPT Realtime 2 es un modelo de voz a voz con razonamiento de clase GPT-5, llamadas de herramientas paralelas y una ventana de contexto de 128K, cuatro veces lo que nos proporcionó el gpt-realtime original. GPT Realtime Translate es un modelo de traducción en streaming dedicado que maneja más de 70 idiomas de entrada, 13 idiomas de salida, funciona a $0,034 por minuto y espera los verbos antes de comprometerse con una traducción para que la salida suene como una persona hablando, no como una cadena de Markov frase por frase.
He pasado las últimas 36 horas probando ambos. Tengo un agente de voz en producción para un cliente existente y ya he migrado la mitad al nuevo modelo. La otra mitad se queda en la pila anterior y explicaré exactamente por qué en un minuto.
Esta publicación es una versión práctica. La parte interesante no es la demostración que OpenAI realizó en el escenario, sino lo que estos modelos significan para todos los que actualmente ofrecen funciones de voz y para todos los que están a punto de comenzar. Al final, sabrá qué modelo elegir, qué migraciones realizar esta semana, dónde las nuevas matemáticas de $ 0,034 por minuto realmente alcanzan el punto de equilibrio y lo único de lo que nadie habla que cambia la forma en que se deben diseñar los flujos de voz desde cero.
La caída de tres modelos que convierte el 7 de mayo en una fecha de reinicio de Voice AI
Antes de entrar en lo que estos modelos hacen bien, necesitas la forma del lanzamiento porque la mitad de las tomas en línea combinan los tres modelos en un solo producto.
OpenAI envió un trío: GPT Realtime 2 (el agente de voz de grado de razonamiento), GPT Realtime Translate (el modelo de traducción dedicado) y GPT Realtime Whisper (un sistema de transmisión de voz a texto que funciona a $0,017 por minuto y que reemplaza silenciosamente el sistema encadenado Tubería STT-LLM-TTS que la mayoría de los sistemas de producción todavía utilizan). Los tres viven detrás del Realtime API, los tres se anunciaron juntos y los tres tienen precios diferentes y trabajos diferentes.
Aquí está la parte que importa. Hasta esta caída, construir un agente de voz serio significaba hacer uno de dos compromisos. O encadenaste ElevenLabs o Deepgram para la transcripción, GPT-4o o Claude para el razonamiento, y ElevenLabs nuevamente para la síntesis, agregando de 400 a 800 milisegundos de latencia de ida y vuelta en cada salto y rezando para que la capa de orquestación no dejara caer una transición de estado. O usó el gpt-realtime original, que le dio voz a voz por debajo de 500 ms pero limitó el razonamiento al nivel de GPT-4o, se ahogó con las llamadas de herramientas paralelas y lo obligó a entrar en una ventana de contexto de 32K que se rompió tan pronto como la conversación duró aproximadamente seis minutos.
GPT Realtime 2 cierra ambas brechas en un solo modelo. Alcanza una latencia de estado estable de un extremo a otro de 300 a 500 ms, al igual que su predecesor. Pero el contexto saltó a 128K. El razonamiento es la clase GPT-5 con cinco niveles de razonamiento controlables por el usuario: minimal, low, medium, high y xhigh. Y en el punto de referencia de Big Bench Audio, GPT Realtime 2 con razonamiento alto obtuvo una puntuación del 96,6 %, en comparación con el 81,4 % de GPT Realtime 1.5. En Audio MultiChallenge, una prueba conversacional de seguimiento de instrucciones de varios turnos, la variante xhigh alcanzó el 48,5% frente al 34,7% de 1,5. Esas no son mejoras marginales. Esos son cambios radicales.
Por eso reorganicé mi mañana. La era del compromiso ha terminado.
Lo que realmente probé en 36 horas
No voy a parafrasear la demostración de OpenAI. La versión del comunicado de prensa está bien, pero también le faltan las partes importantes. Esto es lo que realmente ejecuté.
Prueba 1: Migrar un agente de cliente real. Tengo un agente de admisión de voz ejecutándose para un pequeño cliente SaaS: califica las solicitudes de demostración entrantes, programa una llamada en el calendario del fundador y envía el cliente potencial a HubSpot. Se creó hace seis semanas en el gpt-realtime original con dos llamadas a herramientas (búsqueda de calendario, webhook de CRM). Lo migré a GPT Realtime 2 con el esfuerzo de razonamiento configurado en medium, mantuve todo lo demás idéntico y ejecuté 23 llamadas simuladas a través de él. La confiabilidad de la llamada a la herramienta pasó de "ocasionalmente necesita un reintento" a "todavía no he visto que falle". La reparación de la conversación cuando interrumpí deliberadamente ("espera, no, martes, no jueves") pasó de "a veces retrocede a la pregunta anterior" a "simplemente confirmó la corrección y siguió adelante".
Prueba 2: Traducción en vivo con cambio de código. No puedo replicar la demostración OpenAI palabra por palabra porque no tengo los mismos parlantes a mano, pero puedo recrear la estructura. Tenía una amiga de habla francesa en Zoom, ejecuté su audio en una sesión de traducción en tiempo real dirigida a la salida en inglés y le pedí que hiciera exactamente lo que hizo la demostración de OpenAI: hablar en francés, pasar al alemán para una oración, pasar a un término técnico en inglés y volver al francés. El retraso en la traducción se produjo unos 600 ms detrás del hablante en el borde frontal de cada frase. El modelo esperó los verbos antes de comprometerse; se podía oír.
La salida se mantuvo coherente a través de los cambios de idioma con una burbuja: un sustantivo técnico compuesto alemán (Bestandsführungssystem, sistema de gestión de inventario) apareció como "el sistema de inventario" en lugar de la traducción más precisa. Aceptable. Mejor de lo que haría en vivo.
Prueba 3: llamada de herramienta paralela con preámbulos. Esta es la que realmente me sorprendió. Creé un pequeño agente con tres herramientas (una búsqueda de calendario, un API del clima y una búsqueda de contactos de CRM) y le hice preguntas que requerían usar las tres simultáneamente ("¿Estoy libre el viernes por la tarde, cómo está el clima fuera del sitio y Sarah de Acme sigue siendo mi contacto principal?"). Con los preámbulos habilitados, el agente dijo "déjame comprobarlo por ti" en aproximadamente 200 ms, luego llamó a las tres herramientas en paralelo y luego sintetizó una única respuesta coherente. Latencia total desde la pregunta hasta la respuesta completa: aproximadamente 2,4 segundos. El gpt-realtime original habría serializado las llamadas a la herramienta (4-6 segundos) o habría descartado una.
Prueba 4: Memoria de conversación larga con ventana de 128K. Ejecuté una única sesión de Realtime 2 durante 47 minutos: una conversación de atención al cliente simulada sobre un problema de facturación complicado. El modelo mantuvo el contexto en todo momento. Se hizo referencia a la frustración declarada por el cliente desde el minuto tres al generar la resolución en el minuto 41. La ventana original de 32K se habría truncado en mitad de la conversación o habría requerido una inyección de memoria externa. Esto es lo que creo que la mayoría de las coberturas están subestimando.
Prueba 5: Lo que se rompió. El esfuerzo de razonamiento establecido en xhigh en una pregunta simple aumentó la latencia del primer token de ~300 ms a más de 1,4 segundos. Ese es el comercio. Un razonamiento más elevado significa una pausa más larga antes de que el agente comience a hablar. Para un agente de ventas que califica a un cliente potencial, esa pausa no le parece adecuada. Para un agente de soporte que está desenredando una disputa de reembolso, parece deliberado. El esfuerzo de razonamiento no es una elección libre, es una elección de UX. Volveré a esto en la sección de implementación porque creo que aquí es donde la mayoría de los constructores se arruinarán.
Esa es la lectura honesta de 36 horas de pruebas. Ahora déjame mostrarte la arquitectura y los costos.
Falta la arquitectura real con mayor cobertura
Cada publicación de blog sobre esta versión quiere decirle que GPT Realtime 2 es un agente de voz. Ese marco está incompleto y llevará a muchos equipos a construir algo equivocado.
GPT Realtime 2 es un modelo de razonamiento con audio nativo I/O y primitivas de llamada de herramientas. La parte de la voz ya no es el diferenciador. El razonamiento + herramientas + contexto de 128K es el diferenciador. Lo que significa que el patrón de diseño que gana este año no es el "chatbot de voz", sino la voz como interfaz principal para un agente que ya existe.
Esto es lo que quiero decir. La mayoría de los equipos que actualmente ofrecen funciones de voz las construyeron como cadenas telefónicas. El visitante llama, el agente ejecuta un script, el agente recopila campos y el agente se lo pasa a un humano. Ese patrón está resuelto. Ya lo resolvió la pila de agentes de voz que documenté hace seis meses usando Claude Code y ElevenLabs. Lo nuevo es que el agente en el otro extremo del canal de voz ahora puede razonar tan bien como el agente de texto de clase GPT-5 que su competidor envía en su tablero. El mismo cerebro. Diferente I/O.
Concretamente: una actualización de CRM basada en voz ya no es "transcribir la voz del usuario → ejecutar un agente de texto → responder el resultado". Se trata de "enviar la transmisión de audio a una única sesión de Realtime 2, definir las herramientas CRM como esquemas JSON, dejar que el modelo elija a qué herramienta llamar, dejar que explique su razonamiento en voz alta a través de preámbulos y dejar que el usuario interrumpa o corrija la mitad del flujo". No se trata de tres servicios unidos. Ese es un modelo que contiene toda la interacción.
La implicación es incómoda para cualquiera que haya invertido mucho en el oleoducto encadenado. Su proveedor de STT ahora compite con un Whisper de calidad de transmisión a $0,017 por minuto. Su proveedor de TTS está compitiendo con un modelo cuya calidad de voz no es la mejor de su clase, pero es lo suficientemente buena como para que la ganancia en latencia generalmente la supere. Su capa de orquestación (LangChain, su bucle de agente local, lo que sea) compite con un único API que maneja la llamada de herramientas, la ejecución paralela y la reparación conversacional de forma nativa.
No digo que ElevenLabs esté muerto. Explicaré en un minuto por qué conservo la mitad de la pila de mi cliente. Estoy diciendo que las matemáticas han cambiado lo suficiente como para que cada equipo de productos de voz deba volver a ejecutar la decisión de construir versus unir esta semana.
La matemática de precios que decide su arquitectura
No puede tomar esta decisión basándose únicamente en las funciones. Tienes que hacer el trabajo de costos. Hice el trabajo de costos y te ahorraré la hora de la hoja de cálculo.
Estas son las tarifas verificadas a partir del anuncio del 7 de mayo de 2026, todas confirmadas en la página de precios de OpenAI API:
| Componente | GPT Realtime 2 | GPT Realtime Translate | GPT Tiempo real Whisper |
|---|---|---|---|
| Entrada de audio | $32 / 1 millón de tokens | $0,034 por minuto (fijo) | $0,017 por minuto (fijo) |
| Entrada de audio en caché | 0,40 $/1 millón de tokens | — | — |
| Salida de audio | $64 / 1 millón de tokens | incluido en por minuto | no aplicable (solo STT) |
| Entrada de texto | $4 / 1 millón de tokens | — | — |
| Salida de texto | $16 / 1 millón de tokens | — | — |
| Ventana contextual | 128.000 fichas | transmisión | transmisión |
| Niveles de razonamiento | mínimo, bajo, medio, alto, xalto | n/a | n/a |
Ahora las matemáticas funcionan por minuto, porque las tasas de tokens no parecen reales hasta que las conviertes. Una sesión de voz típica de Realtime 2 utiliza aproximadamente entre 800 y 1200 tokens de entrada de audio por minuto de voz del usuario y aproximadamente entre 1500 y 2500 tokens de salida de audio por minuto de voz del agente, dependiendo de cuánto hable el agente. Llámelo una conversación bidireccional equilibrada: está viendo aproximadamente $0,10 a $0,18 por minuto de conversación activa para Realtime 2 en la configuración predeterminada, antes de cualquier razonamiento de texto o llamadas de herramientas. Empuje el esfuerzo de razonamiento hasta high y eso aumentará hacia $0,20-$0,25 por minuto debido a los tokens de razonamiento adicionales consumidos.
Compare eso con la alternativa encadenada. Un canal encadenado serio hoy en día (STT de transmisión Deepgram Nova-3 + razonamiento de texto GPT-5 + TTS de transmisión ElevenLabs Turbo v3) cuesta entre $ 0,06 y $ 0,12 por minuto de voz activa, pero se come el costo de latencia: 400-800 ms en total de ida y vuelta, a menudo peor en los turnos de llamada de herramientas.
Por lo tanto, Realtime 2 cuesta aproximadamente entre 1,5 y 2 veces el costo por minuto del enfoque encadenado. La pregunta es si la latencia, el razonamiento y la simplicidad operativa valen esa prima. Para un agente de ventas donde la conversión sigue a la fluidez, sí, fácilmente. Para un IVR de gran volumen donde el guión es un árbol telefónico y el costo es el cuello de botella, probablemente no.
GPT Realtime Translate es el modelo donde las matemáticas se aclaran. $0.034 por minuto es una locura en la dirección correcta. Compare eso con el enfoque encadenado típico para la traducción en streaming (Deepgram o Whisper para STT, GPT-4o para razonamiento de traducción, ElevenLabs multilingüe para TTS), que cuesta entre $ 0,10 y $ 0,15 por minuto y es significativamente más lento. A $ 0,034 por minuto con el modelo de retraso con reconocimiento de verbos, esta es la primera vez que veo un proceso de traducción en el que sería una locura no utilizarlo de forma predeterminada.
GPT Whisper en tiempo real a $ 0,017 por minuto es el que duerme tranquilamente de los tres. Si ya tiene un canal encadenado en producción, reemplazar su proveedor STT actual por este es probablemente la migración más barata y menos riesgosa del menú. Puedes hacerlo en una tarde.
Cómo migrar realmente: un plan concreto
Si tiene un producto de voz en producción hoy, aquí está el plan de migración que estoy ejecutando para el trabajo de mi propio cliente, dividido en el orden en el que realmente lo haría.
Paso 1: Audite su pila de voz actual e identifique su cuello de botella. Sea específico. ¿El cuello de botella es la latencia conversacional? ¿Fiabilidad de llamada de herramientas? ¿Costo? ¿Calidad de la síntesis de voz? ¿Idiomas que no puedes soportar? Diferentes cuellos de botella justifican diferentes migraciones. Si su cuello de botella es la latencia conversacional y la confiabilidad de la herramienta, GPT Realtime 2 es su objetivo de migración. Si tiene un costo y la calidad de su voz ya es adecuada, su objetivo de migración podría ser solo el componente Whisper mientras conserva el resto.
Paso 2: Ponga en marcha una implementación paralela en una rama de funciones. No migre in situ. El modelo de sesión Realtime API es similar al gpt-realtime original (WebRTC, WebSocket o transporte SIP), pero el objeto de configuración tiene nuevos campos para reasoning_effort, preambles y definiciones de herramientas paralelas. Quiere aprender la nueva forma en una rama limpia antes de tocar la producción.
Paso 3: Defina sus herramientas como esquemas JSON, incluidas las cadenas de preámbulo. Esta es la parte en la que realmente puede dar forma al comportamiento del agente. Una definición de herramienta para el nuevo modelo es la siguiente:
{
type: "function",
name: "lookup_calendar_availability",
description: "Check the user's calendar for available 30-minute slots in the next 14 days.",
preamble: "Let me check your calendar.",
parameters: {
type: "object",
properties: {
timezone: { type: "string" },
preferred_window: {
type: "object",
properties: {
earliest: { type: "string", format: "date-time" },
latest: { type: "string", format: "date-time" }
}
}
},
required: ["timezone"]
}
}
El campo preamble es nuevo. Es la frase corta que el modelo dice en voz alta mientras la herramienta se está ejecutando, lo que hace que la experiencia de la herramienta paralela parezca receptiva en lugar de estancada. Trate los preámbulos como una parte de primera clase de la voz de su agente: deben coincidir con la personalidad del agente.
Paso 4: Elija un esfuerzo de razonamiento por caso de uso, no por agente. Esta es la trampa en la que caerán la mayoría de los constructores. Elegirán medium y se olvidarán de él. El patrón correcto es establecer dinámicamente el nivel de razonamiento según la solicitud del usuario. Las búsquedas simples ("cuál es mi próxima reunión") se ejecutan en low. Las decisiones de varios pasos ("volver a programar todas mis reuniones de los martes en torno al conflicto") se ejecutan en high. Los flujos agentes complejos de varios pasos ("planificar mis próximas dos semanas de llamadas de clientes y actualizar mi CRM en consecuencia") se ejecutan en xhigh y usted consume la latencia. La configuración de sesión OpenAI admite la actualización de esta sesión a mitad de sesión.
Paso 5: Conecte intencionalmente las llamadas a herramientas paralelas. Las llamadas paralelas están habilitadas de forma predeterminada, pero debe escribir sus herramientas para que sean realmente paralelizables. Si tres herramientas dependen del resultado de cada una, el modelo las serializará de todos modos. Las ganancias se obtienen cuando tiene tres búsquedas independientes que pueden desplegarse: calendario + clima + CRM, por ejemplo, o precio de las acciones + noticias + posición de la cartera.
Paso 6: Pruebe con el nivel de razonamiento un nivel más alto de lo que cree que necesita, luego baje. En contra de mi propia advertencia anterior, el modo de falla que veo con mayor frecuencia cuando los equipos hacen una autoestima es "Elegí bajo porque la pregunta era simple, pero la pregunta era en realidad un flujo agente de múltiples saltos disfrazado". Comience un nivel más alto, observe el presupuesto de latencia y luego baje una vez que tenga datos.
Paso 7: Verifique que el contexto de 128K esté haciendo lo que cree que está haciendo. El contexto más largo es prácticamente invisible hasta que lo necesita. Dónde aparece: conversaciones más largas de atención al cliente, sesiones de coaching de varios turnos, cualquier cosa en la que el usuario haga referencia a algo que dijo hace 20 minutos. Pruebe estos escenarios deliberadamente. No asuma que el modelo utiliza el contexto sólo porque el contexto existe.
Si desea obtener una visión más profunda de cómo estructuro las especificaciones del agente antes de escribir este código, repasé el marco en mi libro de estrategias de compilación del agente; esa pieza combina bien con esta para cualquiera que migre el trabajo de voz de producción.
El modelo de traducción merece su propia conversación
Casi escribí sobre Realtime Translate al mismo tiempo que Realtime 2 y esa habría sido una decisión equivocada. Son productos diferentes que resuelven problemas diferentes y los patrones de diseño de cada uno son completamente diferentes.
Realtime 2 es para que una parte (su software) hable con otra parte (su usuario). Realtime Translate es para dos partes humanas que hablan entre sí a través de su software. Esa es una topología diferente y cambia todo acerca de cómo construyes.
El modelo se basa en una hermosa elección de diseño: espera los verbos antes de comprometerse con una traducción. En idiomas Sujeto-Verbo-Objeto como el inglés, el verbo es temprano. En idiomas Sujeto-Objeto-Verbo como el alemán o el japonés, el verbo está al final. Un traductor ingenuo que emite palabra por palabra producirá basura en cualquier dirección porque el significado de la oración está encerrado detrás del verbo. Realtime Translate almacena en buffer el tiempo suficiente para encontrar la palabra de acción y luego confirma la traducción con una voz fluida que preserva la prosodia. El resultado es una voz traducida que suena como una persona que tiene sentido, no como un sistema corriendo para mantenerse al día.
La lista de más de 70 idiomas de entrada y 13 idiomas de salida cubre básicamente todos los idiomas con una gran demanda de traducción comercial. Deutsche Telekom lo utiliza para la atención al cliente transfronteriza en los mercados europeos. Zillow está utilizando GPT Realtime 2 (no Translate) para crear un asistente de compra de vivienda que programe recorridos de forma autónoma, y Priceline está creando un agente de gestión de viajes impulsado por voz. El patrón en todos los primeros pilotos empresariales es el mismo: la voz como una capa encima de un agente que ya tenía razonamiento, con la traducción como una capa paralela cuando el usuario y el agente no comparten un idioma.
Creo que los casos de uso están a punto de explotar en los próximos 90 días, según lo que ya escucho de los constructores:
-
Atención al cliente en todas las regiones. Una empresa SaaS con sede en EE. UU. ahora puede ofrecer soporte en 70 idiomas sin necesidad de contratar 70 hablantes nativos. El cliente habla en su idioma, el agente (humano o AI) lo escucha en inglés, la respuesta vuelve a través del modelo. - Interpretación de eventos en vivo. Conferencias, ayuntamientos, personal interno de la empresa. El modelo actual de interpretación humana es caro y lento. La traducción en tiempo real a 0,034 dólares por minuto con un retraso de medio segundo es más rápida que los humanos y más barata que los humanos en un orden de magnitud. - Educación y tutoría. Las aplicaciones de aprendizaje de idiomas ya estaban saturadas de AI. La próxima ola es la tutoría en tiempo real en un idioma de destino con el idioma nativo del estudiante disponible como alternativa: instantáneo, bajo demanda, sin programación.
-
Ventas B2B transfronterizas. Un vendedor en Berlín ahora puede realizar llamadas de descubrimiento con clientes potenciales en Tokio, Madrid y São Paulo sin dominar tres idiomas. Los gastos generales de traducción solían ser el factor decisivo. Se acaba de eliminar.
No creo que ninguno de ellos sea especulativo. Creo que son lanzamientos de productos de 2026 por parte de equipos que empezaron a construir ayer.
Las compensaciones honestas que nadie menciona
Ahora la parte donde les digo lo que no amo.
La calidad de voz de GPT Realtime 2 es, caritativamente, la tercera mejor en el campo por su cruda naturalidad. Las pruebas independientes de escucha a ciegas realizadas en el primer trimestre de 2026 siguen clasificando constantemente a ElevenLabs en primer lugar en claridad de consonantes, ubicación de la respiración y prosodia de oraciones largas: las pequeñas cosas que hacen que una voz se sienta humana en lugar de sintetizada. OpenAI Sonidos en tiempo real buenos. No suena mejor. Para productos donde la fidelidad de voz es el producto real (un narrador de audiolibros de alta gama, un clon de voz de una celebridad, una IP de entretenimiento), aún deberías usar ElevenLabs. El costo de latencia vale la calidad y el patrón de canalización encadenado es lo suficientemente maduro para manejarlo.
La historia de la clonación de voces tampoco es donde está ElevenLabs. Realtime 2 viene con la biblioteca de voz seleccionada de OpenAI. No existe un equivalente de Professional Voice Clone que le permita entrenar una voz personalizada con horas de su propio audio. Si su producto necesita la voz real de su fundador, ElevenLabs es la respuesta en el futuro previsible. Esa es la mitad de la pila de mi cliente que no voy a migrar.
Las cargas de trabajo elegibles para HIPAA siguen siendo una consideración real. La modalidad de audio en tiempo real OpenAI, según mi lectura de los documentos hasta el día de hoy, no ha sido certificada para cargas de trabajo HIPAA de la misma manera que se puede configurar el patrón encadenado Deepgram + GPT-4 + ElevenLabs. Si está creando voz para la atención médica, ejecute su revisión de cumplimiento antes de migrar y asuma que es posible que deba permanecer encadenado hasta que la cobertura se ponga al día.
La latencia del esfuerzo de razonamiento no es gratuita. Dije esto antes, pero vale la pena repetirlo porque la mayoría de los constructores no lo sentirán hasta que realicen el envío. Configurar reasoning_effort en high agrega una latencia notable antes de la primera palabra audible. Para un agente de coaching o agente de apoyo donde la pausa se considera considerada, esa latencia se interpreta como consideración. Para un agente de ventas donde el ritmo importa, esto se interpreta como un problema del sistema. Sintonice en consecuencia.
Y la prima de precio es real. De 1,5 a 2 veces el costo de la canalización encadenada no es nada si está ejecutando un producto de voz de alto volumen. Analice la economía de su unidad antes de migrar y observe detenidamente dónde el costo adicional se convierte en ingresos adicionales (mejor conversión, menor tiempo de manejo, mayor CSAT) y dónde simplemente se muestra como compresión de margen.
Lo que construiría esta semana si tuviera un viernes libre
Si estuviera sentado un viernes sin compromisos con el cliente y con los nuevos modelos en mi escritorio, esto es lo que realmente construiría.
Un CRM personal controlado por voz que reside en mis AirPods. Presiono el botón, digo "registrar una reunión con Sarah de Acme, ella está interesada en el paquete de migración del agente, haga seguimiento el próximo martes a las 10", y el agente escribe un registro de HubSpot, programa un recordatorio de seguimiento, redacta el correo electrónico de seguimiento en mi bandeja de salida y vuelve a leer el resumen para que pueda confirmar. Todo en una sesión de Realtime 2, todo en menos de tres segundos, de principio a fin. Tiempo total de construcción, dado el nuevo modelo: probablemente cuatro horas. Costo total de operación: quizás $0,25 por interacción registrada.
Eso no es hipotético. Eso es algo que voy a construir en el momento en que cierre este borrador.
O, y esta es la versión que creo que toda empresa B2B SaaS debería considerar, un agente de demostración multilingüe en el sitio de marketing. Un cliente potencial llega al sitio, hace clic en el botón de voz y dice en su idioma nativo: "muéstrame qué hace tu producto". El agente, que se ejecuta en Realtime 2 con Realtime Translate manejando la capa entre idiomas, ofrece un recorrido personalizado de cinco minutos en su idioma nativo, califica su caso de uso y reserva el seguimiento humano de las ventas en su zona horaria nativa. El costo por cliente potencial calificado se reduce en un orden de magnitud. La conversión aumenta porque el idioma ya no es una fricción.
No te estoy vendiendo nada de esto. Estoy señalando los patrones que los modelos realmente desbloquean y diciendo, en voz alta, que la brecha entre "esto es posible" y "esto está construido" simplemente colapsó.
Qué significa esto para la pila de voz AI
Alejar. El lanzamiento del 7 de mayo no es sólo una actualización del modelo. Es una renivelación de dónde ocurre el razonamiento en los sistemas de voz.
Durante dos años, la arquitectura fue: entrada de voz → STT → LLM → TTS → salida de voz. El razonamiento vivió en la etapa LLM, intercalado entre dos conversiones I/O que consumen latencia. Cada equipo que creaba sistemas de voz estaba resolviendo el mismo problema de orquestación, el mismo problema de latencia, el mismo problema de reparación conversacional.
GPT Realtime 2 colapsa eso en: voz entrante → modelo de razonamiento → voz saliente. Una etapa. Un costo de latencia. Una ventana de contexto que contiene toda la interacción.
Eso no es un refinamiento. Esa es una categoría diferente de sistema. Los equipos que reconozcan el cambio lo suficientemente rápido como para rediseñar sus productos de voz en torno a él parecerán genios en seis meses. Los equipos que lo tratan como una mejora marginal de su canal encadenado existente se sentirán confundidos dentro de doce meses cuando sus números de conversión se estabilicen y los de sus competidores no.
El desbloqueo no es que los agentes de voz ahora sean posibles. Fueron posibles hace un año. La ventaja es que la voz ahora puede ser una modalidad peer I/O junto con el texto (el mismo razonamiento, las mismas herramientas, el mismo contexto) y eso es lo que hace que la voz sea viable como interfaz principal para cualquier agente que ya exista. Tu tablero. Tu CRM. Tu sistema de apoyo. Tu asistente de codificación. Todos ellos ahora pueden desarrollar un modo de voz que no es una versión peor de la experiencia de escribir, sino una forma diferente de la misma inteligencia.
El clip de 91 segundos que me envió mi amigo a las 8:14 a.m. no era una demostración de traducción. Fue una vista previa de cómo será cada producto de voz. Dos humanos, dos idiomas, un modelo, sin fricciones. Lo que me llevó tres volver a mirar para registrarme no fue la calidad del modelo, sino que la voz se sentía como un canal normal para hablar con el software. No es un árbol telefónico. No es un chatbot que finge escuchar. Sólo hablando. Con el sistema comprendiendo y actuando.
Ese es el momento en que madura la categoría de voz.
Preguntas frecuentes
¿Cuál es la diferencia entre GPT Realtime 2 y GPT Realtime Translate?
GPT Realtime 2 es un agente de voz completo con razonamiento de clase GPT-5, llamadas de herramientas paralelas y una ventana de contexto de 128 KB, creado para conversaciones entre su software y un usuario. GPT Realtime Translate es un modelo de traducción en streaming dedicado con más de 70 idiomas de entrada y 13 idiomas de salida, creado para dos personas que hablan idiomas diferentes entre sí a través de su aplicación. Son productos diferentes para diferentes topologías. Para obtener un desglose más profundo de la arquitectura, consulte "La arquitectura real que falta con mayor cobertura" más arriba.
¿Cuánto cuesta GPT Realtime 2 en comparación con el gpt-realtime original?
Las tarifas de los tokens son idénticas al momento de escribir este artículo: $ 32 por millón de tokens de entrada de audio, $ 64 por millón de tokens de salida de audio, por lo que una conversación bidireccional equilibrada típica cuesta aproximadamente entre $ 0,10 y $ 0,18 por minuto en la configuración predeterminada. Con un mayor esfuerzo de razonamiento habilitado, eso aumenta entre $0,20 y $0,25 por minuto. El precio no cambió; las capacidades lo hicieron.
¿Debo migrar de una canalización STT-LLM-TTS encadenada a Realtime 2?
Migre si su cuello de botella es la latencia conversacional, la confiabilidad de las llamadas a herramientas o la complejidad operativa. Manténgase encadenado si su cuello de botella es la fidelidad de la voz (ElevenLabs aún gana en naturalidad), el cumplimiento de HIPAA o necesita un clon de voz personalizado. El plan de migración completo se encuentra arriba en "Cómo migrar realmente".
¿Qué significa "preámbulos" en el nuevo Realtime API?
Los preámbulos son frases cortas que el modelo dice en voz alta antes o durante una llamada a la herramienta, cosas como "déjame comprobar eso" o "revisar tu calendario". Mantienen al usuario interesado durante uno o dos segundos cuando las herramientas están en funcionamiento para que la conversación no quede en el aire. Los preámbulos se configuran por herramienta en sus definiciones de funciones y deben coincidir con la personalidad de su agente.
¿Realtime Translate es lo suficientemente bueno como para reemplazar a los intérpretes humanos?
Para la mayoría de los casos de uso comercial (atención al cliente, llamadas de ventas B2B, capacitación interna), sí, con la salvedad de que actualmente es mejor en pares de idiomas con datos de capacitación maduros. Para contextos de alto riesgo, como procedimientos legales, traducción diplomática o consultas médicas en vivo, los intérpretes humanos siguen siendo la opción correcta. El precio de 0,034 dólares por minuto lo convierte en una opción obvia para la larga cola de conversaciones en varios idiomas que antes no podían justificar el costo de un ser humano.
Trabajemos juntos
¿Quiere crear sistemas AI, automatizar flujos de trabajo o ampliar su infraestructura tecnológica? Me encantaría ayudar.
- Fiverr (compilaciones e integraciones personalizadas): fiverr.com/s/EgxYmWD
- Cartera: mejba.me
- Ramlit Limited (soluciones empresariales): ramlit.com
- ColorPark (diseño y marca): colorpark.io
- xCyberSecurity (servicios de seguridad): xcybersecurity.io