Skip to main content
OpenAI

GPT Realtime 2 en Translate: wat dit verandert voor bouwers

OpenAI heeft GPT Realtime 2 en GPT Realtime Translate op 7 mei 2026 verzonden. Dit is wat ze feitelijk doen, wat ze kosten en wat bouwers vervolgens moeten

24 min
Leestijd
4,707
Woorden
Gepubliceerd
Engr Mejba Ahmed

Geschreven door

Engr Mejba Ahmed

Artikel delen

GPT Realtime 2 en Translate: wat dit verandert voor bouwers

Het fragment dat mijn vriend mij gisteren om 08:14 uur stuurde, was 91 seconden lang. Een Franstalige aan de linkerkant, een Engelse spreker aan de rechterkant, beiden praten door elkaar heen zoals echte mensen dat doen, beiden horen de ander in hun eigen taal met misschien een halve seconde vertraging. Halverwege schakelde de Franstalige over op het Duits voor één volledige zin, en daarna weer op het Frans. De Engelse vertaling ging netjes om met het Duits, behield dezelfde stemkenmerken, stotterde niet en voegde geen verduidelijkende tag toe "de spreker is van taal gewisseld", zoals elk ander systeem dat ik heb getest. Het bleef maar doorgaan.

Ik heb het drie keer opnieuw bekeken voordat ik de OpenAI-aankondiging opende. Vervolgens opende ik de API-console. Toen heb ik mijn ochtendvergaderingen geannuleerd.

Wat OpenAI op 7 mei 2026 heeft verzonden, zijn twee dingen waar ik twee jaar op heb gewacht. GPT Realtime 2 is een voice-to-voice-model met GPT-5-klasse redenering, parallelle tool-aanroep en een contextvenster van 128K - vier keer wat de oorspronkelijke gpt-realtime ons gaf. GPT Realtime Translate is een speciaal streaming-vertaalmodel dat meer dan 70 invoertalen en 13 uitvoertalen verwerkt, werkt op $ 0,034 per minuut en wacht op werkwoorden voordat het een vertaling uitvoert, zodat de uitvoer klinkt als een persoon die praat, en niet als een Markov-reeks zin voor zin.

Ik heb de afgelopen 36 uur beide getest. Ik heb een stemagent in productie voor een bestaande klant en ik heb de helft ervan al naar het nieuwe model gemigreerd. De andere helft blijft op de oudere stapel, en ik zal zo meteen uitleggen waarom.

Dit bericht is een praktische versie. Het interessante deel is niet de demo die OpenAI op het podium draaide; het is wat deze modellen betekenen voor iedereen die momenteel spraakfuncties levert en voor iedereen die op het punt staat te beginnen. Aan het einde zul je weten welk model je moet kiezen, welke migraties je deze week moet doen, waar de nieuwe wiskunde van $ 0,034 per minuut feitelijk break-even draait, en het enige waar niemand het over heeft, verandert de manier waarop je stemstromen vanaf het begin moet ontwerpen.

De drop met drie modellen die van 7 mei een stem maakt AI resetdatum

Voordat ik inga op wat deze modellen goed doen, heb je de vorm van de release nodig, omdat de helft van de online opnames de drie modellen samenvoegt tot één product.

OpenAI heeft een drietal geleverd: GPT Realtime 2 (de stemagent op redeneerniveau), GPT Realtime Translate (het speciale vertaalmodel) en GPT Realtime Whisper (een streaming spraak-naar-tekst met een snelheid van $ 0,017 per minuut die stilletjes de geketende STT-LLM-TTS-pijpleiding die de meeste productiesystemen nog steeds gebruiken). Ze staan ​​alle drie achter de Realtime API, ze zijn alle drie samen aangekondigd en ze hebben alle drie verschillende prijzen en verschillende banen.

Dit is het deel dat ertoe doet. Tot deze daling betekende het bouwen van een serieuze stemagent het sluiten van een van de twee compromissen. Je hebt ElevenLabs of Deepgram geketend voor transcriptie, GPT-4o of Claude voor redenering, en ElevenLabs opnieuw voor synthese - waarbij je bij elke hop 400 tot 800 milliseconden aan round-trip latentie hebt toegevoegd en hebt gebeden dat de orkestratielaag geen statusovergang heeft laten vallen. Of je gebruikte de originele gpt-realtime, die je voice-to-voice minder dan 500 ms gaf, maar de redenering op het niveau van GPT-4o beperkte, je verslikte in parallelle tool-oproepen en je in een 32K-contextvenster dwong dat kapot ging zodra het gesprek ongeveer zes minuten duurde.

GPT Realtime 2 dicht beide gaten in één model. Het bereikt een end-to-end steady-state latentie van 300 tot 500 ms, net als zijn voorganger. Maar de context sprong naar 128K. De redenering is de klasse GPT-5 met vijf door de gebruiker bestuurbare redeneringsniveaus: minimal, low, medium, high en xhigh. En op de Big Bench Audio benchmark scoorde GPT Realtime 2 met een hoge redenering 96,6%, vergeleken met 81,4% voor GPT Realtime 1.5. Op Audio MultiChallenge – een multi-turn conversatie-instructie-volgende test – behaalde de xhigh-variant 48,5% versus 34,7% voor 1,5. Dat zijn geen marginale verbeteringen. Dat zijn stapsgewijze veranderingen.

Daarom heb ik mijn ochtend opnieuw ingedeeld. Het tijdperk van compromissen is voorbij.

Wat ik feitelijk in 36 uur heb getest

Ik ga de OpenAI-demo niet naar u parafraseren. De persberichtversie is prima, maar mist ook de onderdelen die er toe doen. Dit is wat ik feitelijk heb gelopen.

Test 1: Migreren van een echte klantagent. Ik heb een stemintakeagent draaien voor een kleine SaaS-client - kwalificeert inkomende demoverzoeken, boekt een gesprek in de agenda van de oprichter en zet de lead neer in HubSpot. Het werd zes weken geleden gebouwd op de originele gpt-realtime met twee toolaanroepen (opzoeken van kalender, CRM-webhook). Ik migreerde het naar GPT Realtime 2 met de redenering ingesteld op medium, hield al het andere identiek en voerde er 23 gesimuleerde oproepen doorheen. De betrouwbaarheid van het aanroepen van tools ging van "moet af en toe opnieuw worden geprobeerd" naar "Ik heb het nog niet gemist." De conversatie-reparatie toen ik opzettelijk onderbrak ("wacht, nee - dinsdag, niet donderdag") ging van "soms teruggaan naar de vorige vraag" naar "gewoon de correctie bevestigen en verder gaan."

Test 2: Live vertaling met codewisseling. Ik kan de OpenAI-demo niet woordelijk repliceren omdat ik niet dezelfde luidsprekers bij de hand heb, maar ik kan de structuur wel opnieuw creëren. Ik had een Franstalige vriendin op Zoom, liet haar audio in een Realtime Translate-sessie draaien die gericht was op Engelse output, en vroeg haar precies te doen wat de OpenAI-demo deed: Frans spreken, een zin in het Duits gebruiken, een technische term in het Engels gebruiken en terugkeren naar het Frans. De vertaalvertraging belandde ongeveer 600 ms achter de spreker aan de voorkant van elke zin. Het model wachtte op werkwoorden voordat ze een commit uitvoerde – je kon het horen.

De uitvoer bleef coherent over de taalwisselingen met één bobbel: een Duits technisch samengesteld zelfstandig naamwoord (Bestandsführungssystem, voorraadbeheersysteem) kwam eruit als 'het inventarissysteem' in plaats van de preciezere vertaling. Aanvaardbaar. Beter dan wat ik live zou doen.

Test 3: Parallelle toolaanroep met preambles. Dit is degene die mij oprecht heeft verrast. Ik bouwde een kleine agent met drie tools (een kalender opzoeken, een API weerbericht en een CRM-contact opzoeken) en stelde hem vragen die alle drie tegelijkertijd moesten gebruiken ("ben ik vrij vrijdagmiddag, hoe ziet het weer eruit voor de externe locatie, en is Sarah van Acme nog steeds mijn belangrijkste contactpersoon"). Met de preambles ingeschakeld, zei de agent binnen ongeveer 200 ms "Laat me dat voor je controleren", riep vervolgens alle drie de tools parallel aan en synthetiseerde vervolgens een enkel samenhangend antwoord. Totale latentie van vraag tot volledig antwoord: ongeveer 2,4 seconden. De originele gpt-realtime zou de tooloproepen (4-6 seconden) hebben geserialiseerd of er een hebben laten vallen.

Test 4: Lang gespreksgeheugen met een venster van 128K. Ik heb één Realtime 2-sessie van 47 minuten uitgevoerd: een gesimuleerd klantondersteuningsgesprek over een ingewikkeld factureringsprobleem. Het model behield de hele context de hele tijd. Verwezen naar de frustratie van de klant vanaf minuut drie bij het genereren van de resolutie op minuut 41. Het oorspronkelijke 32K-venster zou halverwege het gesprek zijn afgekapt of externe geheugeninjectie vereisen. Dit is wat volgens mij de meeste dekking onderverkoop is.

Test 5: Het ding dat kapot ging. Redenering ingesteld op xhigh op basis van een eenvoudige vraag zorgde ervoor dat de latentie van de eerste token steeg van ~300 ms naar meer dan 1,4 seconden. Dat is de handel. Hoger redeneren betekent een langere pauze voordat de agent begint te praten. Voor een verkoopagent die een lead kwalificeert, voelt die pauze verkeerd. Voor een ondersteuningsagent die een terugbetalingsgeschil oplost, voelt het opzettelijk. De redeneringsinspanning is geen vrije keuze – het is een UX-keuze. Ik kom hier in het implementatiegedeelte op terug, omdat ik denk dat dit de plek is waar de meeste bouwers zullen worden verbrand.

Dat is de eerlijke uitslag van 36 uur testen. Laat me je nu de architectuur en de kosten laten zien.

De echte architectuur die de meeste dekking mist

Elke blogpost over deze release wil je vertellen dat GPT Realtime 2 een stemagent is. Dat kader is onvolledig en het zal veel teams ertoe brengen het verkeerde te bouwen.

GPT Realtime 2 is een redeneringsmodel met native audio I/O en primitieven voor het aanroepen van tools. De stempartij is niet meer de onderscheidende factor. De redenering + tools + 128K-context is de differentiator. Dat betekent dat het ontwerppatroon dat dit jaar wint niet de ‘voice chatbot’ is – het is voice als primaire interface voor een agent die al bestaat.

Dit is wat ik bedoel. De meeste teams die momenteel spraakfuncties leveren, hebben ze gebouwd als telefoonbomen. Bezoeker belt, agent doorloopt een script, agent verzamelt velden, agent draagt ​​deze over aan een mens. Dat patroon is opgelost. Het was al opgelost door de stemagentstack die ik zes maanden geleden heb gedocumenteerd met behulp van Claude Code en ElevenLabs. Wat nieuw is, is dat de agent aan de andere kant van het spraakkanaal nu net zo goed kan redeneren als de tekstagent van de GPT-5-klasse die uw concurrent in zijn dashboard levert. Hetzelfde brein. Verschillende I/O.

Concreet: een spraakgestuurde CRM-update is niet langer "de stem van de gebruiker transcriberen → een tekstagent uitvoeren → het resultaat terugspreken." Het is "stuur de audiostream naar een enkele Realtime 2-sessie, definieer de CRM-tools als JSON-schema's, laat het model kiezen welke tool moet worden aangeroepen, laat het zijn redenering hardop uitleggen via preambules, en laat de gebruiker de mid-flow onderbreken of corrigeren." Dat zijn niet drie diensten die aan elkaar zijn genaaid. Dat is één model dat de hele interactie omvat.

De implicatie is ongemakkelijk voor iedereen die zwaar heeft geïnvesteerd in de geketende pijplijn. Uw STT-leverancier concurreert nu met een Whisper van streamingkwaliteit voor $ 0,017 per minuut. Uw TTS-leverancier concurreert met een model waarvan de spraakkwaliteit niet de beste in zijn klasse is, maar zo goed is dat de latentiewinst daar doorgaans groter van wordt. Je orkestratielaag – LangChain, je eigen agentloop, wat dan ook – concurreert met een enkele API die het aanroepen van tools, parallelle uitvoering en conversatiereparatie native afhandelt.

Ik zeg niet dat ElevenLabs dood is. Ik zal zo meteen uitleggen waarom ik de helft van de stapel van mijn cliënt erop laat staan. Ik zeg dat de wiskunde zo veranderd is dat elk stemproductteam deze week de build-versus-stitch-beslissing opnieuw moet nemen.

De prijswiskunde die uw architectuur bepaalt

U kunt deze beslissing niet alleen op basis van de functies nemen. Je moet het kostenwerk doen. Ik heb het kostenwerk gedaan en ik zal je het spreadsheet-uur besparen.

Hier zijn de geverifieerde tarieven vanaf de aankondiging van 7 mei 2026, allemaal bevestigd op basis van de OpenAI API-prijspagina:

Onderdeel GPT Realtime 2 GPT Realtime Translate GPT Realtime Whisper
Audio-ingang $32 / 1 miljoen tokens $ 0,034 per minuut (plat) $ 0,017 per minuut (plat)
In cache opgeslagen audio-invoer $ 0,40 / 1 miljoen tokens — —
Audio-uitvoer $64 / 1 miljoen tokens inbegrepen in per minuut niet van toepassing (alleen STT)
Tekstinvoer $ 4 / 1 miljoen tokens — —
Tekstuitvoer $ 16 / 1 miljoen tokens — —
Contextvenster 128K-tokens streamen streamen
Redeneerniveaus minimaal, laag, gemiddeld, hoog, xhoog n/a n/a

Nu de werkende wiskunde per minuut, omdat tokentarieven pas echt aanvoelen als je ze converteert. Een typische Realtime 2-spraaksessie gebruikt ongeveer 800 tot 1.200 audio-invoertokens per minuut spraak van de gebruiker en ongeveer 1.500 tot 2.500 audio-uitvoertokens per minuut spraak van de agent, afhankelijk van hoeveel de agent praat. Noem het een gebalanceerd tweerichtingsgesprek: u kijkt naar ongeveer $0,10 tot $0,18 per minuut actief gesprek voor Realtime 2 met standaardinstellingen, vóór tekstredenering of toolaanroepen. Verhoog de redeneringsinspanning tot high en dat kruipt richting $0,20-$0,25 per minuut vanwege de extra verbruikte redeneertokens.

Vergelijk dat eens met het geketende alternatief. Een serieuze ketenpijplijn vandaag (Deepgram Nova-3 streaming STT + GPT-5 tekstredenering + ElevenLabs Turbo v3 streaming TTS) belandt ergens rond de $0,06 tot $0,12 per minuut actieve stem, maar je eet de latentiekosten op: 400-800 ms totale retour, vaak slechter bij het bellen van tools.

Realtime 2 is dus ongeveer 1,5x tot 2x de kosten per minuut van de geketende aanpak. De vraag is of de latentie, de redenering en de operationele eenvoud die premie waard zijn. Voor een verkoopagent waar conversie vloeiendheid volgt, ja, gemakkelijk. Voor een IVR met een hoog volume waarbij het script een telefoonboom is en de kosten het knelpunt vormen, waarschijnlijk niet.

GPT Realtime Translate is het model waarbij de wiskunde duidelijk wordt. $ 0,034 per minuut is krankzinnig in de goede richting. Vergelijk dat eens met de typische ketenaanpak voor het streamen van vertalingen – Deepgram of Whisper voor STT, GPT-4o voor vertaalredeneringen, ElevenLabs meertalig voor TTS – die rond de $ 0,10 tot $ 0,15 per minuut uitkomt en aanzienlijk trager is. Voor $ 0,034 per minuut met het werkwoordbewuste vertragingsmodel is dit de eerste keer dat ik een vertaalpijplijn zie waarvan je niet krankzinnig zou zijn als je deze standaard zou gebruiken.

GPT Realtime Whisper met $ 0,017 per minuut is de rustige slaper van de drie. Als u al een geketende pijplijn in productie heeft, is het vervangen van uw huidige STT-leverancier hierdoor waarschijnlijk de goedkoopste en minst risicovolle migratie op het menu. Je kunt het in een middag doen.

Hoe daadwerkelijk te migreren: een concreet plan

Als je vandaag een spraakproduct in productie hebt, is hier het migratieplan dat ik gebruik voor mijn eigen klantwerk, opgesplitst in de volgorde waarin ik het daadwerkelijk zou doen.

Stap 1: Controleer uw huidige voicestack en identificeer uw knelpunt. Wees specifiek. Is het knelpunt de gesprekstijd? Betrouwbaarheid bij het bellen van tools? Kosten? Kwaliteit van stemsynthese? Talen die u niet ondersteunt? Verschillende knelpunten rechtvaardigen verschillende migraties. Als uw knelpunt de gesprekslatentie en de betrouwbaarheid van tools is, is GPT Realtime 2 uw migratiedoel. Als het om kosten gaat en uw spraakkwaliteit al voldoende is, is uw migratiedoel wellicht alleen de Whisper-component, terwijl u de rest behoudt.

Stap 2: Voer een parallelle implementatie uit in een feature branch. Migreer niet ter plaatse. Het Realtime API-sessiemodel is vergelijkbaar met het originele gpt-realtime – WebRTC, WebSocket of SIP-transport – maar het configuratieobject heeft nieuwe velden voor reasoning_effort, preambles en parallelle tooldefinities. Je wilt de nieuwe vorm op een schone tak leren voordat je aan de productie begint.

Stap 3: Definieer uw tools als JSON-schema's, inclusief de preambule-tekenreeksen. Dit is het deel waarin u het gedrag van de agent feitelijk vorm kunt geven. Een gereedschapsdefinitie voor het nieuwe model ziet er als volgt uit:

{
  type: "function",
  name: "lookup_calendar_availability",
  description: "Check the user's calendar for available 30-minute slots in the next 14 days.",
  preamble: "Let me check your calendar.",
  parameters: {
    type: "object",
    properties: {
      timezone: { type: "string" },
      preferred_window: {
        type: "object",
        properties: {
          earliest: { type: "string", format: "date-time" },
          latest: { type: "string", format: "date-time" }
        }
      }
    },
    required: ["timezone"]
  }
}

Het veld preamble is nieuw. Het is de korte zin die het model hardop zegt terwijl de tool draait, waardoor de ervaring met parallelle tools responsief aanvoelt in plaats van doodstil. Beschouw preambules als een eersteklas onderdeel van de stem van uw agent; ze moeten passen bij de persoonlijkheid van de agent.

Stap 4: Kies een redenering per use case, niet per agent. Dit is de valkuil waar de meeste bouwers in trappen. Ze kiezen medium en vergeten het. Het juiste patroon is om het redeneerniveau dynamisch in te stellen op basis van het verzoek van de gebruiker. Eenvoudige zoekopdrachten ("wat is mijn volgende vergadering") worden uitgevoerd op low. Beslissingen in meerdere stappen ("herboek al mijn dinsdagbijeenkomsten rond het conflict") worden uitgevoerd op high. Complexe agentische stromen die uit meerdere stappen bestaan ​​("plan mijn volgende twee weken aan klantoproepen en update mijn CRM dienovereenkomstig") draaien op xhigh en u eet de latentie op. De OpenAI-sessieconfiguratie ondersteunt het bijwerken van deze tussentijdse sessie.

Stap 5: Bekabel opzettelijk parallel aanroepen van tools. Parallel aanroepen is standaard ingeschakeld, maar u moet uw tools zo schrijven dat ze eigenlijk parallelleerbaar zijn. Als drie tools van elkaars output afhankelijk zijn, zal het model ze toch serialiseren. De winst is dat je drie onafhankelijke zoekopdrachten hebt die kunnen uitwaaieren: kalender + weer + CRM bijvoorbeeld, of aandelenkoers + nieuws + portefeuillepositie.

Stap 6: Test met het redeneerniveau een stapje hoger dan je denkt nodig te hebben, en draai dan omlaag. In tegenstelling tot mijn eigen waarschuwing hierboven, is de foutmodus die ik het vaakst tegenkom bij de zelfinschatting van teams: "Ik heb laag gekozen omdat de vraag eenvoudig was, maar de vraag was eigenlijk een vermomde multi-hop agentische stroom." Begin een tandje hoger, let op het latentiebudget en bel vervolgens terug zodra u gegevens heeft.

Stap 7: Controleer of de 128K-context doet wat u denkt dat hij doet. De langere context is grotendeels onzichtbaar totdat u deze nodig heeft. Waar het verschijnt: langere klantondersteuningsgesprekken, coachingsessies met meerdere beurten, alles waar de gebruiker verwijst naar iets dat hij 20 minuten geleden heeft gezegd. Test deze scenario's bewust. Ga er niet van uit dat het model de context gebruikt alleen maar omdat de context bestaat.

Als je een dieper inzicht wilt in hoe ik agentspecificaties structureer voordat deze code wordt geschreven, heb ik het raamwerk in mijn agent build playbook doorgenomen - dat stuk past goed bij dit voor iedereen die productiestemwerk migreert.

Het vertaalmodel verdient een eigen gesprek

Ik schreef bijna in één adem over Realtime Translate met Realtime 2 en dat zou een verkeerde beslissing zijn geweest. Het zijn verschillende producten die verschillende problemen oplossen en de ontwerppatronen voor elk product zijn totaal verschillend.

Realtime 2 is bedoeld voor één partij (uw software) die met een andere partij (uw gebruiker) praat. Realtime Translate is bedoeld voor twee menselijke partijen die via uw software met elkaar praten. Dat is een andere topologie en het verandert alles aan de manier waarop je bouwt.

Het model is gebouwd rond één mooie ontwerpkeuze: het wacht op werkwoorden voordat het tot een vertaling overgaat. In Subject-Verb-Object-talen zoals Engels is het werkwoord vroeg. In subject-object-werkwoord-talen zoals Duits of Japans staat het werkwoord aan het einde. Een naïeve vertaler die woord voor woord uitzendt, zal in beide richtingen rotzooi produceren, omdat de betekenis van de zin achter het werkwoord verborgen zit. Realtime Translate buffert net lang genoeg om het actiewoord te vinden en voert de vertaling vervolgens uit met een vloeiende, prosodiebehoudende stem. Het resultaat is een vertaalde stem die klinkt als een zinvolle persoon, en niet als een systeem dat racet om bij te blijven.

De lijst met meer dan 70 invoertalen en 13 uitvoertalen omvat vrijwel elke taal met een serieuze vraag naar commerciële vertalingen. Deutsche Telekom gebruikt het voor grensoverschrijdende klantenondersteuning op Europese markten. Zillow gebruikt GPT Realtime 2 (niet Translate) om een ​​huizenaankoopassistent te bouwen die autonoom rondleidingen plant, en Priceline bouwt een stemgestuurde reisbeheeragent. Het patroon in alle vroege enterprise-pilots is hetzelfde: stem als een laag bovenop een agent die al redenering had, met vertaling als een parallelle laag wanneer de gebruiker en de agent geen taal delen.

Ik denk dat de gebruiksscenario's de komende 90 dagen zullen exploderen, gebaseerd op wat ik al hoor van bouwers:

  • Klantenondersteuning in verschillende regio's. Een in de VS gevestigd SaaS-bedrijf kan nu ondersteuning bieden in 70 talen zonder 70 moedertaalsprekers in dienst te hebben. De klant praat in zijn eigen taal, de agent (mens of AI) hoort het in het Engels, het antwoord gaat terug via het model. - Live evenementinterpretatie. Conferenties, gemeentehuizen, intern bedrijf alle handen. Het huidige menselijke interpretatiemodel is duur en laggy. Realtime vertalen voor $ 0,034 per minuut met een vertraging van een halve seconde is sneller dan mensen en een orde van grootte goedkoper dan mensen. - Onderwijs en begeleiding. Apps voor het leren van talen waren al AI-verzadigd. De volgende golf is real-time begeleiding in een doeltaal, waarbij de moedertaal van de leerling beschikbaar is als reserve — direct, on-demand, zonder planning.

  • Grensoverschrijdende B2B-verkoop. Een verkoper in Berlijn kan nu ontdekkingsgesprekken voeren met potentiële klanten in Tokio, Madrid en São Paulo zonder dat hij drie talen vloeiend spreekt. Vroeger waren de vertaaloverheads de deal killer. Het is zojuist verwijderd.

Ik denk niet dat een van deze speculatief is. Ik denk dat het productlanceringen uit 2026 zijn door teams die gisteren zijn begonnen met bouwen.

De eerlijke afwegingen die niemand noemt

Nu het gedeelte waarin ik je vertel waar ik niet van hou.

De stemkwaliteit van GPT Realtime 2 is, liefdadig, de derde beste op dit gebied wat betreft rauwe natuurlijkheid. Onafhankelijke blinde luistertests in het eerste kwartaal van 2026 plaatsen ElevenLabs nog steeds consequent op de eerste plaats voor de helderheid van medeklinkers, de plaatsing van de ademhaling en de prosodie van lange zinnen – de kleine dingen die ervoor zorgen dat een stem menselijk aanvoelt in plaats van gesynthetiseerd. OpenAI Realtime klinkt goed. Het klinkt niet beste. Voor producten waarbij stemgetrouwheid het eigenlijke product is (een hoogwaardige audioboekverteller, een stemkloon van beroemdheden, een entertainment-IP) zou u nog steeds ElevenLabs moeten gebruiken. De latentiekosten zijn de kwaliteit waard, en het geketende pijplijnpatroon is volwassen genoeg om dit aan te kunnen.

Het verhaal over het klonen van stemmen is ook niet waar ElevenLabs zich bevindt. Realtime 2 wordt geleverd met de samengestelde stemmenbibliotheek van OpenAI. Er is geen Professional Voice Clone-equivalent waarmee u een aangepaste stem kunt trainen op basis van urenlang eigen audio. Als uw product de daadwerkelijke stem van uw oprichter nodig heeft, is ElevenLabs het antwoord voor de nabije toekomst. Dat is de helft van de stapel van mijn klant die ik niet migreer.

Voor HIPAA in aanmerking komende werklasten zijn nog steeds een echte overweging. De OpenAI Realtime audiomodaliteit is, zoals ik de documenten tot nu toe heb gelezen, niet gecertificeerd voor HIPAA-workloads op dezelfde manier waarop het gekoppelde Deepgram + GPT-4 + ElevenLabs-patroon kan worden geconfigureerd. Als u een stem voor de gezondheidszorg opbouwt, voer dan een nalevingsbeoordeling uit voordat u migreert en ga ervan uit dat u mogelijk aan de keten moet blijven totdat de dekking is ingehaald.

De latentie van redeneerinspanningen is niet gratis. Ik heb dit eerder gezegd, maar het is de moeite waard om het te herhalen, omdat de meeste bouwers het pas zullen voelen als ze worden verzonden. Als u reasoning_effort instelt op high, wordt er merkbare latentie toegevoegd vóór het eerste hoorbare woord. Voor een coach- of ondersteuningsagent waarbij de pauze als overwogen wordt ervaren, leest die latentie als bedachtzaamheid. Voor een verkoopagent waar tempo belangrijk is, leest dit als een systeemfout. Stem dienovereenkomstig af.

En de prijspremie is reëel. 1,5x tot 2x uw kosten voor de ketenpijplijn zijn niet niets als u een spraakproduct met een hoog volume gebruikt. Breng de economie van uw eenheid in kaart voordat u migreert, en kijk goed waar de extra kosten worden omgezet in extra inkomsten (betere conversie, lagere verwerkingstijd, hogere klanttevredenheid) en waar deze zich alleen manifesteren als margecompressie.

Wat ik deze week zou bouwen als ik een vrije vrijdag had

Als ik op een vrijdag zou zitten zonder verplichtingen voor de klant en de nieuwe modellen op mijn bureau, dan is dit wat ik daadwerkelijk zou bouwen.

Een stemgestuurde persoonlijke CRM die in mijn AirPods leeft. Ik druk op de knop, ik zeg "log een ontmoeting met Sarah van Acme, ze is geïnteresseerd in het agentmigratiepakket, neem volgende dinsdag om 10 uur contact op", en de agent schrijft een HubSpot-record, plant een vervolgherinnering, stelt de vervolg-e-mail op in mijn outbox en leest de samenvatting terug zodat ik kan bevestigen. Alles in één Realtime 2-sessie, allemaal binnen drie seconden van begin tot eind. Totale bouwtijd, gezien het nieuwe model: waarschijnlijk vier uur. Totale exploitatiekosten: misschien $ 0,25 per geregistreerde interactie.

Dat is niet hypothetisch. Dat is iets dat ik ga bouwen zodra ik dit concept afsluit.

Of – en dit is de versie waarvan ik denk dat elk B2B SaaS-bedrijf naar zou moeten kijken – een meertalige demo-agent op de marketingsite. Een potentiële klant komt op de site terecht, klikt op de stemknop en zegt in zijn moedertaal: "laat me zien wat uw product doet." De agent, die draait op Realtime 2 waarbij Realtime Translate de cross-taallaag afhandelt, geeft een op maat gemaakte walkthrough van vijf minuten in hun moedertaal, kwalificeert hun gebruiksscenario en boekt de menselijke verkoopopvolging in hun eigen tijdzone. De kosten per gekwalificeerde lead dalen met een orde van grootte. De conversie neemt toe omdat taal niet langer een wrijving is.

Ik verkoop je niets van dit alles. Ik wijs op de patronen die de modellen daadwerkelijk ontsluiten en zeg hardop dat de kloof tussen ‘dit is mogelijk’ en ‘dit is gebouwd’ zojuist is ingestort.

Wat dit betekent voor de stem AI-stapel

Uitzoomen. De release van 7 mei is niet alleen een modelupdate. Het is een her-nivellering van waar redeneren plaatsvindt in stemsystemen.

Twee jaar lang was de architectuur: voice in → STT → LLM → TTS → voice out. De redenering leefde in de LLM-fase, ingeklemd tussen twee latency-etende I/O-conversies. Elk team dat spraaksystemen bouwde, loste hetzelfde orkestratieprobleem op, hetzelfde latentieprobleem, hetzelfde conversatiereparatieprobleem.

GPT Realtime 2 vat dat samen in: stem in → redeneermodel → stem uit. Eén fase. Eén latentiekosten. Eén contextvenster met de volledige interactie.

Dat is geen verfijning. Dat is een andere categorie systemen. De teams die de verschuiving snel genoeg onderkennen om hun stemproducten eromheen opnieuw te ontwerpen, zullen er over zes maanden uitzien als genieën. De teams die het als een marginale verbetering van hun bestaande ketenpijplijn beschouwen, zullen over twaalf maanden in de war raken als hun conversiecijfers blijven hangen en die van hun concurrenten niet.

Het ontgrendelen is niet zo dat stemagenten nu mogelijk zijn. Een jaar geleden waren ze mogelijk. De ontgrendeling is dat stem nu naast tekst een peer I/O-modaliteit kan zijn – dezelfde redenering, dezelfde tools, dezelfde context – en dat is wat stem levensvatbaar maakt als primaire interface voor elke agent die al bestaat. Jouw dashboard. Uw CRM-systeem. Jouw ondersteuningssysteem. Uw codeerassistent. Ze kunnen nu allemaal een stemmodus ontwikkelen die geen slechtere versie is van de typervaring, maar een andere vorm van dezelfde intelligentie.

Het fragment van 91 seconden dat mijn vriend mij om 08:14 uur stuurde, was geen vertaaldemo. Het was een voorproefje van hoe elk spraakproduct eruit gaat zien. Twee mensen, twee talen, één model, geen wrijving. Wat me drie keer opnieuw kijken kostte om te registreren was niet de kwaliteit van het model; het was dat de stem aanvoelde als een normaal kanaal om met software te praten. Geen telefoonboom. Geen chatbot die doet alsof hij luistert. Gewoon praten. Met het systeem begrijpen en handelen.

Dat is het moment waarop de stemcategorie volwassen wordt.

Veelgestelde vragen

Wat is het verschil tussen GPT Realtime 2 en GPT Realtime Translate?

GPT Realtime 2 is een volledige stemagent met GPT-5-klasse redenering, parallelle toolaanroepen en een contextvenster van 128K - gebouwd voor gesprekken tussen uw software en één gebruiker. GPT Realtime Translate is een speciaal streaming-vertaalmodel met meer dan 70 invoertalen en 13 uitvoertalen – gebouwd voor twee mensen die via uw app verschillende talen met elkaar spreken. Het zijn verschillende producten voor verschillende topologieën. Voor een diepere uitsplitsing van de architectuur, zie "De echte architectuur die de meeste dekking mist" hierboven.

Hoeveel kost GPT Realtime 2 vergeleken met de originele gpt-realtime?

De tokentarieven zijn op het moment van schrijven identiek – $32 per miljoen audio-invoertokens, $64 per miljoen audio-uitvoertokens – dus een typisch gebalanceerd tweerichtingsgesprek kost ongeveer $0,10 tot $0,18 per minuut bij standaardinstellingen. Als er meer redeneerinspanningen mogelijk zijn, kruipt dat in de richting van $0,20 tot $0,25 per minuut. De prijs veranderde niet; de mogelijkheden deden dat wel.

Moet ik migreren van een gekoppelde STT-LLM-TTS-pijplijn naar Realtime 2?

Migreer als uw knelpunt de latentie van gesprekken, de betrouwbaarheid van het aanroepen van tools of operationele complexiteit is. Blijf geketend als uw knelpunt stemgetrouwheid is (ElevenLabs wint nog steeds op natuurlijkheid), HIPAA-compliance, of als u een aangepaste stemkloon nodig heeft. Het volledige migratieplan vindt u in 'Hoe daadwerkelijk migreren' hierboven.

Wat betekent "preambules" in de nieuwe Realtime API?

Preambules zijn korte zinnen die het model hardop zegt voor of tijdens een gereedschapsoproep, bijvoorbeeld 'Laat me dat even controleren' of 'controleer je agenda'. Ze houden de gebruiker gedurende een paar seconden betrokken wanneer de tools actief zijn, zodat het gesprek geen dode lucht krijgt. Preambules worden per tool geconfigureerd in uw functiedefinities en moeten overeenkomen met de persoonlijkheid van uw agent.

Is Realtime Translate goed genoeg om menselijke tolken te vervangen?

Voor de meeste commerciële gebruiksscenario's – klantenondersteuning, B2B-verkoopgesprekken, interne training – ja, met het voorbehoud dat dit momenteel het beste is bij taalparen met volwassen trainingsgegevens. Voor contexten waar veel op het spel staat, zoals gerechtelijke procedures, diplomatieke vertalingen of live medische consultaties, blijven menselijke tolken de juiste keuze. De prijs van $ 0,034 per minuut maakt het een no-brainer voor de lange staart van gesprekken in meerdere talen die voorheen de kosten van een mens niet konden rechtvaardigen.

Laten we samenwerken

Wilt u AI-systemen bouwen, workflows automatiseren of uw technische infrastructuur schalen? Ik help je graag.

Coffee cup

Vond u dit artikel leuk?

Uw steun helpt mij meer diepgaande technische content, open-source tools en gratis bronnen voor de ontwikkelaarsgemeenschap te maken.

Gerelateerde onderwerpen

Engr Mejba Ahmed

Engr Mejba Ahmed

Engr. Mejba Ahmed builds AI-powered applications and secure cloud systems for businesses worldwide. With 8+ years shipping production software in Laravel, Python, and AWS, he's helped companies automate workflows, reduce infrastructure costs, and scale without security headaches. He writes about practical AI integration, cloud architecture, and developer productivity.

Gerelateerde artikelen

Alles bekijken

Comments

Leave a Comment

Comments are moderated before appearing.

Learning Resources

Expand Your Knowledge

Accelerate your growth with structured courses, verified certificates, interactive flashcards, and production-ready AI agent skills.

Sample Certificate of Completion

Sample certificate — complete any course to earn yours

Engr Mejba Ahmed

Engr Mejba Ahmed

AI assistant · trained on my work

👋

Hey there!

Quick Actions

WhatsApp Direct line to me

Chat on WhatsApp

+880 1723 741224 · Replies within the hour on working days

Popular Questions

Engr Mejba Ahmed is connected
Engr Mejba Ahmed is typing...
Engr Mejba Ahmed avatar

✉ Want me to follow up? Drop your email

Engr Mejba Ahmed avatar

📞 Connect Directly

Choose how you'd like to reach me

WhatsApp

+880 1723 741224

Email

mejba.13@gmail.com

✓ Details sent! I'll get back to you shortly.

Powered by OpenAI

335+

Blog Posts

25

AI Courses

63

Projects

Services & Expertise

Pricing & Process

Learning & Resources

Connect & Support