L'IA vocale a beaucoup bougé cet été. Trois nouveaux modèles, une gamme renouvelée, et des tarifs qui n'ont pas baissé. Voici l'état des lieux au 28 août 2026, chiffres vérifiés à la source — et ce qu'un dirigeant doit en retenir avant de faire décrocher une machine à sa place.
Ce qui est sorti
Le 7 mai 2026, OpenAI a mis en service trois modèles audio dans son API.
GPT-Realtime-2 tient une conversation vocale en temps réel. Sa nouveauté la plus utile est un réglage de l'effort de réflexion sur cinq crans : on arbitre explicitement entre la rapidité de réponse et la qualité du raisonnement. Sa mémoire de conversation passe de 32 000 à 128 000 jetons, de quoi tenir un échange long sans perdre le fil.
Les deux autres sont plus spécialisés : GPT-Realtime-Translate traduit la parole en direct depuis plus de 70 langues vers 13, et GPT-Realtime-Whisper transcrit au fil de l'eau pendant que la personne parle.
Le 6 juillet 2026, la gamme a été renouvelée avec GPT-Realtime-2.1. OpenAI annonce trois progrès : meilleure reconnaissance des suites mêlant lettres et chiffres — références de commande, codes de suivi, immatriculations —, meilleure gestion des silences et du bruit de fond, meilleur comportement quand l'interlocuteur coupe la parole.
Ce qu'aucun éditeur ne publie
Ces trois progrès ne sont chiffrés nulle part. OpenAI ne publie aucune mesure de latence pour ces modèles, ni dans son journal des versions, ni dans la fiche technique.
C'est le point à retenir de tout ce paysage : les annonces vocales se font en adjectifs, pas en millisecondes. Un éditeur qui vous parle de « latence ultra-faible » sans donner de chiffre ne vous a rien dit.
Le seuil qui compte, dans une vraie conversation, se situe autour de la seconde. Au-delà de deux secondes de silence après une question, l'échange casse et votre interlocuteur reprend la main — ou raccroche. C'est le critère qui élimine le plus de solutions, et c'est celui que vous devez mesurer vous-même, sur votre propre contenu.
Les prix, au 28 août 2026
Chez OpenAI, l'audio du modèle temps réel se facture 32 dollars par million de jetons en entrée et 64 en sortie. La version allégée descend à 10 et 20 dollars. Les deux modèles spécialisés se facturent, eux, à la durée : 0,034 dollar la minute pour la traduction, 0,017 pour la transcription.
Deux points qui comptent pour un budget. D'abord, la facturation se fait au jeton consommé, pas à la minute de conversation : une estimation de coût mensuel demande une hypothèse de volume, pas une règle de trois. Ensuite, la sortie de la génération 2.1 en juillet s'est faite au tarif de la précédente. Aucune baisse.
Autrement dit : la technologie progresse, le coût unitaire ne descend pas.
Le piège européen
OpenAI indique que son API temps réel prend en charge la résidence des données dans l'Union européenne. Sa documentation technique, à jour au 28 août 2026, assortit cette option de trois réserves qu'il faut connaître avant de s'engager.
L'éligibilité est accordée au cas par cas par OpenAI. Le surcoût est de 10 % sur les modèles sortis depuis mars 2026. Et le traçage des appels de l'API temps réel n'est, à ce jour, pas conforme à la résidence européenne.
Pour une PME française qui traite des demandes de clients au téléphone, ce n'est pas un détail administratif : c'est la différence entre pouvoir répondre à un questionnaire de conformité et devoir expliquer pourquoi on ne peut pas.
Ce qu'il faut vérifier avant de signer
Quatre questions, dans cet ordre :
- Combien de millisecondes ? Exigez un chiffre mesuré, pas un adjectif. Et mesurez vous-même.
- Où sont traitées les données, et à quel surcoût ? La réponse doit être écrite.
- Que se passe-t-il quand on coupe la parole à l'agent ? Testez-le trois fois de suite.
- Comment se comporte-t-il sur vos références produit ? Faites-lui épeler une immatriculation ou un numéro de commande.
Un mot sur les fins de vie
Détail d'intendance qui coûte cher quand on l'oublie : OpenAI a fixé au 20 janvier 2027 l'arrêt de la génération précédente de ses modèles temps réel. Si votre prestataire s'appuie dessus, il devra migrer. Demandez-lui quand.
C'est le genre de question qui distingue un fournisseur qui suit sa technologie d'un intégrateur qui a branché une API il y a un an.
Sources : OpenAI, « Advancing voice intelligence with new models in the API », 7 mai 2026 ; journal des versions de l'API OpenAI, 6 juillet 2026 ; page de tarification et documentation technique OpenAI, consultées le 28 août 2026.