Microsoft AI a lancé MAI-Transcribe-2 le 3 septembre 2026, un modèle de transcription vocale n°1 sur FLEURS (60 langues) à seulement 0,10 $ par heure, surpassant OpenAI, Google et ElevenLabs.
En bref
- Microsoft AI a lancé MAI-Transcribe-2 le 3 septembre 2026, un modèle de transcription vocale qui s'impose en tête du benchmark FLEURS sur 60 langues avec un taux d'erreur moyen de 5,2 %.
- Développé par une équipe de seulement dix ingénieurs, il surclasse les offres d'OpenAI, Google et ElevenLabs en précision, vitesse et coût, à 0,10 $ par heure d'audio.
- Les équipes techniques doivent évaluer une migration de leurs pipelines de transcription avant la fin de l'offre promotionnelle fixée à la fin 2026.
Un modèle construit par dix ingénieurs qui surclasse les géants
Microsoft AI a officialisé le 3 septembre 2026 le lancement de MAI-Transcribe-2, son nouveau modèle de reconnaissance vocale automatique (ASR). Ce lancement illustre une tendance de fond dans l'industrie de l'IA : des équipes réduites, dotées des bonnes architectures, parviennent à produire des résultats supérieurs à ceux de laboratoires disposant de ressources bien plus importantes. L'équipe à l'origine du modèle ne comptait que dix ingénieurs, un chiffre qui a surpris la communauté technique au moment de l'annonce.
Sur le benchmark FLEURS (Few-shot Learning Evaluation of Universal Representations of Speech), qui mesure les performances de transcription sur 60 langues, MAI-Transcribe-2 atteint un taux d'erreur moyen de 5,2 %, le plaçant en première position. Ce résultat devance des modèles bien établis tels que Gemini 3.5 Transcribe de Google, GPT-Transcribe d'OpenAI, Whisper V3-Large d'OpenAI et ScribeV2 d'ElevenLabs. Sur le leaderboard d'Artificial Analysis, il se classe en deuxième position en précision avec un taux AA-WER de 2,0 %.
La vitesse de traitement constitue l'un des avantages les plus significatifs du modèle. Pour les fichiers audio longs — plusieurs heures d'enregistrement continu — MAI-Transcribe-2 affiche des performances jusqu'à dix fois supérieures à celles de ses concurrents directs. Cette caractéristique le rend particulièrement adapté aux cas d'usage professionnels : transcription de réunions, sous-titrage automatique, analyse d'appels en centre de contact, ou encore traitement de corpus audio volumineux dans des pipelines de recherche.
Techniquement, le modèle intègre plusieurs fonctionnalités absentes de la première version. La diarisation permet d'identifier et de séparer les différents locuteurs dans un enregistrement, une capacité très demandée pour les retranscriptions de réunions ou d'entretiens. Les timestamps au niveau des mots offrent une précision de synchronisation utile pour les applications de sous-titrage ou de recherche dans les transcriptions. Enfin, les styles de transcription configurables permettent d'adapter le formatage de la sortie selon le contexte : verbatim, ponctuation automatique, suppression des hésitations.
MAI-Transcribe-2 est disponible sur trois plateformes dès son lancement : Microsoft Foundry, l'environnement cloud de développement IA de Microsoft ; le MAI Playground, l'interface de test publique de Microsoft AI ; et Open Router, l'agrégateur de modèles tiers très utilisé par les développeurs indépendants et les startups. Cette distribution multi-canal vise à maximiser l'adoption initiale et à capter des segments de marché que Microsoft ne touche pas directement via Azure.
Sur le plan tarifaire, le modèle est proposé à 0,10 $ par heure d'audio en tarif promotionnel jusqu'à la fin 2026. Ce positionnement représente une réduction de 72 % par rapport au premier modèle MAI-Transcribe, lancé cinq mois plus tôt à 0,36 $ l'heure. Pour contextualiser, OpenAI Whisper-large-v3 via l'API est facturé 0,006 $ par minute, soit 0,36 $ de l'heure — un prix identique à l'ancien MAI-Transcribe. Le tarif du nouveau modèle équivaut donc à environ 0,0017 $ par minute, soit une réduction massive en termes de coût unitaire.
Ce lancement s'inscrit dans une séquence accélérée de publications de modèles spécialisés par Microsoft AI depuis début 2026. Après MAI-1 (modèle de langage général), MAI-Code (assistance au développement) et MAI-Transcribe (première génération), l'entreprise consolide une gamme de modèles propriétaires destinée à réduire sa dépendance à OpenAI, dont elle est actionnaire historique, et à proposer des alternatives compétitives sur ses propres plateformes cloud.
Selon les informations rapportées par VentureBeat et WindowsReport, le modèle a bénéficié d'architectures d'entraînement optimisées spécifiquement pour la reconnaissance vocale multilingue, et non d'un transfert de technologie depuis des modèles de langage existants. Cette approche dédiée expliquerait en partie les gains de performance et d'efficacité constatés par les évaluateurs indépendants.
La transcription vocale, nouveau terrain de compétition critique dans l'IA d'entreprise
Le marché de la reconnaissance vocale automatique a longtemps été dominé par deux acteurs : Google, avec ses API Cloud Speech-to-Text héritées de deux décennies de recherche, et OpenAI, dont Whisper a imposé un nouveau standard de qualité open source en 2022. ElevenLabs, initialement spécialisé dans la synthèse vocale, a élargi son offre à la transcription avec ScribeV2 en 2025, ajoutant une pression supplémentaire sur les acteurs historiques.
L'arrivée de MAI-Transcribe-2 à ce niveau de performance et à ce tarif modifie significativement les équilibres. Pour les entreprises qui dépensent des dizaines de milliers de dollars par mois en transcription automatique — plateformes de vidéoconférence, opérateurs télécom, médias audiovisuels, éditeurs de logiciels métier — une réduction de 72 % des coûts unitaires est une donnée économique majeure. Elle peut justifier à elle seule une migration de fournisseur, sous réserve de qualité équivalente ou supérieure.
Le choix de couvrir 60 langues d'emblée traduit également une ambition internationale qui contraste avec les stratégies de certains concurrents, qui privilégient l'anglais et quelques langues européennes majeures. Pour les marchés francophones, hispanophones ou arabophones, une telle couverture ouvre des possibilités d'intégration jusque-là limitées par la qualité des modèles disponibles.
La disponibilité sur Open Router — plateforme indépendante de Microsoft — mérite une attention particulière du point de vue stratégique. En rendant le modèle accessible via un agrégateur neutre, Microsoft adresse une clientèle qui cherche précisément à éviter les dépendances cloud propriétaires. C'est une posture nouvelle pour une entreprise dont le modèle économique repose historiquement sur l'écosystème Azure. Cela suggère que MAI-Transcribe-2 est aussi un outil de conquête de parts de marché, au-delà de la monétisation directe.
Pour les équipes de sécurité, la prolifération des outils de transcription IA soulève par ailleurs des questions de confidentialité et de traitement des données. Les réunions d'entreprise, les communications sensibles et les enregistrements d'auditions judiciaires transitent désormais fréquemment par des API cloud. Avant toute migration vers MAI-Transcribe-2 ou ses concurrents, il convient de vérifier les conditions de traitement des données, la localisation des serveurs d'inférence et la conformité RGPD ou HIPAA selon le secteur.
Ce qu'il faut retenir
- MAI-Transcribe-2 se classe n°1 sur FLEURS (60 langues, WER 5,2 %) et jusqu'à 10× plus rapide que ses concurrents sur les fichiers audio longs.
- Tarif introductif de 0,10 $/heure jusqu'à fin 2026, soit 72 % moins cher que l'ancien MAI-Transcribe et inférieur aux tarifs OpenAI/Google comparables.
- Avant toute intégration, vérifier la conformité données (RGPD, localisation) et évaluer la qualité sur les langues métier spécifiques à votre organisation.
MAI-Transcribe-2 est-il accessible sans compte Azure ?
Oui. En plus de Microsoft Foundry (qui requiert un compte Azure), le modèle est disponible sur le MAI Playground en accès public et sur Open Router, qui n'exige pas de contrat Microsoft. Open Router accepte une inscription par e-mail et facturation par carte bancaire, ce qui le rend accessible aux développeurs indépendants et aux PME sans accord-cadre cloud.
Besoin d'un accompagnement expert ?
Ayi NEDJIMI vous accompagne sur vos projets cybersécurité et IA.
Prendre contactÀ propos de l'auteur
Ayi NEDJIMI
Auditeur Senior Cybersécurité & Consultant IA
Expert Judiciaire — Cour d'Appel de Paris
Habilitation Confidentiel Défense
ayi@ayinedjimi-consultants.fr
Ayi NEDJIMI est un vétéran de la cybersécurité avec plus de 25 ans d'expérience sur des missions critiques. Ancien développeur Microsoft à Redmond sur le module GINA (Windows NT4) et co-auteur de la version française du guide de sécurité Windows NT4 pour la NSA.
À la tête d'Ayi NEDJIMI Consultants, il réalise des audits Lead Auditor ISO 42001 et ISO 27001, des pentests d'infrastructures critiques, du forensics et des missions de conformité NIS2 / AI Act.
Conférencier international (Europe & US), il a formé plus de 10 000 professionnels.
Domaines d'expertise
Ressources & Outils de l'auteur
Articles connexes
CISA KEV : 3 failles sur 7 ciblent l'infrastructure IA, dont LiteLLM MCP
La CISA a ajouté 7 CVE au KEV le 2 septembre 2026, dont 3 failles dans l'écosystème IA : LiteLLM (CVE-2026-59822, CVSS 8.8), Kestra et Starlette. Patch urgent requis.
Nscale lève 3,5 milliards et signe 45 Md$ avec Anthropic : l'infrastructure IA s'emballe
Nscale, startup britannique de deux ans, signe un contrat de 45 Md$ avec Anthropic, 3,5 Md$ avec Figure AI, et cherche à lever 3,5 Md$ auprès de NVIDIA en pré-IPO.
Krybit cible ProHealth Medical Group : données médicales volées à Singapour
Le groupe Krybit, apparu en mars 2026 avec un ransomware cross-platform (Windows, Linux, ESXi, NAS), revendique le vol de données médicales chez ProHealth Medical Group (Singapour). Plus de 36 victimes revendiquées en moins de 6 mois.
Un projet cybersécurité ? Parlons-en.
Pentest, conformité NIS 2, ISO 27001, audit IA, RSSI externalisé… nos experts répondent sous 24h pour évaluer votre besoin et vous proposer un accompagnement sur mesure.
Commentaires
Aucun commentaire pour le moment. Soyez le premier à commenter !
Laisser un commentaire