Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

Speech-to-Text (STT) avec LLM

ia

Définition

Le Speech-to-Text (STT) ou ASR (Automatic Speech Recognition) est la technologie de transcription de l'audio en texte, constituant la premiere etape des assistants vocaux et des pipelines de traitement de reunions. Les LLMs ont revolutionne ce domaine : Whisper (OpenAI, 2022) a etabli un nouveau standard en utilisant l'apprentissage auto-supervise sur 680K heures d'audio multilangue, surpassant tous les modeles precedents pour de nombreuses langues. Whisper est un transformer Seq2Seq qui prend en entree des spectrogrammes Mel 80 bandes et genere du texte. Sa cle est la diversite des donnees d'entrainement (680K heures vs quelques milliers pour les modeles precedents), ce qui lui confere une robustesse exceptionnelle aux accents, bruits ambiants, et langues rares. Il supporte 99 langues et atteint des WER (Word Error Rate) de 2-4% sur l'anglais standard. Les variantes de Whisper vont de tiny (39M params, rapide sur CPU) a large-v3 (1.5B params, SOTA precision). Des implementations optimisees existent : faster-whisper (CTranslate2, 4x plus rapide), whisper.cpp (CPU sur Apple Silicon M1/M2/M3), Distil-Whisper (HuggingFace, 6x plus rapide que large avec -1% WER). Les services cloud specialises offrent des fonctionnalites complementaires : Deepgram (SDK temps reel, streaming, 200ms latence), AssemblyAI (diarisation des locuteurs, detection de sentiments, redaction automatique de PII), Azure Speech, Google Speech-to-Text (integration native avec leurs LLMs). Ils sont privilegies pour les applications de production ou la latence et la scalabilite sont critiques. Les cas d'usage enterprise : transcription et analyse de reunions (avec résumé LLM automatique), sous-titrage video, call center analytics (transcription + analyse sentiments), assistants vocaux en temps reel, accessibilite (sous-titres automatiques), et documentation automatique (dictee medicale, rapports sur le terrain).

Transcription avec Whisper (faster-whisper)

from faster_whisper import WhisperModel

# Charger le modele (premiere fois : telecharge depuis HuggingFace)
model = WhisperModel('large-v3', device='cuda', compute_type='float16')

# Transcrire un fichier audio
segments, info = model.transcribe('reunion.mp3', language='fr',
    word_timestamps=True,  # Timestamps par mot
    diarize=False           # Diarisation des locuteurs (necessite pyannote)
)

print(f'Langue detectee: {info.language} ({info.language_probability:.0%})')
for segment in segments:
    print(f'[{segment.start:.1f}s -> {segment.end:.1f}s] {segment.text}')

Performances Whisper large-v3

  • WER anglais (Common Voice) : ~2.7%
  • WER francais : ~5.1%
  • Vitesse (A100 float16) : ~180x temps reel (1h audio en 20s)
  • Vitesse faster-whisper (CPU i9) : ~8x temps reel

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis