Transcrire
Voix isolée, locuteurs distingués, parole transcrite dans la langue parlée, puis découpée en phrases.
- 1La voix est isolée de la musique et des bruits.
- 2Les locuteurs sont distingués, sans être identifiés : A, B, C.
- 3La parole est transcrite dans la langue parlée, tour par tour.
- 4Le texte est découpé en phrases, prêtes pour les classifieurs.
Six étapes de traitement
La méthode compte six étapes. Les cinq premières sont exécutées sur les ordinateurs du réseau, la dernière sur le serveur central. Les modèles indiqués sont ceux en service en octobre 2026.
Tours de parole
Le modèle pyannote repère qui parle et à quel moment. Chaque tour de parole est attribué à un locuteur anonyme (A, B…). Les locuteurs ne sont pas identifiés.
Transcription
Whisper large-v3, en version turbo depuis le 2 octobre 2026, transcrit chaque passage de parole dans sa langue : une vidéo en anglais est transcrite en anglais, une vidéo mixte passage par passage.
Segmentation
Les tours de parole sont découpés en phrases, sans dépasser la longueur admise par les classifieurs.
Politisation
Chaque phrase de transcription d’une chaîne francophone est classée politique ou non. Les phrases de commentaires passent par un second classifieur, pré-entraîné sur des messages de réseaux sociaux.
Thèmes
Chaque phrase politique passe ensuite par des classifieurs binaires, un par catégorie des grilles d’analyse du projet (Boursier et Lemor, 2025). Chacun indique si la phrase traite de son thème, quelle que soit la position exprimée. Neuf d’entre eux sont publiés.
Recherche par le sens
Sur le serveur central, chaque phrase est convertie en vecteur numérique. L’explorateur de données se sert de ces vecteurs pour retrouver des phrases de sens proche.
Cette méthode est en service depuis le 3 octobre 2026. Auparavant, la voix était d’abord isolée de la musique (Demucs), puis la vidéo entière était transcrite avant l’attribution des tours de parole. La plupart des vidéos du corpus ont été transcrites de cette façon.