Pour approfondir la méthode
Notre méthode · 03

Transcrire

Voix isolée, locuteurs distingués, parole transcrite dans la langue parlée, puis découpée en phrases.

  1. 1La voix est isolée de la musique et des bruits.
  2. 2Les locuteurs sont distingués, sans être identifiés : A, B, C.
  3. 3La parole est transcrite dans la langue parlée, tour par tour.
  4. 4Le texte est découpé en phrases, prêtes pour les classifieurs.
Traitement

Six étapes de traitement

La méthode compte six étapes. Les cinq premières sont exécutées sur les ordinateurs du réseau, la dernière sur le serveur central. Les modèles indiqués sont ceux en service en octobre 2026.

01

Tours de parole

Le modèle pyannote repère qui parle et à quel moment. Chaque tour de parole est attribué à un locuteur anonyme (A, B…). Les locuteurs ne sont pas identifiés.

pyannote 3.1
02

Transcription

Whisper large-v3, en version turbo depuis le 2 octobre 2026, transcrit chaque passage de parole dans sa langue : une vidéo en anglais est transcrite en anglais, une vidéo mixte passage par passage.

WhisperMLX
03

Segmentation

Les tours de parole sont découpés en phrases, sans dépasser la longueur admise par les classifieurs.

SaT
04

Politisation

Chaque phrase de transcription d’une chaîne francophone est classée politique ou non. Les phrases de commentaires passent par un second classifieur, pré-entraîné sur des messages de réseaux sociaux.

CamemBERTav2XLM-RoBERTa
05

Thèmes

Chaque phrase politique passe ensuite par des classifieurs binaires, un par catégorie des grilles d’analyse du projet (Boursier et Lemor, 2025). Chacun indique si la phrase traite de son thème, quelle que soit la position exprimée. Neuf d’entre eux sont publiés.

CamemBERTLLM_Tool
06

Recherche par le sens

Sur le serveur central, chaque phrase est convertie en vecteur numérique. L’explorateur de données se sert de ces vecteurs pour retrouver des phrases de sens proche.

Qwen3-Embedding-8B

Cette méthode est en service depuis le 3 octobre 2026. Auparavant, la voix était d’abord isolée de la musique (Demucs), puis la vidéo entière était transcrite avant l’attribution des tours de parole. La plupart des vidéos du corpus ont été transcrites de cette façon.

Article de présentation