Notre méthode · 04

Classer

Politique ou non, puis neuf thèmes, par des classifieurs dont la fiabilité est publiée.

  1. 1Chaque phrase est lue par un classifieur entraîné sur des annotations humaines.
  2. 2Elle est classée politique ou non.
  3. 3Une phrase politique est rattachée à neuf thèmes, chacun avec sa probabilité.
  4. 4La fiabilité de chaque classifieur est mesurée et publiée.
Thèmes

Neuf thèmes, neuf classifieurs

Les classifieurs repèrent le thème d’une phrase, quelle que soit la position exprimée. Ils ont été entraînés sur des annotations conçues pour mesurer les idées d’extrême droite et néoréactionnaires, mais chaque catégorie y était définie par son sujet : une critique de la politique migratoire compte comme une phrase sur l’immigration.

Ces catégories viennent des grilles d’analyse du projet (Boursier et Lemor, 2025). Dans le protocole d’annotation, une phrase relevait de l’immigration dès qu’elle parlait d’étrangers, d’immigrés ou de migrants. Les façons réactionnaires de traiter ce sujet, par exemple l’immigration décrite comme une menace pour l’identité nationale, étaient codées à part, en sous-catégories. Les classifieurs publiés n’ont appris que la catégorie générale.

Dans les données d’entraînement, la part des phrases annotées comme relevant d’un thème sans aucune sous-catégorie réactionnaire varie fortement : 75 % pour l’écologie, 46 % pour l’immigration, 33 % pour la démocratie, 31 % pour la défiance envers l’État, 29 % pour la technologie. Elle reste inférieure à 6 % pour l’autorité, la tradition, le progrès et l’égalité, dont les exemples d’entraînement traitaient presque tous le thème sous un angle réactionnaire. Ces quatre classifieurs manquent peut-être davantage les phrases qui abordent leur thème sous un autre angle ; ce point n’a pas été mesuré.

Les parts publiées sur ce site indiquent de quoi parlent les phrases politiques. Les positions défendues sur chaque thème font l’objet d’une autre analyse, menée sur des échantillons de phrases : voir les arguments par thème.

Quand une orientation est comparée à une autre, la part d’un thème est une moyenne par vidéo : pour chaque vidéo, la part de ses phrases politiques que le classifieur rattache au thème, puis la moyenne de ces parts sur les vidéos de l’orientation, chaque vidéo comptant pour une. Une vidéo entre dans cette moyenne à partir de 20 phrases politiques. Additionner les phrases donnerait le poids des chaînes les plus prolifiques, pas celui de l’orientation : en 2026, les chaînes de gauche produisent près des trois quarts des phrases politiques transcrites. « Ensemble » est la moyenne des orientations, chacune comptant à parts égales. La répartition des phrases d’un thème entre orientations reste affichée sur la page des thèmes, comme description du corpus.

Les neuf thèmes publiés
Immigration
Phrases politiques qui parlent d’immigration : étrangers, immigrés, migrants, asile.
Démocratie
Phrases politiques qui parlent de la démocratie, comme idéal ou comme régime : élections, institutions, représentation.
Autorité
Phrases politiques qui parlent d’autorité : obéissance, ordre, usage de la force contre ceux qui enfreignent les normes.
Tradition
Phrases politiques qui parlent de tradition : valeurs, coutumes, modèles familiaux, héritage.
Progrès
Phrases politiques qui parlent de progrès au sens large : progrès technique, humain ou social.
Égalité et inégalités
Phrases politiques qui parlent d’égalité ou d’inégalité entre les êtres humains : sexes, origines, groupes sociaux.
Écologie
Phrases politiques qui parlent d’environnement ou d’écologie : climat, énergie, nature, partis écologistes.
Technologie
Phrases politiques qui parlent de technologie, de technique ou d’innovation, ou des entreprises et dirigeants de la tech.
Défiance envers l’État
Phrases politiques qui expriment des idées libertariennes ou une défiance envers l’État, les services publics, l’impôt ou les normes.
Validation

Fiabilité des classifieurs

Les classifieurs sont entraînés sur des phrases annotées par un grand modèle de langue à l’aide de l’outil LLM_Tool (article technique). La fiabilité de ce modèle a d’abord été mesurée sur 1 000 phrases de transcription annotées aussi, de façon indépendante, par deux chercheurs : pour la politisation, le κ de Light est de 0,787 et le F1 macro de 0,922 (article de présentation, tableau 2). Ce contrôle humain ne porte que sur la politisation des transcriptions. Chaque classifieur est ensuite évalué sur un jeu de validation tenu à l’écart de l’entraînement. Selon le registre des modèles du projet, le F1 macro est de 0,92 pour la politisation des transcriptions (2 000 phrases) et de 0,89 pour celle des commentaires (4 339 phrases).

Ce score mesure l’accord de chaque classifieur avec les annotations du modèle de langue. Pour les thèmes, un contrôle complémentaire a été fait en juin 2026 : de 30 à 40 phrases retenues avec une forte probabilité par chaque classifieur ont été annotées de nouveau par un second modèle de langue. La précision est la part de ces phrases qui traitent bien du thème, les cas limites comptant pour moitié. Ce contrôle n’a pas été fait séparément par orientation. La part des phrases sur un thème que le classifieur ne repère pas (le rappel) n’a pas été mesurée.

ThèmeF1 macro (validation)PhrasesPrécision (contrôle)Phrases
Immigration0,952 2200,7640
Démocratie0,882 1340,9030
Autorité0,872 5150,7040
Tradition0,911 5100,7030
Progrès0,891 0420,6230
Égalité et inégalités0,892 3810,8530
Écologie0,961 8090,9030
Technologie0,955420,6330
Défiance envers l’État0,905130,6530

Pour les thèmes dont la précision est proche de 0,6, les parts publiées sont des ordres de grandeur. Deux classifieurs ne sont pas publiés : le nationalisme, qui retient presque toute mention de la nation ou de la France (précision de 0,39 au contrôle), et les métaphores fictionnelles, dont le jeu de validation ne compte que 77 phrases.

Article de présentation