Classer
Chaque phrase est classée politique ou non, puis rattachée à neuf thèmes par neuf classifieurs dont la fiabilité est publiée.
- 1Chaque phrase est lue par un classifieur entraîné sur des annotations humaines.
- 2Elle est classée politique ou non.
- 3Une phrase politique est rattachée à neuf thèmes, chacun avec sa probabilité.
- 4La fiabilité de chaque classifieur est mesurée et publiée.
- Modèles
- CamemBERTav2, un classifieur par étiquette ; XLM-RoBERTa pour les commentaires
- Fiabilité
- F1 de validation et précision contrôlée publiés pour chaque classifieur
- Écrit
- étiquette et probabilité par phrase et par classifieur
Politique ou non, puis les thèmes
Deux familles de classifieurs lisent les phrases l’une après l’autre, sur les ordinateurs du réseau. Ils sont entraînés sur du français. Le corpus anglophone, étendu en octobre 2026, n’y passe pas encore. Ses équivalents en anglais seront bientôt entraînés et déployés.
Politisation
Chaque phrase de transcription est classée politique ou non par un classifieur entraîné sur des annotations humaines. Les phrases de commentaires passent par un second classifieur, pré-entraîné sur des messages de réseaux sociaux.
Thèmes
Chaque phrase politique passe ensuite par des classifieurs binaires, un par catégorie des grilles d’analyse du projet (Boursier et Lemor, 2025). Chacun indique si la phrase traite de son thème, quelle que soit la position exprimée, avec une probabilité. Neuf d’entre eux sont publiés.
Chaînes anglophones
Les phrases des chaînes anglophones n’entrent ni dans les parts de phrases politiques ni dans celles des thèmes. Leurs vidéos sont transcrites dans la langue parlée, résumées en français et en anglais, et les personnalités qu’elles citent sont comptées comme les autres.
Neuf thèmes, neuf classifieurs
Les classifieurs repèrent le thème d’une phrase, quelle que soit la position exprimée. Ils ont été entraînés sur des annotations conçues pour mesurer les idées d’extrême droite et néoréactionnaires, mais chaque catégorie y était définie par son sujet, si bien qu’une critique de la politique migratoire compte comme une phrase sur l’immigration.
Ces catégories viennent des grilles d’analyse du projet (Boursier et Lemor, 2025). Dans le protocole d’annotation, une phrase relevait de l’immigration dès qu’elle parlait d’étrangers, d’immigrés ou de migrants. Les façons réactionnaires de traiter ce sujet, par exemple l’immigration décrite comme une menace pour l’identité nationale, étaient codées à part, en sous-catégories. Les classifieurs publiés n’ont appris que la catégorie générale.
Dans les données d’entraînement, la part des phrases annotées comme relevant d’un thème sans aucune sous-catégorie réactionnaire varie fortement. Elle est de 75 % pour l’écologie, 46 % pour l’immigration, 33 % pour la démocratie, 31 % pour la défiance envers l’État, 29 % pour la technologie. Elle reste inférieure à 6 % pour l’autorité, la tradition, le progrès et l’égalité, dont les exemples d’entraînement traitaient presque tous le thème sous un angle réactionnaire. Ces quatre classifieurs manquent peut-être davantage les phrases qui abordent leur thème sous un autre angle ; ce point n’a pas été mesuré.
Les parts publiées sur ce site indiquent de quoi parlent les phrases politiques. Les positions défendues sur chaque thème font l’objet d’une autre analyse, menée sur des échantillons de phrases. Voir les arguments par thème.
Quand une orientation est comparée à une autre, la part d’un thème est une moyenne par vidéo. Pour chaque vidéo, la part de ses phrases politiques que le classifieur rattache au thème est calculée, puis la moyenne de ces parts sur les vidéos de l’orientation, chaque vidéo comptant pour une. Une vidéo entre dans cette moyenne à partir de 20 phrases politiques. Additionner les phrases donnerait le poids des chaînes les plus prolifiques, pas celui de l’orientation. En 2026, les chaînes de gauche produisent près des trois quarts des phrases politiques transcrites. « Ensemble » est la moyenne des orientations, chacune comptant à parts égales. La répartition des phrases d’un thème entre orientations reste affichée sur la page des thèmes, comme description du corpus.
- Immigration
- Phrases politiques qui parlent d’immigration, des étrangers, des immigrés, des migrants ou de l’asile.
- Démocratie
- Phrases politiques qui parlent de la démocratie, comme idéal ou comme régime, des élections, des institutions ou de la représentation.
- Autorité
- Phrases politiques qui parlent d’autorité, d’obéissance, d’ordre ou de l’usage de la force contre ceux qui enfreignent les normes.
- Tradition
- Phrases politiques qui parlent de tradition, de valeurs, de coutumes, de modèles familiaux ou d’héritage.
- Progrès
- Phrases politiques qui parlent de progrès au sens large, technique, humain ou social.
- Égalité et inégalités
- Phrases politiques qui parlent d’égalité ou d’inégalité entre les êtres humains, selon les sexes, les origines ou les groupes sociaux.
- Écologie
- Phrases politiques qui parlent d’environnement ou d’écologie, de climat, d’énergie, de nature ou des partis écologistes.
- Technologie
- Phrases politiques qui parlent de technologie, de technique ou d’innovation, ou des entreprises et dirigeants de la tech.
- Défiance envers l’État
- Phrases politiques qui expriment des idées libertariennes ou une défiance envers l’État, les services publics, l’impôt ou les normes.
Fiabilité des classifieurs
Les classifieurs sont entraînés sur des phrases annotées par un grand modèle de langue à l’aide de l’outil LLM_Tool (article technique). La fiabilité de ce modèle a d’abord été mesurée sur 1 000 phrases de transcription annotées aussi, de façon indépendante, par deux chercheurs. Pour la politisation, le κ de Light est de 0,787 et le F1 macro de 0,922 (article de présentation, tableau 2). Ce contrôle humain ne porte que sur la politisation des transcriptions. Chaque classifieur est ensuite évalué sur un jeu de validation tenu à l’écart de l’entraînement. Selon le registre des modèles du projet, le F1 macro est de 0,92 pour la politisation des transcriptions (2 000 phrases) et de 0,89 pour celle des commentaires (4 339 phrases).
Ce score mesure l’accord de chaque classifieur avec les annotations du modèle de langue. Pour les thèmes, un contrôle complémentaire a été fait en juin 2026. De 30 à 40 phrases retenues avec une forte probabilité par chaque classifieur ont été annotées de nouveau par un second modèle de langue. La précision est la part de ces phrases qui traitent bien du thème, les cas limites comptant pour moitié. Ce contrôle n’a pas été fait séparément par orientation. La part des phrases sur un thème que le classifieur ne repère pas (le rappel) n’a pas été mesurée.
| Thème | F1 macro (validation) | Phrases | Précision (contrôle) | Phrases |
|---|---|---|---|---|
| Immigration | 0,95 | 2 220 | 0,76 | 40 |
| Démocratie | 0,88 | 2 134 | 0,90 | 30 |
| Autorité | 0,87 | 2 515 | 0,70 | 40 |
| Tradition | 0,91 | 1 510 | 0,70 | 30 |
| Progrès | 0,89 | 1 042 | 0,62 | 30 |
| Égalité et inégalités | 0,89 | 2 381 | 0,85 | 30 |
| Écologie | 0,96 | 1 809 | 0,90 | 30 |
| Technologie | 0,95 | 542 | 0,63 | 30 |
| Défiance envers l’État | 0,90 | 513 | 0,65 | 30 |
Pour les thèmes dont la précision est proche de 0,6, les parts publiées sont des ordres de grandeur. Deux classifieurs ne sont pas publiés. Le nationalisme retient presque toute mention de la nation ou de la France (précision de 0,39 au contrôle). Le jeu de validation des métaphores fictionnelles ne compte que 77 phrases.