Pour approfondir la méthode
Les arguments par thème
Un modèle lit un échantillon de phrases de chaque thème et en dégage les arguments, vérifiés sur les phrases.
-
Échantillonner
Des phrases de plusieurs chaînes et orientations, sur un même thème.
120 phrases au plus -
Lire à l’aveugle
Le modèle rapproche les positions sans voir les noms des chaînes.
3 à 6 arguments -
Recouper
Chaque argument doit être soutenu par plusieurs phrases et vidéos.
≥ 3 phrases · ≥ 2 vidéos -
Revenir à la source
Lire les citations, ouvrir les vidéos et comparer les orientations.
Citations et parts calculées
Du texte aux arguments
Chaque argument renvoie aux phrases qui le portent. Ouvrez un point pour consulter les règles du calcul.
01Périodes
Les phrases sont regroupées par période : les derniers mois, chaque année depuis 2018 (l’année en cours comprise) et les années 2009 à 2017 réunies. La période récente couvre trois, six ou douze mois : la plus courte dans laquelle chaque thème réunit au moins 600 phrases, issues d’au moins huit chaînes, avec au moins 50 phrases dans chacune de deux orientations.
02Échantillon
Le tirage porte sur les phrases politiques de 60 à 400 caractères que le classifieur rattache au thème avec une forte probabilité. Un échantillon compte au plus 120 phrases. Chaque orientation reçoit un quota proportionnel à la racine carrée de son nombre de phrases, avec au moins huit phrases quand c’est possible. Une chaîne fournit au plus huit vidéos (seize pour 2009 à 2017) et 15 % de l’échantillon ; une vidéo fournit au plus deux phrases.
03Filtres
Avant le tirage, des filtres écartent les doublons, les boucles de la reconnaissance vocale (une même formule répétée) et les phrases de sens presque identique. Ils écartent aussi les phrases qui contiennent un nom de personne absent de la liste fermée des personnalités publiques. Une période n’est traitée que si elle réunit au moins 150 phrases candidates, issues d’au moins cinq chaînes.
04Lecture à l’aveugle
Le modèle de langue ouvert des résumés (Gemma 4 31B), exécuté sur le serveur central, lit les phrases sans connaître leur chaîne ni leur orientation. Il dégage de trois à six arguments. Pour chacun, il donne les numéros des phrases qui l’avancent à leur compte et ceux des phrases qui le critiquent ou défendent la position opposée. Il signale aussi les phrases qui ne relèvent pas du thème.
05Deux tirages
Quand la période compte au moins 240 phrases candidates, deux échantillons disjoints sont lus séparément, puis une troisième lecture rapproche les deux listes d’arguments. Les arguments retrouvés dans les deux lectures sont présentés en premier. Un argument n’est retenu que s’il s’appuie sur au moins trois phrases, issues d’au moins deux vidéos.
06Citations et parts
Les citations reprennent les phrases transcrites sans retouche, coupées au-delà de 280 caractères. Le nombre de phrases, les chaînes et la répartition par orientation sont calculés à partir de l’échantillon, sans passer par le modèle. Les parts par orientation sont pondérées pour corriger les quotas : chaque phrase compte pour le nombre de phrases de son orientation qu’elle représente.
Publication, mises à jour et précautions de lecture
Un résultat qui semble nommer un particulier n’est pas publié. Une période est marquée provisoire quand moins de la moitié de ses vidéos YouTube sont transcrites. L’analyse de la période récente est refaite au plus toutes les quatre semaines, quand son nombre de phrases a changé d’au moins 15 % ou que sa durée a changé. Une année est analysée de nouveau quand elle se termine, quand son nombre de phrases augmente d’au moins 15 % ou quand sa part de vidéos transcrites franchit 50 %, 75 % ou 90 %.
Les arguments décrivent un échantillon. Ils sont classés selon leur fréquence dans cet échantillon ; cette fréquence donne un ordre de grandeur pour l’ensemble des phrases du thème. Les parts par orientation dépendent de la composition du corpus, où l’extrême droite est surreprésentée, et de la part de vidéos transcrites dans chaque orientation. Le classifieur rattache parfois une phrase au thème à tort : le modèle signale ces phrases, qui sont écartées des arguments. Le modèle peut aussi mal lire une phrase ironique ou ambiguë. Les erreurs de transcription passent dans les citations. Les textes produits ne sont pas relus par l’équipe. Voir les arguments par thème →
Les fréquences décrivent les phrases de l’échantillon ; elles ne mesurent pas l’opinion de la population. Les citations permettent de revenir aux propos analysés.