Dégager les arguments
Pour chaque thème, le modèle lit à l’aveugle un échantillon de phrases de plusieurs chaînes et en dégage les arguments ; chacun renvoie aux phrases qui le portent.
- 1Un échantillon d’au plus 120 phrases du thème est tiré, de plusieurs chaînes et orientations.
- 2Le modèle les lit à l’aveugle, sans le nom des chaînes ni leur orientation.
- 3Il dégage de trois à six arguments ; chacun doit tenir sur trois phrases de deux vidéos au moins.
- 4Chaque argument renvoie à ses citations exactes ; les parts par orientation sont pondérées.
- Échantillon
- 120 phrases au plus par tirage, quotas par orientation, plafond par chaîne
- Garde-fou
- au moins trois phrases de deux vidéos par argument ; deux tirages rapprochés quand c’est possible
- Écrit
- arguments, citations, parts par orientation pondérées
Du texte aux arguments
Chaque argument renvoie aux phrases qui le portent. Ouvrez un point pour consulter les règles du calcul.
01Périodes
Les phrases sont regroupées par période, les derniers mois, chaque année depuis 2018 (l’année en cours comprise) et les années 2009 à 2017 réunies. La période récente couvre trois, six ou douze mois, la plus courte durée dans laquelle chaque thème réunit au moins 600 phrases, issues d’au moins huit chaînes, avec au moins 50 phrases dans chacune de deux orientations.
02Échantillon
Le tirage porte sur les phrases politiques de 60 à 400 caractères que le classifieur rattache au thème avec une forte probabilité. Un échantillon compte au plus 120 phrases. Chaque orientation reçoit un quota proportionnel à la racine carrée de son nombre de phrases, avec au moins huit phrases quand c’est possible. Une chaîne fournit au plus huit vidéos (seize pour 2009 à 2017) et 15 % de l’échantillon ; une vidéo fournit au plus deux phrases.
03Filtres
Avant le tirage, des filtres écartent les doublons, les boucles de la reconnaissance vocale (une même formule répétée) et les phrases de sens presque identique. Ils écartent aussi les phrases qui contiennent un nom de personne absent de la liste fermée des personnalités publiques. Une période n’est traitée que si elle réunit au moins 150 phrases candidates, issues d’au moins cinq chaînes.
04Lecture à l’aveugle
Le modèle de langue ouvert des résumés (Gemma 4 31B), exécuté sur le serveur central, lit les phrases sans connaître leur chaîne ni leur orientation. Il dégage de trois à six arguments. Pour chacun, il donne les numéros des phrases qui l’avancent à leur compte et ceux des phrases qui le critiquent ou défendent la position opposée. Il signale aussi les phrases qui ne relèvent pas du thème.
05Deux tirages
Quand la période compte au moins 240 phrases candidates, deux échantillons disjoints sont lus séparément, puis une troisième lecture rapproche les deux listes d’arguments. Les arguments retrouvés dans les deux lectures sont présentés en premier. Un argument n’est retenu que s’il s’appuie sur au moins trois phrases, issues d’au moins deux vidéos.
06Citations et parts
Les citations reprennent les phrases transcrites sans retouche, coupées au-delà de 280 caractères. Le nombre de phrases, les chaînes et la répartition par orientation sont calculés à partir de l’échantillon, sans passer par le modèle. Les parts par orientation sont pondérées pour corriger les quotas ; chaque phrase compte pour le nombre de phrases de son orientation qu’elle représente.
Publication, mises à jour et précautions de lecture
Un résultat qui semble nommer un particulier n’est pas publié. Une période est marquée provisoire quand moins de la moitié de ses vidéos YouTube sont transcrites. L’analyse de la période récente est refaite au plus toutes les quatre semaines, quand son nombre de phrases a changé d’au moins 15 % ou que sa durée a changé. Une année est analysée de nouveau quand elle se termine, quand son nombre de phrases augmente d’au moins 15 % ou quand sa part de vidéos transcrites franchit 50 %, 75 % ou 90 %.
Les arguments décrivent un échantillon. Ils sont classés selon leur fréquence dans cet échantillon ; cette fréquence donne un ordre de grandeur pour l’ensemble des phrases du thème. Les parts par orientation dépendent de la composition du corpus, où l’extrême droite est surreprésentée, et de la part de vidéos transcrites dans chaque orientation. Le classifieur rattache parfois une phrase au thème à tort ; le modèle signale ces phrases, qui sont écartées des arguments. Le modèle peut aussi mal lire une phrase ironique ou ambiguë. Les erreurs de transcription passent dans les citations. Les textes produits ne sont pas relus par l’équipe. Voir les arguments par thème →
Les fréquences décrivent les phrases de l’échantillon ; elles ne mesurent pas l’opinion de la population. Les citations permettent de revenir aux propos analysés.