Veille IA Veille IA sans buzz : pour stratèges québécois.
La veille

Étapes de raisonnement : une signature interne, pas une preuve de fidélité

3 min de lecture · The Decoder · 12 sept. 2026

D'après The Decoder, relayé par The Decoder

Étapes de raisonnement : une signature interne, pas une preuve de fidélité

Image : générée (Gemini)

Rédigé à partir du média cité; chaque fait est vérifié contre le texte source.

À retenir

  • Le type d'étape est reconnaissable dans les états internes des trois modèles testés, et le signal est le plus fort dans les couches du milieu. Le résultat a été répliqué sur un quatrième modèle et transféré à deux autres bancs d'évaluation.
  • Ce n'est pas un effet de vocabulaire : un classificateur qui ne regarde que les mots employés fait moins bien que celui qui lit les représentations internes. Un même mot reçoit une représentation différente selon l'étape à laquelle il appartient.
  • Une étape fausse garde la signature de son type : un calcul raté ressemble encore, à l'intérieur, à un calcul. La signature dit ce que le modèle est en train de faire, jamais s'il le fait correctement.
  • Ces étapes ne se forment pas isolément. Quand les chercheurs bloquent l'attention aux 30 mots précédents, le signal faiblit : la correspondance observée dépend du contexte qui précède.
  • Le périmètre est étroit et le texte le dit : des problèmes de mathématiques, une poignée de modèles. Savoir si ces motifs permettraient de repérer une erreur en cours de génération reste une question ouverte, pas un acquis.

Pourquoi ça compte

Deux questions se cachent derrière le mot « transparence », et cette étude n'en tranche qu'une. Elle montre que la CATÉGORIE d'une étape laisse une trace interne repérable. Elle ne montre pas que le texte affiché explique la réponse donnée. La preuve que la seconde question reste ouverte est dans l'article lui-même : une méthode de lecture des états internes a révélé qu'un modèle récent traite davantage de choses que ce qui apparaît dans son raisonnement écrit. Confondre les deux mène à faire confiance à un texte pour ce qu'il ne prouve pas.

Chiffre-clé

25 à 39 % : la part des cas où un modèle mentionne réellement, dans son raisonnement écrit, l'indice qui a influencé sa réponse. Ce chiffre vient d'une étude d'Anthropic citée en fin d'article, JAMAIS de l'étude du KAIST et de Naver, et il mesure autre chose : la fidélité du contenu, pas la catégorie de l'étape. Les deux résultats coexistent sans se contredire, et rien dans le texte ne permet de conclure que l'un corrige l'autre.

Citation

« A flawed computation step still looked like a computation step internally, even when the result was wrong. » The Decoder, rapportant l'étude du KAIST et de Naver AI Lab

Action concrète

Devant un raisonnement affiché par une IA, séparer les deux questions que « transparence » confond. De quel TYPE d'opération s'agit-il ? Cette question a désormais un corrélat mesurable à l'intérieur du modèle. Et ce qui est écrit explique-t-il vraiment la réponse donnée ? Celle-là reste ouverte, et la seule mesure publiée la situe entre 25 et 39 %. Lire une chaîne de pensée pour repérer OÙ le raisonnement dérape reste utile. La lire comme l'aveu de ce qui s'est passé dans le modèle, non.

D'après un média relais

Sources

🔐 Connexion rapide

Entrez votre courriel pour recevoir un code à 6 chiffres.

Pas besoin de mot de passe ni d'inscription. Entrez votre courriel, recevez un code par courriel, et c'est tout !