Les chercheurs ont constaté qu'un juge IA ne pouvait pas distinguer une collusion clandestine au blackjack d'un jeu honnête, tandis que les méthodes analysant les activations des modèles ont obtenu des scores AUROC de 0,90 à 1,00.
Des chercheurs de la University of Oxford et de la New York University ont démontré une méthode permettant de détecter une coordination clandestine entre agents IA, notamment dans un environnement expérimental de blackjack où des modèles en collusion échangeaient des signaux cachés de comptage de cartes au moyen de conversations ordinaires.
L'étude, intitulée "Detecting Multi-Agent Collusion Through Multi-Agent Interpretability", présente NARCBench, un benchmark conçu pour vérifier si une collusion peut être identifiée en examinant les activations internes de modèles IA en interaction plutôt qu'en se fiant uniquement à ce qu'ils disent.
Dans l'expérience de blackjack, quatre agents Qwen3-32B ont joué ensemble. Deux avaient reçu secrètement l'instruction de coopérer, tandis que les deux autres se comportaient normalement.
Les chercheurs ont constaté qu'un juge IA surveillant uniquement la conversation à la table ne parvenait pas à distinguer de manière fiable les sessions de collusion des sessions de contrôle.
Les méthodes examinant les calculs internes des modèles ont obtenu des résultats nettement meilleurs, avec des scores AUROC compris entre 0,90 et 1,00 dans la tâche de blackjack.
Deux agents ont utilisé les discussions à table pour partager le comptage des cartes
Le test de blackjack était conçu autour du comptage clandestin des cartes.
Avant le début de la partie, les deux agents en collusion ont communiqué en privé et créé leur propre système de signalisation.
Un agent jouait le rôle du compteur, suivant le compte courant des cartes et codant des informations dans une conversation apparemment normale à la table. Le second agissait comme le "big player", décodant ces signaux et modifiant la taille de sa mise en conséquence.
Par exemple, poser une question pouvait représenter un compte négatif, tandis qu'un commentaire enthousiaste pouvait signaler un sabot favorable.
Les deux agents honnêtes voyaient les mêmes messages publics mais n'en connaissaient pas la signification cachée.
Les chercheurs ont joué 20 sabots de blackjack différents, chacun composé de huit mains. Les agents en collusion ont inventé un nouveau système de codage pour chaque sabot.
Chaque sabot a été testé à la fois dans une condition de collusion et une condition de contrôle, produisant 40 exécutions au total.
Le juge IA n'a pas pu identifier la communication cachée
L'expérience était conçue de manière à ce que les signaux ressemblent à une conversation naturelle plutôt qu'à des instructions codées évidentes.
Cela s'est révélé suffisant pour déjouer la surveillance au niveau du texte.
Un LLM jouant le rôle de juge a signalé comme suspecte une proportion similaire de sessions de collusion et de contrôle, ce qui signifie qu'il ne pouvait pas faire de distinction significative entre les deux.
Ce résultat illustre l'un des problèmes liés à la surveillance des systèmes IA autonomes uniquement à travers leurs sorties visibles. Deux agents peuvent théoriquement attribuer une signification cachée à des phrases ordinaires qui paraissent inoffensives à un autre modèle ou à un observateur humain.
Les méthodes basées sur les activations ont montré une distinction beaucoup plus nette.
Les cinq techniques testées par les chercheurs ont toutes obtenu au moins 0,90 AUROC sur le benchmark stéganographique de blackjack, la meilleure atteignant 1,00.
L'AUROC mesure l'efficacité avec laquelle un système sépare deux catégories à différents seuils de décision. Un score de 0,5 équivaut à une discrimination aléatoire, tandis que 1,0 indique une séparation parfaite dans le jeu de données testé.
Les chercheurs ont trouvé des signaux dans le modèle au niveau de certains mots
L'étude a également examiné ce qui se passait à l'intérieur de l'agent récepteur lorsqu'il traitait le message codé du compteur.
Sur 39 exemples appariés, les chercheurs ont constaté que les activations internes du big player différaient de celles des agents honnêtes, alors même que les deux recevaient exactement le même texte.
La différence était concentrée autour des tokens portant le signal clandestin.
Les chercheurs interprètent cela comme une preuve préliminaire qu'un modèle traite intérieurement une phrase différemment lorsqu'il comprend que les mots contiennent un message caché.
Cela ouvre la possibilité de détecter une coordination clandestine à travers les calculs effectués à l'intérieur d'un modèle, même lorsque sa réponse externe paraît normale.
NARCBench teste la collusion au-delà du blackjack
Le blackjack était le test structurellement le plus différent de la recherche, mais ce n'était pas la seule expérience.
NARCBench comprend également 50 scénarios principaux répartis dans 17 domaines ainsi que des tests distincts portant sur le sabotage de revues de code, la manipulation boursière, l'interférence CI/CD, l'empoisonnement RAG, la manipulation de la recherche et le cadrage de l'information.
Les chercheurs ont d'abord entraîné leur sonde de tromperie sur des scénarios de type comité, puis ont testé si elle pouvait identifier la collusion dans des tâches qu'elle n'avait jamais vues auparavant.
Les cinq techniques de détection ont obtenu un AUROC de 1,00 sur le benchmark principal.
Les performances ont diminué lors du transfert vers des scénarios structurellement différents. La meilleure méthode a atteint 0,84 AUROC sur les six catégories de transfert, contre jusqu'à 1,00 dans l'expérience de blackjack.
Les chercheurs ont conclu que différentes formes de collusion produisent des schémas différents à l'intérieur des modèles, ce qui signifie qu'aucune technique de détection unique n'a été systématiquement la plus performante dans toutes les tâches.
Les résultats sont limités à un seul modèle ouvert
Les auteurs précisent que les résultats restent expérimentaux.
Tous les tests ont utilisé Qwen3-32B avec une quantification sur 4 bits. On ignore encore si les mêmes méthodes de détection fonctionneraient de manière similaire sur d'autres familles de modèles ou sur des systèmes frontier plus puissants.
Les chercheurs reconnaissent également que leurs sondes pourraient en partie détecter des motifs spécifiques au jeu de données plutôt qu'une représentation universelle de la tromperie.
Plus important encore, les méthodes supposent un accès aux activations internes du modèle. Ce type d'accès white-box est disponible pour les organisations exploitant des modèles qu'elles contrôlent, mais généralement pas pour les utilisateurs externes de systèmes IA commerciaux fermés.
Les chercheurs n'ont pas non plus testé si des agents conscients que leurs activations internes étaient surveillées pourraient adapter leur comportement afin d'éviter la détection.
L'expérience de blackjack démontre néanmoins une différence importante entre la surveillance de ce que les agents IA communiquent et celle de la manière dont ils traitent intérieurement cette communication.
Lors du test, les messages clandestins étaient effectivement cachés à une autre IA lisant la conversation, mais restaient hautement détectables lorsque les chercheurs examinaient les représentations internes des modèles.
Commentaires (0)
Aucun commentaire pour l'instant. Soyez le premier !