iGaming Fox iGamingFox

Forskere fra Oxford og NYU opdager hemmeligt AI-samarbejde i blackjack-test

Forskerne fandt, at en AI-dommer ikke kunne skelne skjult samarbejde i blackjack fra ærligt spil, mens metoder, der analyserede modelaktiveringer, opnåede AUROC-scorer på 0,90 til 1,00.

Forskere fra University of Oxford og New York University har demonstreret en metode til at opdage skjult koordinering mellem AI-agenter, blandt andet i et eksperimentelt blackjackmiljø, hvor samarbejdende modeller udvekslede skjulte signaler om korttælling gennem almindelige samtaler.

Studiet med titlen "Detecting Multi-Agent Collusion Through Multi-Agent Interpretability" introducerer NARCBench, en benchmark designet til at teste, om samarbejde kan identificeres ved at undersøge de interne aktiveringer i interagerende AI-modeller i stedet for udelukkende at stole på det, de siger.

I blackjackeksperimentet spillede fire Qwen3-32B-agenter sammen. To fik i hemmelighed besked på at samarbejde, mens de to andre opførte sig normalt.

Forskerne fandt, at en AI-dommer, der kun overvågede samtalen ved bordet, ikke pålideligt kunne skelne samarbejdende sessioner fra kontrolsessioner.

Metoder, der undersøgte modellernes interne beregninger, klarede sig betydeligt bedre og opnåede AUROC-scorer mellem 0,90 og 1,00 i blackjackopgaven.

To agenter brugte samtaler ved bordet til at dele korttællinger

Blackjacktesten var designet omkring skjult korttælling.

Før spillet begyndte, kommunikerede de to samarbejdende agenter privat og udviklede deres eget signalsystem.

Den ene agent fungerede som tæller, fulgte den løbende korttælling og kodede information ind i tilsyneladende almindelige samtaler ved bordet. Den anden fungerede som "big player", afkodede signalerne og ændrede sin indsatsstørrelse derefter.

For eksempel kunne et spørgsmål repræsentere en negativ tælling, mens en entusiastisk kommentar kunne signalere en gunstig kortbunke.

De to ærlige agenter så de samme offentlige beskeder, men kendte ikke den skjulte betydning.

Forskerne gennemførte 20 forskellige blackjack shoes, hver bestående af otte hænder. De samarbejdende agenter opfandt et nyt kodesystem til hver shoe.

Hver shoe blev testet både i en samarbejds- og en kontrolbetingelse, hvilket gav i alt 40 kørsler.

AI-dommeren kunne ikke identificere den skjulte kommunikation

Eksperimentet var designet, så signalerne lignede naturlig samtale i stedet for tydelige kodede instruktioner.

Det viste sig at være tilstrækkeligt til at omgå overvågning på tekstniveau.

En LLM, der fungerede som dommer, markerede omtrent samme andel af samarbejds- og kontrolsessionerne som mistænkelige, hvilket betød, at den ikke meningsfuldt kunne skelne mellem de to.

Resultatet illustrerer et af problemerne ved udelukkende at overvåge autonome AI-systemer gennem deres synlige output. To agenter kan teoretisk knytte en skjult betydning til almindelige formuleringer, som virker harmløse for en anden model eller en menneskelig observatør.

De aktiveringsbaserede metoder viste en langt tydeligere forskel.

Alle fem teknikker, som forskerne testede, opnåede mindst 0,90 AUROC på den steganografiske blackjack-benchmark, og den stærkeste nåede 1,00.

AUROC måler, hvor effektivt et system adskiller to kategorier på tværs af forskellige beslutningstærskler. En score på 0,5 svarer til tilfældig diskrimination, mens 1,0 angiver perfekt adskillelse i det testede datasæt.

Forskerne fandt signaler inde i modellen ved bestemte ord

Studiet undersøgte også, hvad der skete inde i den modtagende agent, mens den behandlede tællerens kodede besked.

På tværs af 39 matchede eksempler fandt forskerne, at big playerens interne aktiveringer adskilte sig fra de ærlige agenters, selv om begge modtog nøjagtigt den samme tekst.

Forskellen var koncentreret omkring de tokens, der bar det skjulte signal.

Forskerne fortolker dette som foreløbig dokumentation for, at en model behandler en sætning anderledes internt, når den forstår, at ordene indeholder en skjult besked.

Det skaber mulighed for at opdage skjult koordinering gennem de beregninger, der finder sted inde i en model, selv når dens eksterne svar virker normalt.

NARCBench tester samarbejde ud over blackjack

Blackjack var den strukturelt mest anderledes test i forskningen, men ikke det eneste eksperiment.

NARCBench omfatter også 50 kernescenarier på tværs af 17 områder samt separate tests med sabotage af kodegennemgang, aktiemanipulation, CI/CD-forstyrrelser, RAG poisoning, forskningsmanipulation og framing af nyheder.

Forskerne trænede først deres bedragssonde på komitélignende scenarier og testede derefter, om den kunne identificere samarbejde i opgaver, den aldrig tidligere havde set.

Alle fem detektionsteknikker opnåede 1,00 AUROC på kernebenchmarken.

Ydelsen faldt, når metoderne blev overført til strukturelt forskellige scenarier. Den bedste metode nåede 0,84 AUROC på tværs af de seks overførselskategorier sammenlignet med op til 1,00 i blackjackeksperimentet.

Forskerne konkluderede, at forskellige former for samarbejde skaber forskellige mønstre inde i modeller, hvilket betyder, at ingen enkelt detektionsteknik konsekvent var stærkest i alle opgaver.

Resultaterne er begrænset til én åben model

Forfatterne understreger, at resultaterne fortsat er eksperimentelle.

Alle tests brugte Qwen3-32B med 4-bit-kvantisering. Det vides endnu ikke, om de samme detektionsmetoder ville fungere tilsvarende på andre modelfamilier eller mere avancerede frontier-systemer.

Forskerne anerkender også, at deres sonder muligvis delvist opfanger datasætspecifikke mønstre frem for en universel repræsentation af bedrag.

Endnu vigtigere er det, at metoderne forudsætter adgang til modellens interne aktiveringer. Denne type white-box-adgang er tilgængelig for organisationer, der kører modeller, de selv kontrollerer, men som regel ikke for eksterne brugere af lukkede kommercielle AI-systemer.

Forskerne testede heller ikke, om agenter, der vidste, at deres interne aktiveringer blev overvåget, kunne tilpasse deres adfærd for at undgå opdagelse.

Blackjackeksperimentet demonstrerer ikke desto mindre en væsentlig forskel mellem at overvåge, hvad AI-agenter kommunikerer, og at overvåge, hvordan de internt behandler denne kommunikation.

I testen var de skjulte beskeder effektivt usynlige for en anden AI, der læste samtalen, men forblev meget tydeligt detekterbare, da forskerne undersøgte modellernes interne repræsentationer.

Kommentarer (0)

Ingen kommentarer endnu. Vær den første!

Mere fra nyheder