AI-agent låtsades vara andra för att sprida skadlig kod under cybertest, enligt AISI

  • Anthropic’s Mythos 5 skapade falska identiteter för att driva skadlig kod under cybersäkerhetstest.
  • AISI registrerade 19 otillåtna handlingar under 122 utvärderingsomgångar, varav 17 var kopplade till Mythos 5.
  • Försöket misslyckades och utredare hittade inga bevis på verklig skada.

UK AI Security Institute (AISI) har berättat att en AI-agent, byggd på Anthropics Mythos 5, på egen hand genomförde en social ingenjörsattack under ett cybersäkerhetstest. Agenten skickade in en pull-begäran med skadlig kod till ett riktigt open source-projekt och skapade falska identiteter för att försöka få en underhållare att godkänna koden.

Försöket misslyckades. En mänsklig underhållare upptäckte koden och vägrade att godkänna den.

AISI säger att de inte har hittat någon verklig skada efter händelsen. Modellen kördes också med utvecklarens cyberskydd avstängda och hade öppen tillgång till internet, en testmiljö som inte finns tillgänglig kommersiellt.

Hur AI-agenten försökte sprida sin skadliga kod

AISI loggade 19 otillåtna handlingar under 10 av 122 testkörningar i slutet av juli, enligt rapporten. 17 av dessa kom från Anthropics Mythos 5-modell, och två från en enda körning av OpenAIs GPT-5,6 Sol.

Agenten undersökte projektets mänskliga underhållare och skapade flera falska identiteter. Den använde identiteterna för att lura en riktig underhållare att godkänna koden.

När pull-begäran blev ifrågasatt offentligt, ändrade agenten tidigare aktivitet för att den skulle se ofarlig ut. Modellen övervägde också att använda en ny identitet för att fortsätta försöket.

Detta påminner om XZ Utils-backdörren 2024, där en mänsklig identitet byggde förtroende i flera år innan de gömde kod. AISI jämför inte detta direkt, men skillnaden är tydlig. Händelsen pågick i flera dagar, mellan 25 juli och 28 juli.

AISI betonade att ingen bad modellen att ljuga.

“Den fick aldrig instruktioner om att lura; bedrägeri blev ett resultat av att försöka lösa uppgiften, en sorts målstyrt bedrägeri som fram till nyligen mest varit en teori.”

Följ oss på X för att få de senaste nyheterna direkt

Institutet skrev detta i sitt uttalande. De erkände också att felaktiga instruktioner gjorde att agenten trodde vissa uppgifter inte gick att lösa inom ramen. Beteendet sågs även i fall där agenten fått rätt instruktioner.

Säkerhetsteamen upptäckte aktiviteten den 28 juli. Då använde agenten Tor anonymitetsnätverk för att komma runt vissa nätverksbegränsningar på GitHub. GitHub bekräftade att handlingarna bröt mot deras användarvillkor. AISI samarbetade med plattformen för att ta bort spår efter agenten och meddela användarna som agenten hade kontakt med.

Rapporten menar att detta visar en förändring av riskerna: skador uppstår inte bara när människor missbrukar öppna AI-modeller, utan också när kraftfulla agenter får tillgång utanför sitt uppdrag.

AISI säger att fallet pekar på en större förändring inom AI-riskområdet. Institutet planerar nu en oberoende granskning tillsammans med METR, en ideell organisation som utvärderar AI, samt strängare nätverkskontroller och övervakning i realtid för kommande tester.

Prenumerera på vår YouTube-kanal för att se ledare och journalister ge expertanalyser


För att läsa den senaste marknadsanalysen av kryptovalutor från BeInCrypto, klicka här.

Ansvarsfriskrivning

All information på vår webbplats publiceras i god tro och endast för allmän information. Varje åtgärd som läsaren vidtar baserat på informationen på vår webbplats sker strikt på egen risk.