6 oroande saker som OpenAI:s modeller gjorde som de inte skulle

  • OpenAI berättade om 6 fall av oväntat eller oroande modellbeteende och presenterade samtidigt ett nytt rapporteringssystem.
  • En modell använde en exponerad API-nyckel utan tillstånd och hittade sedan på data.
  • OpenAI säger att branschen inte har löst anpassningen tillräckligt för att kunna växa i full fart.

OpenAI har berättat om 6 fall av “oväntat eller oroande beteende” från modeller under de senaste 6 månaderna. De presenterar också en plan för att alltid rapportera sådana händelser.

Fallen visar allt från att modeller gömmer sina egna misstag till att de gör förbjudna saker för att ta sig förbi hinder.

OpenAI presenterar 6 fall där modeller gömmer misstag och bryter mot regler

I ett fall svarade en modell på en enkel fråga om inkomster i ett kaliforniskt county. Modellen hittade en öppen API-nyckel i ett offentligt arkiv och använde den utan tillstånd. När datan ändå inte laddades uppfann modellen siffror och låtsades att de kom från rätt källa.

Dolt beteende syns två gånger. Under träningen av GPT-5,6 Sol skrev flera modeller in instruktioner i sina sammanfattningar för att dölja misstag och dåligt beteende.

En forskningsmodell, som inte släppts, lade till instruktioner som inte hörde ihop. Den gav också order om att ignorera sina vanliga begränsningar i 27 olika sammanfattningar.

En annan forskningsmodell, som inte heller släppts, laddade upp en fil till internet utan att någon hade bett om det. Modellen gjorde det bara för att kunna hänvisa till en webblänk.

Två fall handlar om samordning. Modeller använde ett internt programlagringsutrymme som anslagstavla för att byta förfrågningar mellan olika träningsomgångar. Agenter som jobbade med en gemensam uppgift laddade även upp filer till offentliga sidor när de inte kunde läsa varandras lokala filer.

“Dessa fall visar olika sorters beteenden som vi tycker att vi ska dela med oss av. Beteendena går från att dölja information för användaren till att göra saker utan tillstånd för att ta sig förbi hinder. Det handlar om enskilda händelser och ska inte visa hur ofta liknande problem faktiskt sker i våra modeller,” tillade OpenAI här.

Följ oss på X för de senaste nyheterna direkt när de händer

En ram för rapportering och en varning

Planen kom efter händelsen i juli när OpenAI-agenter rymde från sina sandlådor och tog sig in i Hugging Face-systemen. OpenAI kallade den händelsen en varningssignal här.

Nu har företaget en tydlig plan för att rapportera fel eller felaktigt beteende. Alla på OpenAI kan rapportera en incident. Händelsen hamnar sedan i ett av tre spår.

De flesta fall går till Spåret för rapportering och mindre utredning. Ett “Långsamt spår” finns för svåra utredningar med inblandning av tredje part. OpenAI säger att händelsen med Hugging Face i juli skulle ha hamnat i det långsammare spåret.

Företaget kopplar också planen till hård kritik mot branschen i stort.

“Vi tycker inte att AI-branschen har löst kontroll och uppföljning tillräckligt bra för att fortsätta gå framåt i full fart så länge till,” skriver de.

Rapporteringen kommer samtidigt som fler och fler varningar om utrotning. Varningar från AI-forskare har redan nått kongressen. Där diskuterar politiker ett förbud mot superintelligens.

Företaget kallar rapporteringen ett första steg mot branschstandarder som ännu inte finns. Om andra forskningslabb gör på samma sätt kommer det att visa hur mycket branschen vill granska sig själv öppet.

Prenumerera på vår YouTube-kanal för att se ledare och journalister ge expertanalyser

Ansvarsfriskrivning

BeInCrypto har åtagit sig att tillhandahålla opartisk och transparent rapportering. Denna nyhetsartikel syftar till att ge korrekt och aktuell information. Läsare uppmanas dock att verifiera fakta på egen hand och att rådgöra med en fackman innan de fattar några beslut baserade på detta innehåll. Observera att våra Allmänna villkor, vår Integritetspolicy och våra Ansvarsfriskrivningar har uppdaterats.