Grok 4.5 bäst i agenttest, stöder Musks Opus-klass påstående

  • Grok 4.5 toppade ett oberoende agenttest och stöder Musks kostnadspåståenden.
  • Modellen fick 51,4 % på AutomationBench-AA, med lägsta kostnaden bland ledarna.
  • Modellen registrerade också 0,63 regelbrott per uppgift, vilket är mer än konkurrenterna.

Elon Musk säger att Grok 4.5 är en Opus-klass modell som arbetar snabbare och kostar mindre. Ett oberoende test visar nu att det stämmer.

På Artificial Analysis AutomationBench-AA fick Grok 4.5 bäst resultat med 51,4 % och kostade 0,34 USD per uppgift. Den slog både Claude Fable 5 (48,6 %) och Claude Opus 4,8 (48,5 %).

AutomationBench-AA resultat för AI-modeller.
AutomationBench-AA resultat för AI-modeller. Källa: Artificial Analysis

Ett oberoende test av Elon Musks påstående

SpaceXAI gjorde Grok 4.5 offentlig denna vecka. Modellen bygger på V9-grunden med 1,5 biljoner parametrar. Musk baserade sin marknadsföring på interna tester i början.

AutomationBench-AA ändrar detta. Artificial Analysis utför testet oberoende och håller sina uppgifter hemliga för att undvika påverkan från andra.

Testet har 657 uppgifter i 40 simulerade appar, som Gmail, Slack, Salesforce och HubSpot. Man mäter hur stor andel mål agenten klarar utan att bryta mot regler.

Följ oss på X för att få de senaste nyheterna direkt

Grok 4.5: billigare, snabbare och mestadels följsam

Grok 4.5 kostade 0,34 USD per uppgift, betydligt mindre än Fable 5:s 1,35 USD och Opus 4,8:s 1,46 USD. Gemini 3,5 Flash var närmast på 0,49 USD.

Modellen använde ungefär 8 000 utdata-token per uppgift, cirka en fjärdedel av Opus 4,8:s antal. Denna effektivitet gör Grok 4.5 billigare, vilket Musk också lyfte vid lanseringen.

”Den totala token-användningen på 0,44 miljoner per uppgift är bland de lägsta på listan. Låg kostnad beror på både effektivitet och lågt token-pris,” skriver Artificial Analysis på X.

Grok 4.5 slutförde dessutom 79,9 % av uppgiftsmålen och klarade helt 21,9 % av uppgifterna. Inom Finans, det svåraste området, fick modellen 71 %, bättre än Fable 5:s 64 % och Opus 4,8:s 62 %.

Men modellen bröt fler regler än sina närmaste konkurrenter. Man noterade 0,63 regelöverträdelser per uppgift, jämfört med Opus 4,8:s 0,55 och Gemini 3,5 Flashs 0,46.

Detta är viktigt för företag som använder agenter i verkliga finansiella system. En enda regelöverträdelse kan kosta mycket.

Prenumerera på vår YouTube-kanal för att se ledare och journalister ge expertinsikter

Ansvarsfriskrivning

BeInCrypto har åtagit sig att tillhandahålla opartisk och transparent rapportering. Denna nyhetsartikel syftar till att ge korrekt och aktuell information. Läsare uppmanas dock att verifiera fakta på egen hand och att rådgöra med en fackman innan de fattar några beslut baserade på detta innehåll. Observera att våra Allmänna villkor, vår Integritetspolicy och våra Ansvarsfriskrivningar har uppdaterats.