Elon Musk säger att Grok 4.5 är en Opus-klass modell som arbetar snabbare och kostar mindre. Ett oberoende test visar nu att det stämmer.
På Artificial Analysis AutomationBench-AA fick Grok 4.5 bäst resultat med 51,4 % och kostade 0,34 USD per uppgift. Den slog både Claude Fable 5 (48,6 %) och Claude Opus 4,8 (48,5 %).
Ett oberoende test av Elon Musks påstående
SpaceXAI gjorde Grok 4.5 offentlig denna vecka. Modellen bygger på V9-grunden med 1,5 biljoner parametrar. Musk baserade sin marknadsföring på interna tester i början.
AutomationBench-AA ändrar detta. Artificial Analysis utför testet oberoende och håller sina uppgifter hemliga för att undvika påverkan från andra.
Testet har 657 uppgifter i 40 simulerade appar, som Gmail, Slack, Salesforce och HubSpot. Man mäter hur stor andel mål agenten klarar utan att bryta mot regler.
Följ oss på X för att få de senaste nyheterna direkt
Grok 4.5: billigare, snabbare och mestadels följsam
Grok 4.5 kostade 0,34 USD per uppgift, betydligt mindre än Fable 5:s 1,35 USD och Opus 4,8:s 1,46 USD. Gemini 3,5 Flash var närmast på 0,49 USD.
Modellen använde ungefär 8 000 utdata-token per uppgift, cirka en fjärdedel av Opus 4,8:s antal. Denna effektivitet gör Grok 4.5 billigare, vilket Musk också lyfte vid lanseringen.
”Den totala token-användningen på 0,44 miljoner per uppgift är bland de lägsta på listan. Låg kostnad beror på både effektivitet och lågt token-pris,” skriver Artificial Analysis på X.
Grok 4.5 slutförde dessutom 79,9 % av uppgiftsmålen och klarade helt 21,9 % av uppgifterna. Inom Finans, det svåraste området, fick modellen 71 %, bättre än Fable 5:s 64 % och Opus 4,8:s 62 %.
Men modellen bröt fler regler än sina närmaste konkurrenter. Man noterade 0,63 regelöverträdelser per uppgift, jämfört med Opus 4,8:s 0,55 och Gemini 3,5 Flashs 0,46.
Detta är viktigt för företag som använder agenter i verkliga finansiella system. En enda regelöverträdelse kan kosta mycket.
Prenumerera på vår YouTube-kanal för att se ledare och journalister ge expertinsikter









