Google har precis släppt sin mest avancerade ljudmodell – så här rankas den

  • Googles nya röstmodell får högsta betyg på Artificial Analysis talindex med poängen 82,6.
  • Gemini 3.8 Live kostar 0,84 USD per timme, indexets billigaste ljudmodell.
  • Männskliga testare föredrar fortfarande den äldre Gemini 3.1 Flash Live i blinda rösttester.

Google släppte Gemini 3,8 Live och Gemini 3,8 Live Extended Thinking den 15 september och kallar de sina mest avancerade ljudmodeller hittills.

De två modellerna kan prata, resonera och utföra uppgifter. Men hur bedömer oberoende analytiker dem? Extended Thinking-varianten toppade Artificial Analysis Speech-to-Speech Index med 82,6, före GPT-Live-1 och Grok Voice.

Följ oss på X för att få de senaste nyheterna direkt

Hur tester rankar Googles nyaste AI-modell för samtal

Artificial Analysis Index räknar genomsnittet av talresonemang, agentprestanda, arenapreferens och uppgiftssuccé.

Gemini 3,8 Live Extended Thinking, testad med hög resonemangsnivå, debuterade på första plats. GPT-Live-1 Astra följde med 81,5 och Grok Voice Think Fast 2,0 High med 81,3.

Hur Gemini 3,8 Live placerade sig på Speech-to-Speech Index
Hur Gemini 3,8 Live placerade sig på Speech-to-Speech Index. Källa: Artificial Analysis

Den vanliga Gemini 3,8 Live tog femte plats med ett resultat på 76,0. Båda varianter slog Gemini 3,1 Flash Live High, som fick 71,5.

Skillnaden i agentprestanda är större. Extended Thinking nådde 68,6 % på Tau Voice-testet, mot 37,7 % för tidigare generationen.

På testet för talresonemang fick Extended Thinking 97,7 % och slog därmed Grok Voice med 97,2 %. Men den låg bakom Qwen Audio 3,0 Realtime Plus, som fick 99,2 %.

Människor föredrar fortfarande den äldre Gemini-modellen

Priset gör skillnad. Standardmodellen kostar 0,84 USD per timme ljudinmatning. Det är ungefär hälften så mycket som föregångaren, 1,75 USD, och det lägsta priset i Indexet.

Extended Thinking kostar 3,50 USD per timme. Det slår GPT-Live-1 Sol på 4,47 USD och Grok Voice Think Fast 2,0 High på 4,80 USD.

Fördröjning har också minskat. Genomsnittlig tid till första ljudet är nu 1,18 sekunder jämfört med 2,99 sekunder för den äldre Gemini-modellen.

Lyssnarna är dock inte helt övertygade. Gemini 3,1 Flash Live leder fortfarande i omtyckthet vid blinda Speech Agent Arena-samtal, med Elo på 1096.

Gemini 3,8 Live ligger tvåa med 1083. Extended Thinking-varianten hamnar lägre, 990, trots att den slutförde 89,1 % av sina uppgifter.

Röst-AI bedöms nu på två olika sätt. Tester belönar den modell som resonerar bäst. Omtycktheten belönar den som pratar tydligast. Google leder just nu båda, men med olika modeller.

Prenumerera på vår YouTube-kanal för att se ledare och journalister ge expertinsikter

Ansvarsfriskrivning

BeInCrypto har åtagit sig att tillhandahålla opartisk och transparent rapportering. Denna nyhetsartikel syftar till att ge korrekt och aktuell information. Läsare uppmanas dock att verifiera fakta på egen hand och att rådgöra med en fackman innan de fattar några beslut baserade på detta innehåll. Observera att våra Allmänna villkor, vår Integritetspolicy och våra Ansvarsfriskrivningar har uppdaterats.