Matteprov har länge varit den vanligaste metoden för att testa AI-modeller som ChatGPT och Claude. OpenAI säger nu att deras modeller klarar matteproven så bra att de inte längre är användbara. Därför har forskare testat något svårare.
De gav en modell som ännu inte släppts cirka 4 000 olösta matteproblem. Resultaten blev både överraskande och oroväckande.
AI:n skapade 722 manuskript, indelade i 372 grupper av liknande resultat. OpenAI säger att varje resultat i genomsnitt krävde omkring tre timmars beräkning och resonemang.
“Det kommer spännande dagar för matematiksamfundet!” säger Stefano Gogioso, medlem i BeInCrypto Future Tech och AI Experts Council
Blir AI för kraftfull för snabbt?
Detta är den större frågan. Ny AI börjar gå från att bara besvara kända frågor till att föreslå möjliga svar på okända frågor.
Det kan göra att forskare, ingenjörer och analytiker kan försöka lösa mycket mer intellektuellt arbete.
Men allt som AI producerar är inte sant. Många av OpenAI:s artiklar har bevis som datorer kan kontrollera via Lean. Andra har det inte. OpenAI varnar att vissa icke-verifierade resultat “kan innehålla fel”.
Det skapar ett nytt hinder: människor kan få svårt att hinna kontrollera forskningen lika fort som AI kan skapa den.
Kan AI nu göra prediktiv analys och fatta investeringsbeslut?
Kanske, men ekonomi är krångligt på ett annat sätt.
Ett matematiskt bevis kan man till slut visa rätt eller fel. Marknader förändras hela tiden och är brusiga.
Nya tester inom finans visar att AI fortfarande har svårt med komplex investering, och studier om marknadstiming visar liten fördel i att kunna förutsäga rätt.
Den närmaste möjligheten är att AI kan göra djupare analyser, inte perfekta förutsägelser.
En AI som kan resonera i många timmar kan samtidigt undersöka rapporter, resultatsamtal, makrodata och olika scenarier, och sedan testa mycket fler hypoteser än vad en analytiker klarar.
Detta är kanske det viktigaste resultatet från OpenAI:s experiment. AI klarar nu att göra seriösa analyser i mycket stor skala. Nästa problem blir att avgöra vilka resultat vi kan lita på.









