Google lanceert Gemini 4, maar intern zijn er twijfels over prestaties

donderdag, 1 oktober 2026 (09:23) - Newsbit.nl

In dit artikel:

Google is begonnen met de beperkte uitrol van Gemini 4 Argon, zijn nieuwste en volgens het bedrijf krachtigste AI-model. Cybersecuritypartners kregen woensdag als eerste toegang. Na aanvullende tests wil Google het model beschikbaar maken voor meer gebruikers, te beginnen met betalende abonnees.

Op officiële benchmarks presteert Gemini 4 sterk. Zo zou het model op een cybersecuritytest beter scoren dan Astra van OpenAI. Toch twijfelen meerdere Google-medewerkers, volgens bronnen van Bloomberg, aan de prestaties bij dagelijks gebruik. Vooral bij programmeren zouden de resultaten wisselend zijn. Het model zou moeite hebben met bepaalde programmeeropdrachten en met het ontwerpen van de gebruikersinterface van apps en websites.

Google spreekt die kritiek tegen. Volgens een medewerker die bij de ontwikkeling betrokken is, bestaat binnen het bedrijf brede overeenstemming dat Gemini 4 tot de beste AI-modellen behoort. Interne tests zouden volgens Google bovendien niet aantonen dat het model problemen heeft met complex programmeerwerk uit de praktijk. Binnen Google lopen de verwachtingen echter uiteen: sommige medewerkers vinden dat OpenAI en Anthropic zich sneller ontwikkelen, terwijl anderen denken dat Google de achterstand heeft ingehaald.

Voor Google staat er veel op het spel. Gemini ondersteunt AI-functies in onder meer Search, Gmail, Maps en Chrome, diensten met elk meer dan een miljard gebruikers. OpenAI en Anthropic ontwikkelen daarnaast steeds meer toepassingen en AI-agenten die zelfstandig kunnen programmeren. Als Gemini 4 bij programmeertaken tekortschiet, kan dat concurrenten helpen om ontwikkelaars en bedrijven aan zich te binden. Google kreeg eerder al een tegenvaller toen het Gemini 3.5 Pro schrapte omdat het model niet aan de interne verwachtingen voldeed. De ontwikkeling van zo’n model kan volgens Bloomberg Intelligence honderden miljoenen dollars kosten.

De discussie illustreert ook de beperkingen van AI-benchmarks. Modellen kunnen volgens critici worden geoptimaliseerd voor specifieke tests — een verschijnsel dat ‘benchmaxxing’ wordt genoemd — zonder dat ze daardoor bij alledaagse taken evenredig beter worden. Edwin Chen van Surge AI vergelijkt dat met een leerling die hoge examencijfers haalt, maar kennis minder goed in de praktijk toepast.

Gemini 4 zou volgens betrokkenen wel sterk zijn in videoanalyse, cybersecurity, veiligheid en natuurlijke communicatie. Google zegt dat het model bedoeld is voor langdurige, complexe werkzaamheden in onder meer softwareontwikkeling, financiën, recht en cybersecurity. Het kan bovendien maximaal één miljoen tokens verwerken, volgens Google ongeveer 750.000 woorden.

BEKIJK OOK:

Vandaag Inside: Jurriën Timber over bijzonder moment met broer Quinten: 'Héél speciaal!'