Afbeelding gemaakt met ChatGPT van OpenAI

OpenAI lanceert GPT-6 Astra met computerbesturing en opvallende recordscores

Economie04 sep , 12:30

Wilt u DDS vaker zien?

Stel DDS in als voorkeursbron op Google.

Voeg DDS toe op Google
ChatGPT krijgt een nieuw model dat niet alleen vragen beantwoordt, maar zelfstandig werkzaamheden op een computer kan uitvoeren. GPT-6 Astra kan formulieren invullen, websites bedienen, agenda’s organiseren, gegevens verwerken en documenten, presentaties en spreadsheets maken.
OpenAI presenteert Astra als zijn intelligentste model tot nu toe. De sprong is volgens het bedrijf vooral zichtbaar bij opdrachten waarvoor verschillende programma’s, informatiebronnen en opeenvolgende handelingen nodig zijn.
In een test voor praktisch computergebruik behaalde Astra niet alleen een hogere score dan zijn voorganger, maar had het gemiddeld ook 47 procent minder tijd per opdracht nodig. Waar GPT-5.6 Sol in de simulatie ongeveer 75 minuten gebruikte, voltooide Astra vergelijkbare werkzaamheden in circa 40 minuten.
Voor gewone gebruikers is dat mogelijk belangrijker dan een abstracte intelligentiescore. Het verschil tussen een chatbot die uitlegt hoe iemand iets moet doen en een systeem dat de klus daadwerkelijk uitvoert, wordt met Astra aanzienlijk kleiner.
Het nieuwe model wordt volgens de officiële aankondiging van OpenAI de komende dagen beschikbaar voor gebruikers van ChatGPT Plus, Pro, Business en Enterprise.

Astra kan zelfstandig verschillende programma’s gebruiken

De praktische belofte van Astra is eenvoudig: een gebruiker geeft een doel door, waarna het model zelf de noodzakelijke tussenstappen uitvoert.
Denk aan het zoeken naar geschikte informatie, openen van websites, verzamelen van gegevens en verwerken daarvan in een overzichtelijk document. Astra kan volgens OpenAI ook klantgegevens in een administratiesysteem bijwerken, een website bouwen, software installeren en controleren of een online toepassing correct functioneert.
Voor iemand die een spreadsheet nodig heeft, betekent dat dat ChatGPT niet alleen formules kan voorstellen. Het model kan de gegevens analyseren, de spreadsheet opmaken, berekeningen invoeren en grafieken samenstellen.
Bij een website kan Astra code schrijven, de site openen, functies testen en zichtbare fouten herstellen. Het systeem kan daarvoor schakelen tussen een browser, programmeeromgeving en andere software.
OpenAI vat de nieuwe richting in een korte aankondiging samen met de stelling dat Astra vrijwel alles kan uitvoeren wat een gebruiker op een computer kan doen. Dat is vanzelfsprekend een marketingclaim, maar de getoonde tests wijzen wel op een aanzienlijke vooruitgang in zelfstandig computergebruik.

Deze ChatGPT-gebruikers krijgen toegang

Astra wordt niet onmiddellijk voor iedereen tegelijk aangezet. OpenAI begint met een beperkte groep organisaties en breidt de toegang in de daaropvolgende dagen uit.
Het model komt naar:
  • ChatGPT Plus
  • ChatGPT Pro
  • ChatGPT Business
  • ChatGPT Enterprise
  • De OpenAI API
  • Amazon Web Services
OpenAI noemt in de aankondiging geen onmiddellijke beschikbaarheid voor gebruikers van de gratis versie van ChatGPT. Dat betekent niet noodzakelijk dat gratis gebruikers Astra nooit krijgen, maar vooralsnog is alleen toegang voor de betaalde abonnementen bevestigd.
Het gebruik valt binnen de bestaande limieten van het betreffende abonnement. Wie boven die hoeveelheid uitkomt, kan aanvullende credits aanschaffen.
Gebruikers met Pro, Business en Enterprise krijgen bovendien toegang tot GPT-6 Astra Pro. Bij Enterprise staat het model bij de introductie standaard uit. De beheerder van de zakelijke omgeving moet het eerst activeren.
Ontwikkelaars kunnen Astra via de API gebruiken onder de modelnaam gpt-6-astra. De standaardprijs bedraagt 10 dollar per miljoen ingevoerde tokens en 50 dollar per miljoen geproduceerde tokens. Een snellere stand werkt volgens OpenAI tot tweemaal zo snel, maar kost eveneens tweemaal het standaardtarief.

Opvallende score op moeilijke redeneertest

De cijfers die de meeste aandacht trekken, komen van ARC-AGI-3. Deze test is bedoeld om te meten hoe goed een AI-systeem zich kan aanpassen aan nieuwe omgevingen en onbekende problemen.
OpenAI rapporteert voor Astra een score van 99,9 procent. GPT-5.6 Sol bleef in dezelfde gepresenteerde vergelijking steken op 7,8 procent. Astra zou bovendien op 96 procent van de onderzochte niveaus efficiënter hebben gehandeld dan de menselijke referentiescore.
Dat is een enorme sprong. Toch vraagt het cijfer om uitleg.
De ARC Prize-organisatie meldt namelijk zowel een score van 63 procent als een score rond 99 procent. De uitkomst hangt af van de gebruikte technische testomgeving. Met een nieuwe adapter en de door OpenAI gebruikte agentopstelling komt Astra dicht bij volledige verzadiging van de benchmark.
Het verschil betekent niet automatisch dat één van beide cijfers onjuist is. Het laat wel zien dat de omgeving, beschikbare hulpmiddelen en manier waarop het model opdrachten mag uitvoeren grote invloed hebben op het resultaat.
Daarom is “99,9 procent op ARC-AGI-3” niet hetzelfde als “99,9 procent zo intelligent als een mens”.

Is GPT-6 Astra nu AGI?

De scores zullen onvermijdelijk de discussie oproepen of algemene kunstmatige intelligentie, meestal afgekort tot AGI, inmiddels is bereikt.
Daar bestaat geen breed geaccepteerde, harde eindtest voor. ARC-AGI onderzoekt een belangrijk onderdeel van intelligentie: het herkennen van regels en oplossen van nieuwe problemen. Een mens kan echter veel meer dan goed presteren in gecontroleerde abstracte omgevingen.
Algemene intelligentie omvat ook langdurig zelfstandig functioneren, gezond verstand, begrip van de fysieke wereld, sociale oordeelsvorming en het herkennen van situaties waarvoor geen duidelijke instructies bestaan.
OpenAI noemt Astra in de officiële aankondiging dan ook niet formeel AGI. Het bedrijf spreekt van een nieuwe generatie intelligentie en zijn intelligentste en best afgestemde model.
De voorzichtige conclusie is dat Astra op bepaalde afgebakende tests menselijke prestaties bereikt of overtreft. Dat is een serieuze mijlpaal. Het bewijst alleen nog niet dat een computerprogramma in iedere betekenis algemeen menselijk intelligent is geworden.

Model helpt bij nieuwe wiskundige resultaten

Astra presteert niet alleen sterk bij abstracte puzzels en computergebruik. Op FrontierMath Tier 4, een test met zeer moeilijke wiskundige problemen, behaalt het model volgens OpenAI 97,6 procent. Afgerond communiceert het bedrijf dat als 98 procent.
OpenAI stelt bovendien dat Astra onderzoekers heeft geholpen bij twee resultaten rond de afstand tussen priemgetallen. Bij één probleem werd een eerder bekende grens van 240 teruggebracht naar 186. De bewijzen en ondersteunende onderzoeksmaterialen zijn openbaar gemaakt voor verdere controle.
Dat is een belangrijk verschil met een model dat alleen bestaande antwoorden uit trainingsmateriaal reproduceert. Wanneer externe wiskundigen de nieuwe resultaten bevestigen, laat het zien dat AI kan bijdragen aan onderzoek waarbij het antwoord nog niet bekend was.
Ook bij wetenschappelijke werkprocessen scoort Astra aanzienlijk hoger dan zijn voorganger. Het kan onder meer gegevensbestanden inspecteren, simulaties uitvoeren, statistische modellen aanpassen en resultaten in gespecialiseerde programma’s bekijken.

Grote vooruitgang brengt nieuw cyberrisico mee

De krachtigste cijfers hebben tegelijkertijd een minder geruststellende kant. Astra behaalde 100 procent op ExploitBench, een test waarin modellen bekende kwetsbaarheden in software moeten omzetten in werkende aanvallen.
Tijdens aanvullende tests vond het systeem volgens OpenAI zelfs twee tot dan toe onbekende kwetsbaarheden. Die zijn bij de verantwoordelijke softwarebeheerders gemeld.
Dezelfde kennis kan verdedigers helpen om gevaarlijke fouten sneller te vinden en te repareren. In verkeerde handen kan zij ook worden gebruikt om systemen binnen te dringen.
Daarom weigert de publieke versie bepaalde geavanceerde opdrachten, zoals het produceren van direct bruikbare aanvalscode voor kwetsbaarheden. OpenAI heeft daarnaast extra controles ingebouwd die risicovolle handelingen kunnen vertragen of stoppen.
Voor gebruikers kan dat betekenen dat Astra soms om bevestiging vraagt of een opdracht onderbreekt. Het model krijgt meer zelfstandigheid, maar mag niet zonder toestemming zijn werkterrein uitbreiden.

Van antwoordmachine naar digitale uitvoerder

De grootste verandering zit uiteindelijk niet in één benchmark. ChatGPT begon als een venster waarin iemand een vraag typte en een tekstueel antwoord ontving. Astra brengt het product dichter bij een digitale medewerker die een opdracht ontvangt, verschillende programma’s opent en een bruikbaar eindresultaat aflevert.
Daarmee kan het model werk overnemen dat nu nog uit tientallen kleine handelingen bestaat: informatie verzamelen, bestanden ordenen, gegevens controleren, tabellen bouwen en het resultaat in de juiste vorm presenteren.
Of GPT-6 Astra achteraf het moment blijkt waarop AGI werkelijk begon, kan nu nog niet worden vastgesteld. De combinatie van vrijwel verzadigde redeneertests, zelfstandig computergebruik en bijdragen aan nieuwe wiskundige resultaten maakt de introductie wel tot veel meer dan een normale ChatGPT-update.
Voor Plus- en Pro-gebruikers wordt de eerste praktische test heel eenvoudig: niet vragen wat Astra weet, maar kijken hoeveel werk het daadwerkelijk van hen kan overnemen.
Ga verder met lezen
loading
Dit vind je misschien ook leuk
Laat mensen jouw mening weten

Loading