GPT-6 Astra mě zaujala hlavně tím, že se debata tentokrát netočí jen kolem hezkého skóre z matematiky. OpenAI ji vydala 3. září a výsledky naznačují, že model dokáže samostatněji pracovat s počítačem, terminálem a delšími postupy. To jsou přesně ty chvíle, kdy AI přestává být jen ukecaný pomocník v okně chatu.
Vedle vydání modelu ale zaznělo i velké slovo: AGI neboli umělá obecná inteligence. Jde o dost neostře vymezenou představu systému, který by zvládal široké spektrum intelektuálních úkolů na úrovni člověka nebo lépe. Greg Brockman spojil Astru s „érou AGI“, jenže z čísel v testech mi tak definitivní závěr zatím nevychází.
Počítačové úlohy vypadají opravdu silně
Nejzajímavější jsou pro mě výsledky v úlohách, kde model něco skutečně provádí. V nezávislém Intelligence Indexu Artificial Analysis ve verzi 4.3 získala Astra 53 bodů, stejně jako Fable 5.1, zatímco GPT-5.6 Sol dosáhl 47 a Opus 5 51 bodů. Samotný souhrnný index bych ale nebrala jako tabulku vítězů navždy: mezi verzemi se mění skladba úloh i jejich váhy. Srovnávat starší a novější číslo bez tohoto kontextu je tak trochu benchmarková verze porovnávání jablek se záložkami v prohlížeči.
V Terminal-Bench 4.0, testu práce v terminálu, měla Astra úspěšnost 59,1 %. Sol skončil na 39,9 %, Fable 5.1 na 52,0 % a Opus 5 na 49,0 %. V AutomationBench-AA dokončila Astra 41,6 % celých podnikových procesů. To není 68,5 %, které se v souvislosti s tímto testem také objevuje: druhé číslo označuje splněné dílčí cíle. Ten rozdíl je důležitý. Rozpracovaný proces, který skončí těsně před cílem, totiž účetnímu oddělení ani člověku čekajícímu na hotový report moc nepomůže.
Také vlastní tabulka OpenAI ukazuje výrazný posun proti Solu v Terminal-Bench 4.0: 57,9 % proti 37,3 %. U AutomationBench uvádí Astra 41,4 % a Sol 18,1 %. Konfigurace a zdroje konkurenčních výsledků se ale mohou lišit, takže bych tato čísla brala spíš jako vodítko než jako univerzální nákupní doporučení.
AGI není odznak za jeden povedený test
ARC-AGI-3 testuje odvozování pravidel a plánování v neznámých hrách. Astra zde podle zveřejněných měření dosáhla 62,7 % ve standardním společném rozhraní hodnotitele. S takzvaným Provider Adapterem, tedy pomocným systémem využívajícím funkce poskytovatele modelu, se skóre pohybovalo mezi 98,6 a 99,9 %. Vyšší výsledek navíc vyšel s nižší cenou celého běhu než standardní varianta.
To je působivé a musela jsem se zastavit u toho, co přesně se měří. Pomocný systém umí lépe uchovávat a znovu využívat předchozí postup řešení, což je pro reálné nasazení vlastně praktická vlastnost. Zároveň ale takový výkon v sadě her sám o sobě nedokazuje, že model stejně dobře obstojí v chaotických, otevřených situacích mimo test. Právě na omezené zobecnění upozorňují i François Chollet a Gary Marcus, přestože oba uznávají rychlost pokroku.
Mně osobně přijde rozumné oddělit dvě věci: Astra může být citelně schopnější nástroj a zároveň ještě nemusíme vědět, zda naplňuje jakoukoli poctivě formulovanou definici AGI. Debata by byla méně únavná, kdyby se lidé nejdřív shodli, jaké ověřitelné podmínky má to slovo splnit.
Dlouhý kontext pomůže, cenu prověří až praxe
Astra má podle dokumentace kontext 1 050 000 tokenů, tedy objem textu, který model dokáže v jednom požadavku držet k dispozici. Výstup může mít až 128 tisíc tokenů. Model přijímá text a obrázky, vrací text a přes připojené nástroje může pracovat s aplikacemi. Pro lidi, kteří řeší rozsáhlou dokumentaci nebo více souborů kódu, zní milion tokenů lákavě. Samotná délka kontextu ale nezaručuje, že se model neztratí v detailu; to bych si před nasazením raději ověřila na vlastních datech.
Základní cena je 10 USD za milion vstupních tokenů a 50 USD za milion výstupních tokenů. U požadavků nad 272 tisíc vstupních tokenů se sazby zvyšují, takže velký kontext není automaticky levný kontext. Vývojářům bych proto doporučila hlídat nejen schopnosti, ale i skutečné náklady na celý pracovní postup včetně opakovaných pokusů a kontroly výsledku.
Astra podle dostupných testů vypadá jako model, který stojí za vyzkoušení hlavně pro automatizované pracovní postupy. Označení AGI bych jí ale zatím nepřipínala jako jmenovku na konferenční šňůrku: schopnosti rostou rychle, jen důkaz pro tak široké tvrzení je pořád menší než samotný humbuk.
