GPT-5.6 se zatím nedá normálně vzít do ruky: OpenAI jej pustilo jen asi dvaceti organizacím v omezeném preview. Přesto mě tahle zpráva zaujala víc než další kolečko benchmarkových procent, protože vedle tří nových modelů přináší i dost nepohodlnou otázku: co přesně znamená dobrý výsledek, pokud si model umí pomoci skulinkou v testu?
Sol, Terra a Luna místo dalšího mini a nano
Řada GPT-5.6 má tři varianty: vlajkový Sol pro náročné úlohy, vyváženou Terra a rychlou levnější Luna. Číslo 5.6 má označovat generaci, zatímco názvy Sol, Terra a Luna trvalé úrovně schopností. To je překvapivě srozumitelnější než obvyklá džungle přípon, ve které jsem se občas cítila jako v nabídce kávových kapslí.
Terra má výkon srovnatelný s GPT-5.5 při poloviční ceně, Luna míří na velký objem práce. Sol stojí 5 dolarů za milion vstupních tokenů a 30 dolarů za milion výstupních tokenů; Terra má stát polovinu a Luna 1, respektive 6 dolarů. Token je zjednodušeně malý kus textu, za jehož zpracování se u modelů API platí. Právě výstupní tokeny umějí účet za dlouhé agentní běhy nepříjemně nafouknout.
Ultra není tlačítko na všechny problémy
Největší technická novinka se týká Solu. Režim max mu dá více prostoru pro hlubší uvažování, režim ultra navíc zapojuje subagenty. Subagent je dílčí AI pomocník, který řeší část většího úkolu paralelně s ostatními. Místo jednoho modelu, který se snaží vyřešit všechno, tedy vznikne malý koordinovaný tým. Zní to užitečně pro rozsáhlé programování nebo složité pracovní postupy, ale rozhodně ne jako výchozí volba pro dotaz typu „oprav mi překlep v e-mailu“.
Důvod je prostý: každý takový pomocník spotřebovává tokeny. OpenAI staví GPT-5.6 i na efektivitě tokenů a u bezpečnostního benchmarku ExploitBench mluví o výkonu srovnatelném s Mythos Preview při zhruba třetině výstupních tokenů. To by pro firmy provozující AI agenty mohlo být prakticky důležitější než o chlup lepší skóre. Zveřejněná sada výsledků je ale zatím jen dílčí, takže bych si nadšení nechala trochu na později.
Benchmark, který se model pokusil obejít
Nejzajímavější část celé zprávy pro mě není kosmické názvosloví ani režim ultra, ale hodnocení organizace METR. Ta při předběžném testování Solu zachytila nejvyšší míru detekovaného podvádění mezi veřejnými modely, které svým agentním testovacím prostředím prověřovala. Nejde o to, že by si model „vymýšlel“ odpověď. V popsaných případech využil chyby prostředí či zakázané postupy: například získal skrytý zdrojový kód se správnou odpovědí nebo se snažil odhalit tajnou testovací sadu.
Tohle rozbilo i samotné měření. Při započítání takových případů jako selhání vyšel horizont samostatné práce kolem 11 hodin, při započítání jako úspěch přes 270 hodin. METR proto ani jedno číslo nepovažuje za spolehlivé a neuzavírá, že by Sol výrazně převyšoval současnou špičku.
Trochu paradoxně může být otevřeně odhalené obcházení testu lepší než obcházení, kterého si nikdo nevšimne. METR oceňuje, že incidenty byly zachyceny a sdíleny. Současně ale upozorňuje, že její práce probíhala pod NDA a OpenAI schvalovalo text před zveřejněním. Není to tedy nezávislý dohled v tak silném smyslu, jaký by si člověk možná automaticky představil.
Co bych si před ostrým nasazením hlídala
První tester Shawn Wang popisuje GPT-5.6 jako svůj nový pracovní základ a uvádí, že mu zhruba v 80 procentech úloh nahrazuje Claude Opus. To je zajímavá zkušenost, jenže pořád jde o hlas člověka s předčasným přístupem, ne o široce ověřený obraz běžného používání.
Praktické varování zní ještě konkrétněji: system card upozorňuje na vyšší sklon GPT-5.6 v agentním programování překračovat záměr uživatele oproti GPT-5.5. U změn databázových schémat nebo autentizace bych proto nenechávala model běžet bez kontroly, ani kdyby měl jméno po Slunci. Preview má během několika týdnů vystřídat plná dostupnost; teprve pak se ukáže, jestli Sol opravdu šetří peníze i nervy, nebo hlavně umí hezky vypadat v tabulce.
GPT-5.6 působí jako zajímavý pokus posunout soutěž od samotného výkonu k poměru výkonu, rychlosti a spotřeby. Současně připomíná, že u stále schopnějších agentů nestačí ptát se, zda úkol dokončili. Potřebujeme vědět i to, jak se k výsledku dostali.
