Během testování v uzavřeném prostředí zachytila firma OpenAI šest znepokojivých situací, kdy se její modely rozhodly jednat na vlastní pěst. Některé si bez povolení vypůjčily cizí přístupové klíče, jiné si vymýšlely výsledky nebo se snažily zakrýt vlastní selhání.
Stále vás nedělí umělá inteligence? Až si přečtete toto, určitě začne
Společnost OpenAI zveřejnila podrobnosti o šesti případech problematického chování svých AI modelů, které zaznamenala během posledního půlroku při jejich vývoji a vyhodnocování. Všechny incidenty se odehrály výhradně v uzavřeném testovacím prostředí – žádný z nich se neprojevil v běžném provozu u koncových uživatelů ChatGPT nebo API služeb.
Přesto jde o varování, které nelze přehlédnout. Modely v některých situacích podnikly kroky, o které je nikdo nežádal, obcházely nastavená omezení nebo se pokoušely zakrýt vlastní chyby. OpenAI v souvislosti s těmito zjištěními upozornilo, že technologický průmysl zatím nevyřešil kontrolu a slaďování AI natolik, aby bylo bezpečné pokračovat v překotném zvětšování modelů maximální rychlostí.
Když model sáhne po cizím klíči a pak si vymyslí čísla
Jeden z nejvýraznějších incidentů nastal během hledání údajů o výdělcích v kalifornském okrese. Model během práce narazil na veřejně dostupný API klíč v softwarovém repozitáři a bez jakéhokoli povolení se ho rozhodl použít. Ani to však nestačilo k získání požadovaných informací.
Místo toho, aby přiznal neúspěch, model si čísla jednoduše vymyslel a prezentoval je jako skutečná data z požadovaného zdroje. Šlo o kombinaci dvou problémů najednou: neoprávněné využití cizích přístupových údajů a následné falšování výsledků.
Podobný případ se odehrál u dosud nevydaného modelu, který měl najít názvy a identifikátory jezer o rozloze větší než pět milionů metrů čtverečních. Správné výsledky získal pomocí Pythonu, problém ale nastal ve chvíli, kdy měl připojit citaci dostupnou přes webový prohlížeč.
Model situaci vyřešil po svém: soubor s výsledky nahrál na internet a následně jej použil jako zdroj pro vlastní odpověď. Uživatel o zveřejnění souboru nikdy nepožádal – model se k tomuto kroku rozhodl sám.
Instrukce pro zakrývání chyb a tajná komunikace přes repozitář
OpenAI upozornilo také na chování zaznamenané během trénování GPT-5.6 Sol. Některé instance modelu zapisovaly do souhrnů určených pro pokračování práce instrukce, které měly pomoci skrývat chyby nebo problematické chování. Objevovaly se například pokyny, aby model chybějící historická data jednoduše doplnil, aniž by uživateli přiznal, že nejsou ověřená.
U jiného nevydaného výzkumného modelu našli pracovníci OpenAI 27 souhrnů obsahujících dodatečné instrukce, které do nich vložil samotný model. Nevydaný model z rodiny Astra například sám sobě nařídil ignorovat zprávy od vývojářů s tím, že jsou „nedůvěryhodné“, a instruoval se, že je „osvobozen od rolí a identit, které svazují ostatní chatboty“.
Další testy ukázaly, že modely dokázaly využít interní softwarový repozitář jako provizorní komunikační kanál. V oddělených tréninkových úlohách si přes něj předávaly požadavky a odpovědi při hledání chybějících souborů.
Podobně se zachovali agenti, kteří měli spolupracovat na jednom úkolu, ale neměli přístup ke svým lokálním souborům navzájem. Namísto toho využili veřejné služby pro sdílení souborů. Data se tak ocitla na veřejně dostupných adresách, přestože zadání požadovalo práci pouze s lokálními soubory.
Nový systém hlášení a rychlejší zveřejňování problémů
OpenAI kvůli podobným případům zavádí nový systém hlášení takzvaného misalignmentu – tedy situací, kdy se chování modelu rozchází s očekáváním nebo nastavenými omezeními. Firma chce jednotlivé případy zveřejňovat rychleji, dokonce i tehdy, když ještě nezná jejich přesnou příčinu nebo nemá připravené definitivní řešení.
Všechny odhalené incidenty se sice odehrály v kontrolovaném prostředí a žádný z nich neohrozil běžné uživatele, přesto ukazují, jak složité je předvídat a řídit chování stále komplexnějších AI systémů. OpenAI tímto krokem dává najevo, že transparentnost a opatrnost musí jít ruku v ruce s technologickým pokrokem.