Abychom mohli rozumně mluvit o superinteligenci, pomůže vědět, jak fungují dnešní systémy jako ChatGPT, Claude nebo Gemini. Základní myšlenka je překvapivě jednoduchá — složité je teprve to, co se z ní naučí.
1. Hádání dalšího kousku textu
Doplňte větu: „Pes štěká, kočka…“ Nejspíš vás napadlo mňouká. Přesně tohle je základ jazykových modelů: podle dosavadního textu předpovídají, co bude následovat.
Nepracují přitom s celými slovy, ale s tokeny. Token může být slovo, jeho část, interpunkce nebo mezera; dlouhé české slovo se rozpadne třeba na tři tokeny a různé modely dělí text různě. Model pro každý možný další token spočítá pravděpodobnost a program pak jeden vybere. Někdy ten nejpravděpodobnější, jindy trochu náhodně z několika dobrých možností — míru náhody řídí nastavení zvané teplota. Proto na stejnou otázku nemusíte dostat pokaždé stejnou odpověď.
Dvě upozornění. Za prvé, pravděpodobnost není pravdivost: model hodnotí, jak dobře pokračování zapadá do textu, ne zda popisuje skutečnost. Rozšířený omyl je v textech tak běžný, že ho model klidně zopakuje, a snížení teploty to nespraví. Za druhé, příklad s kočkou vysvětluje princip, ne jednoduchost. Aby model dobře doplnil „Tento program padá, protože…“ nebo „Pacient má horečku a vyrážku, takže…“, musí si během učení vytvořit užitečné představy o tom, jak svět funguje. „Předpovídač tokenů“ neříká nic o tom, jak složitý výpočet za tím stojí.
2. Miliardy knoflíků
Uvnitř modelu je neuronová síť — matematický model s miliardami nastavitelných hodnot, parametrů. Představte si obrovský mixážní pult s miliardami knoflíků. Na rozdíl od pultu ale jednotlivý knoflík obvykle nejde popsat jako „čeština“ nebo „počítání“; znalosti jsou rozprostřené napříč mnoha z nich.
3. Trénink: zkus, porovnej, dolaď
Model dostane kus skutečného textu, zkusí odhadnout pokračování a výsledek se porovná se skutečností. Optimalizační algoritmus pak všechny knoflíky nepatrně pootočí směrem, který by chybu zmenšil. A znovu. A znovu — na obrovském množství knih, webu, článků a kódu. Nikdo do modelu ručně nezapisuje fakta; usadí se v nastavení knoflíků sama.
Pro představu
Podobně se dítě učí mateřštinu: nikdo mu nevysvětlí pravidla skloňování, jen slyší tisíce vět a opravuje se. Rozdíl je v měřítku — model během tréninku „přečte“ víc textu, než by člověk zvládl za mnoho životů.
Velkou roli hraje transformer, architektura z roku 2017 (Attention Is All You Need). Jejím jádrem je pozornost: při zpracování každého kousku textu model zvažuje, které jiné části vstupu jsou pro něj důležité. Transformer je dnes nejrozšířenější, ale ne jediný — odlišný přístup zkouší například Mamba.
Tři slova, která uslyšíte často: trénink mění parametry, dolaďování je další trénink zaměřený na konkrétní úlohy nebo chování a inference je použití hotového modelu k výpočtu odpovědi. Trochu jako studium a zkouška: při studiu se mění, co umíte, u zkoušky to používáte.
4. Z modelu se stává asistent
Model po prvním tréninku umí pokračovat v textu, ale užitečný asistent to ještě není. Následuje dolaďování: ukázky dobrých odpovědí, hodnocení od lidí („tahle pomohla, tahle ne, tahle je nebezpečná“) i automatické ověřování — u programu se dá spustit test a zkontrolovat, zda opravdu funguje. Příklad vícefázového vývoje popisuje technická zpráva The Llama 3 Herd of Models.
Důležité: při běžném rozhovoru se model nepřeučuje. Vaše zadání a předchozí zprávy mu slouží jako pracovní kontext, ne jako nové nastavení knoflíků. Když modelu v zadání ukážete tři příklady, jak má odpověď vypadat, přizpůsobí se jim — ale jen pro tento rozhovor, parametry zůstávají stejné. Tuto schopnost učit se z příkladů v kontextu bez přetrénování popsala už studie o GPT-3.
5. Tři různé významy paměti
Když se řekne, že si AI něco „pamatuje“, může to znamenat tři různé věci:
- Parametry: co se model naučil při tréninku. Není to databáze, ve které by šla spolehlivě dohledat každá přečtená věta.
- Kontext: zadání, předchozí zprávy a dokumenty, které má model před sebou právě teď. Vejde se ho jen omezené množství (kontextové okno) a ani dlouhý vstup nezaručuje, že model každý detail správně využije.
- Externí paměť: soubory, databáze nebo poznámky, které si aplikace ukládá a při dalším rozhovoru znovu načte.
Na třetí možnosti stojí metoda RAG (retrieval-augmented generation): aplikace nejdřív vyhledá podklady, třeba ve firemních dokumentech, a přidá je modelu do kontextu. Model se tím nepřetrénuje, jen má z čeho čerpat. Odpovědi bývají podloženější, ale jen tak dobré, jako jsou nalezené podklady — špatný nebo neúplný dokument dá špatnou odpověď. Původní práce o RAG.
6. Model, aplikace a agent
Když používáte AI asistenta, pracujete s celým systémem. Jazykový model může mít připojené vyhledávání, kalkulačku, firemní dokumenty nebo prostředí pro spouštění kódu — a výsledná schopnost závisí i na těchto nástrojích. Dva produkty se stejným modelem se proto mohou chovat dost odlišně.
AI agent navíc provádí více kroků směrem k cíli. Zadání „připrav podklady na poradu“ rozdělí na hledání dokumentů, jejich porovnání a sepsání přehledu. S příslušnými oprávněními může i měnit soubory nebo psát e-maily. Stejný model s různými oprávněními může mít velmi rozdílné dopady — kdo agentovi dá přístup k účtu, mění jeho možnosti zasáhnout do světa. Více: AI agenti.
7. Proč se modely mýlí
Halucinace je výstup, který zní věrohodně, ale je chybný nebo nepodložený: neexistující citace, zaměněné datum, vymyšlené vysvětlení. Model se naučil, jak má dobrá odpověď znít — a plynulost řeči není ukazatel pravdivosti. Přístup k vyhledávání pomáhá, ale nevylučuje špatný zdroj ani chybný výklad.
Halucinace má i jemnější podobu. Když model shrne dokument a přidá tvrzení, které v něm není, selhal v práci se zdrojem, i kdyby bylo přidané tvrzení náhodou pravdivé. Proto je při každém použití dobré vědět, co přesně má výstup splňovat: držet se dokumentu, nebo odpovídat podle světa?
Pozor i na populární tvrzení, že s každým zvětšením modelu „samy od sebe“ naskakují nové schopnosti. Část zdánlivých skoků závisí na tom, jak se měří (Are Emergent Abilities… a Mirage?). Přínos většího měřítka je skutečný — že by pokračoval až k ASI, prokázané není.
A ještě k „uvažování“. Novější modely umějí před odpovědí rozepsat postup a řešit úlohy o více krocích. Je to skutečný pokrok ve výkonu, ale sám o sobě neprokazuje lidské myšlení — a dlouhé, sebejisté vysvětlení může být chybné stejně jako krátká odpověď. Jak to funguje a kde to má hranice: Vrstvy AI a reasoning.