Téma 1 z 11

Jak funguje AI

Abychom mohli rozumně mluvit o superinteligenci, pomůže vědět, jak fungují dnešní systémy jako ChatGPT, Claude nebo Gemini. Základní myšlenka je překvapivě jednoduchá — složité je teprve to, co se z ní naučí.

1. Hádání dalšího kousku textu

Doplňte větu: „Pes štěká, kočka…“ Nejspíš vás napadlo mňouká. Přesně tohle je základ jazykových modelů: podle dosavadního textu předpovídají, co bude následovat.

Nepracují přitom s celými slovy, ale s tokeny. Token může být slovo, jeho část, interpunkce nebo mezera; dlouhé české slovo se rozpadne třeba na tři tokeny a různé modely dělí text různě. Model pro každý možný další token spočítá pravděpodobnost a program pak jeden vybere. Někdy ten nejpravděpodobnější, jindy trochu náhodně z několika dobrých možností — míru náhody řídí nastavení zvané teplota. Proto na stejnou otázku nemusíte dostat pokaždé stejnou odpověď.

„Pes štěká, kočka …“mňouká: 72 %mňouká72 %spí: 9 %spí9 %se protahuje: 6 %se protahuje6 %vrní: 5 %vrní5 %utíká: 4 %utíká4 %
Co model „vidí“, když odhaduje pokračování: pravděpodobnost pro každou možnost. Ilustrační čísla — skutečný model zvažuje desítky tisíc tokenů a program z nich jeden vybere.

Dvě upozornění. Za prvé, pravděpodobnost není pravdivost: model hodnotí, jak dobře pokračování zapadá do textu, ne zda popisuje skutečnost. Rozšířený omyl je v textech tak běžný, že ho model klidně zopakuje, a snížení teploty to nespraví. Za druhé, příklad s kočkou vysvětluje princip, ne jednoduchost. Aby model dobře doplnil „Tento program padá, protože…“ nebo „Pacient má horečku a vyrážku, takže…“, musí si během učení vytvořit užitečné představy o tom, jak svět funguje. „Předpovídač tokenů“ neříká nic o tom, jak složitý výpočet za tím stojí.

2. Miliardy knoflíků

Uvnitř modelu je neuronová síť — matematický model s miliardami nastavitelných hodnot, parametrů. Představte si obrovský mixážní pult s miliardami knoflíků. Na rozdíl od pultu ale jednotlivý knoflík obvykle nejde popsat jako „čeština“ nebo „počítání“; znalosti jsou rozprostřené napříč mnoha z nich.

3. Trénink: zkus, porovnej, dolaď

Model dostane kus skutečného textu, zkusí odhadnout pokračování a výsledek se porovná se skutečností. Optimalizační algoritmus pak všechny knoflíky nepatrně pootočí směrem, který by chybu zmenšil. A znovu. A znovu — na obrovském množství knih, webu, článků a kódu. Nikdo do modelu ručně nezapisuje fakta; usadí se v nastavení knoflíků sama.

Pro představu

Podobně se dítě učí mateřštinu: nikdo mu nevysvětlí pravidla skloňování, jen slyší tisíce vět a opravuje se. Rozdíl je v měřítku — model během tréninku „přečte“ víc textu, než by člověk zvládl za mnoho životů.

Velkou roli hraje transformer, architektura z roku 2017 (Attention Is All You Need). Jejím jádrem je pozornost: při zpracování každého kousku textu model zvažuje, které jiné části vstupu jsou pro něj důležité. Transformer je dnes nejrozšířenější, ale ne jediný — odlišný přístup zkouší například Mamba.

Tři slova, která uslyšíte často: trénink mění parametry, dolaďování je další trénink zaměřený na konkrétní úlohy nebo chování a inference je použití hotového modelu k výpočtu odpovědi. Trochu jako studium a zkouška: při studiu se mění, co umíte, u zkoušky to používáte.

4. Z modelu se stává asistent

Model po prvním tréninku umí pokračovat v textu, ale užitečný asistent to ještě není. Následuje dolaďování: ukázky dobrých odpovědí, hodnocení od lidí („tahle pomohla, tahle ne, tahle je nebezpečná“) i automatické ověřování — u programu se dá spustit test a zkontrolovat, zda opravdu funguje. Příklad vícefázového vývoje popisuje technická zpráva The Llama 3 Herd of Models.

Důležité: při běžném rozhovoru se model nepřeučuje. Vaše zadání a předchozí zprávy mu slouží jako pracovní kontext, ne jako nové nastavení knoflíků. Když modelu v zadání ukážete tři příklady, jak má odpověď vypadat, přizpůsobí se jim — ale jen pro tento rozhovor, parametry zůstávají stejné. Tuto schopnost učit se z příkladů v kontextu bez přetrénování popsala už studie o GPT-3.

5. Tři různé významy paměti

Když se řekne, že si AI něco „pamatuje“, může to znamenat tři různé věci:

Na třetí možnosti stojí metoda RAG (retrieval-augmented generation): aplikace nejdřív vyhledá podklady, třeba ve firemních dokumentech, a přidá je modelu do kontextu. Model se tím nepřetrénuje, jen má z čeho čerpat. Odpovědi bývají podloženější, ale jen tak dobré, jako jsou nalezené podklady — špatný nebo neúplný dokument dá špatnou odpověď. Původní práce o RAG.

6. Model, aplikace a agent

Když používáte AI asistenta, pracujete s celým systémem. Jazykový model může mít připojené vyhledávání, kalkulačku, firemní dokumenty nebo prostředí pro spouštění kódu — a výsledná schopnost závisí i na těchto nástrojích. Dva produkty se stejným modelem se proto mohou chovat dost odlišně.

AI agent navíc provádí více kroků směrem k cíli. Zadání „připrav podklady na poradu“ rozdělí na hledání dokumentů, jejich porovnání a sepsání přehledu. S příslušnými oprávněními může i měnit soubory nebo psát e-maily. Stejný model s různými oprávněními může mít velmi rozdílné dopady — kdo agentovi dá přístup k účtu, mění jeho možnosti zasáhnout do světa. Více: AI agenti.

7. Proč se modely mýlí

Halucinace je výstup, který zní věrohodně, ale je chybný nebo nepodložený: neexistující citace, zaměněné datum, vymyšlené vysvětlení. Model se naučil, jak má dobrá odpověď znít — a plynulost řeči není ukazatel pravdivosti. Přístup k vyhledávání pomáhá, ale nevylučuje špatný zdroj ani chybný výklad.

Halucinace má i jemnější podobu. Když model shrne dokument a přidá tvrzení, které v něm není, selhal v práci se zdrojem, i kdyby bylo přidané tvrzení náhodou pravdivé. Proto je při každém použití dobré vědět, co přesně má výstup splňovat: držet se dokumentu, nebo odpovídat podle světa?

Pozor i na populární tvrzení, že s každým zvětšením modelu „samy od sebe“ naskakují nové schopnosti. Část zdánlivých skoků závisí na tom, jak se měří (Are Emergent Abilities… a Mirage?). Přínos většího měřítka je skutečný — že by pokračoval až k ASI, prokázané není.

A ještě k „uvažování“. Novější modely umějí před odpovědí rozepsat postup a řešit úlohy o více krocích. Je to skutečný pokrok ve výkonu, ale sám o sobě neprokazuje lidské myšlení — a dlouhé, sebejisté vysvětlení může být chybné stejně jako krátká odpověď. Jak to funguje a kde to má hranice: Vrstvy AI a reasoning.