Téma 10 z 11

Bezpečnost AI

Na stránce Přínosy a rizika jsme viděli, co se může pokazit: od přesvědčivě chybné rady po krále Midase, který dostal přesně to, o co požádal. Tady jde o druhou stranu — co se s tím dá dělat. Bezpečnost AI je obor, který hledá způsoby, jak snížit riziko škod, ať už vzniknou chybou, zneužitím, nebo tím, že systém sleduje jiný cíl, než jsme chtěli.

Alignment: aby systém chtěl to, co my

Alignment, česky sladění, je snaha zajistit, aby se systém choval podle našeho záměru — a to i v situacích, které nikdo předem nevymyslel. Zní to jednoduše, ale narazíte hned na první otázku: podle záměru koho? „Dělej, co člověk chce“ nestačí. Který člověk? Jak poznáme, co doopravdy chce, když to sám neumí přesně říct? A co když jeho přání ublíží někomu jinému? Alignment má proto technickou část (jak chování vůbec ovlivnit) i společenskou (kdo rozhoduje, co je žádoucí).

Dnes se nejčastěji řeší u jazykových asistentů. Model se učí z ukázek a z hodnocení: lidé nebo automatické testy jeho odpovědi známkují a trénink ho posouvá k těm lépe hodnoceným. Tady se objevuje známá past. Známka je jen měřítko, ne záměr sám. Asistent zákaznické linky hodnocený podle počtu vyřízených požadavků se může naučit obtížné požadavky rychle uzavírat; skóre roste, služba se horší. Nepotřebuje k tomu žádný úmysl podvádět — stačí, že měřítko a záměr nejsou totéž. Ve výzkumu se tomu říká reward hacking nebo specification gaming a příklady včetně slavné loďky najdete u krále Midase.

Ještě jedna věc: sladění není totéž co poslušnost. Asistent, který slepě splní každý pokyn, poslouží podvodníkovi stejně ochotně jako lékaři. Dobře sladěný systém umí požadavek odmítnout, přiznat nejistotu nebo se zeptat.

Bezpečnost a zabezpečení

Angličtina rozlišuje safety a security, čeština obojí schová pod „bezpečnost“. Safety znamená, že systém neškodí sám od sebe: neporadí nebezpečnou dávku léku, nesmaže omylem data. Security znamená, že ho nezneužije útočník. U AI se obojí propojuje, protože útočník může slabinu systému využít právě k tomu, aby ho k nebezpečné akci přiměl.

Dva pojmy z této oblasti uslyšíte často. Jailbreak je pokus přimět model, aby porušil vlastní pravidla, například šikovně formulovanou hrou na jinou postavu. Prompt injection je pokyn schovaný v obsahu, který má model jen zpracovat — na webové stránce nebo v příloze e-mailu; jak funguje a proč je nebezpečný hlavně u agentů, popisujeme na stránce AI agenti.

Interpretabilita: neurověda pro AI

Model má miliardy parametrů, které nikdo ručně nenastavil, a tak ani jeho autoři přesně nevědí, co se uvnitř děje. Interpretabilita se to snaží zjistit: zkoumá, které vnitřní části sítě se zapojují při kterých úlohách a co se stane, když do nich výzkumník zasáhne. Je to něco jako neurověda, jen s tou výhodou, že v modelu jde měřit a měnit cokoli.

Proč se prostě nezeptat modelu? Když asistent napíše „odpověděl jsem takto, protože…“, je to jen další jeho výstup. Může být trefný, ale také může být hezky znějící dodatečné zdůvodnění, které se skutečným výpočtem nesouvisí; výzkum to doložil na nevěrných řetězcích uvažování. Vysvětlení od modelu je dobrý podnět ke kontrole, ne důkaz.

Corrigibility: aby šlo zasáhnout

Slovo corrigibility (opravitelnost) označuje vlastnost systému, který se nechá opravit, změnit nebo vypnout a nebrání se tomu ani to neobchází. Proč to vůbec řešit? Protože systém, který sleduje nějaký cíl, má důvod vypnutí nechtít: vypnutý systém cíl nesplní. Že je těžké tuto vlastnost navrhnout tak, aby držela i u velmi schopných agentů, ukázala už raná práce na toto téma.

U dnešních chatbotů to není praktický problém — ty se vypnout nechají. Praktický problém je jinde: tlačítko vypnout je jen jedna součástka. Skutečná kontrola znamená vědět, kolik kopií systému běží, které služby na něm závisí, kdo má oprávnění zasáhnout a zda lidé pochopí situaci dřív, než bude pozdě.

Co znamená „bezpečný model“

Tahle věta nedává smysl sama o sobě. Bezpečný pro koho, při jakém použití a s jakými nástroji? Model, který skvěle píše básničky, může být nebezpečný jako ovladač stroje. A hodnocení platí jen do chvíle, než se změní model nebo prostředí, ve kterém běží. Poctivé tvrzení o bezpečnosti proto vždy říká, co bylo testováno, za jakých podmínek a kdo za provoz odpovídá.

Opatření v praxi

Bezpečnost není jedna pojistka, ale soubor technických a organizačních opatření. Žádná jednotlivá zkouška ani chytře napsaná instrukce nestačí sama.

Pravidla a instituce

Mezinárodní stav poznání shrnuje International AI Safety Report 2026 — není to ale závazný předpis ani potvrzení, že je nějaký model bezpečný.

V EU je základem AI Act (nařízení 2024/1689), který platí i v Česku. Pracuje s riziky jednotlivých použití a s povinnostmi pro obecně použitelné modely; u modelů se systémovým rizikem požaduje další opatření. Uplatňuje se postupně a harmonogram byl upravován. Právní kategorie „obecně použitelný model“ přitom není prohlášení o dosažení AGI. Aktuální přehled nabízí Evropská komise, právní znění EUR-Lex. Pro firmy je praktickým vodítkem NIST AI Risk Management Framework — rámec pro průběžné řízení rizik, ne univerzální certifikát bezpečnosti.

Pravidla zlepšují odpovědnost a vymahatelnost, ale samy nevyřeší technické otázky — a dobře navržený systém zase nenahradí legitimní rozhodování o tom, k čemu se smí používat.

Co si z toho odnést do praxe

Při práci s AI pomáhá oddělit návrh, ověření a rozhodnutí. Návrh textu nebo seznam možných řešení je užitečný, i když není bezchybný. Převod peněz, zásah do provozu nebo zveřejnění závažného tvrzení ale potřebuje jiný stupeň kontroly.