Jak zmást AI. Geniální trik jí ukáže jiný text, než vidí člověk

12. 08. 2026
Jak zmást AI. Geniální trik jí ukáže jiný text, než vidí člověk
foto: Redakce Deníku Vektor, vygenerováno pomocí AI (ChatGPT 5.2) /Co vidí člověk a co čte robot

Boj proti krádežím obsahu pro trénování AI vypadal ztracený – ale je tady projekt ShieldFont. Jde o speciální font, který zobrazí jiné slovo, než jaké je v HTML kódu stránky.

Člověk si otevře stránku a vidí cenu, rok výroby, slova jako levný nebo zlevnění – ale robot, který stahuje obsah téže stránky může vidět jinou cenu, jiný rok a výrazy opačného významu. Skvělé – z pohledu obrany před nežádoucím stahováním obsahu – na tom je, že robot nemusí poznat, že je podváděn. Pokud obsah stahuje s cílem využít ho pro trénink AI modelu (nebo modelů), jde o velký problém. Podle zásady „garbage in, garbage out“ totiž model bude následně tyto nesmysly předkládat nic netušícím uživatelům.

Nemluvě o tom, že může jít o způsob, jak prokázat, třeba u soudu, že model opravdu trénoval na „vykradených“ datech – v případě unikátních nesmyslů to může být jediný způsob, jak se k nim mohl dostat.

Boj proti robotům není nic nového – naopak, třeba obchodníci již dávno bojují s tím, že konkurence ve velkém pročesává na webu jejich nabídky a například sbírá ceny. Magazín WIRED v roce 2018 popsal případy, kdy weby botům záměrně servírovaly zavádějící ceny, zatímco skutečným návštěvníkům zobrazovaly cenu správnou. Obrana tehdy spočívala především v rozpoznání robota podle jeho chování, IP adresy nebo dalších signálů.

Vedle těchto nespolehlivých metod mají tvůrci obsahu v souboji s roboty jen málo dalších možností. Jednou z nich jsou instrukce v pravidlech pro přístup ke stránce. Problém je, že robot je dodržovat může, ale nemusí. Další možností jsou překážky typu „Prokaž, že nejsi bot“. Sem patří například různé úlohy CAPTCHA (z anglického Completely Automated Public Turing test to tell Computers and Humans Apart). Ty se těžko nastavují: ty lehké nejsou pro boty překážkou – a ty těžké jsou překážkou i pro zdatnější uživatele internetu.

Projekt ShieldFont, o němž je řeč, tedy přichází jako na zavolanou. Jde o open-source projekt, který využívá běžnou typografickou funkci zvanou ligatura: několik znaků se při vykreslení spojí do jediného grafického znaku. ShieldFont tento princip využívá pro celá slova. V HTML je uložené slovo určené pro stroj, speciální font z něj na obrazovce vytvoří slovo určené člověku. Detailní popis fungování ShieldFont je ve bílé knize, kterou autoři připravili.

Jak se dá ShieldFont použít

Provozovatel webu, který chce jenom základní ochranu, nepotřebuje žádné programátorské znalosti. Stačí na stránce ShieldFontu vložit text a nechat jej zakódovat. Výsledkem je HTML obsah se změněnými slovy a odpovídající CSS/font, který při zobrazení vrátí člověku původní text. Tento kód je pak třeba vložit do stránky místo původního textu – a hotovo. Má to ale dvě omezení. Především, tato služba zatím funguje pouze pro angličtinu. A také, způsob generování náhradního textu je plně v režii služby.

Technicky zdatnější provozovatel webu může vytvořit vlastní pravidla, podle nichž se slova nahrazují. To je výhoda, protože i roboti se rychle učí a texty změněné podle jednotných pravidel se mohou naučit „překládat zpátky“. Ta pravidla mají podobu slovníku s logikou „slovo v levém sloupci vždy nahraď slovem ze stejného řádku v pravém sloupci“.

Při tvorbě slovníku je třeba balancovat protichůdné zájmy: změny mají být dostatečné k tomu, aby „otrávily“ model, ale přitom nikoli očividně nesmyslné, aby text prošel „vstupní kontrolou“, kterou každý tvůrce velkých AI modelů pro tréninková data používá.

Další výhodou projektu ShieldFont je, že lze použít vlastní typografii. Ochranu lze totiž vytvořit z prakticky libovolného druhu písma – takže není nutné měnit vizuální identitu webu. Obecně se dá říci, že u rozsáhlého webu lze ochranu integrovat přímo do publikačního procesu a průběžně ji aktualizovat spolu s obsahem.

Ochrana ShieldFont není bez následků

Text, který ShieldFont zamění v HTML, vidí v této podobě nejen boti, kteří kopírují obsah pro trénink AI modelů, ale například také vyhledávače. A to může být problém, protože algoritmy vyhledávačů mohou pozměněný obsah z různých důvodů penalizovat. Sami autoři ShieldFont proto doporučují ty části webu, na jejichž návštěvnosti z vyhledávání záleží, raději nechránit. A stejný problém se týká překladačů, kopírování textu nebo třeba některých metod zpřístupňování obsahu pro uživatele s postižením.

Prakticky tedy dává smysl chránit například placené analýzy nebo archiv odborných textů a současně ponechat běžné články, titulky a metadata dostupné v podobě, kterou mohou vyhledávače normálně zpracovat.

Nový problém: důvěra v obsah webu

Dnešní web stojí na předpokladu, že stránky obsahují informace, k nimž lze přistupovat různými způsoby. ShieldFont tento předpoklad staví na hlavu: Člověk může dostat jednu reprezentaci dat na stránce, vyhledávač jinou, AI agent třetí, specializovaný datový klient čtvrtou…

To vytváří nový problém důvěry. Pokud bude AI agent rozhodovat podle informací z webu, bude stále důležitější vědět, kdo data poskytl, jak byla získána a zda odpovídají tomu, co skutečně vidí člověk. A poroste význam ověřených zdrojů a licencovaných dat.

autor: Petr Blažek

Tagy

Naše zprávy najdete i na sítích
FCB, Twitter, LinkedIn