ChatGPT začne do textů ukrývat neviditelný vodoznak. Má to ale jeden zásadní háček

ChatGPT

ChatGPT • Zdroj: Profimedia.cz

Marek Lutonský - Živě.cz
Diskuze (0)
  • OpenAI kvůli evropskému AI Actu zavádí vodoznaky v generovaném textu.
  • Technologie textGrain skrývá statistický signál ve výběru slov, píše web Živě.cz.
  • Záměna čtvrtiny slov sníží úspěšnost detekce na 17 %.

Evropský akt o umělé inteligenci (AI Act) ukládá provozovatelům AI novou povinnost. Text vytvořený jejich modely musí být možné strojově rozpoznat. OpenAI teď popsalo, jak chce tento požadavek splnit. Podobné řešení už v srpnu zveřejnil také Anthropic.

OpenAI přiznává, že vodoznaky v textu jsou zatím mladá technologie s výraznými limity. Proto je bude zavádět postupně. Zákazníci využívající API, tedy programové rozhraní, přes které vývojáři napojují modely do svých aplikací, si už teď mohou vodoznak u vybraných modelů zapnout. Ve výchozím nastavení ale zůstane vypnutý.

V příštích týdnech pak OpenAI přidá neviditelný vodoznak do textů z ChatGPT a Codexu. Bude se to týkat všech tarifů, ale pouze v Evropské unii. Ve zbytku světa budou modely zatím generovat texty bez označení.

Kdo chce, vodoznak snadno obejde

Technologie OpenAI se jmenuje textGrain (PDF). Do výběru slov modelu přidává neviditelný statistický signál. Je to podobné jako u Anthropicu: když má model na výběr z několika podobně vhodných slov, zvolí je podle skrytého vzorce. Detektor pak v textu hledá právě tenhle vzorec.

Podle OpenAI dosáhl textGrain v testech stejných nebo lepších výsledků než jiné přístupy, včetně SynthID od Googlu. Firma ale upozorňuje, že dobré výsledky v ideálních podmínkách nezaručují spolehlivost v běžném provozu.

Detektor může udělat dvě chyby. Buď najde vodoznak tam, kde žádný není. Tomu se říká falešně pozitivní výsledek. Nebo vodoznak přehlédne, a to je falešně negativní výsledek.

OpenAI nastavilo detektor tak, aby chybně označil nanejvýš 1 % textů. Pak zachytil vodoznak asi v 80 % pasáží o délce 200 tokenů. U textu s rozsahem 400 tokenů to bylo kolem 95 %. Tato čísla ale platila pro texty z psychologie, u matematiky vycházely výsledky výrazně hůř. Model tam má méně volnosti ve výběru slov, tedy i méně prostoru pro skrytý signál.


U textů povídavé psychologie je detekce spolehlivá. U matematiky ale i při délce textů 400 tokenů dosáhne jen k 60 %

Vodoznak navíc s každou úpravou slábne. Když OpenAI v pasážích o 400 tokenech nahradilo 10 % slov synonymy, úspěšnost detekce klesla z 92 na 66 %. Při záměně čtvrtiny slov spadla na 17 %. Kdo chce tedy vodoznak obejít, nepotřebuje k tomu žádné zvláštní nástroje.


Snížení kvality detekce po úpravě textů

Značkování podle firmy nezhoršuje kvalitu výstupů. V benchmarcích pro nejnovější model Astra vyšly rozdíly zanedbatelné. V testu GPQA Diamond dosáhl model s vodoznakem výsledku 93,94 %, bez něj 94,44 %. JInde dopadla verze s vodoznakem dokonce o něco lépe:

Tento text zřejmě prošel přes AI… nic víc

Kvůli chybovosti ale OpenAI detektor zatím veřejně nezpřístupní. Přístup chce rozšířit, až si bude jisté, že lidé umí výsledky detekce správně číst. Nyní mohou žádat o přístup jen výzkumníci a odborné organizace.

Detektor jim prozradí, jestli text nese vodoznak OpenAI. Nespojí ho ale s konkrétním uživatelem, účtem nebo konverzací. Vodoznak také neměří, kolik lidské práce, úsudku nebo kreativity text obsahuje. Neurčuje, komu text patří, kdo za něj odpovídá ani jestli ho někdo použil legálně. A neříká nic o tom, jestli je text pravdivý.

Platí i opačný pohled: chybějící vodoznak neprokazuje, že text napsal člověk. Text může být příliš krátký, upravený nebo přeložený. Může pocházet z doby před zavedením vodoznaků, z nepodporovaného modelu nebo od konkurence.

Pro generované obrázky a zvuk má OpenAI už veřejné ověřovací nástroje, například web openai.com/verify. Používá standard C2PA, který do souborů zapisuje jejich původ a historii úprav. K tomu přidává neviditelné vodoznaky SynthID, které vydrží i odstranění metadat. U textu je ale situace složitější, protože jde snadno upravit.

Začít diskuzi

Články z jiných titulů