У своєму блозі компанія Anthropic спробувала дати відповіді на найважливіші запитання стосовно того, як вона буде позначати текстовий контент, створений її чат-ботом Claude, за допомогою водяних знаків. Зокрема: яким чином функціонуватимуть ці знаки, чи можливо їх приховати шляхом редагування, та як це позначиться на програмному коді.
Залишити коментар
У своєму блозі компанія Anthropic спробувала дати відповіді на найважливіші запитання стосовно того, як вона буде позначати текстовий контент, створений її чат-ботом Claude, за допомогою водяних знаків. Зокрема: яким чином функціонуватимуть ці знаки, чи можливо їх приховати шляхом редагування, та як це позначиться на програмному коді.
Користувачі Claude активно обговорюють це нововведення відтоді, як минулого тижня компанія анонсувала впровадження водяних знаків, що є відповіддю на вимоги Кодексу прозорості EU AI Act. Цей законодавчий акт зобов’язує компанії, що займаються розробкою штучного інтелекту, використовувати системи, які дозволяють ідентифікувати контент, згенерований ШІ.
Нова публікація Anthropic починається з загального ознайомлення з концепцією водяних знаків. У ній пояснюється, що під час виконання «некритичних завдань» — приміром, вибору між словами «сонячно» та «ясно» для опису погоди — Claude може вбудовувати у свої відповіді певний шаблон. Цей шаблон «непомітний для сприйняття читачем, але може бути виявлений за допомогою ключа, в якому він закодований».
«Водяні знаки жодним чином не впливають на якість відповідей Claude, — наголошують у компанії. — Для читача відповідь із водяним знаком виглядає ідентично відповіді без нього».
Зокрема, Anthropic повідомила, що застосовуватиме підхід SynthID-Text, розроблений фахівцями Google DeepMind у 2024 році, а також планує надати доступ до API для виявлення водяних знаків, як повідомляє TechCrunch. Компанія також підкреслила, що маркування водяними знаками суттєво відрізняється від методів детекції ШІ, які пропонують такі компанії, як Pangram. Останні шукають у тексті стилістичні «індикатори» (наприклад, структуру «це не [X], це [Y]»), щоб розпізнати використання ШІ: «Виявлення таких закономірностей докорінно відрізняється від перевірки наявності водяного знака».
«Чи можливо просто переписати текст, щоб усунути водяний знак? В Anthropic зазначили, що це реально, проте «незначне редагування, найімовірніше, не прибере водяний знак повністю», тоді як «повне переписування, де було замінено кожне слово, дійсно зможе це зробити».
«У останньому випадку, звичайно, виникає питання, чи можна взагалі вважати такий текст згенерованим ШІ», — додали у компанії.
Щодо того, чи буде розпізнаватися водяний знак у тексті, який Claude лише вичитував або редагував, в Anthropic пояснили, що це залежатиме від «обсягу тексту та глибини внесених ШІ правок». Якщо редагування було мінімальним, «майже всі слова» залишаться оригінальними, тому «водяному знаку просто не буде до чого прив’язатися (або майже не буде)».
Програмний код, своєю чергою, матиме менш виражене маркування порівняно зі звичайним текстом. Причина полягає в тому, що модель повинна генерувати функціональний код і не має такого широкого вибору між численними еквівалентними варіантами синонімів.
«Водночас програмний код матиме менш виразний водяний знак, ніж звичайний текст, оскільки модель зобов’язана генерувати працюючий код і не володіє такою свободою вибору серед множини однаково правильних варіантів.
«З огляду на це, у фрагментах, де можливий довільний вибір між конкретними словами чи термінами в межах коду — наприклад, у коментарях — водяний знак може бути застосований, — повідомили в Anthropic. — Але за своєю суттю він матиме незначний вплив на сам згенерований код».
В Anthropic також додали, що Claude не буде єдиним чат-ботом, який застосовуватиме маркування тексту, оскільки «інші провідні розробники моделей приєдналися до того ж Кодексу практики та також запровадять власні механізми водяних знаків».
Розробники вже займаються пошуком способів обходу таких водяних знаків. Наприклад, у відкритому доступі з’явився інструмент Watermarks Remover. Цей додаток допомагає перефразувати текст за допомогою локальної LLM. Отже, якщо маркування полягає у виборі слів, що використовує Claude, достатньо радикальне перефразування може його усунути. Проте розробник не гарантує повного обходу детектора.
Source: dev.ua
