Цього тижня Anthropic оголосила, що майбутні моделі Claude будуть непомітно додавати до генерованих текстів спеціальні «водяні знаки». Вони зберігатимуться під час копіювання та вставлення тексту, а в деяких випадках можуть залишитися навіть після його редагування. Тепер розробники детальніше розповіли, як працює ця технологія та чи вплине вона на відповіді ШІ-помічника.
У Anthropic пояснили, що «водяні знаки» дозволять визначити ймовірність того, що Claude брав участь у написанні тексту. Компанія також зазначила, що разом з іншими великими розробниками ШІ впроваджує цю технологію для дотримання вимог Закону про штучний інтелект Європейського Союзу.
За словами Anthropic, ця технологія не матиме помітного впливу на якість та зміст відповідей Claude. Текст із «водяним знаком» візуально не відрізнятиметься від звичайного, при цьому до нього не додаватимуться приховані символи чи інші додаткові дані. Водяні знаки також не потребуватимуть додаткових токенів, тому їхнє використання не призведе до зростання вартості запитів.
Anthropic описує технологію як зміну малозначущих рішень під час вибору слів. Мовна модель і без того обирає між кількома близькими за змістом варіантами, а система водяних знаків змінює джерело випадковості таким чином, щоб у тексті формувався статистично перевірений патерн. Його неможливо виявити візуально, але спеціальний інструмент із відповідним ключем зможе оцінити ймовірність того, що текст був згенерований Claude.
Ефективність технології залежить від обсягу тексту. У довгих фрагментах «водяний знак» виявити простіше, тоді як у коротких текстах і фактичних уривках можливостей для статистичного аналізу менше. Якщо Claude лише редагує текст, написаний людиною, мітка може практично зникнути. У програмному коді вона також працює гірше, оскільки там вибір формулювань сильніше обмежений вимогами до синтаксису та результату.

При цьому «водяні знаки» не містять ідентифікуючої інформації та не дозволяють встановити, хто саме користувався Claude, яка організація це робила або в якому чаті був створений текст. Вони будуть характерні для моделей Claude і призначені насамперед для того, щоб сторонні інструменти могли оцінювати ймовірність участі ШІ у створенні тексту. Для звичайного користувача практично нічого не зміниться: Claude продовжуватиме генерувати та редагувати текст так само, як і раніше. Відрізнити текст із водяним знаком від звичайного на око буде неможливо, а для його виявлення знадобиться спеціальний інструмент.