Клод становится амбициозным с водяными знаками, и я чувствую проблемы за милю.
Anthropic хочет сделать текст, сгенерированный ИИ, легче для идентификации, и на бумаге у меня очень мало причин жаловаться. Компания экспериментирует с невидимым водяным знаком, который можно встроить непосредственно в текст, сгенерированный Claude.
Это звучит как разумная идея. Текст, сгенерированный ИИ, повсюду, и знание о том, откуда что-то произошло, определенно может помочь. Более того, Anthropic не просто прячет маркер где-то внутри документа. Их подход меняет то, как Claude выбирает слова, чтобы создать статистический шаблон, который можно будет позже обнаружить.
Но есть одна деталь, которая меня беспокоит. Anthropic тестирует, насколько стойким может быть этот водяной знак, даже после того, как текст был изменен.
Вот где я уже чувствую проблемы.
Nadeem Sarwar / Digital Trends
Claude коснулся моего письма. Он действительно его написал?
Подумайте о переводе на мгновение. Допустим, кто-то сам пишет целое эссе на испанском и просит Claude перевести его на английский. Идеи принадлежат им. Исследования принадлежат им. Аргументы принадлежат им. Единственная задача Claude — перевод.
Тем не менее, получившийся текст все равно может нести водяной знак Claude.
Тот же вопрос касается корректуры. Что, если кто-то сам пишет что-то и просит Claude исправить грамматику? Что насчет сокращения абзаца, изменения его тона, очистки диктованного текста или просто упрощения трудного для чтения предложения?
Это уже не крайние случаи использования ИИ. Люди все чаще обращаются к помощникам, таким как ChatGPT, Gemini и Claude, для повседневных задач, которые имеют мало общего с созданием оригинальной работы. Водяной знак может сказать вам, что Claude был вовлечен в создание текста. Он не может сказать вам, действительно ли Claude его написал. Anthropic подчеркивает ту же мысль, утверждая, что водяной знак показывает участие Claude, а не то, кто создал оригинальную работу.
Теперь представьте, как вы объясняете это различие профессору после того, как его программное обеспечение для обнаружения только что отметило ваше эссе.
Unsplash
Мы уже знаем, насколько запутанным может быть обнаружение ИИ
Я бы не волновался так сильно, если бы наш опыт с обнаружением ИИ был особенно хорошим. Это не так.
Рекомендации MIT Sloan довольно ясны относительно существующих детекторов ИИ. Они говорят, что у них высокая ошибка и они могут привести к ложным обвинениям студентов в неправомерных действиях.
Мы уже видели, как это выглядит на практике. Студенты оказались в ситуации, когда им пришлось защищать работу, которую они утверждали, что написали сами, после того как автоматизированные системы определили ее как сгенерированную ИИ. В одном случае, задокументированном The Guardian, эссе студента было отмечено как полностью сгенерированное ИИ, несмотря на то, что студент утверждал, что использовал только одобренные помощь в правописании и грамматике. Апелляция в конечном итоге была принята.
Чтобы прояснить, водяной знак Claude принципиально отличается. Обычные детекторы ИИ смотрят на текст и, по сути, оценивают, мог ли его создать ИИ. Anthropic намеренно внедряет обнаружимый сигнал в вывод Claude. В теории это должно сделать их систему значительно более надежной. Но надежность — это не единственная проблема здесь. Интерпретация — вот что важно.
Nadeem Sarwar / Digital Trends
Мы используем ИИ, чтобы доказать, что не использовали ИИ
Ситуация уже достигла слегка абсурдной точки.
Студенты, обеспокоенные обнаружением ИИ, обращаются к так называемым "очеловечивателям ИИ", которые переписывают текст специально для того, чтобы сделать его менее вероятным для активации детекторов. Некоторые студенты даже используют эти инструменты на работах, которые они написали сами, потому что боятся ложных срабатываний. Компании-детекторы, естественно, разрабатывают способы идентификации "очеловечивателей".
Прочитайте это еще раз.
Человек может написать что-то, беспокоиться, что ИИ подумает, что это написал ИИ, пропустить это через другой ИИ, чтобы сделать его более человечным, а затем еще одна система определяет, сделал ли ИИ его более человечным.
Это технологический уроборос.
Сделать водяной знак Claude достаточно стойким, чтобы пережить редактирование и перевод, технически впечатляет. Предыдущие исследования показали, что перевод может преодолеть некоторые техники водяного знака текста, поэтому решение этой проблемы будет представлять собой значительный прогресс.
Я просто не думаю, что сделать сигнал труднее удаляемым решает более важную проблему.
Rachit Agarwal / Digital Trends
Водяной знак нуждается в контексте
Существуют веские причины для водяного знака на контенте, сгенерированном ИИ. Это может помочь идентифицировать массово производимую дезинформацию, нераскрытый синтетический текст или материалы, написанные ИИ, которые позже оказываются в обучающих наборах данных.
Проблема в том, что ИИ-помощники теперь делают гораздо больше, чем просто генерируют контент с нуля. Люди используют их для перевода текста, корректуры документов, обобщения исследований, помощи с кодом, улучшения доступности или просто очистки электронного письма перед отправкой. В этом контексте обнаружение участия ИИ не автоматически говорит вам, кто на самом деле создал работу.
Все эти взаимодействия включают ИИ в совершенно разных масштабах. Если Claude пишет эссе с нуля, знание этого полезно. Если Claude переводит эссе, над которым кто-то потратил три недели на исследование и написание, знание о том, что Claude был вовлечен, говорит вам значительно меньше.
Водяной знак может быть вполне способен ответить на вопрос "Коснулся ли Claude этого?" Моя озабоченность заключается в том, что произойдет, когда люди начнут воспринимать ответ как доказательство "Написал ли Claude это?"
Anthropic может создать самый умный водяной знак в мире. Если только люди, использующие его, не поймут это различие, я подозреваю, что у нас возникнут некоторые проблемы.
Другие статьи
Клод становится амбициозным с водяными знаками, и я чувствую проблемы за милю.
Anthropic пытается решить проблему идентификации текста, сгенерированного ИИ, но постоянный водяной знак может создать другую проблему, если помощь ИИ будет ошибочно воспринята как авторство ИИ.
