В этом году роботы научились делать фейковые новости, которые человек уже не сразу способен отличить от настоящих, пишет The Wall Street Journal. Сами по себе тексты еще недостаточно хороши, зато они «пишутся» очень быстро и уже могут быть использованы людьми в качестве сырья в кампаниях дезинформации. Самым эффективным оружием человека в борьбе с текстовыми «дипфейками» остаются опыт и здравый смысл, а распознавать их еще лучше помогут другие роботы.
Читайте также «Я не даю Facebook разрешение»: история фейка об авторских правах и реальность
Читайте также Илон Маск выйдет из компании OpenAI. Она создала алгоритм для генерации фейковых новостей
Проект GPT-2 приводит пример новости, сгенерированной только из затравки следующего содержания: «Ученые сделали шокирующее открытие: в доселе недоступной горной долине Анд обнаружено стадо единорогов. Еще большим сюрпризом для исследователей стало то, что единороги прекрасно говорят по-английски».
За 10 итераций система создала грамматически правильную и на первый взгляд убедительную новость, причем даже с фейковым исследователем и его фейковыми цитатами. Вывод статьи — единороги происходят от предшествующей человеку расы, жившей в Аргентине, а английскому они научились путем социальной эволюции. Авторы проекта подчеркивают, что робот не знает ничего ни об эволюции, ни о единорогах, однако качество его текста приближается к человеческому.
Журналисты WSJ с помощью проекта Grover создали статью в стиле своего издания, озаглавленную «Горнодобывающая компания ведет переговоры о добыче ресурсов на Луне». Фейк, утверждающий, что проект уже рассматривает SEC, оказался менее совершенным, чем продукт GPT-2, но в отдельных его абзацах совершенно отчетливо слышится тон настоящей газеты. К тому же генерация заняла меньше 30 секунд.
Послать робота искать робота. Как ни парадоксально, сгенерированный машиной фейк лучше всего видит обученная на похожей базе система генерации текстов. Достоверность распознавания фейков «обратным» алгоритмом Grover, к примеру, превышает 90%, уверяют исследователи. Дополнительный бонус — самообучение такого алгоритма: чем больше сгенерированных фейковых новостей вбрасывает проблемный источник, тем легче их распознать.
Применить здравый смысл. Это общий камень преткновения всех современных моделей искусственного интеллекта: реальный мир попросту недостаточно «размечен» для робота, тогда как человек воспринимает и совершенствует картину мира начиная с рождения. Поэтому робот не знает, что человечество пока не способно к промышленному освоению Луны, и не понимает, что оно стоило бы на много порядков дороже заявленных в статье $40 млн.
Подумать о контексте. Робот пока не способен извлекать смысл из текста. Соответственно, он не может понять, что у единорога по определению может быть только один рог (в сгенерированной статье утверждается, что их четыре) или что «гравитационный луч», которым предполагается доставать минералы с Луны, происходит из фантастического «Звездного пути».
Искать значение. Верный маркер искусственно сгенерированного текста — лишенные смысла, но формально корректные фразы. В фейковой статье WSJ, например, говорится, что «компании исследуют разные способы добычи на астероидах из расчета $100 за фунт платины». «Точный контроль содержания находится за пределами современной технологии», — признает профессор Юджин Чой из команды GPT-2.
Искать специфические маркеры. Это резкая смена тем между параграфами, а часто и в пределах одного параграфа, повторы, «иссякание» текста к концу статьи и «нечеловеческие» грамматические конструкции.
Нет никаких сомнений, что новостных фейков в мире будет становиться больше, а доля текстов, сгенерированных роботами или при их участии, — расти. Соответственно растет значение умения и возможности распознавать такую информацию.