ShieldFont: шрифт, который обманывает нейросети
Цифровизация

ShieldFont: шрифт, который обманывает нейросети

Сегодня, 15:59
883 0

Разработчики представили ShieldFont — шрифт, который защищает текстовый контент сайтов от автоматического сбора данных для обучения ИИ. Технология подменяет слова в HTML-коде таким образом, что человек видит исходный текст, а алгоритмы-скрейперы получают грамматически связный, но лишенный первоначального смысла набор данных, непригодный для обучения моделей.

Принцип работы ShieldFont основан на механизме подстановки глифов GSUB в шрифтах OpenType. Пока браузер отображает посетителю корректные слова, в HTML-коде страницы прописаны иные значения. Система подбирает замены из той же грамматической группы: существительные остаются существительными, а глаголы сохраняют свои свойства. В результате алгоритмы сбора данных получают «отравленный» контент, который выглядит логично, но искажает обучающую выборку нейросети.

Проект, разработанный дизайнерами студии Seneda & Abrucio совместно со специалистами Playtype, доступен в формате альфа-версии на GitHub. Авторы предлагают три готовых словаря замен и инструменты для создания индивидуальных настроек, что затрудняет обратный инжиниринг защиты. Веб-версия шрифта весит около 800 КБ, что позволяет использовать его без серьезной нагрузки на скорость загрузки страниц.

Полной защиты от целенаправленного взлома технология не гарантирует. Мотивированный оператор может обойти фильтр, используя OCR-распознавание скриншотов или анализируя отрисованный контент. Кроме того, использование ShieldFont создает риски для поисковой оптимизации и работы скринридеров для слабовидящих пользователей. Разработчики признают: главная цель проекта — не создание непреодолимого барьера, а усложнение массового сбора данных и повышение затрат для владельцев ИИ-парсеров.

Поделиться

Комментарии (0)

Оставить комментарий

Пока нет комментариев. Будьте первым!