Добавь сайт в закладки! Инструкция по ссылке.
ShieldFont заменяет слова в HTML на другие по смыслу, но сохраняет их читаемыми на экране
Дизайнеры Исаке Сенеда (Isaque Seneda) и Габриэль Абручи (Gabriel Abruci) создали ShieldFont — шрифт, который призван затруднить ИИ-компаниям сбор данных с веб-сайтов для обучения моделей, при этом не ухудшая читаемость страниц для людей. При обычном просмотре пользователь видит оригинальный текст, в то время как в загружаемом HTML слова заменяются другими. В результате скрейпер получает текст, который выглядит осмысленно, но на самом деле искажен, тогда как браузер отображает оригинал.
Механизм основан на лигатурах — функции шрифтов, которая обычно объединяет определенные сочетания букв в более удобные для восприятия символы. ShieldFont применяет их по-другому: вместо отдельных буквенных комбинаций он заменяет целые слова уже на этапе отображения страницы. Например, слово «лошадь» может быть заменено на «картофель»: оба слова существуют и грамматически подходят к предложению, однако передают совершенно различную информацию. Такой метод должен усложнить автоматическое восстановление исходного текста по простым правилам замены синонимов или выявление искажений как бессмысленного мусора.

За три месяца авторы разработали словарь, включающий почти 12 000 часто употребляемых слов. В среднем ShieldFont заменяет 24,5% всех слов на странице и 45,8% значимых слов; в зависимости от набора текстов это искажает смысл от 31% до 56% отдельных фрагментов.
В тестах на шести общедоступных системах скрейпинга более 90% страниц, которые без ShieldFont проходили проверку качества, после замены слов были отклонены. Среди небольшого числа страниц, которые всё же были приняты, почти 20% слов авторы назвали «мусором для обучения»: это существующие, правильно написанные английские слова, которые в совокупности формируют утверждения, не соответствующие исходной информации.

Защита не является абсолютной: если скрейпер сначала визуально отрисует страницу в браузере, а затем распознает изображение с помощью OCR (оптического распознавания символов), он сможет получить исходный текст. Тем не менее, такая обработка, по оценкам авторов ShieldFont, обходится в 5–13 раз дороже обычного скачивания HTML и требует значительно больше вычислительных ресурсов.
Эта технология имеет и обратную сторону: изменённый HTML может затруднять работу поисковых систем, программ экранного доступа, копирование текста и автоматический перевод. Поэтому ShieldFont в первую очередь нацелен на замедление массового автоматического сбора веб-страниц, а не на абсолютную блокировку доступа ИИ к их содержимому.
ИсточникПоделись видео:
