Големи езикови модели вече могат да идентифицират потребители само по няколко коментара и дигитални следи
„В интернет никой не знае, че си куче“ – тази прочута реплика от карикатурата на Питър Стайнър дълги години символизираше свободата и анонимността в онлайн пространството. Днес обаче технологичната реалност изглежда коренно различна.
Ново академично изследване показва, че съвременните големи езикови модели – LLM – са способни да деанонимизират потребители въз основа на техни коментари, езиков стил и други дигитални следи, оставени в публичното пространство.
Как ИИ свързва фрагментите в пълна идентичност
Според изследователя в областта на изкуствения интелект Саймън Лерман, публикувал анализ в платформата Substack, традиционният процес на разкриване на самоличност изисква време и човешки анализ. Данните често са неструктурирани, разпръснати в различни форуми и социални мрежи, а свързването им изисква логическо разсъждение.
LLM обаче могат да автоматизират този процес чрез:
-
анализ на речник, синтаксис и стил;
-
извличане на косвени данни за местоживеене, професия и възраст;
-
сравнение на профили между различни платформи;
-
откриване на повтарящи се поведенчески модели.
Изследването показва, че само няколко коментара могат да бъдат достатъчни за изграждане на профил с висока степен на вероятност.
Експерименти с реални онлайн платформи
Екипът тества метода чрез два основни подхода.
В първия случай са анонимизирани акаунти от технологичния форум Hacker News, като са премахнати всички директно идентифициращи данни. След това LLM е трябвало да свърже анонимния профил с реалния човек. Резултатите показват, че моделът успява да направи съвпадения на база езикови и поведенчески характеристики.
Във втория експеримент един акаунт е „разделен“ на два отделни профила, за да се провери дали ИИ ще установи връзка между тях. Моделите успешно идентифицират, че двата профила принадлежат на един и същ потребител.
Особено показателен е тестът върху инструмента Anthropic Interviewer на Anthropic, базиран на модела Claude. Макар интервютата със специалисти да са публикувани анонимно, анализът с LLM позволява частична идентификация на участниците.
Защо това променя правилата на играта
Онлайн анонимността вече не зависи само от липсата на име или имейл адрес.
ИИ може да комбинира:
-
географски препратки;
-
професионални детайли;
-
специфични интереси;
-
характерни езикови конструкции.
Тези елементи функционират като своеобразен дигитален отпечатък. Колкото повече съдържание публикува даден потребител, толкова по-лесно става изграждането на неговия профил.
Рискове и възможни защити
Изследователите признават, че подобна технология крие риск от злоупотреби – включително преследване, политически натиск или корпоративен шпионаж. В същото време публичното обсъждане на тези възможности може да стимулира разработването на по-ефективни механизми за защита.
От гледна точка на платформите са необходими:
-
ограничения върху масовия достъп до исторически данни;
-
по-строги API политики;
-
механизми срещу автоматизиран профилиращ анализ.
Потребителите, които разчитат на анонимност, следва да бъдат по-внимателни относно:
-
споделянето на конкретен град или работно място;
-
уникални професионални детайли;
-
постоянен стил или повторяеми формулировки.
Анонимността като относително понятие
С развитието на ИИ традиционното разбиране за анонимност в интернет постепенно губи своята устойчивост. Дори без директно разкриване на лични данни, езиковият модел на поведение може да се превърне в средство за идентификация.
В дигитална среда, в която алгоритмите свързват данни с мащаб и скорост, непостижими за човешкия анализ, анонимността вече не е гаранция, а условна привилегия.









