[
31
.
07
.
2026
]

Утечка данных через LLM: где бизнес теряет данные и как их защитить

LLM
Искусственный интеллект
link
Летом 2025 года в России заработали оборотные штрафы за утечки персональных данных. Цена одного инцидента выросла с десятков тысяч рублей до процента от выручки. В тот же год объём конфиденциальной информации, которую сотрудники российских компаний загрузили в публичные ИИ-сервисы, вырос в 30 раз по сравнению с 2024 годом, а почти две трети компаний такие утечки не контролируют (данные «Солара» по трафику 150 компаний).

Два тренда встретились. Бизнес массово подключает большие языковые модели к рабочим процессам, а спрос за утечки ужесточился. Утечка данных через LLM открывает каналы, которых раньше не было. Разберём, где именно бизнес теряет данные через языковые модели и как эти каналы закрыть.

Что считается утечкой данных из LLM

Утечка происходит, когда чувствительная, конфиденциальная или регулируемая информация раскрывается без нужного разрешения. Как правило, это происходит так: сотрудник вставляет данные в промпт, модель извлекает закрытую информацию из подключённых систем, чувствительные данные попадают в ответ, логи переписки и обучающие выборки хранятся без защиты.

По отчёту IBM Cost of a Data Breach за 2025 год, около 13% организаций сообщили об утечках с участием ИИ-моделей, и 97% из них назвали причиной недостаточный контроль доступа к ИИ. То есть в подавляющем большинстве случаев дело не в изощрённой атаке, а в открытых воротах.

По оценке Gartner, к 2027 году более 40% утечек данных, связанных с ИИ, будут вызваны неправомерным трансграничным использованием генеративного ИИ: внедрение GenAI опережает развитие управления данными и мер безопасности. По опросу Gartner (май — ноябрь 2025), 57% сотрудников используют для работы личные аккаунты в генеративном ИИ, а треть признались, что загружали чувствительную информацию в неодобренные компанией инструменты. 

Как утечка данных через LLM выглядит в отраслях

Опасность проще увидеть на конкретных сценариях. Зачастую они выглядят как обычная работа:

  • В банке аналитик загружает в чат-бот выгрузку по клиентам, чтобы быстро подготовить отчёт. Вместе с цифрами наружу уходят ФИО, номера счетов и контакты. 
  • В ритейле маркетолог отдаёт модели базу лояльности для сегментации рассылки, и персональные данные покупателей оказываются на внешнем сервере. 
  • На производстве инженер просит модель проверить участок кода АСУ ТП, а вместе с кодом раскрывает детали технической архитектуры. 
  • Юрист загружает договор с контрагентом, чтобы получить краткое содержание, и коммерческие условия сделки покидают периметр компании.

Каждое действие вписывается в повседневные задачи и выглядит безобидно. Но если данные обрабатываются, хранятся, извлекаются или раскрываются вне утверждённых правил, компания получает риски по безопасности, приватности, договорным обязательствам и регуляторике.

Как контролировать каналы утечки

Защита строится на контроле того, как данные входят в инфраструктуру, движутся и выходят из ИИ-систем. 

Что необходимо настроить

  • Политики использования ИИ. Зафиксируйте, что можно и нельзя вводить в LLM, какие инструменты одобрены, кто отвечает за ревью. Это ограничивает Shadow AI (теневой ИИ), который часто становится причиной утечек.
  • Классификация данных. До подключения LLM найдите и разметьте чувствительные данные во всей инфраструктуре. 
  • Минимизация. Модель получает минимум данных под задачу. Обезличенная версия вместо полной клиентской базы снижает последствия утечки.
  • Контроль доступа. Нет прав на документ вне LLM – нет и внутри. Ролевая модель, наименьшие привилегии, регулярный пересмотр прав.
  • Защита RAG и коннекторов. Пайплайны должны следовать существующим правам и возвращать только уместную информацию. Каждый коннектор нужно проверять на права, объём данных и аутентификацию.

Как защитить LLM от утечки данных на практике

Каналов утечки, как мы писали выше, много, поэтому частичные меры не работают. Одной проверкой доступа задача не решается, если обучающие данные лежат в открытом виде, а среда выполнения не изолирована.

Наполеон Гейт: LLM-шлюз, который защищает от утечки данных

Каналы утечки закрывает отдельный слой инфраструктуры между сотрудниками и языковыми моделями. Наполеон Гейт работает как LLM-шлюз: весь трафик к моделям проходит через одну контролируемую точку. Шлюз логирует каждый запрос, фильтрует чувствительные данные на уровне DLP до отправки в модель и разграничивает права по ролям. Решение отвечает требованиям 152-ФЗ и приказа ФСТЭК №117, модуль распознавания чувствительных данных работает в закрытом контуре, который как раз и не выпускает данные наружу в модели

Как устроено решение, мы описали в отдельной статье про Наполеон Гейт. Ниже – небольшое сравнение, какие задачи решает шлюз.

Так схематично выглядит процесс работы Наполеон Гейт: весь трафик к LLM проходит через контролируемый шлюз.

Цена утечки: регуляторика

Утечка данных из LLM создаёт серьёзные проблемы с комплаенсом. Компании важно не только то, что данные утекли. Важен и сам механизм: как их собирали, обрабатывали, хранили и раскрывали. Утечка говорит о провале контроля на этом уровне.

В России цена утечки данных выросла напрямую. Оборотные штрафы за утечки персональных данных заменили символические взыскания, которые бизнес закладывал в операционные расходы. Утечка запускает цепочку обязательств: уведомление об инциденте, план реагирования, аудит. Если LLM раскрыла клиентские записи, данные сотрудников, медицинские или финансовые данные, компания оценивает, квалифицируется ли инцидент как утечка персональных данных, и какие обязанности из этого следуют.

В регулируемых отраслях последствия жёстче. Медицинские и финансовые организации защищают данные административными, физическими и техническими мерами. Если LLM раскрывает такие данные без защиты, компания сталкивается с нарушениями по приватности и по безопасности одновременно.

Частые вопросы об утечке данных через LLM

Какие данные утекают через LLM чаще всего

Чаще всего наружу уходят персональные данные клиентов и сотрудников, исходный код, учётные данные и API-ключи, финансовая информация и коммерческая тайна. Самый высокий риск несут регулируемые данные: медицинские, биометрические, финансовые, данные детей. Их утечка запускает юридические и договорные последствия.

Безопасно ли загружать конфиденциальные данные в публичные ИИ-сервисы

Нет. Данные, отправленные в публичный сервис, попадают на внешние серверы, сохраняются в логах и могут использоваться для обучения модели. Удалить их оттуда практически невозможно. Для работы с конфиденциальной информацией нужна модель в закрытом контуре и контроль трафика к внешним ИИ-сервисам.

Запоминает ли LLM персональные данные

Да, если персональные данные попали в обучающую или дообучающую выборку, модель способна воспроизвести их в будущих ответах. 

Решаете похожую задачу по безопасности LLM? Расскажите о проекте, обсудим, как закрыть каналы утечки под ваши требования.

[
предыдущая
]
Наполеон Гейт: инфраструктурное решение для безопасной и управляемой работы с LLM от Napoleon IT
[
следующая
]
Raft и ИТМО запустили лабораторию по развитию безопасности в сфере ИИ и LLM-моделей
Мы используем cookies. Продолжая просматривать сайт, вы соглашаетесь с этим. Узнать больше
OK
обсудить проект
обсудить проект