Заметки

Как не слить данные через ИИ: правила для бизнеса

M
Markabus
·20 августа 2026 г.
Распечатанный документ с зачёркнутыми чёрным маркером строками лежит на столе перед монитором с открытым чат-интерфейсом и таблицей

Самая частая утечка корпоративных данных через ИИ выглядит буднично: менеджер копирует кусок клиентской базы в чат и просит «сделай сводку». Никто не взламывал сеть, антивирус промолчал, инцидента формально не было — а фрагмент реальных персональных данных уже ушёл на сторонний сервер, где его могут хранить месяцами и показать живому рецензенту. Разбираемся, где именно протекает, кто действительно учится на ваших данных, а кто нет, и какие правила стоит ввести в компании, чтобы не собирать эти грабли.

Четыре канала, по которым данные уходят

Полезно разделять источники риска — у них разные владельцы и разные меры защиты.

1. Сотрудники в личных чатах

Человек с личным аккаунтом ChatGPT, Claude или Gemini вставляет в окно договор, выгрузку из CRM, кусок кода с ключами. Компания об этом не знает: трафик идёт мимо корпоративной инфраструктуры, логов нет, отозвать данные нельзя. Это самый массовый канал и, к счастью, самый управляемый — он лечится тарифом и регламентом, а не технологиями.

2. Обучение модели на ваших разговорах

Часть тарифов прямо разрешает провайдеру использовать переписку для обучения новых моделей. Это не значит, что ваш договор дословно всплывёт в чужом ответе, но данные покидают контур и живут дольше, чем вы думаете.

3. Интеграции и агенты

Когда ИИ получает доступ к почте, диску или базе через API и MCP-серверы, ошибка стоит дороже: агент может сам прочитать лишнее и сам отправить это наружу. Здесь работает связка из трёх условий — недоверенный контент, доступ к чувствительным данным и возможность передать что-то вовне. Подробно эта механика разобрана в заметке о промпт-инъекциях и защите от них, а права и границы для агентов — в материале о безопасности AI-агентов.

4. Подрядчики, плагины и расширения

Браузерные расширения «улучшите текст», сомнительные обёртки над API, фрилансер со своим аккаунтом. Данные проходят через ещё одного посредника, о политике которого вы не знаете ничего.

Кто учится на ваших данных, а кто нет

Ключевое различие проходит не между сервисами, а между потребительскими и корпоративными тарифами одного и того же сервиса. Проверяйте это первым делом.

OpenAI (ChatGPT)

Для бизнес-продуктов позиция сформулирована прямо: «мы не обучаем модели на ваших данных по умолчанию». Это относится к ChatGPT Business, Enterprise, Edu и к API — обучение возможно, только если клиент явно включил такую опцию. В API данные хранятся до 30 дней для контроля злоупотреблений, а для подходящих сценариев доступен режим нулевого хранения (zero data retention). В личных тарифах (Free, Plus, Pro) всё наоборот: обучение включено по умолчанию, отключается вручную — Settings → Data Controls → Improve the model for everyone.

Anthropic (Claude)

В 2025 году Anthropic изменила потребительские условия: чаты и сессии пользователей Free, Pro и Max могут использоваться для обучения новых моделей, если соответствующая настройка включена, — и тогда срок хранения вырастает до пяти лет. Кто отказался, остаётся на прежнем 30-дневном сроке. Изменения касаются только новых и возобновлённых диалогов. Важное для бизнеса: на коммерческие продукты — Claude for Work (Team и Enterprise), API, включая Amazon Bedrock и Google Cloud Vertex AI, Claude for Government и Claude for Education — эти правила не распространяются.

Google (Gemini)

Здесь стоит внимательно прочитать формулировку самого Google: «Не вводите конфиденциальную информацию, которую вы не хотели бы показать рецензенту или отдать Google для улучшения сервисов». Часть диалогов действительно просматривают люди — включая подрядчиков Google, — и такие выборки хранятся до трёх лет, отдельно от аккаунта. При выключенной истории («Keep Activity» off) обычные чаты хранятся 72 часа. Корпоративный Gemini в Google Workspace регулируется отдельной политикой и не используется для обучения общих моделей.

«Удалил» не значит «удалено»

Кнопка удаления диалога убирает его из интерфейса, но не всегда из инфраструктуры. Типичный срок фактического стирания — до 30 дней. Есть и менее очевидный сценарий: судебное разбирательство может заморозить удаление целиком. В 2025 году суд по иску The New York Times обязал OpenAI сохранять пользовательские логи, включая удалённые; предписание сняли только в октябре 2025 года, но уже сохранённый массив никуда не делся, и позже часть чатов пришлось передать в рамках дела.

Практический вывод простой: считайте, что всё отправленное во внешний сервис остаётся у провайдера на неопределённый срок и теоретически может быть прочитано человеком. Планируйте исходя из этого, а не из обещаний интерфейса.

Правило пяти секунд: что нельзя вставлять в чат

Понятный список запрещённого работает лучше, чем длинная политика, которую никто не дочитает. Минимальный набор:

  • Персональные данные клиентов и сотрудников — ФИО вместе с телефоном, адресом, паспортом, диагнозом, зарплатой.
  • Секреты доступа — API-ключи, пароли, токены, содержимое .env, приватные ключи SSH.
  • Коммерческая тайна — неподписанные договоры, финмодели, себестоимость, условия по конкретным контрагентам.
  • Данные под NDA от клиентов — здесь утечка бьёт ещё и по репутации, и по договору.
  • Дампы баз и логи целиком — «просто посмотри, что тут не так» превращается в выгрузку персональных данных.

Позитивная часть правила важнее запретительной: почти всегда задачу можно решить на обезличенных данных. Замените реальные ФИО на «Клиент А», номера — на маску, суммы — на порядок величины. Модели нужен формат и структура, а не подлинные значения.

Что делать бизнесу: семь практических шагов

  1. Купите корпоративный тариф. Это самая дешёвая мера с наибольшим эффектом: обучение на данных выключено по умолчанию, появляются администратор, SSO, журналы и управление сроками хранения.
  2. Закройте личные аккаунты в рабочем контуре. Если сотрудникам не дать легальный удобный инструмент, они продолжат пользоваться личным — «теневой ИИ» появляется именно там, где корпоративного нет.
  3. Напишите политику на одну страницу. Что можно, что нельзя, к кому идти с вопросом. Одна страница, которую прочитают, полезнее двадцати, которые подпишут не читая.
  4. Введите обезличивание как норму. Простейший скрипт-маскировщик перед отправкой данных снимает большую часть риска.
  5. Ограничьте права интеграций. Для API, MCP-серверов и агентов — минимальные необходимые доступы, отдельные ключи, короткий срок жизни токенов, подтверждение человеком для необратимых действий. Ориентир по настройке — чек-лист безопасности MCP-серверов.
  6. Обучите людей на примерах. Один разбор реального кейса «вот это отправлять нельзя, а вот так — можно» работает лучше часового вебинара про риски.
  7. Заранее опишите порядок действий при инциденте. Кто фиксирует факт, кто оценивает объём, кто уведомляет регулятора и в какой срок.

Российский контекст: 152-ФЗ и новые штрафы

С 30 мая 2025 года действуют ужесточённые санкции по закону № 420-ФЗ. Для юридических лиц штраф за утечку персональных данных зависит от масштаба: от 3–5 млн рублей при утечке данных 1 000 и более субъектов до 10–15 млн при 100 000 и более; за биометрию — 15–20 млн рублей. За повторное нарушение предусмотрен оборотный штраф — 1–3 % годовой выручки, минимум 20–25 млн и максимум 500 млн рублей. Отдельно наказывается неуведомление регулятора об инциденте: 1–3 млн рублей. Скидка 50 % за быструю оплату к этим составам не применяется.

Отсюда два вывода. Первый: отправка клиентской базы в зарубежный чат — это не «неаккуратность», а потенциально дорогое нарушение, в том числе с точки зрения требований о хранении и обработке. Второй: обязанность уведомить регулятора существует независимо от того, считаете ли вы произошедшее «настоящей утечкой».

Мини-чек-лист

  • Знаете ли вы, каким тарифом каждого ИИ-сервиса пользуются ваши сотрудники?
  • Выключено ли обучение на данных там, где оно включено по умолчанию?
  • Есть ли короткий список того, что нельзя вставлять в чат, и видел ли его каждый?
  • Проходят ли данные обезличивание перед отправкой?
  • Минимальны ли права у интеграций, агентов и MCP-серверов?
  • Понятно ли, кто и в какой срок уведомляет регулятора при инциденте?

Вывод

Утечка через ИИ почти никогда не результат хитрой атаки — это результат отсутствия правил. Корпоративный тариф закрывает вопрос обучения на данных, обезличивание закрывает вопрос содержимого, ограничение прав закрывает вопрос интеграций, а понятная политика на одну страницу закрывает вопрос человеческого фактора. Всё это делается за неделю и стоит несопоставимо дешевле любого штрафа. Более широкий взгляд на риски внедрения — в заметке «Безопасность ИИ для бизнеса».

Частые вопросы

Q.Можно ли пользоваться бесплатным ChatGPT или Claude в работе, если ничего секретного не отправлять?

Формально да, но граница «секретного» на практике размывается очень быстро: сегодня это безобидный текст, завтра — кусок переписки с клиентом. Безопаснее один раз выключить обучение на данных в настройках личного аккаунта и параллельно перевести рабочие задачи на корпоративный тариф, где обучение отключено по умолчанию и есть журналы.

Q.Обучаются ли модели на данных, которые идут через API?

У OpenAI и Anthropic данные из API не используются для обучения моделей по умолчанию. У OpenAI API данные хранятся до 30 дней для контроля злоупотреблений, а для подходящих сценариев доступен режим нулевого хранения. У Anthropic на API, включая доступ через Amazon Bedrock и Google Cloud Vertex AI, изменения потребительских условий 2025 года не распространяются.

Q.Что делать, если сотрудник уже отправил в чат персональные данные?

Удалите диалог и отключите обучение в настройках, смените все засветившиеся ключи и пароли, зафиксируйте факт и объём данных. Затем оцените, попадает ли случай под обязанность уведомить Роскомнадзор: за неуведомление об инциденте предусмотрен отдельный штраф в 1–3 млн рублей для юридических лиц.

Q.Помогает ли режим временного чата?

Частично. Он уменьшает срок хранения — например, у Gemini чаты при выключенной истории хранятся 72 часа, — но не отменяет прохождения данных через инфраструктуру провайдера и не защищает от юридической заморозки удаления. Это снижение риска, а не его устранение.

Источники

Предыдущая
Объектный кеш (Redis) в WordPress: зачем нужен и как настроить
Следующая
Классификация заявок и обращений с помощью ИИ

Читайте также

Монитор на рабочем столе с очередью обращений в поддержку, где каждая заявка помечена цветным ярлыком категорииЗаметки
21 августа 2026 г.

Классификация заявок и обращений с помощью ИИ

Языковая модель раскидывает входящие тикеты по категориям и очередям без разметки датасетов. Разбираем таксономию, промпт, структурированный вывод, порог уверенности, метрики и реальную стоимость обработки.

Читать →
Тёмный рабочий стол разработчика: на мониторе крупным планом консоль со статистикой кеша — процент попаданий и график, рядом мини-сервер с синим индикатором и сетевыми кабелямиЗаметки
19 августа 2026 г.

Объектный кеш (Redis) в WordPress: зачем нужен и как настроить

По умолчанию объектный кеш WordPress живёт ровно один запрос. Redis делает его постоянным и снимает с базы сотни повторяющихся запросов — особенно там, где кеш страниц не работает: в админке, корзине и API. Разбираем настройку по шагам.

Читать →
Монитор на рабочем столе разработчика с отчётом автоматических тестов: список пройденных и упавших проверок, синие графики доли успешных прогонов; рядом второй экран с логами в терминалеЗаметки
18 августа 2026 г.

Как тестировать AI-агента: гайд по evals

Агента мало проверить «на глазок»: правильный ответ он может получить по неправильному пути. Разбираем, как построить автоматические проверки (evals) — что складывать в датасет, чем оценивать, какие метрики важны и почему один прогон ничего не доказывает.

Читать →