Утечка данных через ChatGPT, Claude, Gemini 2026: retention вендоров, риски и как защититься
Автор: Silvana · Дата: 10.08.2026 · Verified: 01.09.2026 · Reading time: 22 минуты · Prerequisite: базовое понимание что такое LLM API и что такое PII
Эта статья — общая информация, не юридическая консультация. Для юр-решений консультируйся с юристом. Для compliance-аудита — со сертифицированным DPO.
Утечка данных через LLM — не гипотетическая угроза: Samsung в 2023 запретил ChatGPT после того как инженеры залили в него исходники, Amazon сделал внутренний запрет обсуждать код в ChatGPT, у OpenAI в марте 2023 был Redis bug — чужие названия чатов и первые сообщения показались в UI. Три разных контура: chat-интерфейс (ChatGPT, Claude.ai, Gemini) — данные могут использоваться для обучения; API — по умолчанию не используются у OpenAI и Anthropic; Enterprise/Teams — отдельные контракты. Retention (сколько хранятся данные): OpenAI Standard API — 30 дней, Anthropic API — 30 дней стандартно, 0 при ZDR. Ниже — как выстроить контур: BAA/DPA с вендором, redaction pipeline, on-prem или локальные модели.
- Утечка данных через LLM — не гипотетическая угроза. Публично известны случаи со Samsung (2023, инженеры залили в ChatGPT исходники), Amazon (внутренний запрет обсуждать код в ChatGPT после инцидента), OpenAI Redis bug (март 2023, чужие названия чатов и первые сообщения показались в UI).
- Три разных контура: chat-интерфейс (ChatGPT, Claude.ai, Gemini) → данные могут использоваться для обучения; API → по умолчанию не используются для обучения у OpenAI и Anthropic; Enterprise/Teams → отдельные контракты, часто без хранения.
- Retention (сколько времени хранятся твои данные): OpenAI Standard API — 30 дней для абузного мониторинга, потом удаление. OpenAI Zero Data Retention — по договору для enterprise. Anthropic API — 30 дней стандартно, 0 при ZDR. Google Gemini API paid — не используется для обучения, retention по политике. Проверяй актуальные условия у вендора.
- Даже без обучения на твоих данных, они всё равно проходят через инфраструктуру вендора. Это transborder-transfer с точки зрения ФЗ № 152 и GDPR, если вендор за пределами РФ.
- Персональные данные (PII), коммерческая тайна, медицинские записи, финансовые данные клиентов, исходный код с секретами — не должны попадать в LLM без специально организованного контура: BAA/DPA с вендором, redaction pipeline, on-prem или локальные модели.
- Пять способов утечки: обучение на данных (для chat-контура), логи вендора, скомпрометированный аккаунт, prompt injection с exfiltration, случайный shared link.
- Практическая иерархия защиты: (1) не посылать в LLM то, что не должно там быть; (2) redaction на клиенте; (3) использовать API с ZDR; (4) для критичных сценариев — локальные модели (Llama, Qwen через Ollama/vLLM).
Что такое утечка через LLM
Заголовок раздела «Что такое утечка через LLM»Утечка данных через LLM — это ситуация, когда информация, отправленная пользователем в модель, оказывается доступной другой стороне: другому пользователю, вендору как training-data, инженерам вендора, злоумышленнику или в открытом доступе.
Три канала, по которым это происходит:
- Использование в обучении. Вендор берёт твои промпты и ответы модели в датасет для fine-tuning или RLHF. Информация запечатывается в весах модели, и другой пользователь может её получить.
- Хранение в логах. Вендор хранит промпты и ответы для мониторинга злоупотреблений, отладки, юридических целей. Доступ имеют инженеры вендора и правоохранительные органы по запросу.
- Технические инциденты. Баги в софте, компрометации аккаунта, ошибки конфигурации — данные становятся доступны неправомерно.
Понимание этих каналов — базис для правильного выбора инструмента и контура.
Chat vs API vs Enterprise: три разных мира
Заголовок раздела «Chat vs API vs Enterprise: три разных мира»Один и тот же вендор (OpenAI, Anthropic, Google) предоставляет доступ к моделям через несколько продуктов с разной data policy. Путаница между ними — источник большинства инцидентов.
Chat-интерфейс (ChatGPT.com, Claude.ai, Gemini.google.com). Продукт для конечного пользователя. По умолчанию у OpenAI и Google промпты могут использоваться для улучшения моделей (у OpenAI можно отключить в настройках data controls, у Google — в настройках Gemini Apps Activity). У Anthropic Claude.ai в 2025 году политика была: данные пользователей не используются для обучения по умолчанию (проверяй актуальные Terms на anthropic.com/legal).
Retention в chat-контуре: обычно недели-месяцы, зависит от вендора и настроек. У OpenAI можно включить временные чаты (не сохраняются, но недоступны 30 дней для abuse monitoring).
Standard API (platform.openai.com, api.anthropic.com, aistudio.google.com). Продукт для разработчиков. По умолчанию у OpenAI и Anthropic данные API не используются для обучения. Google Gemini API paid tier — также не используется. У Google Gemini AI Studio free tier — использовалось для улучшения (уточняй на актуальной странице политики).
Retention в API: OpenAI 30 дней стандартно (для abuse monitoring), потом удаляется, если только не запрошено сохранение по договору. Anthropic — аналогично 30 дней. По требованию можно оформить Zero Data Retention (ZDR), но обычно только для enterprise.
Enterprise / Teams / Workspace продукты. ChatGPT Enterprise, ChatGPT Team, Claude for Enterprise, Gemini for Workspace. Отдельные контракты с гарантиями: данные не используются для обучения, часто ZDR, SOC 2 Type II, HIPAA BAA возможен, региональный контроль хранения.
Практическое правило: если ты корпоративный пользователь и обрабатываешь чувствительные данные — используй Enterprise-план или API с ZDR. Не используй бесплатный chat-интерфейс.
Что именно вендор хранит
Заголовок раздела «Что именно вендор хранит»Разбор по крупнейшим вендорам на 2026 год. Условия часто меняются — сверяйся с trust-центрами вендоров.
OpenAI (по openai.com/policies и trust.openai.com):
- Chat (ChatGPT Free, Plus, Pro): промпты и ответы хранятся неограниченно, если пользователь не удалит. Могут использоваться для обучения, если пользователь не отключил в data controls. Временные чаты (temporary chats) не сохраняются в истории, но хранятся 30 дней для abuse monitoring.
- Chat (ChatGPT Team, Enterprise, Edu): не используются для обучения. Enterprise — часто с гарантией удаления в срок по договору.
- API (Standard): промпты и ответы не используются для обучения. Хранятся до 30 дней для abuse monitoring, потом удаляются. Zero Data Retention доступен по запросу для enterprise (данные обрабатываются in-memory, не хранятся вообще).
- Custom GPTs и Assistants: контекст (файлы, инструкции) хранится в рабочем пространстве. Обучение зависит от типа плана.
- Files API: файлы, загруженные через API, хранятся до явного удаления пользователем.
Anthropic (по anthropic.com/legal):
- Claude.ai (Free, Pro, Max): промпты и ответы не используются для обучения без явного opt-in пользователя. Хранятся в истории пользователя до удаления. При включении сбора для улучшения — используются.
- Claude API: не используются для обучения. Retention — обычно до 30 дней для abuse monitoring, потом удаление. ZDR доступен для enterprise.
- Claude for Enterprise: не используются для обучения, SOC 2 Type II, региональные варианты хранения, BAA для HIPAA возможен.
Google (по policies.google.com и cloud.google.com/gemini):
- Gemini App (consumer): промпты могут храниться до 18 месяцев по умолчанию, могут использоваться людьми-ревьюерами и для улучшения. Пользователь может отключить в настройках Gemini Apps Activity.
- Google AI Studio (free tier): используется для улучшения продуктов. Не для чувствительных данных.
- Gemini API (paid tier через Vertex AI): не используется для обучения, retention по политике Google Cloud, обычно доступны опции региона хранения.
- Google Workspace (business/enterprise): подчиняется контракту Workspace, обычно не используется для обучения, есть европейские регионы, HIPAA BAA возможен по договору.
Российские провайдеры (YandexGPT, GigaChat):
- Yandex Cloud YandexGPT API: политика описана в yandex.cloud/docs. Retention и использование для обучения — по контракту. Данные хранятся в РФ, что снимает вопрос transborder-transfer по ФЗ № 152.
- GigaChat API: аналогично, документация на developers.sber.ru. Данные в РФ.
Практический вывод: для чувствительных данных из РФ российские провайдеры имеют юрисдикционное преимущество (данные не покидают РФ). Для нечувствительных задач иностранные frontier-модели дают более качественный результат.
Пять способов утечки
Заголовок раздела «Пять способов утечки»Систематизация векторов, чтобы понимать, от чего защищаться.
Вектор 1: обучение на твоих данных. Актуально для chat-контура без opt-out и для free-tier некоторых API. Твой промпт с исходным кодом или клиентскими данными попадает в датасет, модель дообучается, потом другой пользователь получает похожий контент. Не гарантированное exact match, но факт: информация просачивается через веса.
Реальный пример: Samsung 2023. Инженеры залили в ChatGPT исходники семикнологической линии, чтобы попросить оптимизацию. Промпт мог использоваться в обучении (opt-out тогда ещё не был доступен). Samsung ввёл внутренний запрет на chat-интерфейсы OpenAI.
Вектор 2: логи вендора. Даже когда данные не используются для обучения, они логируются. К логам имеют доступ инженеры вендора для отладки и мониторинга abuse. Плюс правоохранительные органы через официальный запрос могут получить логи.
Реальный пример: стандартное 30-дневное хранение у OpenAI API. Если через API отправили PII, они 30 дней лежат на серверах вендора. Формально безопасно, но точка риска есть.
Вектор 3: компрометация аккаунта вендора. Твой login/password утёк, злоумышленник входит в аккаунт и читает всю историю чатов. Или API-ключ утёк, злоумышленник шлёт запросы и оплата идёт по твоему счёту, плюс он видит модели, которые ты вызываешь.
Реальный пример: тысячи API-ключей OpenAI попадают в публичные GitHub-репозитории через .env-файлы. Есть боты, сканирующие GitHub и подхватывающие ключи. У Anthropic и OpenAI сейчас автодетект и revoke таких ключей, но окно между push и revoke может быть достаточным для utилization.
Вектор 4: prompt injection с exfiltration. Обсуждали подробно в статье по prompt injection. Злоумышленник встраивает в данные инструкцию, заставляющую агента слить конфиденциальную информацию: отправить на внешний URL, вернуть в ответе, вставить в комментарий к PR.
Реальный пример: GitHub Copilot Chat 2024, комментарии в коде могли вытащить содержимое файла в подсказку.
Вектор 5: случайный shared link. ChatGPT и Claude имеют функцию share chat — генерируется публичный URL. Если пользователь по невнимательности расшарил чат с чувствительными данными, а URL попал в поисковики или был отправлен не тому получателю — утечка.
Реальный пример: в 2024 году множество shared chats ChatGPT индексировалось Google, включая чаты с исходниками, паролями, ключами API. OpenAI ужесточил политику индексации, но старые ссылки остались.
Что нельзя посылать в LLM без специального контура
Заголовок раздела «Что нельзя посылать в LLM без специального контура»Список данных, для которых обычный chat-интерфейс и стандартный API — категорически не подходящий инструмент.
Персональные данные (PII) третьих лиц. ФИО, паспорт, СНИЛС, номер телефона, email, адрес, дата рождения, IP-адрес, банковские реквизиты клиентов, сотрудников, партнёров. Обработка PII через LLM без надлежащих оснований и мер защиты — нарушение ФЗ № 152 и GDPR.
Специальные категории данных. По ФЗ № 152 статья 10: расовая, национальная принадлежность, политические взгляды, религиозные убеждения, состояние здоровья, интимная жизнь. По GDPR Article 9 — аналогичный список плюс биометрия и генетика. Их обработка требует явного письменного согласия и особых мер защиты.
Медицинские данные. Диагнозы, результаты анализов, история болезни. В США подпадает под HIPAA — только через LLM-вендора с BAA (Business Associate Agreement). В РФ — под ФЗ № 152 статья 10 (специальная категория).
Финансовые данные клиентов. Номера карт, CVV, PIN — по PCI DSS вообще нельзя передавать через сторонние сервисы. Балансы, транзакции, кредитные истории — требуют специальных мер.
Коммерческая тайна. Формулы, техпроцессы, клиентские базы, прайсы для крупных клиентов, стратегии, финансовые прогнозы. Юридически защищена ФЗ № 98 «О коммерческой тайне». Утечка может квалифицироваться как разглашение с уголовной ответственностью.
Исходный код с секретами. API-ключи, database credentials, приватные ключи SSH/PGP. Даже если сам код открытый, встроенные секреты — критичны.
Государственная тайна. Понятно — ни через какой публичный LLM, никогда.
Данные под NDA. Если ты подписал NDA с клиентом или партнёром — обычно передача информации в третьи сервисы (включая LLM-вендоров) без согласия — нарушение.
Юридически привилегированные коммуникации. Общение адвокат-клиент. Отправка в LLM может разрушить привилегию.
Как строить безопасный контур: практическая иерархия
Заголовок раздела «Как строить безопасный контур: практическая иерархия»Не всегда нужен максимум защиты. Выбор контура зависит от чувствительности данных.
Уровень 0: публичные и обезличенные данные. Технические вопросы, генерация текстов без PII, анализ публичных данных. Подходит любой chat-интерфейс или API. Расходов на защиту минимум.
Уровень 1: внутренние данные без PII. Внутренние обсуждения, драфты документов, ideation. Использовать корпоративный chat (Team, Enterprise) с opt-out для обучения. Стандартный API с retention.
Уровень 2: PII и клиентские данные. Обработка обращений клиентов, автосуммаризация переписки, анализ базы. Требования:
- Использовать API с ZDR или Enterprise-план с гарантией не-обучения.
- Оформить DPA (Data Processing Agreement) с вендором. У OpenAI и Anthropic есть шаблоны.
- Для российских субъектов данных — учитывать transborder-transfer (см. отдельную секцию ниже).
- Redaction: до отправки в LLM — убирать прямые идентификаторы (замена ФИО на ID, маскирование телефонов).
- Логи в твоей системе (не только у вендора) для аудита.
Уровень 3: медицинские, финансовые, критичные данные. BAA с вендором обязателен (для HIPAA). Или полностью локальные модели (Llama 4, Qwen 3, DeepSeek R2) на своей инфраструктуре. Redaction в любом случае. Полный аудит доступа.
Уровень 4: гостайна и максимально критичные данные. Только on-prem модели на изолированной сети (air-gapped). Никаких API-вызовов наружу. Аттестация ФСТЭК/ФСБ для российского контура.
Redaction pipeline: как убирать PII до отправки
Заголовок раздела «Redaction pipeline: как убирать PII до отправки»Redaction — процесс удаления или замены идентифицирующих данных перед отправкой в LLM. Работает как второй слой поверх выбора контура.
Что удалять:
- ФИО → заменять на «Клиент А», «Пользователь 123», случайный ID.
- Email → маскировать (u***@d***.ru) или заменять на «email».
- Телефоны → «номер телефона».
- Паспорта, СНИЛС, ИНН → удалять полностью.
- Адреса → обезличивать до города или региона.
- IP-адреса → маскировать последние октеты.
- Номера карт → удалять всегда.
- Уникальные детали, позволяющие ре-идентификацию (например, «CEO компании X» — вычисляется однозначно) → обобщать.
Инструменты:
- Microsoft Presidio — open source, поддерживает большой набор PII-типов, есть модуль для русского языка.
- Google DLP API — облачное решение, много встроенных типов, интегрируется с Vertex AI и BigQuery.
- AWS Comprehend PII — аналог для AWS-экосистемы.
- Nightfall AI, Skyflow, Piiano — коммерческие вендоры redaction as a service.
- Собственный regex + список — для простых случаев подходит, но нужно постоянно поддерживать шаблоны.
Практика: redaction на клиенте (в твоей системе), до отправки в LLM. Если redaction на стороне вендора — данные уже прошли через его инфраструктуру, что снижает ценность защиты.
Ограничение redaction: не даёт 100% гарантии. Есть контекстная утечка (по совокупности нередактированных деталей можно восстановить личность). Есть false negative (redaction пропустил PII). Использовать вместе с другими слоями.
Локальные модели: когда и как
Заголовок раздела «Локальные модели: когда и как»Если данные слишком чувствительные для передачи в облако, альтернатива — запуск моделей локально. В 2026 году это реальный сценарий для многих задач.
Открытые модели, доступные локально:
- Llama 4 (Meta) — 8B, 70B, 405B параметров. Лицензия почти open source (есть ограничения для крупных компаний). По качеству близко к GPT-4/Claude Sonnet для многих задач.
- Qwen 3 (Alibaba) — сильная многоязычная модель, отдельная версия для кода. Apache 2.0.
- DeepSeek R2 — модель с сильным reasoning, дешёвая в inference. MIT.
- Mistral Large 3 — французская, EU-friendly. Открытые веса для research, коммерческая через API.
- Phi-4 (Microsoft) — маленькие модели, работающие на CPU и edge.
Инструменты запуска:
- Ollama — самый простой способ.
ollama run llama4:70b, и работает. Для одного разработчика или маленькой команды. - vLLM — production-grade сервер, оптимизированный throughput. Для команд с реальной нагрузкой.
- LM Studio — GUI для запуска моделей на десктопе. Для нон-разработчиков.
- Together AI, Groq, Fireworks — облачные хостинги открытых моделей, если своей инфраструктуры нет.
Плюсы локальных моделей:
- Данные не покидают твою инфраструктуру.
- Нет retention у вендора.
- Нет transborder-transfer при использовании внутри страны.
- Fine-tuning под твой domain доступен без разрешения вендора.
- Cost при высоких объёмах может быть ниже, чем API.
Минусы:
- Инфраструктура: GPU-серверы стоят от 2000$/мес за приличную конфигурацию.
- Качество: open source модели догоняют frontier, но всё ещё уступают на сложных задачах.
- Поддержка: обновления моделей, безопасность, monitoring — твоя работа.
- Экспертиза: нужен engineer, умеющий деплоить и оптимизировать inference.
Практика: для базовых задач (классификация, извлечение сущностей, простое переформулирование) — локальные модели работают отлично. Для сложных задач с creative reasoning — пока лучше использовать frontier с redaction.
Transborder transfer: если данные пересекают границу
Заголовок раздела «Transborder transfer: если данные пересекают границу»По ФЗ № 152 передача персональных данных за пределы РФ (transborder-transfer) требует специального регулирования.
Основные правила (ФЗ № 152 статья 12, редакция 2026 года):
- До начала transborder-transfer оператор обязан уведомить Роскомнадзор.
- Уведомление содержит цель, категории данных, категории субъектов, страны-получатели.
- Роскомнадзор в срок до 10 рабочих дней может ограничить или запретить transfer, если сочтёт, что защита в стране-получателе недостаточна.
- Список стран с «адекватным уровнем защиты» ведёт Роскомнадзор. США там нет.
- Для transfer в страны без адекватного уровня требуется письменное согласие субъекта на конкретную операцию с указанием получателя.
Что это значит на практике для использования иностранных LLM:
- Отправка PII российских граждан в OpenAI, Anthropic, Google — это transborder-transfer.
- Для законности нужны: уведомление Роскомнадзора + согласие субъектов (для стран без адекватного уровня) + договор с вендором с гарантиями защиты.
- Для многих компаний в РФ проще использовать российских провайдеров (Yandex, Sber, MTS) для операций с PII, чтобы вообще не иметь transborder-transfer.
- Или redaction: если в LLM уходят полностью обезличенные данные — это не PII, и transfer не регулируется.
Локализация (ФЗ № 152 статья 18):
- Оператор при сборе PII российских граждан обязан обеспечить хранение и обработку в базах, находящихся на территории РФ.
- Обработка в иностранных LLM не считается «первичной» обработкой при условии, что копия хранится в РФ. Но formality есть, и Роскомнадзор проверяет.
Практическое правило: если ты работаешь с клиентами в РФ и используешь иностранные LLM для обработки их данных — обязательно проконсультируйся с юристом по compliance. Формулировки согласия, уведомления Роскомнадзора, договоры с вендорами — тонкая работа.
Detailed compliance разбирается в статье про AI compliance по ФЗ-152 и GDPR.
Кейсы и уроки
Заголовок раздела «Кейсы и уроки»Публичные инциденты, из которых полезно вытащить уроки.
Samsung, 2023. Инженеры полупроводникового подразделения залили в ChatGPT исходники и данные о линии производства для оптимизации. Промпты могли использоваться в обучении (opt-out тогда ещё не был доступен для всех). Samsung ввёл жёсткий запрет на использование внешних LLM для внутреннего кода и данных.
Урок: корпоративная политика по использованию LLM должна быть явно сформулирована, до инцидента, а не после.
OpenAI Redis bug, март 2023. Из-за race condition в Redis некоторые пользователи ChatGPT видели заголовки чужих чатов и первые сообщения в UI. Утечка коснулась ~1.2% пользователей ChatGPT Plus в момент бага. OpenAI признал, публично разобрал root cause.
Урок: даже у крупнейших вендоров бывают инциденты. Не полагайся на «у них SOC 2, всё безопасно» как единственный аргумент.
JPMorgan, 2023. Банк заблокировал доступ сотрудников к ChatGPT из-за опасений утечки. Позже развернул внутренний контур с OpenAI Enterprise и redaction pipeline.
Урок: для финансовых и юридически чувствительных отраслей — сначала специальный контур, потом использование. Не наоборот.
Air Canada chatbot, 2024. Чатбот на LLM пообещал клиенту скидку, которую компания не готова была предоставить. Суд принял сторону клиента. Утечка не данных, а обещаний, но иллюстрирует, что LLM в проде — юридический риск.
Урок: всё, что твой AI-агент говорит клиенту, юридически привязывается к тебе. Строй ограничения.
Массовые утечки API-ключей на GitHub, постоянно. Разработчики коммитят .env с ключами OpenAI/Anthropic. Боты сканируют, ключи используются злоумышленниками до revoke.
Урок: .env в .gitignore — базово. Pre-commit hooks с git-secrets или truffleHog. Ротация ключей по расписанию. Мониторинг спенда с алертами на резкие скачки.
MongoDB и OpenAI, 2023. MongoDB демонстрировал интеграцию, где LLM мог запрашивать production DB. В одном демо был показ, где неаккуратный prompt injection мог вытащить содержимое базы.
Урок: агент с доступом к базе — высокорисковый компонент. Read-only минимум. Row-level security. Логирование всех запросов.
Практические рекомендации по ролям
Заголовок раздела «Практические рекомендации по ролям»Для разных ролей в команде — разные приоритеты.
Для разработчика:
- Никогда не коммить .env. Используй secrets manager (AWS Secrets Manager, GCP Secret Manager, Vault).
- Никогда не паст свой код с секретами в chat-интерфейс. Redact перед пастом или используй временные placeholder.
- Для code assistance подключай Copilot или Claude Code через официальный контур компании.
- Логируй все LLM-запросы своего сервиса. Аудит помогает и в incident response, и в оптимизации.
Для CTO и техлида:
- Определи корпоративный контур для использования LLM. ChatGPT Enterprise / Claude Teams / OpenAI API с ZDR / on-prem — выбор зависит от бюджета и требований.
- Напиши AI Usage Policy для команды. Что можно, что нельзя, где узнать больше.
- Внедри проверки: pre-commit hooks на секреты, review-процесс для промптов с PII, редакторские правила.
- Регулярный аудит: что реально используется, соответствует ли политике, есть ли инциденты.
Для CEO и business owner:
- Требуй от CTO явного плана data governance для AI.
- Не соглашайся на «мы сейчас MVP, безопасность потом». Утечка на MVP-стадии убивает продукт.
- Инвестируй в compliance до масштабирования. Штраф Роскомнадзора после инцидента дороже, чем DPA с вендором заранее.
Для DPO и compliance-офицера:
- Инвентаризируй все места, где организация использует LLM. Включая теневые (сотрудники используют ChatGPT со своего аккаунта).
- Для каждого — оцени соответствие ФЗ № 152/GDPR: правовое основание, transborder-transfer, retention, безопасность.
- Заключи DPA с вендорами, где applicable.
- Обучай сотрудников: что такое PII, что можно/нельзя, как правильно пользоваться LLM.
Для юриста:
- Обновляй Terms of Service и Privacy Policy с учётом использования AI. Указывай, какие данные обрабатываются, для каких целей, с какими вендорами.
- Согласовывай форму согласия субъектов, если PII идёт в LLM.
- Готовь incident response plan с юридической частью.
Инструменты и сервисы
Заголовок раздела «Инструменты и сервисы»Что есть на рынке в 2026 году для защиты от утечек.
Redaction / DLP:
- Microsoft Presidio (open source) — русский язык поддерживается.
- Google Cloud DLP API — коммерческий, много встроенных типов.
- AWS Comprehend PII.
- Nightfall AI, Skyflow, Piiano — специализированные вендоры.
LLM gateway / proxy с политиками:
- Portkey, Helicone, LiteLLM Proxy — прокси, через которое идут все запросы к LLM. Можно применять политики: redaction, rate limits, alerts на подозрительное.
- Kong AI Gateway — enterprise решение с политиками.
Secrets management:
- AWS Secrets Manager, GCP Secret Manager, HashiCorp Vault, 1Password Secrets Automation.
Мониторинг ключей на GitHub:
- GitGuardian, TruffleHog — сканируют репозитории и алертят на утечку.
- GitHub Secret Scanning (встроен, включай на каждом репо).
Observability для LLM:
- Langfuse, LangSmith, Helicone — трекинг запросов, помогает ловить utечки в реальном времени.
Локальный запуск моделей:
- Ollama, vLLM, LM Studio — для запуска open source моделей.
- Together AI, Fireworks, Groq — облачный хостинг открытых моделей с приемлемой ценой.
План на неделю для команды
Заголовок раздела «План на неделю для команды»Если только сейчас решил заняться защитой от утечек через LLM.
День 1. Аудит. Составь список: какие LLM используются в компании, кем, для чего. Включи теневой использование (личные ChatGPT-аккаунты сотрудников).
День 2. Классификация данных, попадающих в LLM. По каждой точке использования: что за данные, где хранятся у вендора, кто имеет доступ.
День 3. Для каждой точки — решение: продолжаем как есть, переходим на Enterprise-план, добавляем redaction, переносим на локальную модель.
День 4. Написание AI Usage Policy. Одна страница: что разрешено, что запрещено, к кому обращаться. Разошли команде.
День 5. Технические меры: pre-commit hooks на секреты, redaction pipeline для критичных потоков, ZDR-контракт с вендором если нужен.
День 6. Обучение команды. 30-минутная встреча: чему обязательно нужно научить сотрудников (что нельзя пастить в ChatGPT, куда идти за корпоративным доступом).
День 7. Мониторинг и алерты. Логирование LLM-запросов через свою систему. Алерт на аномалии.
Использует ли OpenAI данные моих API-запросов для обучения?
Заголовок раздела «Использует ли OpenAI данные моих API-запросов для обучения?»По стандартной политике OpenAI (на 2026 год): нет, данные API не используются для обучения моделей. Хранятся до 30 дней для abuse monitoring, потом удаляются. Есть опция Zero Data Retention для enterprise-клиентов, при которой данные не хранятся вообще. Chat-интерфейс (ChatGPT Free/Plus) — там политика другая, данные могут использоваться, если пользователь не отключил в data controls.
А Anthropic Claude API?
Заголовок раздела «А Anthropic Claude API?»Аналогично OpenAI: данные API не используются для обучения, стандартный retention до 30 дней, ZDR доступен по договору для enterprise. Claude.ai (chat) — не используется для обучения без явного opt-in пользователя.
Что такое Zero Data Retention?
Заголовок раздела «Что такое Zero Data Retention?»Опция для enterprise, при которой вендор гарантирует не сохранять твои промпты и ответы после обработки. Данные обрабатываются in-memory, логи не пишутся. Оформляется отдельным договором. У OpenAI и Anthropic доступно для Enterprise-планов и крупных API-клиентов. Google Cloud Vertex AI также имеет опции без retention.
Могу ли я использовать ChatGPT для работы с клиентскими данными?
Заголовок раздела «Могу ли я использовать ChatGPT для работы с клиентскими данными?»С обычным ChatGPT Free/Plus — нет, если клиентские данные содержат PII. Промпты могут использоваться для обучения (если не отключил) и хранятся у вендора. С ChatGPT Team или Enterprise — можно, там гарантии не-обучения и Business Data Protection. Но для российских клиентов дополнительно смотри статью о transborder-transfer.
Что делать, если сотрудник случайно залил PII в chat?
Заголовок раздела «Что делать, если сотрудник случайно залил PII в chat?»По ФЗ № 152 (для российских операторов) — уведомить Роскомнадзор в течение 24 часов о факте неправомерной передачи. По GDPR — уведомить надзорный орган в 72 часа при риске для прав субъектов. Внутренне: инцидент-репорт, root cause analysis, обновление политики и обучения. Технически: если возможно — запросить у вендора удаление данных.
Безопасно ли использовать локальные модели (Llama, Qwen) для клиентских данных?
Заголовок раздела «Безопасно ли использовать локальные модели (Llama, Qwen) для клиентских данных?»Данные не покидают твою инфраструктуру, что снимает проблему transborder-transfer и retention у вендора. Но это не 100% безопасно: остаются вопросы правового основания обработки, надлежащих мер защиты твоей инфраструктуры, аудита. Локальные модели снимают часть рисков, не все.
Как проверить, что мой ключ API не утёк на GitHub?
Заголовок раздела «Как проверить, что мой ключ API не утёк на GitHub?»GitHub Secret Scanning работает автоматически для публичных репо, если ключ имеет распознаваемый формат (OpenAI, Anthropic ключи распознаются). Дополнительно: сервисы вроде GitGuardian сканируют публичный GitHub на утечки. Внутри команды — TruffleHog для сканирования истории репо. Периодически ротируй ключи, даже если утечка не подтверждена.
Что делать, если я хочу использовать иностранный LLM, но данные — российских граждан?
Заголовок раздела «Что делать, если я хочу использовать иностранный LLM, но данные — российских граждан?»Три опции: (1) redaction перед отправкой, чтобы данные перестали быть PII; (2) уведомление Роскомнадзора о transborder-transfer + согласие субъектов на transfer; (3) переход на российского провайдера (Yandex, Sber). Первая опция чаще всего практичнее. Юридические тонкости обсуди с юристом.
Хранит ли Google Gemini данные paid API?
Заголовок раздела «Хранит ли Google Gemini данные paid API?»По официальной политике Google Cloud (на 2026 год): промпты и ответы paid API Gemini не используются для обучения и не сохраняются постоянно. Retention — по политике Google Cloud, есть опции регионального хранения. Consumer Gemini (gemini.google.com) — другая политика, может использоваться для улучшения продуктов, retention до 18 месяцев по умолчанию.
Сколько стоит правильный контур для клиентских данных?
Заголовок раздела «Сколько стоит правильный контур для клиентских данных?»Для стартапа: Team/Business план ChatGPT ($25-30/user/мес) + Presidio open source + LiteLLM Proxy = ~$40-50/user/мес + разработка pipeline. Для среднего бизнеса: Enterprise-план + Google Cloud DLP или Nightfall + observability = $50-200/user/мес. Для крупного enterprise: индивидуальный контракт, обычно доля процента от общего IT-бюджета.
Есть ли смысл в собственной модели, если у меня 100 сотрудников?
Заголовок раздела «Есть ли смысл в собственной модели, если у меня 100 сотрудников?»При объёмах 100 сотрудников API-подход обычно дешевле локальной инфраструктуры. Локальная модель имеет смысл, если: (1) регуляторные требования жёсткие (гостайна, медицина в РФ), (2) объёмы очень большие (миллионы запросов в день), (3) нужен fine-tuning на закрытом домене. Иначе Enterprise-план с ZDR обычно выгоднее.
Какие данные регулятор точно проверит при аудите?
Заголовок раздела «Какие данные регулятор точно проверит при аудите?»Роскомнадзор в 2026 году активно проверяет: наличие уведомления об обработке PII, наличие уведомления о transborder-transfer (если применимо), договоры с обработчиками (DPA с LLM-вендором), реестр обработки, меры защиты, наличие DPO для крупных операторов. При инциденте — timeline уведомлений и мер mitigation.
Актуальность
Заголовок раздела «Актуальность»Актуально на 10.08.2026. Модели, цены и условия доступа меняются часто. Перед бизнес-решением всегда сверяйся с первоисточником — все ссылки в разделе Sources ниже.
Sources
Заголовок раздела «Sources»- https://openai.com/policies/privacy-policy — OpenAI Privacy Policy, актуальная версия (проверено 10.08.2026)
- https://openai.com/policies/business-terms — OpenAI Business Terms, условия для API и Enterprise (проверено 10.08.2026)
- https://openai.com/enterprise-privacy — политика по данным для Enterprise-планов (проверено 10.08.2026)
- https://trust.openai.com — OpenAI Trust Portal, security и privacy documentation (проверено 10.08.2026)
- https://www.anthropic.com/legal — все юридические документы Anthropic, включая Terms и Privacy (проверено 10.08.2026)
- https://trust.anthropic.com — Anthropic Trust Center (проверено 10.08.2026)
- https://policies.google.com/privacy — Google Privacy Policy, включая раздел Gemini (проверено 10.08.2026)
- https://cloud.google.com/gemini/docs/discover/data-governance — data governance для Gemini API в Google Cloud (проверено 10.08.2026)
- https://yandex.cloud/ru/docs/yandexgpt — документация YandexGPT (проверено 13.09.2026)
- https://developers.sber.ru — документация GigaChat API (проверено 10.08.2026)
- https://owasp.org/www-project-top-10-for-large-language-model-applications/ — OWASP Top 10 for LLM, включая LLM06 Sensitive Information Disclosure (проверено 10.08.2026)
- https://pravo.gov.ru — консультативная копия ФЗ № 152 «О персональных данных» (проверено 10.08.2026)
- https://edpb.europa.eu — European Data Protection Board, guidance по GDPR (проверено 10.08.2026)
- https://microsoft.github.io/presidio/ — документация Microsoft Presidio, redaction library (проверено 10.08.2026)