Безпека ШІ: які дані не варто передавати штучному інтелекту?
Ретельний контроль даних, які ви вводите, — основа безпечного користування споживчими версіями мовних моделей: інформація, надіслана до відкритих інструментів штучного інтелекту, залишає локальне середовище користувача. Передавання конфіденційних даних ШІ створює ризик витоку, розкриття комерційної таємниці та порушення законодавства про захист персональних даних. Тому кожну взаємодію з ШІ варто сприймати так, ніби ви публікуєте інформацію у відкритому доступі.
Що не можна вставляти в запити до ШІ?
У загальнодоступних моделях категорично не слід обробляти такі дані:
- персональні дані — імена, прізвища, адреси, номери паспортів чи ID-карток, РНОКПП, номери телефонів та адреси електронної пошти клієнтів, працівників і власні;
- медичну документацію — історії хвороб, результати обстежень і діагнози пацієнтів, захищені суворими правовими нормами, зокрема GDPR або HIPAA;
- конфіденційну інформацію компанії — неопубліковані фінансові звіти, маркетингові стратегії, клієнтські бази, плани злиття, поглинання чи скорочення персоналу;
- комерційні таємниці — вихідний код програм, виробничі рецептури, унікальні алгоритми та внутрішню технічну документацію компанії;
- паролі та реквізити доступу — ключі API, дані для входу, токени авторизації, реквізити платіжних карток і ключі шифрування;
- матеріали, захищені авторським правом — повні тексти книжок, платних наукових статей або сценаріїв, на використання яких у вас немає відповідної ліцензії;
- незаконний контент — матеріали, що пропагують насильство чи ненависть, або інструкції щодо протиправних дій.
Що відбувається з даними, які ви вводите в ШІ?
Дані, надіслані постачальникам хмарних послуг, проходять кілька етапів обробки й аналізу. Їхній життєвий цикл не обмежується генеруванням відповіді.
Навчання моделей
Дані, введені у стандартних споживчих версіях генеративних інструментів, нерідко використовують для подальшого навчання моделей. Це означає, що така інформація може вплинути на вагові коефіцієнти нейромережі й теоретично з’явитися в майбутній відповіді іншому користувачеві.
Ручна перевірка та модерація
Окрім автоматизованої обробки, системи ШІ використовують фільтри безпеки. Якщо алгоритм визнає запит підозрілим, наприклад таким, що порушує правила сервісу, розмову можуть позначити й передати на ручну перевірку. Це означає, що працівники постачальника послуг або зовнішні фахівці з розмітки даних можуть отримати доступ до введеного тексту, зокрема для вдосконалення модерації.
Зберігання даних і резервні копії
Постачальники ШІ зберігають історію розмов на своїх серверах, щоб забезпечувати роботу сервісу, діагностувати помилки та зберігати контекст для наступних сеансів. Важливо: видалення чату в інтерфейсі зазвичай не означає негайного видалення інформації із серверів. Дані можуть певний час залишатися в резервних копіях постачальника, що підвищує ризик розкриття конфіденційної інформації в разі успішної кібератаки на хмарну інфраструктуру.
Особисті й корпоративні облікові записи: чим відрізняється захист?
Рівень захисту під час роботи з ШІ істотно залежить від типу підписки та способу розгортання сервісу.
Безплатні та платні стандартні особисті облікові записи в багатьох популярних сервісах за замовчуванням передбачають використання надісланої інформації для навчання моделей. Якщо передати через них конфіденційні матеріали, виникає ризик втрати контролю над цими даними.
У бізнес- і корпоративних середовищах — наприклад, в облікових записах типу Enterprise або сервісах, розгорнутих у приватних хмарах через API постачальників на кшталт Microsoft Azure, AWS чи Google Cloud, — діють суворіші стандарти захисту. Постачальники гарантують відповідність стандартам безпеки та вимогам захисту даних (ISO 27001, SOC 2, GDPR), а також зазначають в угодах SLA/DPA, що дані клієнтів не використовують для навчання загальнодоступних базових моделей. Вимоги до введення даних у таких середовищах можуть бути менш жорсткими, проте політика управління ризиками й контроль доступу все одно необхідні.
Що можна безпечно вводити в ШІ?
Попри численні обмеження, є чимало інформації, яку можна передавати ШІ для обробки. Зокрема:
- загальнодоступні матеріали — статті з відкритих джерел, дописи в блогах, оприлюднені ринкові звіти, нормативно-правові акти та вміст відкритих сайтів, наприклад Вікіпедії;
- неконфіденційну інформацію — загальні інструкції, запитання про теоретичні поняття, правила граматики й правопису, математичні рівняння та словникові запити;
- анонімізовані фрагменти документів — шаблони листів, зразки договорів або фрагменти коду, з яких повністю вилучено унікальні змінні, ключі, назви клієнтів і відомості про внутрішню архітектуру;
- власні творчі тексти — чернетки електронних листів, дописи для соціальних мереж, плани презентацій і статті, що не містять чутливих бізнес-даних;
- відкриті набори даних — синтетичні дані або статистику з публічних репозиторіїв для навчання аналізу й форматування.
Як анонімізувати повідомлення й дані перед надсиланням до ШІ?
Перш ніж надсилати конфіденційні документи мовній моделі, їх потрібно підготувати й очистити від чутливої інформації. Так можна працювати з текстом, не розкриваючи конфіденційних даних.
Видалення ідентифікаторів і токенізація
Токенізація полягає в заміні чутливих даних умовними позначеннями. Наприклад, ім’я «Олена Петренко» можна замінити на маркер «[Клієнт_1]», а назву компанії «ТОВ Мрія» — на «[Організація_А]». Так мовна модель отримує структуру, синтаксис і контекст документа, але не може визначити, про яку саме особу чи компанію йдеться.
Маскування чутливої інформації
Маскування — це приховування критично важливих послідовностей символів, найчастіше шляхом заміни їх спеціальними знаками, наприклад: номер картки 4532 **** **** ****. Ще один дієвий метод — узагальнення даних. Замість точної суми, скажімо зарплати 45 000 грн, можна вказати діапазон «40 000–50 000 грн». Це зменшує ризик повторної ідентифікації людини.
Автоматизація: інструменти DLP і RegEx
Під час ручного очищення довгих текстів легко щось пропустити. У професійних середовищах використовують скрипти на основі регулярних виразів (RegEx) або системи DLP для запобігання витоку даних. Такі інструменти можуть автоматично перевіряти запит перед надсиланням, виявляючи й блокуючи або замінюючи послідовності, схожі на РНОКПП, податкові номери компаній, адреси електронної пошти чи номери банківських рахунків.
Як вимкнути навчання ШІ на ваших даних?
Зменшити ризики, пов’язані з передаванням інформації ШІ, можна також за допомогою налаштувань самого інструмента. Більшість постачальників дають змогу відмовитися від використання ваших розмов для навчання моделей.
- ChatGPT (OpenAI) — у налаштуваннях облікового запису (Settings), у розділі «Data controls», є перемикач «Improve the model for everyone». Якщо його вимкнути, нові розмови не використовуватимуться для навчання моделі. У поточній версії інтерфейсу це не видаляє історію чатів. Залежно від режиму роботи та політики зберігання OpenAI може ще певний час зберігати журнали розмов для безпеки й запобігання зловживанням.
- Gemini (Google) — у налаштуваннях приватності можна вимкнути «Gemini Apps Activity». Тоді нові розмови не зберігатимуться в історії активності облікового запису Google і не використовуватимуться для навчання моделей у межах цієї функції. Водночас це не означає миттєвого видалення всіх даних з інфраструктури постачальника: Google може тимчасово зберігати їх для безпеки сервісу.
- Claude (Anthropic) — у стандартних споживчих версіях варто перевірити поточні налаштування використання розмов для вдосконалення сервісу: політика компанії змінювалася. Щоб відмовитися від використання даних для навчання, перейдіть до розділу приватності в налаштуваннях облікового запису й вимкніть «Help improve Claude».
Пам’ятайте: зміна налаштувань приватності та відмова від використання даних для навчання діють на майбутні розмови. Вони не гарантують вилучення інформації, яку було надіслано й використано раніше.
Підсумок
- Сприймайте взаємодію зі споживчими ШІ-сервісами так, ніби публікуєте інформацію у відкритому доступі: не вводьте персональні дані, медичну документацію, паролі та комерційні таємниці.
- Надіслана інформація може проходити кілька етапів обробки, зокрема використовуватися для навчання моделей, модерації та зберігатися в резервних копіях.
- Зменшити ризики допомагають попередня анонімізація, маскування чутливих даних, токенізація та спеціалізовані інструменти DLP.
- Облікові записи типу Enterprise і спеціалізовані бізнес-середовища зазвичай пропонують суворіші стандарти захисту та договірні гарантії щодо невикористання даних для навчання загальнодоступних моделей.
- Зміна налаштувань приватності стосується майбутніх розмов і не гарантує вилучення даних, які було передано раніше.
Залишити відповідь