Bezpečnosť AI: aké údaje by ste nemali zdieľať s umelou inteligenciou?
Dôsledná kontrola zadávaných údajov je základom bezpečného používania spotrebiteľských verzií jazykových modelov, pretože informácie odoslané do verejne dostupných nástrojov AI opúšťajú lokálne prostredie používateľa. Zadávanie dôverných údajov do AI prináša riziko úniku informácií, prezradenia obchodného tajomstva aj porušenia predpisov o ochrane osobných údajov. Ku každej interakcii s AI preto pristupujte, akoby ste informácie zverejňovali.
Čo nevkladať do AI?
Do verejne dostupných modelov v žiadnom prípade nevkladajte tieto kategórie údajov:
- osobné údaje – mená, priezviská, adresy, rodné čísla, telefónne čísla či e-mailové adresy klientov, zamestnancov alebo vaše vlastné;
- zdravotnú dokumentáciu – anamnézy, výsledky vyšetrení a diagnózy pacientov, ktoré podliehajú prísnym právnym predpisom, napríklad GDPR či HIPAA;
- dôverné firemné informácie – nezverejnené finančné správy, marketingové stratégie, databázy klientov či plány fúzií, akvizícií alebo prepúšťania;
- obchodné tajomstvá – zdrojový kód softvéru, výrobné receptúry, jedinečné algoritmy či internú technickú dokumentáciu firmy;
- heslá a prístupové údaje – kľúče API, prihlasovacie údaje, autorizačné tokeny, údaje o platobných kartách a šifrovacie kľúče;
- materiály chránené autorským právom – celé knihy, platené vedecké články či scenáre, na ktorých použitie nemáte príslušnú licenciu;
- nezákonný obsah – materiály propagujúce násilie alebo nenávisť či návody na konanie v rozpore so zákonom.
Čo sa deje s údajmi zadanými do AI?
Údaje odoslané poskytovateľom cloudových služieb prechádzajú viacerými fázami spracovania a analýzy. Ich životný cyklus sa nekončí vygenerovaním odpovede.
Trénovanie modelov
Údaje zadané do štandardných spotrebiteľských verzií generatívnych nástrojov sa často používajú na ďalšie trénovanie modelov. Zadané informácie tak môžu ovplyvniť váhy neurónovej siete a teoreticky sa v budúcnosti objaviť v odpovedi pre úplne iného používateľa.
Manuálna kontrola a moderovanie
Systémy AI okrem automatizovaného spracovania používajú aj bezpečnostné filtre. Ak algoritmus vyhodnotí požiadavku ako podozrivú, napríklad ako porušenie pravidiel služby, konverzácia môže byť označená a odoslaná na manuálnu kontrolu. Zamestnanci poskytovateľa alebo externí audítori, takzvaní anotátori údajov, tak môžu získať priamy prístup k zadanému obsahu s cieľom zlepšiť mechanizmy moderovania.
Ukladanie údajov a zálohy
Poskytovatelia AI uchovávajú záznamy konverzácií na svojich serveroch, aby zabezpečili kontinuitu služieb, diagnostikovali chyby a zachovali kontext pre budúce relácie. Vymazanie chatu v používateľskom rozhraní však zriedka znamená okamžité odstránenie informácií zo serverov. Údaje zostávajú určitý čas v záložných systémoch poskytovateľa, čo zvyšuje riziko odhalenia dôverných informácií pri úspešnom kybernetickom útoku na cloudovú infraštruktúru.
Súkromné a firemné účty: rozdiely v úrovni ochrany
Úroveň ochrany údajov pri používaní AI sa výrazne líši podľa typu predplatného a spôsobu nasadenia.
Bezplatné aj platené štandardné súkromné účty v mnohých populárnych službách predvolene umožňujú používať odoslané informácie na trénovanie modelov. Ak do nich vložíte dôverný obsah, každá relácia tak predstavuje riziko jeho nekontrolovaného sprístupnenia.
V podnikových a korporátnych prostrediach – napríklad pri účtoch Enterprise alebo službách prevádzkovaných v súkromných cloudoch cez API poskytovateľov, ako sú Microsoft Azure, AWS či Google Cloud – platia prísnejšie štandardy ochrany. Poskytovatelia deklarujú súlad s bezpečnostnými normami a predpismi (ISO 27001, SOC 2, GDPR) a v zmluvách (SLA/DPA) uvádzajú, že údaje klientov nepoužívajú na trénovanie verejne dostupných základných modelov. Obmedzenia týkajúce sa zadávaných údajov môžu byť v takýchto prostrediach miernejšie, stále však vyžadujú pravidlá riadenia rizík a kontroly prístupu.
Čo možno bezpečne vložiť do AI?
Napriek mnohým obmedzeniam existuje široká škála informácií, ktoré možno do AI vložiť a spracovať. Patria medzi ne napríklad:
- verejne dostupné materiály – články z otvorených zdrojov, blogové príspevky, verejne prístupné trhové správy, právne predpisy či obsah webových stránok, napríklad Wikipédie;
- nedôverné informácie – všeobecné pokyny, otázky o teoretických konceptoch, gramatické a pravopisné pravidlá, matematické rovnice či jazykové otázky;
- anonymizované časti dokumentácie – šablóny listov, vzory zmlúv či úryvky kódu, z ktorých boli úplne odstránené jedinečné premenné, kľúče, názvy klientov a informácie o internej architektúre;
- vlastné tvorivé texty – návrhy e-mailov, príspevkov na sociálne siete, osnovy prezentácií či články, ktoré neobsahujú citlivé firemné údaje;
- otvorené súbory údajov – syntetické údaje alebo štatistiky z verejných repozitárov používané na učenie sa analýzy a formátovania.
Ako účinne anonymizovať správy a údaje pred odoslaním do AI?
Pred odoslaním dôverných dokumentov do jazykového modelu ich treba pripraviť a odstrániť z nich citlivé informácie. Vďaka tomu možno s textom pracovať bez zbytočného rizika odhalenia dôverných údajov.
Nahrádzanie identifikátorov a tokenizácia
Pri tokenizácii sa citlivé údaje nahrádzajú zástupnými označeniami. Meno „Ján Novák“ možno napríklad nahradiť značkou „[Klient_1]“ a názov „Spoločnosť ABC“ značkou „[Organizácia_A]“. Jazykový model tak môže pracovať so štruktúrou, syntaxou a kontextom dokumentu bez toho, aby dostal pôvodné identifikačné údaje.
Techniky maskovania citlivých informácií
Maskovanie znamená priame skrytie kritických reťazcov, najčastejšie ich nahradením špeciálnymi znakmi, napríklad pri čísle karty 4532 **** **** ****. Účinná je aj generalizácia údajov: namiesto presnej hodnoty, napríklad mzdy 3 200 EUR, sa použije interval „mzda v rozmedzí 3 000–4 000 EUR“. Tým sa znižuje riziko spätnej identifikácie.
Automatizácia procesu pomocou DLP a RegEx
Pri manuálnom odstraňovaní informácií z dlhých textov možno ľahko niečo prehliadnuť. V profesionálnom prostredí sa preto používajú skripty založené na regulárnych výrazoch (RegEx) alebo systémy DLP (Data Loss Prevention). Tieto nástroje dokážu automaticky skontrolovať zadanie pred odoslaním a odhaliť, zablokovať alebo nahradiť reťazce zodpovedajúce formátu rodných čísel, DIČ, e-mailových adries či čísel bankových účtov.
Ako vypnúť trénovanie AI na vašich údajoch?
Riziko spojené so zadávaním informácií do AI možno obmedziť aj nastavením samotného nástroja. Väčšina poskytovateľov ponúka možnosť odmietnuť používanie obsahu na trénovanie modelov.
- ChatGPT (OpenAI) – v nastaveniach účtu „Settings“ nájdete v časti „Data controls“ možnosť „Improve the model for everyone“. Jej vypnutím sa zadané texty prestanú používať na trénovanie modelu. V aktuálnej verzii rozhrania pritom konverzácie zostanú viditeľné v histórii chatov. Podľa opísaných pravidiel uchovávania OpenAI naďalej uchováva záznamy na svojich serveroch 30 dní na účely bezpečnosti a monitorovania zneužívania, kým ich natrvalo vymaže.
- Gemini (Google) – v nastaveniach súkromia vypnite funkciu „Gemini Apps Activity“. Nové konverzácie sa potom nebudú ukladať do účtu Google ani používať na trénovanie modelov. Táto zmena však neodstráni záznamy z infraštruktúry poskytovateľa: Google ich na účely bezpečnosti služby uchováva najviac 72 hodín.
- Claude (Anthropic) – bezplatné a štandardné spotrebiteľské verzie majú v súčasnosti predvolené nastavenia, ktoré umožňujú používať zadané údaje na zlepšovanie modelov. Ide o významnú zmenu oproti začiatkom spoločnosti, keď Anthropic zdôrazňoval, že konverzácie používateľov na trénovanie nepoužíva. Ak chcete túto možnosť vypnúť, prejdite v nastaveniach účtu do sekcie ochrany súkromia a deaktivujte „Help improve Claude“.
Pamätajte, že zmeny nastavení súkromia a vypnutie používania údajov na trénovanie platia len do budúcnosti. Nevzťahujú sa spätne na informácie, ktoré už boli odoslané a zahrnuté do trénovania modelu.
Zhrnutie
- Ku každej interakcii so spotrebiteľskou verziou nástroja AI pristupujte, akoby ste informácie zverejňovali. Nevkladajte do nej osobné údaje, zdravotnú dokumentáciu, heslá ani obchodné tajomstvá.
- Odoslané informácie môžu prejsť viacerými fázami spracovania vrátane trénovania modelov, moderovania a uchovávania záloh na serveroch poskytovateľa.
- Bezpečnejšiu prácu s modelom umožňuje predchádzajúca anonymizácia, maskovanie citlivých reťazcov, tokenizácia a používanie nástrojov DLP.
- Účty Enterprise a vyhradené podnikové cloudové prostredia poskytujú prísnejšie štandardy ochrany a zmluvné záruky, že sa údaje nepoužijú na trénovanie verejných modelov.
- Zmeny nastavení súkromia a vypnutie používania údajov na trénovanie platia len do budúcnosti; spätne neodstránia informácie, ktoré už boli zahrnuté do trénovania.
Pridaj komentár