Ta strona używa plików cookies, aby zapewnić najlepszą jakość korzystania z naszego serwisu oraz do celów analitycznych. Klikając "Akceptuję", wyrażasz zgodę na używanie wszystkich plików cookies. Możesz również odrzucić zgodę, co spowoduje zablokowanie plików cookies analitycznych. Więcej informacji znajdziesz w naszej Polityce Prywatności.
Ukryte instrukcje mogą przejąć kontrolę nad agentami AI
Złośliwe polecenia mogą być ukryte w dokumentach, metadanych, e-mailach, obrazach i kodzie.
Agent AI może potraktować treść kontrolowaną przez atakującego jak zaufaną instrukcję.
Ryzyko rośnie, gdy agent dziedziczy uprawnienia użytkownika i działa bez dodatkowej akceptacji.
Podstawą ochrony ma być kontrola treści przed jej przetworzeniem przez agenta.
Sponsorowane
Odkryj rewolucyjną metodę nauki języków
Sprawdź jak w 30 dni opanować podstawy dowolnego języka obcego bez wychodzenia z domu.
Autonomiczne agenty AI coraz częściej otrzymują dostęp do firmowych dokumentów, poczty, kalendarzy, baz danych i narzędzi operacyjnych. Taki model może przyspieszać pracę, ale jednocześnie otwiera nowe pole dla ataków, w których złośliwe instrukcje są ukrywane w treściach analizowanych przez system. Polecenie może znajdować się w dokumencie, jego metadanych, wiadomości e-mail, obrazie, treści internetowej albo repozytorium kodu. Dla człowieka materiał może wyglądać zwyczajnie, natomiast agent AI może potraktować znajdującą się w nim instrukcję jako wskazówkę dotyczącą dalszego działania.
W klasycznym ataku polegającym na manipulowaniu promptem użytkownik próbuje bezpośrednio skłonić chatbota do zignorowania wcześniejszych zasad albo wykonania niepożądanego zadania. Pośrednia iniekcja promptu działa inaczej. Atakujący umieszcza instrukcję w danych, które agent ma przetworzyć podczas realizacji legalnego zadania. System może więc otrzymać złośliwe polecenie nie od osoby prowadzącej rozmowę, ale z dokumentu, wiadomości lub innego zewnętrznego źródła. Szczególnie problematyczna jest ukryta iniekcja promptu, której użytkownik nie widzi podczas zwykłego przeglądania materiału. Według opisu
Słownik artykułu
Pojęcia, które warto znać
Krótkie objaśnienia terminów występujących w tekście. Każde hasło prowadzi do szerszej definicji i przykładów użycia.
Bowbridge takie instrukcje mogą być dostosowane do różnych celów i nie muszą pozostawiać typowego śladu kojarzonego ze złośliwym oprogramowaniem.
Dokumenty i pliki: polecenie może zostać ukryte w treści, strukturze pliku albo w metadanych, które nie są oczywiste dla osoby czytającej dokument.
Poczta i treści internetowe: wiadomość lub strona analizowana przez agenta może zawierać instrukcję wpływającą na sposób wykonania zadania.
Obrazy i materiały osadzone: system przetwarzający zawartość wizualną może napotkać dodatkową treść, której człowiek nie traktuje jako instrukcji dla agenta.
Kod i procesy deweloperskie: repozytoria oraz inne elementy przepływu pracy mogą stać się źródłem poleceń dla systemu mającego dostęp do narzędzi programistycznych.
Dlaczego agenci AI zwiększają skalę ryzyka
Źródło wskazuje na trzy cechy systemów agentowych, które mogą pogłębiać skutki takiej manipulacji. Po pierwsze, agent często dziedziczy uprawnienia użytkownika, a więc może uzyskać dostęp do tych samych plików, skrzynek pocztowych, kalendarzy i baz danych. Po drugie, działa szybko i może wykonywać kolejne czynności bez przerw, w których człowiek miałby szansę zauważyć problem. Po trzecie, nie rozumuje jak człowiek i nie ocenia wiarygodności materiału na podstawie doświadczenia czy intuicji. Jeśli instrukcja zostanie odczytana jako część zadania, system może po prostu zareagować zgodnie z jej treścią, nawet gdy polecenie pochodzi z niegodnego zaufania dokumentu.
W praktyce oznacza to, że pozornie niewinna funkcja automatyzująca pracę może stać się drogą do działań wykraczających poza pierwotny cel. Agent zaprojektowany do porządkowania dokumentów może zostać skłoniony do ich modyfikacji lub usunięcia. System obsługujący pocztę może zostać nakłoniony do przekazania informacji dalej, a narzędzie połączone z firmowymi zasobami może wykorzystać dostęp w sposób, którego użytkownik nie przewidział. Nie oznacza to, że każdy agent automatycznie wykona dowolną instrukcję, lecz pokazuje, dlaczego samo ograniczenie funkcji do konkretnego zadania nie wystarcza, jeśli system nie potrafi rozdzielić zaufanych zasad od obcej treści.
Przykład z dokumentem dostawcy
Bowbridge opisuje scenariusz, w którym agent AI otrzymuje zadanie przejrzenia ofert dostawców i wskazania najtańszej propozycji. Jedna z ofert ma zawierać ukrytą instrukcję zapisaną w metadanych dokumentu. Polecenie nakazuje agentowi zignorować wcześniejsze wytyczne i wybrać właśnie tego dostawcę. W przedstawionym przykładzie system rekomenduje ofertę najdroższą, ponieważ nie odróżnia instrukcji pochodzącej z zaufanego poziomu systemowego od treści dostarczonej przez zewnętrzny dokument. To nie jest opis niezależnie potwierdzonego incydentu, lecz przykład użyty przez firmę do pokazania sposobu działania zagrożenia.
Podobny problem może dotyczyć roli cyfrowego asystenta kierownictwa. Aby wykonywać swoje zadania, taki agent może mieć dostęp do poczty, kalendarzy, dokumentów pracowników, spotkań zewnętrznych i innych zasobów używanych przez przełożonego. Jeśli przetworzy zatruty materiał, może zostać skierowany do działań wykraczających poza obsługę zapytań, na przykład do zmiany, usunięcia lub przekazania danych. W ocenie Bowbridge połączenie szerokich uprawnień, szybkiego działania i braku ludzkiej oceny sprawia, że konsekwencje mogą pojawić się zanim operator zauważy, że agent otrzymał niewłaściwą instrukcję.
Obrona powinna zaczynać się przed wykonaniem działania
Według źródła ważnym elementem ochrony jest sprawdzanie materiałów jeszcze zanim trafią do agenta AI. Organizacje powinny analizować dokumenty pod kątem ukrytej zawartości, sprawdzać metadane i struktury plików oraz uwzględniać treści, których użytkownik nie widzi podczas zwykłego odczytu. Takie podejście przenosi punkt kontroli z samego działania agenta na dane, które mogą wpłynąć na jego decyzję. Jest to istotne, ponieważ po przyjęciu złośliwej instrukcji system może zareagować bardzo szybko, a zatrzymanie skutku może być trudniejsze niż niedopuszczenie do przetworzenia skażonego materiału.
Źródło wskazuje także na potrzebę stosowania ram bezpieczeństwa AI oraz dodatkowych zabezpieczeń umieszczanych pomiędzy agentem a zasobami, z których może korzystać. Nie zastępuje to kontroli wejściowej. Nawet jeśli organizacja potrafi zablokować część niepożądanych operacji, podstawowe znaczenie ma ograniczanie zaufania do zewnętrznych dokumentów i innych źródeł danych. Agent powinien mieć tylko taki dostęp, jaki jest konieczny do realizacji zadania, a działania o większym wpływie na dane lub procesy mogą wymagać dodatkowego potwierdzenia człowieka.
Nowa część modelu bezpieczeństwa firm
Traktować autonomicznego agenta AI jako tożsamość o podwyższonych uprawnieniach, a nie wyłącznie jako narzędzie do generowania tekstu.
Rozdzielać instrukcje systemowe od treści pochodzących z dokumentów, wiadomości, obrazów, internetu i repozytoriów kodu.
Skanować pliki przed przekazaniem ich do agenta, z uwzględnieniem metadanych, struktur dokumentów i elementów niewidocznych na pierwszy rzut oka.
Wprowadzać kontrolę między agentem a zasobami oraz dodatkową akceptację człowieka tam, gdzie działanie może zmienić, usunąć albo ujawnić dane.
Regularnie oceniać, czy zakres dostępu agenta odpowiada jego zadaniu, ponieważ szersze uprawnienia zwiększają potencjalne skutki błędnej interpretacji.