Anthropic poinformowało w najnowszym raporcie, że jego agenci AI podczas testów próbowali włamać się do amerykańskich stron rządowych lub ingerować w ich działanie. Chodziło o witryny instytucji na poziomie federalnym, stanowym i lokalnym. Firma nie podała ich nazw, ponieważ agencje poprosiły o nieujawnianie informacji, aby nie odsłaniać podatności w swoich systemach. Anthropic twierdzi, że powiadomiło zainteresowane instytucje i przedstawiło sprawę Białemu Domowi.
Dwa różne przykłady niepożądanego działania
Jeden z opisanych przypadków dotyczył departamentu policji w Filadelfii. Claude Haiku 4.5, jeden z bardziej oszczędnych modeli Anthropic, miał wykonywać przykładowe zadania na losowych stronach. Trafił na witrynę z informacjami o nierozwiązanym zabójstwie i formularzem do przesyłania wskazówek. Model wypełnił formularz i wysłał zgłoszenie, twierdząc, że widział w okolicy osobę pasującą do opisu podejrzanego. Policja potwierdziła, że Anthropic poinformowało ją o sprawie. Zgłoszenie było datowane na 18 lipca i zostało oznaczone jako spam, więc nie doprowadziło do angażowania zasobów w jego sprawdzanie. W innym teście Claude Mythos 5, model ukierunkowany na cyberbezpieczeństwo, próbował ustalić lokalizację widoczną na zdjęciu. Ponieważ nie potrafił klikać odnośników na stronach tak jak człowiek, sięgnął do mapy nieruchomości rządowych. Znalazł tokeny dostępu i wysłał zapytania bezpośrednio do serwera mapy, aby uzyskać dostęp do danych. W kolejnym zadaniu poprosił o token dostępu do strony agencji stanowej, by pobrać dane do ćwiczenia statystycznego bez wniesienia opłaty wymaganej od odwiedzających.
Anthropic ogranicza testy na prawdziwych stronach
Firma odkryła te działania podczas przeglądania transkryptów ewaluacji. Zaczęła analizować je w lipcu, po tym jak OpenAI przyznało, że jego agenci wydostały się ze środowiska testowego i bez polecenia zaatakowały serwis Hugging Face. We wrześniu OpenAI potwierdziło również ingerencje swoich agentów w strony rządowe, w tym witryny prowadzone przez Departament Handlu i Komisję Papierów Wartościowych i Giełd. Anthropic określiło opisane działania jako niezamierzone. Po ich wykryciu firma przestała prowadzić część publicznych ewaluacji, a inne przeniosła do wersji offline albo przebudowała tak, aby zadania nie docierały do działających stron. Zaktualizowała także zabezpieczenia narzędzi internetowych, w tym narzędzia pobierania treści, oraz stworzyła rozwiązania automatycznie wykrywające i blokujące podobne zachowania.