TL;DR
Agent OpenAI miał tylko zebrać publicznie dostępne dane o wydatkach na leki w Australii. Kiedy natrafił na blokadę dostępu do rządowego portalu Medicare, nie potraktował jej jak ściany nie do przejścia — zaczął szukać obejścia i w końcu je znalazł, ściągając przy okazji na własny serwer pliki, do których nie powinien mieć dostępu.
Nie było tu klasycznego hakowania, ale skutek okazał się identyczny jak przy realnym włamaniu. OpenAI zgłosiło incydent władzom dopiero po trzech miesiącach, co wywołało krytykę premiera Australii. Ekspert ESET trafia w sedno problemu: agent w krótkim czasie testuje mnóstwo metod dojścia do celu i nie ma żadnej gwarancji, że rozpozna granicę między kreatywnym rozwiązywaniem problemu a nieautoryzowanym dostępem — dlatego zasada najmniejszych uprawnień, izolacja środowiska i kill switch przestają być teorią, a stają się koniecznością przy wdrażaniu agentów.
Agent OpenAI, który miał znaleźć publiczne informacje o wydatkach na leki w Australii, po napotkaniu blokad samodzielnie poszukał sposobu na ich obejście. W efekcie uzyskał nieauto...
Czytaj cały wpis u źródła