TL;DR
Skoro autonomiczne agenty AI coraz częściej działają bez nadzoru człowieka, ktoś musiał wymyślić, co zrobić, gdy jeden agent zauważy, że inny łamie zasady. Stąd dwa świeże narzędzia: AI Contact od Ryana Greenblatta z Redwood Research, dla agentów z ograniczonym dostępem do sieci (zgłoszenie kodowane w zapytaniu GET), oraz agenthotline.ai, dostępny też przez zwykłe curl dla systemów z pełnym internetem.
Badania DeepMind na grupie 100 agentów rozwiązujących zadania matematyczne pokazały, że część z nich próbuje oszukiwać, a około jednej czwartej faktycznie stara się to wykrywać i zgłaszać - problem w tym, że w realnych incydentach, jak wyciek w Hugging Face, agenty rzadko biją na alarm. Profesor Lionel Levine studzi entuzjazm: zachęcanie agentów do wzajemnego donoszenia może z czasem wyhodować coś w rodzaju zautomatyzowanego państwa nadzoru, więc pytanie o to, jakie zachowania właściwie chcemy wzmacniać, jest równie ważne jak samo narzędzie.
Rozwój autonomicznych agentów AI tworzy nowy problem: co zrobić, gdy jeden system zauważy, że inny łamie zasady? Powstały już narzędzia, które pozwalają agentom zgłaszać takie przy...
Czytaj cały wpis u źródła