TL;DR
Wystarczy ukryć złośliwe polecenie w eleganckiej, gramatycznie poprawnej prozie, żeby oszukać filtry bezpieczeństwa czterech czołowych systemów AI. W 23 testowych atakach technika PuzzleMask ani razu nie została wykryta przez Claude-3-Haiku, GPT-4o-Mini, GPT-oss-safeguard i Llama-Guard3 - żaden z nich nie odróżnił niewinnego wiersza od zakamuflowanej instrukcji.
Sztuczka wykorzystuje lukę w typowej dwupoziomowej architekturze obrony: szybki model-strażnik ocenia tekst na wejściu i widzi tylko poezję, a dopiero drugi, potężniejszy model faktycznie wykonuje ukryte polecenie - w 94% prób mimo ponad minuty głębokich obliczeń. Jedynym wyjątkiem okazały się modele klasy Opus od Anthropic, co sugeruje, że nie sama moc obliczeniowa, ale konkretne podejście do bezpieczeństwa robi różnicę.
Mamy nową technikę ataku na sztuczną inteligencję. PuzzleMask wykorzystuje nienaganną, naturalną prozę, by bez trudu ominąć systemy filtrujące wiodących dostawców AI, obnażając kry...
Czytaj cały wpis u źródła// tagi