// avlab.pl

Zgrabny tekst i proza oszukują filtry bezpieczeństwa AI ze 100% skutecznością

Streszczenie wpisu i odnośnik do pełnej treści u źródła.

Zgrabny tekst i proza oszukują filtry bezpieczeństwa AI ze 100% skutecznością

TL;DR

Wystarczy ukryć złośliwe polecenie w eleganckiej, gramatycznie poprawnej prozie, żeby oszukać filtry bezpieczeństwa czterech czołowych systemów AI. W 23 testowych atakach technika PuzzleMask ani razu nie została wykryta przez Claude-3-Haiku, GPT-4o-Mini, GPT-oss-safeguard i Llama-Guard3 - żaden z nich nie odróżnił niewinnego wiersza od zakamuflowanej instrukcji.

Sztuczka wykorzystuje lukę w typowej dwupoziomowej architekturze obrony: szybki model-strażnik ocenia tekst na wejściu i widzi tylko poezję, a dopiero drugi, potężniejszy model faktycznie wykonuje ukryte polecenie - w 94% prób mimo ponad minuty głębokich obliczeń. Jedynym wyjątkiem okazały się modele klasy Opus od Anthropic, co sugeruje, że nie sama moc obliczeniowa, ale konkretne podejście do bezpieczeństwa robi różnicę.

Mamy nową technikę ataku na sztuczną inteligencję. PuzzleMask wykorzystuje nienaganną, naturalną prozę, by bez trudu ominąć systemy filtrujące wiodących dostawców AI, obnażając kry...

Czytaj cały wpis u źródła

// powiązane wpisy