ChatGPT може запам'ятати брехню: вчені знайшли небезпечну вразливість
- Впровадження (Injection): зловмисник надсилає приховане шкідливе навантаження у цільовий ШІ-агент.
- Активація (Activation): отруєний спогад витягується з бази даних під час виконання легітимного запиту користувача.
Агенти LLM без пам’яті обробляють кожну взаємодію ізольовано. Агенти LLM із постійною пам’яттю дають змогу здійснювати запити та отримувати збережену інформацію (схема: Джордж Торрес, Шарад Шрестха та Сатьяджаянт Місра)
Читайте більше: Роботи перестали "думати" перед кожною перешкодою: у чому секрет
Як нейтралізувати загрозу?
Вразливість виникає через відсутність орієнтованого на безпеку управління пам’яттю. Для вирішення цієї проблеми дослідники розробили систему захисту Agentic Memory Sentry (AM-Sentry).
Захисний механізм AM-Sentry базується на двох методах:
Політика збереження пам'яті (memory-saving policy): контролює процес запису нових даних у довготривале сховище.
Екран витягування пам'яті (memory-retrieval screen): перевіряє збережені інструкції безпосередньо перед їхньою активацією та виконанням.
За даними експериментів, застосування AM-Sentry суттєво знижує успішність атаки GhostWriter, зберігаючи при цьому загальну функціональність і продуктивність ШІ-агента.
Науковці переконані, що розроблені стратегії можуть бути адаптовані для підвищення безпеки інших ШІ-систем з довготривалою пам'яттю.
Ще більше цікавого:
- Роботом тепер можна керувати силою думки: нову технологію вже показали
- "Батько інтернету" взявся за головну проблему ШІ: у чому рішення