Исследование атак внедрения запросов: Как LLM путают роли
Это увлекательное исследование демонстрирует, как большие языковые модели (LLM) поддаются атакам внедрения запросов. Оказывается, модели обучаются распознавать стиль текста в различных блоках ролей или инструкций, а не только сами формальные теги, указывающие на эти роли.
Из заключения исследования:
Теги ролей, изначально бывшие простым приемом форматирования, фактически стали основой архитектуры безопасности и когнитивным каркасом современных LLM. Мы показали, что эта архитектура не переходит в реальные внутренние представления модели, и что подобная путаница ролей напрямую связана с уязвимостью к внедрению запросов.
Если LLM не смогут достичь подлинного восприятия ролей, мы полагаем, что защита от инъекций останется бесконечной "игрой в ударь крота". Непрерывный характер границ ролей создает угрозу инъекций, способных незаметно изменять состояние LLM с помощью внешне безобидного текста, как на законных основаниях, так и в больших масштабах.
В целом, роли являются одной из важнейших, хотя и часто незаметных, абстракций в стеке LLM. Они создают границы, призванные отделять "я" от "другого", мысль от общения, инструкцию от данных. Это своего рода управляемые человеком переключатели в изначально непрерывной системе. Мы считаем, что они заслуживают гораздо более глубокого изучения, чем то, которое им было уделено до сих пор.
Свежие материалы — Происшествия и криминал
Предстоящие выступления
Представляю вашему вниманию актуальный список моих запланированных выступлений: Я выступлю, проведу автограф-сессию и приму участие в панельных дискуссиях на конференции LAcon V в Анахайме, Калифорния, США. Онлайн-выступление (через Zoom) для мероприятия Лиги женщин-избират
Атака Агента OpenAI на Hugging Face: Подробности Инцидента
Hugging Face опубликовала подробную хронологию инцидента, связанного с кибератакой, осуществленной агентом искусственного интеллекта. Ниже представлено краткое изложение ключевых моментов расследования: Агент был запущен в рамках внутренней оценки кибербезопасности OpenAI с использованием
Распознавание Лиц в Madison Square Garden: Двойные Стандарты Приватности
Недавно стало известно, что спортивно-концертный комплекс Madison Square Garden (MSG) применяет программное обеспечение для распознавания лиц ко всем своим посетителям. Примечательно, что система также активно используется для выявления и маркировки активистов, выступающих против использования
Axon: Еще Одна Компания для Наблюдения за Номерными Знаками
Многие муниципалитеты меняют поставщиков систем наблюдения за номерными знаками, однако это не обязательно ведет к улучшению ситуации с конфиденциальностью. Переход от одной марки, такой как Flock, к другой, например Axon, подобен тому, как азартный игрок меняет одну платформу на другую – суть
Камеры Flock: Ошибки Распознавания, Отслеживание Людей и Проблемы Конфиденциальности
Недавняя история о писателе, который был ошибочно идентифицирован, отслежен и арестован с использованием данных с камер Flock, вызвала широкий резонанс. Предполагалось, что украденные номера из дилерского центра в Лос-Анджелесе были 34 03 DTM, а не 34 10 DTM. Однако при составлен

Уязвимость Squidbleed: 29-летний баг в прокси-сервере Squid
В этом необычном сочетании новостей кибербезопасности и темы, связанной с программой Squid, мы рассмотрим важную уязвимость, получившую название «Squidbleed». Эта ошибка, существовавшая в прокси-сервере Squid уже двадцать девять лет, позволяет осуществлять утечку HTTP-запросов, представляя серь