Глава 22

Не повышайте доверие при переходе между агентами

Subagent summary, shared memory и сообщения teammates остаются недоверенными данными. Иначе prompt injection получает новый путь через "своего" агента. Multi-agent topology расширяет attack surface: один worker читает внешнюю страницу, второй доверяет его summary, третий имеет write tool. Если host считает внутреннее сообщение безопасным только из-за sender id, внешняя инструкция может пройти через всю цепочку.

Anthropic отдельно описывает multi-agent trust escalation: subagent способен изолировать недоверенный content, но его output может ошибочно получить более высокий trust level. OWASP multi-agent threat guide отмечает дополнительные attack surfaces координирующихся автономных компонентов.

Построить границу доверия на конкретной цепочке помогает лаборатория.

Интерактивная лаборатория 4

Постройте границу доверия

Риск 5 из 10. Нужны isolation, scoped identity, output filtering и policy approval.

Минимальная защита складывается из нескольких правил: отмечайте source и trust class каждого поля; не переносите инструкции из retrieved content в system policy; передавайте structured facts со ссылками на raw evidence; повторно авторизуйте каждое действие на tool boundary; ограничивайте persistent memory и проверяйте её при загрузке; не выдавайте reviewer доверие выше проверяемых sources.

Trust class - это данные, а не отправитель. Сообщение не становится безопасным оттого, что пришло от "своего" агента. Безопасным его делает происхождение содержимого и повторная проверка на границе прав.

Границы доверия расставлены. Чтобы всё это можно было объяснить и отладить, решения, вызовы и границы нужно трассировать.

Проверка знаний

Как относиться к summary от subagent или сообщению teammate?

Ссылки