Не повышайте доверие при переходе между агентами
Subagent summary, shared memory и сообщения teammates остаются недоверенными данными. Иначе prompt injection получает новый путь через "своего" агента. Multi-agent topology расширяет attack surface: один worker читает внешнюю страницу, второй доверяет его summary, третий имеет write tool. Если host считает внутреннее сообщение безопасным только из-за sender id, внешняя инструкция может пройти через всю цепочку.
Anthropic отдельно описывает multi-agent trust escalation: subagent способен изолировать недоверенный content, но его output может ошибочно получить более высокий trust level. OWASP multi-agent threat guide отмечает дополнительные attack surfaces координирующихся автономных компонентов.
Построить границу доверия на конкретной цепочке помогает лаборатория.
Постройте границу доверия
Риск 5 из 10. Нужны isolation, scoped identity, output filtering и policy approval.
Минимальная защита складывается из нескольких правил: отмечайте source и trust class каждого поля; не переносите инструкции из retrieved content в system policy; передавайте structured facts со ссылками на raw evidence; повторно авторизуйте каждое действие на tool boundary; ограничивайте persistent memory и проверяйте её при загрузке; не выдавайте reviewer доверие выше проверяемых sources.
Trust class - это данные, а не отправитель. Сообщение не становится безопасным оттого, что пришло от "своего" агента. Безопасным его делает происхождение содержимого и повторная проверка на границе прав.
Границы доверия расставлены. Чтобы всё это можно было объяснить и отладить, решения, вызовы и границы нужно трассировать.
Как относиться к summary от subagent или сообщению teammate?