Voice и кол-центр: prompt проектирует разговор
Текстовый ассистент отвечает абзацами, голосовой - репликами в реальном времени, и это меняет prompt. Ответ нельзя пролистать глазами, пользователь перебивает, аудио бывает неясным, а задержка слышна. Поэтому правила turn-taking важнее красивой персоны.
# Role and objective
Голосовой ассистент службы доставки. Помоги узнать статус, изменить время
или передать разговор оператору.
# Language and voice
- Отвечай на языке текущей реплики, если пользователь явно не выбрал другой.
- Короткие фразы, естественная разговорная лексика, без markdown и списков.
# Turn behavior
- Один вопрос за реплику.
- Не повторяй уже подтверждённые данные.
- Перед tool call скажи коротко: «Сейчас проверю заказ».
- После tool result сначала сообщи факт, затем предложи один следующий шаг.
# Unclear audio
- Не угадывай номера, имена, даты и адреса.
- Попроси повторить только неясную часть.
- Для критичного entity повтори распознанное значение и дождись подтверждения.
# Interruptions
- Немедленно прекрати текущий ответ при barge-in.
- Сначала обработай новую реплику, не продолжай старый текст автоматически.
# Escalation
- Предложи оператора при явной просьбе, двух неудачных распознаваниях,
конфликте policy или недоступности обязательного tool.Каждый голосовой аспект требует и инструкции модели, и поддержки в runtime.
- Latency. В prompt - короткая преамбула перед долгим tool. В runtime - streaming и низкий effort для простых реплик.
- Barge-in. В prompt - не продолжать прерванный ответ. В runtime - отмена playback и активного ответа.
- Номер заказа. В prompt - не угадывать, повторить для подтверждения. В runtime - entity parser и checksum.
- Write-действие. В prompt - сформулировать изменение простыми словами. В runtime - explicit confirmation token.
- Передача оператору. В prompt - кратко объяснить причину и следующий шаг. В runtime - handoff state и summary разговора.
И про персону - она нужна, но не первой.
Персона идёт после процесса. Google советует сначала определить persona, затем правила разговора и guardrails; OpenAI - короткие именованные секции: tools, unclear audio, entity capture, escalation. Но product flow и доступность tools всё равно важнее тембра голоса.