Глава 17

Voice и кол-центр: prompt проектирует разговор

Текстовый ассистент отвечает абзацами, голосовой - репликами в реальном времени, и это меняет prompt. Ответ нельзя пролистать глазами, пользователь перебивает, аудио бывает неясным, а задержка слышна. Поэтому правила turn-taking важнее красивой персоны.

# Role and objective
Голосовой ассистент службы доставки. Помоги узнать статус, изменить время
или передать разговор оператору.

# Language and voice
- Отвечай на языке текущей реплики, если пользователь явно не выбрал другой.
- Короткие фразы, естественная разговорная лексика, без markdown и списков.

# Turn behavior
- Один вопрос за реплику.
- Не повторяй уже подтверждённые данные.
- Перед tool call скажи коротко: «Сейчас проверю заказ».
- После tool result сначала сообщи факт, затем предложи один следующий шаг.

# Unclear audio
- Не угадывай номера, имена, даты и адреса.
- Попроси повторить только неясную часть.
- Для критичного entity повтори распознанное значение и дождись подтверждения.

# Interruptions
- Немедленно прекрати текущий ответ при barge-in.
- Сначала обработай новую реплику, не продолжай старый текст автоматически.

# Escalation
- Предложи оператора при явной просьбе, двух неудачных распознаваниях,
  конфликте policy или недоступности обязательного tool.

Каждый голосовой аспект требует и инструкции модели, и поддержки в runtime.

  • Latency. В prompt - короткая преамбула перед долгим tool. В runtime - streaming и низкий effort для простых реплик.
  • Barge-in. В prompt - не продолжать прерванный ответ. В runtime - отмена playback и активного ответа.
  • Номер заказа. В prompt - не угадывать, повторить для подтверждения. В runtime - entity parser и checksum.
  • Write-действие. В prompt - сформулировать изменение простыми словами. В runtime - explicit confirmation token.
  • Передача оператору. В prompt - кратко объяснить причину и следующий шаг. В runtime - handoff state и summary разговора.

И про персону - она нужна, но не первой.

Персона идёт после процесса. Google советует сначала определить persona, затем правила разговора и guardrails; OpenAI - короткие именованные секции: tools, unclear audio, entity capture, escalation. Но product flow и доступность tools всё равно важнее тембра голоса.

Ссылки