
Пока я сверял факты для этой статьи, в терминале случилась небольшая демонстрация. Обычный поиск по документации RTK вернул не портянку совпадений, а одну строку: "58 matches in 1 files" - и путь к файлу, где лежит полный результат, если он вдруг понадобится. RTK на этой машине уже стоял и молча отработал на самом себе.
Это и есть весь замысел проекта, показанный без слайдов. Вывод команд оболочки писали для человека, который смотрит в терминал: прогресс-бары, рамки, сотни успешных строк, повторяющиеся кадры стека. Агент читает то же самое, но каждый байт становится частью следующего запроса к модели. RTK встаёт между ними и отдаёт агенту сокращённую версию.
Что именно измеряет цифра "до 90%"
Начну с самого спорного места, потому что проект здесь ведёт себя необычно честно.
RTK не сжимает системный промпт, не трогает историю разговора и не касается того, что пишет модель в ответ. Он видит ровно одно - байты, которые команда вернула в оболочку. Всё, что проект называет экономией, измерено на этих байтах.
Документация проговаривает вывод сама: сокращение размывается на каждом шаге, и команда с выводом на 90% короче не делает сессию на 90% дешевле. Отдельная страница так и называется - "Как работают экономии RTK", и она объясняет, чего цифра не значит, подробнее, чем чего значит.
Второй нюанс из той же серии. Токены RTK не считает, а оценивает: длина в байтах делится на четыре.
Настоящего токенизатора в бинарнике нет намеренно - он стоил бы времени запуска и потребовал бы отдельной таблицы под каждую модель. Отсюда практическое правило: доля сокращения надёжна, потому что обе величины считаются одним и тем же способом, а абсолютные числа вроде "сэкономлен миллион токенов" - порядок величины, а не строка счёта.