BC token-guard-pro
Token Guardian — это система оптимизации затрат на токены для AI-агентов, разработанная для решения четырех распространенных проблем: «чрезмерное сжатие с потерей качества, низкая частота попаданий семантического кэша, отсутствие маршрутизации моделей, невидимость и неконтролируемость бюджета». Он использует трехуровневый кэш (точное совпадение/семантическое совпадение/сопоставление шаблонов) + адаптивное сжатие + маршрутизацию моделей + защиту бюджета для снижения затрат на токены на 50-80% без ущерба для качества ответа. Основные возможности: интеллектуальное сжатие контекста (сжатие по уровням важности, блоки кода и ключевые решения никогда не сжимаются), трехуровневый семантический кэш (L1 точное совпадение 100% экономия/L2 семантическая схожесть 80% экономия/L3 сопоставление шаблонов 50% экономия), адаптивная оптимизация (поэтапная корректировка в зависимости от нагрузки токенов), маршрутизация моделей (маршрутизация к подходящей модели в зависимости от сложности задачи), защита бюджета (установка верхнего предела бюджета, предупреждение и понижение при превышении), визуализация затрат (отчеты в реальном времени и анализ тенденций), поддержка Prefix Cache (стоимость повторяющегося префиксного ввода снижается в 10 раз). Применимые сценарии: управление токенами в длинных сессиях, кэширование в сценариях часто задаваемых вопросов, оптимизация затрат на смешанный вызов нескольких моделей, контроль бюджета токенов корпоративного уровня, снижение затрат на агентов службы поддержки, максимальная экономия в исследовательских задачах. Отличия: по сравнению с поверхностным оптимизатором, который выполняет только «сжатие контекста», этот навык добавляет (1) трехуровневый семантический кэш, L2 семантическое совпадение (косинусное сходство >= 0.85) значительно повышает частоту попаданий кэша, избавляя от неэффективности «совпадения только при полном совпадении»; (2) маршрутизация моделей, автоматическая маршрутизация к подходящей модели в зависимости от сложности задачи (маленькие модели для простых задач, большие модели для сложных задач), дальнейшее снижение затрат на 30%; (3) защита бюджета, установка дневного/недельного/месячного верхнего предела бюджета, автоматическое предупреждение и понижение при превышении, предотвращение потери контроля над бюджетом; (4) поддержка Prefix Cache, стоимость повторяющегося префиксного ввода снижается в 10 раз, задержка первого токена снижается на 50-85%; (5) панель визуализации затрат, отображающая в реальном времени коэффициент экономии, частоту попаданий кэша, распределение моделей, тенденции затрат. Ключевые слова для запуска: оптимизация токенов, снижение затрат, семантический кэш, сжатие контекста, маршрутизация моделей, контроль бюджета, token saver, cost optimization, semantic cache, model routing
машинный переводПоказать оригиналСкрыть оригинал«Token 守护者是面向 AI Agent 的 token 成本优化系统,针对"压缩过度损失质量、语义缓存命中率低、缺乏模型路由、预算不可见…»
Token 守护者是面向 AI Agent 的 token 成本优化系统,针对"压缩过度损失质量、语义缓存命中率低、缺乏模型路由、预算不可见不可控"四大高频痛点而设计。它用三层缓存(精确匹配/语义匹配/模式匹配)+ 自适应压缩 + 模型路由 + 预算守护,在不牺牲响应质量的前提下降低 50-80% 的 token 成本。 核心能力:智能上下文压缩(按重要度分级压缩,代码块与关键决策永不压缩)、三层语义缓存(L1 精确匹配 100% 节省/L2 语义相似 80% 节省/L3 模式匹配 50% 节省)、自适应优化(按 token 压力分阶段调整)、模型路由(按任务复杂度路由到合适模型)、预算守护(设置预算上限,超限告警与降级)、成本可视化(实时报告与趋势分析)、Prefix Cache 支持(重复前缀输入成本降至 1/10)。 适用场景:长会话 token 治理、高频问答场景缓存、多模型混合调用成本优化、企业级 token 预算管控、客服 Agent 成本降低、研究探索类任务的最大化节省。 差异化:相比仅做"上下文压缩"的浅层优化器,本技能新增 (1) 三层语义缓存,L2 语义匹配(cosine 相似度 >= 0.85)显著提升缓存命中率,告别"完全相同才命中"的低效;(2) 模型路由,按任务复杂度自动路由到合适模型(简单任务用小模型,复杂任务用大模型),成本再降 30%;(3) 预算守护,设置日/周/月预算上限,超限自动告警与降级,杜绝预算失控;(4) Prefix Cache 支持,重复前缀输入成本降至 1/10,首 token 延迟降低 50-85%;(5) 成本可视化仪表盘,实时展示节省率、缓存命中率、模型分布、成本趋势。 触发关键词:token优化、成本降低、语义缓存、上下文压缩、模型路由、预算控制、token saver、cost optimization、semantic cache、model routing
Token Guardian — это система оптимизации затрат на токены для AI-агентов, разработанная для решения четырех распространенных проблем: «чрезмерное сжатие с…
Как процесс C 53/100 · Есть пробелы — слабые места: результат и критерий готовности, когда включается, входы и предусловия
Как улучшить
- Скажите в description, КОГДА применять скилл («используй, когда…», примеры запросов): это главный сигнал для агента.
- Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
- spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.
Находки guard · 0
✓ Критических и высоких находок нет
Просканировано файлов: 0. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.
По спецификации Agent Skills
- предупреждение
description-no-whendescription не говорит, КОГДА применять скилл (нет "use when / используй когда") - заметка
frontmatter-keyнеизвестное поле фронтматтера "slug" - заметка
frontmatter-keyнеизвестное поле фронтматтера "displayName" - заметка
frontmatter-keyнеизвестное поле фронтматтера "summary" - заметка
frontmatter-keyнеизвестное поле фронтматтера "tools"
Процессный рейтинг: все десять параметров 53/100
- 0Результат и критерий готовности. Не сказано, что считать результатом
- 0Входы и предусловия. Не сказано, что нужно иметь на входе
- 0Ошибки и развилки. Линейный процесс без обработки сбоев
- 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
- 20Когда включается. Не сказано, при каком запросе скилл включается
- 100Инструменты и файлы. Инструменты объявлены во frontmatter
- 100Шаги. Шагов: 25
- 100Согласованность. Имя и обязательные поля на месте
- 100Стоимость исполнения. Тело инструкции 1847 токенов
- 100Повторный запуск. Изменяющих операций нет
- low Разделов верхнего уровня: 13. Похоже на несколько доменов в одном скилле
Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.
Сигналы качества
- +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
- +3Длина description 828: рекомендуется 120–800 символов
- +3Формат ответа не описан: модель каждый раз решает сама
- +2Инструкции на одном языке
- +5В description 2 примера фраз-триггеров в кавычках
- +4Структура: 29 заголовков
- +3Пошаговые инструкции: 25 пунктов
- +4Есть примеры (10 блоков кода)
- +1Лицензия указана
База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 72.