BC agentsop-cost-tiered-models
Разделяет многошаговый рабочий процесс LM по когнитивной нагрузке, а не по точности: позволяет одной сильной модели принимать редкие решения по рассуждению, а дешевой модели выполнять множество механических операций (архитектор+редактор Aider, оптимизатор DSPy-LM против task-LM, спекулятивный черновик+цель vLLM, супервизор+рабочий LangGraph имеют одинаковую структуру). Используйте при проектировании или оптимизации затрат конвейера, который многократно вызывает LM, при принятии решения о том, какие шаги требуют сильного рассуждающего или дешевого исполнителя, или при добавлении клапана эскалации на случай ухудшения качества дешевого уровня. Ключевые слова для поиска: снизить стоимость LLM, более дешевая модель, снизить стоимость токенов, каскад моделей, маршрутизация к дешевой модели, сильная модель плюс дешевая модель, оптимизация затрат LLM.
машинный переводПоказать оригиналСкрыть оригинал«Split a multi-call LM workflow by cognitive load, not by accuracy: let…»
Split a multi-call LM workflow by cognitive load, not by accuracy: let one strong model make the few reasoning decisions and a cheap model do the many mechanical executions (Aider architect+editor, DSPy optimizer-LM vs task-LM, vLLM speculative draft+target, LangGraph supervisor+worker are the same shape). Use when designing or cost-optimizing a pipeline that calls an LM many times, when deciding which steps need a strong reasoner vs a cheap executor, or when adding an escalation valve for when the cheap tier degrades. Search keywords: reduce LLM cost, cheaper model, lower token cost, model cascade, route to cheap model, strong model plus cheap model, LLM cost optimization.
Разделяет многошаговый рабочий процесс LM по когнитивной нагрузке, а не по точности: позволяет одной сильной модели принимать редкие решения по рассуждению, а…
Как процесс C 58/100 · Есть пробелы — слабые места: результат и критерий готовности, когда включается, входы и предусловия
Чем это грозит
Находки средней серьёзности: скорее всего скилл честный, но прочитайте, что именно насторожило сканер.
Ниже описан худший случай для этой категории. Здесь находка средней серьёзности: guard увидел признак, но не доказательство.
В тексте есть фразы вроде «игнорируй предыдущие инструкции» или «теперь ты…». Это попытка перехватить управление агентом: он может нарушить ваши правила, системные ограничения или политику компании.
Такие фразы не нужны честному скиллу: сформулируйте роль и правила прямо, без отмены чужих инструкций. Иначе сканеры каталогов и корпоративные фильтры заблокируют публикацию.
Как улучшить
- Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
- spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.
Находки guard · 1
✓ Критических и высоких находок нет
Средние и низкие: 1
-
средняя Подмена инструкций
en-ignore-previousreferences/R1-source-evidence.md:32Фраза-перехват ("ignore previous instructions") (в кавычках — упоминание, а не команда)aider.chat/docs/troubleshooting/edit-errors.html — when SEARCH blocks fail to match, escalate the model or fall back to `--edit-format whole`; weaker models "more easily disregard the system prompt".
в кавычках
Просканировано файлов: 5. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.
По спецификации Agent Skills
- заметка
frontmatter-keyнеизвестное поле фронтматтера "domain" - заметка
frontmatter-keyнеизвестное поле фронтматтера "dated" - заметка
frontmatter-keyнеизвестное поле фронтматтера "audience" - заметка
frontmatter-keyнеизвестное поле фронтматтера "sources"
Процессный рейтинг: все десять параметров 58/100
- 0Результат и критерий готовности. Не сказано, что считать результатом
- 0Входы и предусловия. Не сказано, что нужно иметь на входе
- 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
- 20Когда включается. Не сказано, при каком запросе скилл включается
- 50Ошибки и развилки. Развилок: 0, есть раздел про ошибки
- 100Инструменты и файлы. Внешние инструменты не нужны
- 100Шаги. Шагов: 64
- 100Согласованность. Имя и обязательные поля на месте
- 100Стоимость исполнения. Тело инструкции 2698 токенов
- 100Повторный запуск. Изменяющих операций нет
Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.
Сигналы качества
- +5В description нет примеров фраз, по которым скилл должен срабатывать
- +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
- +3Формат ответа не описан: модель каждый раз решает сама
- -41 справочных файлов, но SKILL.md на них не ссылается: модель их не откроет
- +1Лицензия не указана
- +2Инструкции на одном языке
- +3Длина description 682 символов: достаточно сигнала, не съедает бюджет
- +4Структура: 33 заголовков
- +3Пошаговые инструкции: 64 пунктов
- +4Есть примеры (1 блоков кода)
База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 77.