BB refine-plan
Итеративно просматривайте и дорабатывайте план, пока новые находки не перестанут появляться при оценке. Используйте, когда пользователь просит "доработать план", "итерировать по плану", "уточнить план" или "улучшить план".
машинный переводПоказать оригиналСкрыть оригинал«Iteratively review and revise a plan until no new findings survive eva…»
Iteratively review and revise a plan until no new findings survive evaluation. Use when the user asks to "refine the plan", "iterate on the plan", "tighten the plan", or "improve the plan".
Итеративно просматривайте и дорабатывайте план, пока новые находки не перестанут появляться при оценке.
Как процесс B 70/100 · Почти готов — слабые места: результат и критерий готовности, входы и предусловия
Как улучшить
- Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
- spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.
Находки guard · 0
✓ Критических и высоких находок нет
Просканировано файлов: 1. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.
По спецификации Agent Skills
- заметка
edit-residueв тексте есть пометки об устаревшем (строки 22, 41): проверьте, не остались ли старые правила рядом с новыми — полная проверка читает текст на противоречия
Процессный рейтинг: все десять параметров 70/100
- 0Входы и предусловия. Не сказано, что нужно иметь на входе
- 40Результат и критерий готовности. Не сказано, что считать результатом
- 60Инструменты и файлы. Используются инструменты (bash), но во frontmatter они не объявлены
- 70Когда включается. Сказано, когда применять, но не сказано, когда не стоит
- 100Шаги. Шагов: 23
- 100Ошибки и развилки. Развилок: 2, есть раздел про ошибки
- 100Согласованность. Имя и обязательные поля на месте
- 100Стоимость исполнения. Тело инструкции 2484 токенов
- 100Повторный запуск. Изменяющие операции проверяют текущее состояние
- 100Отчётность по ходу. Скилл сообщает о ходе работы
- low Ответ описан самодельной разметкой (4 тегов): типизированный вызов надёжнее
Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.
Сигналы качества
- +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
- +3Формат ответа не описан: модель каждый раз решает сама
- +4Нет примеров входа/выхода
- +1Лицензия не указана
- +2Инструкции на одном языке
- +5В description 4 примера фраз-триггеров в кавычках
- +3Длина description 189 символов: достаточно сигнала, не съедает бюджет
- +4Структура: 10 заголовков
- +3Пошаговые инструкции: 23 пунктов
База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 85.