AC llm-as-judge
Межмодельная проверка для сложных задач. Запускает субагента-судью с другой моделью для проверки планов, кода, архитектуры или решений перед выполнением. Используйте при работе над «архитектурой», «проектированием системы», «сложной функцией», «проверкой безопасности», «развертыванием в продакшене», финансовыми/торговыми системами или когда вы застряли после 3+ попыток. НЕ для простых правок, изменений конфигурации или рутинных задач.
машинный переводПоказать оригиналСкрыть оригинал«Cross-model verification for complex tasks. Spawn a judge subagent wit…»
Cross-model verification for complex tasks. Spawn a judge subagent with a different model to review plans, code, architecture, or decisions before execution. Use when working on "architecture", "system design", "complex feature", "security review", "production deployment", financial/trading systems, or when stuck after 3+ attempts. NOT for simple edits, config changes, or routine tasks.
Межмодельная проверка для сложных задач.
Как процесс C 60/100 · Есть пробелы — слабые места: результат и критерий готовности, входы и предусловия, повторный запуск
Как улучшить
- Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
- spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.
Находки guard · 0
✓ Критических и высоких находок нет
Просканировано файлов: 3. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.
По спецификации Agent Skills
✓ По спецификации Agent Skills замечаний нет
Процессный рейтинг: все десять параметров 60/100
- 0Результат и критерий готовности. Не сказано, что считать результатом
- 0Входы и предусловия. Не сказано, что нужно иметь на входе
- 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
- 30Повторный запуск. Изменяющих операций: 1, без проверки текущего состояния
- 50Когда включается. Не сказано, при каком запросе скилл включается
- 60Ошибки и развилки. Развилок: 2
- 100Инструменты и файлы. Внешние инструменты не нужны
- 100Шаги. Шагов: 24
- 100Согласованность. Имя и обязательные поля на месте
- 100Стоимость исполнения. Тело инструкции 716 токенов
Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.
Сигналы качества
- +3Формат ответа не описан: модель каждый раз решает сама
- +1Лицензия не указана
- +2Инструкции на одном языке
- +5В description 5 примера фраз-триггеров в кавычках
- +4Описание говорит, когда скилл НЕ применять
- +3Длина description 389 символов: достаточно сигнала, не съедает бюджет
- +4Структура: 9 заголовков
- +3Пошаговые инструкции: 24 пунктов
- +4Есть примеры (2 блоков кода)
- +4Справочные файлы упоминаются в инструкциях (1 из 1)
База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 97.