AF grade-iterate
Фаза 3 создания управляемого агента Claude (CMA) — ограниченный цикл оценки→итерации. Определите результат CMA (обязательная таблица markdown, оцениваемая изолированным оценщиком), прочитайте каждый вердикт, примите решение о следующем шаге (уточнить / повторно запустить / продвинуть в расписание), и после того, как версия пройдет, параллельно выполните отложенные тестовые случаи. Используйте, когда пользователь говорит «оцени моего агента», «сделай так, чтобы он прошел по критериям», «итерируй, пока он не станет хорошим», «достаточно ли он хорош», или когда оркестратор направляет фазу=grade-iterate. outcome_builder.py создает полезную нагрузку user.define_outcome (требуется таблица критериев, максимальное количество итераций ограничено 1..20 — никогда не без ограничений); verdict_reader.py читает результат оценщика и рекомендует следующий шаг; eval_scaffold.py генерирует отложенные случаи + план параллельного выполнения (ограниченный потолком CMA в 25 потоков). Отличается от stage-launch (первый запуск) и run-without-you (планирование).
машинный переводПоказать оригиналСкрыть оригинал«Phase 3 of building a Claude Managed Agent — the bounded grade→iterate…»
Phase 3 of building a Claude Managed Agent — the bounded grade→iterate loop. Define a CMA outcome (a required markdown rubric graded by an isolated grader), read each verdict, decide the next move (sharpen / re-run / promote to schedule), and once a version passes, run held-back eval cases in parallel. Use when the user says "grade my agent", "make it pass the rubric", "iterate until it's good", "is it good enough", or when the orchestrator routes phase=grade-iterate. outcome_builder.py builds the user.define_outcome payload (rubric required, max_iterations clamped 1..20 — never unbounded); verdict_reader.py reads the grader result and recommends the next move; eval_scaffold.py generates held-back cases + a parallel run plan (capped at the 25-thread CMA ceiling). Distinct from stage-launch (first launch) and run-without-you (scheduling).
Фаза 3 создания управляемого агента Claude (CMA) — ограниченный цикл оценки→итерации.
Как процесс F 39/100 · Не запустится — Скилл ссылается на файлы, которых нет в архиве: ../../references/loops-and-workflows.md, ../../references/cma-primitives.md
Как улучшить
- В тексте есть ссылки на отсутствующие файлы: добавьте файлы или уберите ссылки.
- Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
- spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.
Находки guard · 0
✓ Критических и высоких находок нет
Просканировано файлов: 5. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.
По спецификации Agent Skills
- предупреждение
missing-refссылка на отсутствующий файл: ../../references/loops-and-workflows.md - предупреждение
missing-refссылка на отсутствующий файл: ../../references/cma-primitives.md - заметка
frontmatter-keyнеизвестное поле фронтматтера "compatible_tools"
Процессный рейтинг: все десять параметров 39/100
- 0Инструменты и файлы. Не хватает 2 файла(ов): ../../references/loops-and-workflows.md, ../../references/cma-primitives.md
- 0Результат и критерий готовности. Не сказано, что считать результатом
- 0Входы и предусловия. Не сказано, что нужно иметь на входе
- 0Ошибки и развилки. Линейный процесс без обработки сбоев
- 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
- 30Повторный запуск. Изменяющих операций: 3, без проверки текущего состояния
- 70Когда включается. Сказано, когда применять, но не сказано, когда не стоит
- 100Шаги. Шагов: 15
- 100Согласованность. Имя и обязательные поля на месте
- 100Стоимость исполнения. Тело инструкции 752 токенов
Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.
Сигналы качества
- +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
- +3Длина description 849: рекомендуется 120–800 символов
- +3Формат ответа не описан: модель каждый раз решает сама
- +2Инструкции на одном языке
- +5В description 4 примера фраз-триггеров в кавычках
- +4Структура: 5 заголовков
- +3Пошаговые инструкции: 15 пунктов
- +4Есть примеры (3 блоков кода)
- +3Все 3 скриптов описаны в инструкциях
- +1Лицензия указана
База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 80.