SKILLEMALL.ai

AF grade-iterate

Фаза 3 создания управляемого агента Claude (CMA) — ограниченный цикл оценки→итерации. Определите результат CMA (обязательная таблица markdown, оцениваемая изолированным оценщиком), прочитайте каждый вердикт, примите решение о следующем шаге (уточнить / повторно запустить / продвинуть в расписание), и после того, как версия пройдет, параллельно выполните отложенные тестовые случаи. Используйте, когда пользователь говорит «оцени моего агента», «сделай так, чтобы он прошел по критериям», «итерируй, пока он не станет хорошим», «достаточно ли он хорош», или когда оркестратор направляет фазу=grade-iterate. outcome_builder.py создает полезную нагрузку user.define_outcome (требуется таблица критериев, максимальное количество итераций ограничено 1..20 — никогда не без ограничений); verdict_reader.py читает результат оценщика и рекомендует следующий шаг; eval_scaffold.py генерирует отложенные случаи + план параллельного выполнения (ограниченный потолком CMA в 25 потоков). Отличается от stage-launch (первый запуск) и run-without-you (планирование).

машинный переводПоказать оригиналСкрыть оригинал«Phase 3 of building a Claude Managed Agent — the bounded grade→iterate…»

Phase 3 of building a Claude Managed Agent — the bounded grade→iterate loop. Define a CMA outcome (a required markdown rubric graded by an isolated grader), read each verdict, decide the next move (sharpen / re-run / promote to schedule), and once a version passes, run held-back eval cases in parallel. Use when the user says "grade my agent", "make it pass the rubric", "iterate until it's good", "is it good enough", or when the orchestrator routes phase=grade-iterate. outcome_builder.py builds the user.define_outcome payload (rubric required, max_iterations clamped 1..20 — never unbounded); verdict_reader.py reads the grader result and recommends the next move; eval_scaffold.py generates held-back cases + a parallel run plan (capped at the 25-thread CMA ceiling). Distinct from stage-launch (first launch) and run-without-you (scheduling).

alirezarezvani/claude-skills Agent Skills автор: alirezarezvani MIT 5 файлов тело ≈ 752 токенов Открыть источникgithub.com проанализирован 2 дн назад

Фаза 3 создания управляемого агента Claude (CMA) — ограниченный цикл оценки→итерации.

Как процесс F 39/100 · Не запустится — Скилл ссылается на файлы, которых нет в архиве: ../../references/loops-and-workflows.md, ../../references/cma-primitives.md

ГенераторИИ и агентытип и темы размечены автоматически по тексту скилла
JSON
Технический рейтинг
A
92/100
безопасность, качество, тесты
Безопасность 60%
100
Качество 40%
80
Прогон на моделях
не было
Процессный рейтинг
F
39/100
Не запустится
Скилл ссылается на файлы, которых нет в архиве: ../../references/loops-and-workflows.md, ../../references/cma-primitives.md
Инструменты и файлы вес 18
0
Результат и критерий готовности вес 14
0
Входы и предусловия вес 11
0
три самых слабых из десяти параметров · все десять

Как улучшить

  1. В тексте есть ссылки на отсутствующие файлы: добавьте файлы или уберите ссылки.
Для прогона на моделях — необязательно
  • Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
  • spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.

Находки guard · 0

✓ Критических и высоких находок нет

Просканировано файлов: 5. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.

По спецификации Agent Skills

  • предупреждение missing-ref ссылка на отсутствующий файл: ../../references/loops-and-workflows.md
  • предупреждение missing-ref ссылка на отсутствующий файл: ../../references/cma-primitives.md
  • заметка frontmatter-key неизвестное поле фронтматтера "compatible_tools"

Процессный рейтинг: все десять параметров 39/100

Не запустится. Скилл ссылается на файлы, которых нет в архиве: ../../references/loops-and-workflows.md, ../../references/cma-primitives.md
  • 0Инструменты и файлы. Не хватает 2 файла(ов): ../../references/loops-and-workflows.md, ../../references/cma-primitives.md
  • 0Результат и критерий готовности. Не сказано, что считать результатом
  • 0Входы и предусловия. Не сказано, что нужно иметь на входе
  • 0Ошибки и развилки. Линейный процесс без обработки сбоев
  • 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
  • 30Повторный запуск. Изменяющих операций: 3, без проверки текущего состояния
  • 70Когда включается. Сказано, когда применять, но не сказано, когда не стоит
  • 100Шаги. Шагов: 15
  • 100Согласованность. Имя и обязательные поля на месте
  • 100Стоимость исполнения. Тело инструкции 752 токенов

Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.

Сигналы качества

  • +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
  • +3Длина description 849: рекомендуется 120–800 символов
  • +3Формат ответа не описан: модель каждый раз решает сама
  • +2Инструкции на одном языке
  • +5В description 4 примера фраз-триггеров в кавычках
  • +4Структура: 5 заголовков
  • +3Пошаговые инструкции: 15 пунктов
  • +4Есть примеры (3 блоков кода)
  • +3Все 3 скриптов описаны в инструкциях
  • +1Лицензия указана

База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 80.