AD autoforge
AutoForge — это производственная автономная система оптимизации для ИИ-агентов. Она заменяет субъективное "рефлексию" математически строгими циклами сходимости — отслеживая каждую итерацию в TSV, перекрестно проверяя с несколькими моделями и останавливаясь только тогда, когда проходные результаты подтверждают реальное улучшение. Четыре специализированных режима: prompt (оптимизация навыков и документации через симуляцию сценариев), code (песочница для выполнения тестов с измеримыми критериями), audit (проверка CLI по сравнению с реальным поведением инструмента) и project (анализ согласованности всего репозитория между файлами). Проверено в бою на более чем 50 итерациях на производственных навыках. Используйте, когда: пользователь говорит "autoforge", "forge", "optimize skill", "improve", "run autoforge", "optimize code", "improve script", "optimize repo", "forge project", "check project", "repo audit".
машинный переводПоказать оригиналСкрыть оригинал«AutoForge is a production-grade autonomous optimization framework for…»
AutoForge is a production-grade autonomous optimization framework for AI agents. It replaces subjective "reflection" with mathematically rigorous convergence loops — tracking every iteration in TSV, cross-validating with multiple models, and stopping only when pass rates confirm real improvement. Four specialized modes: prompt (skill & doc optimization via scenario simulation), code (sandboxed test execution with measurable criteria), audit (CLI verification against live tool behavior), and project (whole-repo cross-file consistency analysis). Battle-tested across 50+ iterations on production skills. Use when: user says "autoforge", "forge", "optimize skill", "improve", "run autoforge", "optimize code", "improve script", "optimize repo", "forge project", "check project", "repo audit".
AutoForge — это производственная автономная система оптимизации для ИИ-агентов.
Как процесс D 42/100 · Процесс не доведён — слабые места: результат и критерий готовности, когда включается, входы и предусловия
Как улучшить
- Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
- spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.
Находки guard · 1
✓ Критических и высоких находок нет
Средние и низкие: 1
-
низкая Опасные команды
cmd-pipe-to-shell-known-hostreferences/ml-mode.md:21Установщик через pipe в shell с известного хоста (всё равно выполняет удалённый код) (документация security-скилла)curl -LsSf https://astral.sh/uv/install.sh | sh
security-скилл
Просканировано файлов: 9. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.
По спецификации Agent Skills
✓ По спецификации Agent Skills замечаний нет
Процессный рейтинг: все десять параметров 42/100
- 0Результат и критерий готовности. Не сказано, что считать результатом
- 0Входы и предусловия. Не сказано, что нужно иметь на входе
- 0Ошибки и развилки. Линейный процесс без обработки сбоев
- 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
- 20Когда включается. Не сказано, при каком запросе скилл включается
- 30Повторный запуск. Изменяющих операций: 3, без проверки текущего состояния
- 60Инструменты и файлы. Используются инструменты (bash, python), но во frontmatter они не объявлены
- 70Стоимость исполнения. Тело инструкции 4983 токенов
- 100Шаги. Шагов: 92
- 100Согласованность. Имя и обязательные поля на месте
- medium Правила безопасности и запреты внутри скилла: их место в системном промпте, здесь они не защищают
- low Разделов верхнего уровня: 16. Похоже на несколько доменов в одном скилле
Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.
Сигналы качества
- +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
- +3Формат ответа не описан: модель каждый раз решает сама
- -218 эмодзи в инструкциях: шум для модели
- +1Лицензия не указана
- +2Инструкции на одном языке
- +5В description 11 примера фраз-триггеров в кавычках
- +3Длина description 795 символов: достаточно сигнала, не съедает бюджет
- +4Структура: 45 заголовков
- +3Пошаговые инструкции: 92 пунктов
- +4Есть примеры (9 блоков кода)
- +4Справочные файлы упоминаются в инструкциях (2 из 2)
- +3Все 2 скриптов описаны в инструкциях
База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 94.