AB linkfox-skill-evaluator
Оцените, является ли навык безопасным для запуска и эффективным в своей работе. Используйте, когда пользователь хочет протестировать, сравнить, оценить, проверить или сравнить версии навыка — фразы вроде «这个 skill 好不好» (хорош ли этот навык), «evaluate this skill» (оцени этот навык), «vet this skill» (проверь этот навык), «新版本比旧版本好吗» (лучше ли новая версия старой), «帮我测测这个 skill» (помоги мне протестировать этот навык), «这个 skill 安全吗» (безопасен ли этот навык), «skill 有没有效果» (есть ли у навыка эффект), «skill 质量如何» (каково качество навыка). Активируйте, когда пользователь имеет навык и хочет получить объективную оценку — эффективности, безопасности или обоих аспектов; оценка всегда охватывает оба аспекта, независимо от того, о чем пользователь спросил первым. Работает с любым навыком независимо от области (письмо, генерация кода, извлечение данных, рабочие процессы, специализированные навыки, сторонние общедоступные навыки).
машинный переводПоказать оригиналСкрыть оригинал«Evaluate whether a skill is both safe to run and effective at its job.…»
Evaluate whether a skill is both safe to run and effective at its job. Use when the user wants to test, benchmark, grade, critique, audit, vet, or compare versions of a skill — phrases like "这个 skill 好不好"、"evaluate this skill"、"vet this skill"、"新版本比旧版本好吗"、"帮我测测这个 skill"、"这个 skill 安全吗"、"skill 有没有效果"、"skill 质量如何". Trigger whenever a user has a skill in hand and wants an objective read — on effectiveness, on safety, or both; the evaluation always covers both dimensions regardless of which the user asks about first. Works on any skill regardless of domain (writing, code generation, data extraction, workflows, domain-specialized skills, third-party community skills).
Оцените, является ли навык безопасным для запуска и эффективным в своей работе.
Как процесс B 67/100 · Почти готов — слабые места: ошибки и развилки, отчётность по ходу
Как улучшить
- Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
- spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.
Находки guard · 0
✓ Критических и высоких находок нет
Просканировано файлов: 8. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.
По спецификации Agent Skills
✓ По спецификации Agent Skills замечаний нет
Процессный рейтинг: все десять параметров 67/100
- 0Ошибки и развилки. Линейный процесс без обработки сбоев
- 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
- 60Инструменты и файлы. Используются инструменты (bash, web, python, node), но во frontmatter они не объявлены
- 60Результат и критерий готовности. Формат результата описан, критерия завершения нет
- 70Когда включается. Сказано, когда применять, но не сказано, когда не стоит
- 70Входы и предусловия. Входные данные и предусловия перечислены
- 70Стоимость исполнения. Тело инструкции 4088 токенов
- 100Шаги. Шагов: 113
- 100Согласованность. Имя и обязательные поля на месте
- 100Повторный запуск. Изменяющих операций нет
- low Разделов верхнего уровня: 19. Похоже на несколько доменов в одном скилле
Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.
Сигналы качества
- +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
- -5В тексте остались TODO / заглушки
- -252 эмодзи в инструкциях: шум для модели
- +1Лицензия не указана
- +2Инструкции на одном языке
- +5В description 8 примера фраз-триггеров в кавычках
- +3Длина description 670 символов: достаточно сигнала, не съедает бюджет
- +4Структура: 40 заголовков
- +3Пошаговые инструкции: 113 пунктов
- +3Формат ответа описан явно
- +4Есть примеры (2 блоков кода)
- +4Справочные файлы упоминаются в инструкциях (3 из 3)
- +3Все 1 скриптов описаны в инструкциях
База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 92.