CC hugging-face-evaluation
Добавляет и управляет результатами оценки в карточках моделей Hugging Face. Поддерживает извлечение таблиц оценки из содержимого README, импорт оценок из API Artificial Analysis и выполнение пользовательских оценок моделей с помощью vLLM/lighteval. Работает с форматом метаданных model-index.
машинный переводПоказать оригиналСкрыть оригинал«Add and manage evaluation results in Hugging Face model cards. Support…»
Add and manage evaluation results in Hugging Face model cards. Supports extracting eval tables from README content, importing scores from Artificial Analysis API, and running custom model evaluations with vLLM/lighteval. Works with the model-index metadata format.
Добавляет и управляет результатами оценки в карточках моделей Hugging Face.
Как процесс C 53/100 · Есть пробелы — Скилл ссылается на файлы, которых нет в архиве: ...
Как улучшить
- Для Hermes description должен быть одним предложением до 60 символов; условия применения вынесите в раздел «When to Use».
- Тело SKILL.md длиннее 5 000 токенов: вынесите справочные детали в references/ и подключайте по необходимости.
- В тексте есть ссылки на отсутствующие файлы: добавьте файлы или уберите ссылки.
- Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
- spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.
Находки guard · 2
✓ Критических и высоких находок нет
Средние и низкие: 2
-
низкая Утечка данных
read-dotenvexamples/USAGE_EXAMPLES.md:24Чтение файла .env (тестовый файл / пример)cp examples/.env.example .env
тестовый файл -
низкая Утечка данных
net-credential-useexamples/USAGE_EXAMPLES.md:347Учётные данные используются в сетевом вызове (проверьте, что адрес — нужный сервис) (тестовый файл / пример)curl -H "x-api-key: $AA_API_KEY" \
тестовый файл
Просканировано файлов: 13. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.
По спецификации Agent Skills
- предупреждение
description-long-hermesdescription 264 символов, а стандарт Hermes требует ≤ 60 (одно предложение, с точкой) - предупреждение
body-longтело SKILL.md ≈ 5580 токенов (рекомендуется < 5000); вынесите детали в references/ - предупреждение
missing-refссылка на отсутствующий файл: ... - заметка
frontmatter-keyнеизвестное поле фронтматтера "dependencies"
Процессный рейтинг: все десять параметров 53/100
- 0Инструменты и файлы. Не хватает 1 файла(ов): ...
- 0Результат и критерий готовности. Не сказано, что считать результатом
- 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
- 50Когда включается. Не сказано, при каком запросе скилл включается
- 70Входы и предусловия. Входные данные и предусловия перечислены
- 70Стоимость исполнения. Тело инструкции 5580 токенов
- 85Шаги. Шагов: 121, расплывчатых формулировок: 1
- 100Ошибки и развилки. Развилок: 2, есть раздел про ошибки
- 100Согласованность. Имя и обязательные поля на месте
- 100Повторный запуск. Изменяющие операции проверяют текущее состояние
- low Разделов верхнего уровня: 10. Похоже на несколько доменов в одном скилле
Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.
Сигналы качества
- +5В description нет примеров фраз, по которым скилл должен срабатывать
- +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
- +3Формат ответа не описан: модель каждый раз решает сама
- -31 из 7 скриптов не упомянуты в SKILL.md
- +2Инструкции на одном языке
- +3Длина description 264 символов: достаточно сигнала, не съедает бюджет
- +4Структура: 36 заголовков
- +3Пошаговые инструкции: 121 пунктов
- +4Есть примеры (29 блоков кода)
- +1Лицензия указана
База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 59.