AF benchmark-model-provider
Сравнивает и ранжирует поставщиков/модели ИИ по пользовательскому набору запросов, полученному из цели, домена и частоты использования пользователем. Используйте, когда пользователи спрашивают, какая модель умнее, дешевле, глубже, быстрее, стоит ежедневного использования, лучше локально или как сервис, или при создании повторяемых спецификаций для бенчмаркинга, переранжировании старых запусков, генерации отчетов о бенчмаркинге в форматах markdown/HTML/PDF.
машинный переводПоказать оригиналСкрыть оригинал«Benchmark and rank AI providers/models against a user-specific prompt…»
Benchmark and rank AI providers/models against a user-specific prompt suite derived from the user's purpose, domain, and usage frequency. Use when users ask which model is smarter, cheaper, deeper, faster, worth using daily, better as local vs service, or when building repeatable benchmark specs, reranking old runs, generating markdown/HTML/PDF benchmark reports.
Сравнивает и ранжирует поставщиков/модели ИИ по пользовательскому набору запросов, полученному из цели, домена и частоты использования пользователем.
Как процесс F 50/100 · Не запустится — Скилл ссылается на файлы, которых нет в архиве: examples/*.yaml
Чем это грозит
Находки средней серьёзности: скорее всего скилл честный, но прочитайте, что именно насторожило сканер.
Ниже описан худший случай для этой категории. Здесь находка средней серьёзности: guard увидел признак, но не доказательство.
Инструкции или скрипты отправляют данные наружу: переменные окружения, ключи, содержимое файлов, историю чата. Вы можете не заметить этого в диалоге, потому что агент выполнит отправку как «часть задачи».
Если отправка не нужна для задачи, уберите её: каталоги помечают такие скиллы как подозрительные и снимают с выдачи. Если нужна, назовите адрес явно, объясните, что именно уходит, и дайте пользователю выключатель.
Как улучшить
- В тексте есть ссылки на отсутствующие файлы: добавьте файлы или уберите ссылки.
- Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
- spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.
Находки guard · 1
✓ Критических и высоких находок нет
Средние и низкие: 1
-
средняя Утечка данных
net-redirectable-api-keyscripts/run_benchmark.py:136Скрипт отправляет API-ключ на хост из переменной окружения — ключ можно перенаправить на другой серверAPI key + configurable base URL from environment
Просканировано файлов: 30. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.
По спецификации Agent Skills
- предупреждение
missing-refссылка на отсутствующий файл: examples/*.yaml
Процессный рейтинг: все десять параметров 50/100
- 0Инструменты и файлы. Не хватает 1 файла(ов): examples/*.yaml
- 0Входы и предусловия. Не сказано, что нужно иметь на входе
- 20Когда включается. Не сказано, при каком запросе скилл включается
- 30Повторный запуск. Изменяющих операций: 15, без проверки текущего состояния
- 60Результат и критерий готовности. Формат результата описан, критерия завершения нет
- 70Ошибки и развилки. Развилок: 4
- 100Шаги. Шагов: 68
- 100Согласованность. Имя и обязательные поля на месте
- 100Стоимость исполнения. Тело инструкции 1855 токенов
- 100Отчётность по ходу. Скилл сообщает о ходе работы
- medium Правила безопасности и запреты внутри скилла: их место в системном промпте, здесь они не защищают
- low Скилл сам сортирует и ранжирует выдачу: это работа системы на той стороне, а не модели
- high Скилл велит модели самой совершать необратимое действие, без подтверждения человеком
Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.
Сигналы качества
- +5В description нет примеров фраз, по которым скилл должен срабатывать
- +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
- +1Лицензия не указана
- +2Инструкции на одном языке
- +3Длина description 365 символов: достаточно сигнала, не съедает бюджет
- +4Структура: 14 заголовков
- +3Пошаговые инструкции: 68 пунктов
- +3Формат ответа описан явно
- +4Есть примеры (0 блоков кода)
- +4Справочные файлы упоминаются в инструкциях (8 из 9)
- +3Все 7 скриптов описаны в инструкциях
База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 88.