SKILLEMALL.ai

AC llm-eval-harness

Тестируйте/оценивайте любую LLM через совместимый с OpenAI или Anthropic эндпоинт: доступность (с учетом max_tokens), точность запроса (доходит ли системный промпт/инструменты/история до модели или шлюз молча отбрасывает их), скорость (TTFT+tok/s), параллелизм (перед воркшопом), соответствие протоколу Anthropic, регрессию качества, отчеты об ошибках поставщика, ворота развертывания, постоянные канарейки. Используйте ДО ручного создания цикла curl (он пропускает выборку N=10, Connection:close и обработку ключей env-var, которые он встраивает). Используйте, когда кто-то тестирует/сравнивает/测评/压测 модель/эндпоинт, подключает поставщика, решает, следует ли переключиться или временно перейти на альтернативный канал (сбой/квота), составляет список поддерживаемых моделей, отлаживает «модель игнорирует системный промпт» или проверяет заявленное значение tok/s. НЕ для оценки поставщика TTS/клонирования голоса (аудио сторона имеет свой навык). Активируется по запросам «benchmark this model», «测一下这个模型/渠道/API», «接入新模型先测一下», «system prompt 不生效», «这个渠道能不能用/稳不稳», «临时切换过去顶一阵子» — даже без «eval», даже обернутых в деловое повествование.

машинный переводПоказать оригиналСкрыть оригинал«Test/evaluate any LLM behind an OpenAI- or Anthropic-compatible endpoi…»

Test/evaluate any LLM behind an OpenAI- or Anthropic-compatible endpoint: availability (max_tokens-aware), request fidelity (does system prompt/tools/history REACH the model, or does the gateway silently drop it), speed (TTFT+tok/s), concurrency (before a workshop), Anthropic protocol compliance, quality regression, vendor bug reports, deployment gates, resident canaries. Use BEFORE hand-rolling a curl loop (it skips the N=10 sampling, Connection:close, and env-var key handling this bakes in). Use when someone tests/benchmarks/测评/压测 a model/endpoint, onboards a provider, decides whether to switch or temporarily fail over to an alternate channel (outage/quota), writes a supported-models list, debugs "model ignores system prompt", or verifies a tok/s claim. NOT for TTS/voice-clone supplier eval (audio side has its own skill). Triggers on "benchmark this model", "测一下这个模型/渠道/API", "接入新模型先测一下", "system prompt 不生效", "这个渠道能不能用/稳不稳", "临时切换过去顶一阵子" — even without "eval", even wrapped in business narrative.

daymade/claude-code-skills Agent Skills автор: daymade 12 файлов тело ≈ 4 555 токенов Открыть источникgithub.com проанализирован 2 ч назад

Тестируйте/оценивайте любую LLM через совместимый с OpenAI или Anthropic эндпоинт: доступность (с учетом maxtokens), точность запроса (доходит ли системный…

Как процесс C 61/100 · Есть пробелы — слабые места: результат и критерий готовности, входы и предусловия, повторный запуск

АнализаторИИ и агентытип и темы размечены автоматически по тексту скилла
JSON
Технический рейтинг
A
99/100
безопасность, качество, тесты
Безопасность 60%
100
Качество 40%
97
Прогон на моделях
не было
Процессный рейтинг
C
61/100
Есть пробелы
Результат и критерий готовности вес 14
0
Входы и предусловия вес 11
0
Отчётность по ходу вес 2
0
три самых слабых из десяти параметров · все десять

Как улучшить

    Для прогона на моделях — необязательно
    • Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
    • spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.

    Находки guard · 0

    ✓ Критических и высоких находок нет

    Просканировано файлов: 12. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.

    По спецификации Agent Skills

    ✓ По спецификации Agent Skills замечаний нет

    Процессный рейтинг: все десять параметров 61/100

    • 0Результат и критерий готовности. Не сказано, что считать результатом
    • 0Входы и предусловия. Не сказано, что нужно иметь на входе
    • 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
    • 30Повторный запуск. Изменяющих операций: 6, без проверки текущего состояния
    • 60Инструменты и файлы. Используются инструменты (bash, web), но во frontmatter они не объявлены
    • 70Стоимость исполнения. Тело инструкции 4555 токенов
    • 100Шаги. Шагов: 39
    • 100Когда включается. Сказано, когда применять и когда не применять
    • 100Ошибки и развилки. Развилок: 1, есть раздел про ошибки
    • 100Согласованность. Имя и обязательные поля на месте
    • medium Правила безопасности и запреты внутри скилла: их место в системном промпте, здесь они не защищают
    • low Разделов верхнего уровня: 12. Похоже на несколько доменов в одном скилле

    Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.

    Сигналы качества

    • +3Длина description 1011: рекомендуется 120–800 символов
    • +3Формат ответа не описан: модель каждый раз решает сама
    • +1Лицензия не указана
    • +2Инструкции на одном языке
    • +5В description 7 примера фраз-триггеров в кавычках
    • +4Описание говорит, когда скилл НЕ применять
    • +4Структура: 13 заголовков
    • +3Пошаговые инструкции: 39 пунктов
    • +4Есть примеры (9 блоков кода)
    • +4Справочные файлы упоминаются в инструкциях (4 из 4)
    • +3Все 6 скриптов описаны в инструкциях

    База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 97.