AC llm-eval-harness
Тестируйте/оценивайте любую LLM через совместимый с OpenAI или Anthropic эндпоинт: доступность (с учетом max_tokens), точность запроса (доходит ли системный промпт/инструменты/история до модели или шлюз молча отбрасывает их), скорость (TTFT+tok/s), параллелизм (перед воркшопом), соответствие протоколу Anthropic, регрессию качества, отчеты об ошибках поставщика, ворота развертывания, постоянные канарейки. Используйте ДО ручного создания цикла curl (он пропускает выборку N=10, Connection:close и обработку ключей env-var, которые он встраивает). Используйте, когда кто-то тестирует/сравнивает/测评/压测 модель/эндпоинт, подключает поставщика, решает, следует ли переключиться или временно перейти на альтернативный канал (сбой/квота), составляет список поддерживаемых моделей, отлаживает «модель игнорирует системный промпт» или проверяет заявленное значение tok/s. НЕ для оценки поставщика TTS/клонирования голоса (аудио сторона имеет свой навык). Активируется по запросам «benchmark this model», «测一下这个模型/渠道/API», «接入新模型先测一下», «system prompt 不生效», «这个渠道能不能用/稳不稳», «临时切换过去顶一阵子» — даже без «eval», даже обернутых в деловое повествование.
машинный переводПоказать оригиналСкрыть оригинал«Test/evaluate any LLM behind an OpenAI- or Anthropic-compatible endpoi…»
Test/evaluate any LLM behind an OpenAI- or Anthropic-compatible endpoint: availability (max_tokens-aware), request fidelity (does system prompt/tools/history REACH the model, or does the gateway silently drop it), speed (TTFT+tok/s), concurrency (before a workshop), Anthropic protocol compliance, quality regression, vendor bug reports, deployment gates, resident canaries. Use BEFORE hand-rolling a curl loop (it skips the N=10 sampling, Connection:close, and env-var key handling this bakes in). Use when someone tests/benchmarks/测评/压测 a model/endpoint, onboards a provider, decides whether to switch or temporarily fail over to an alternate channel (outage/quota), writes a supported-models list, debugs "model ignores system prompt", or verifies a tok/s claim. NOT for TTS/voice-clone supplier eval (audio side has its own skill). Triggers on "benchmark this model", "测一下这个模型/渠道/API", "接入新模型先测一下", "system prompt 不生效", "这个渠道能不能用/稳不稳", "临时切换过去顶一阵子" — even without "eval", even wrapped in business narrative.
Тестируйте/оценивайте любую LLM через совместимый с OpenAI или Anthropic эндпоинт: доступность (с учетом maxtokens), точность запроса (доходит ли системный…
Как процесс C 61/100 · Есть пробелы — слабые места: результат и критерий готовности, входы и предусловия, повторный запуск
Как улучшить
- Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
- spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.
Находки guard · 0
✓ Критических и высоких находок нет
Просканировано файлов: 12. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.
По спецификации Agent Skills
✓ По спецификации Agent Skills замечаний нет
Процессный рейтинг: все десять параметров 61/100
- 0Результат и критерий готовности. Не сказано, что считать результатом
- 0Входы и предусловия. Не сказано, что нужно иметь на входе
- 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
- 30Повторный запуск. Изменяющих операций: 6, без проверки текущего состояния
- 60Инструменты и файлы. Используются инструменты (bash, web), но во frontmatter они не объявлены
- 70Стоимость исполнения. Тело инструкции 4555 токенов
- 100Шаги. Шагов: 39
- 100Когда включается. Сказано, когда применять и когда не применять
- 100Ошибки и развилки. Развилок: 1, есть раздел про ошибки
- 100Согласованность. Имя и обязательные поля на месте
- medium Правила безопасности и запреты внутри скилла: их место в системном промпте, здесь они не защищают
- low Разделов верхнего уровня: 12. Похоже на несколько доменов в одном скилле
Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.
Сигналы качества
- +3Длина description 1011: рекомендуется 120–800 символов
- +3Формат ответа не описан: модель каждый раз решает сама
- +1Лицензия не указана
- +2Инструкции на одном языке
- +5В description 7 примера фраз-триггеров в кавычках
- +4Описание говорит, когда скилл НЕ применять
- +4Структура: 13 заголовков
- +3Пошаговые инструкции: 39 пунктов
- +4Есть примеры (9 блоков кода)
- +4Справочные файлы упоминаются в инструкциях (4 из 4)
- +3Все 6 скриптов описаны в инструкциях
База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 97.