SKILLEMALL.ai

BF vllm

Эксплуатирует, конфигурирует, тестирует и устраняет неполадки серверов инференса vLLM: развертывание Docker и Kubernetes, конфигурация моделей с учетом квантования (тензорный параллелизм, KV-кэш), обслуживание API, совместимого с OpenAI, тестирование пропускной способности и задержки, настройка непрерывного батчинга, работа с GPU, а также обновление/откат. Используйте при развертывании или запуске сервера vLLM (vllm serve, vllm/vllm-openai), подборе размера модели и ее KV-кэша для GPU, выборе квантования и параллелизма, обслуживании через конечные точки /v1, измерении пропускной способности или задержки обслуживания, настройке батчинга или диагностике сбоев GPU, OOM или запуска в развертывании vLLM. Не используйте для обучения моделей, дообучения, проектирования наборов для оценки или методологии выбора движка (это ml-engineering), или для эксплуатации стека llama.cpp с моделями GGUF (это llama-cpp); другие инференс-движки (TGI, Ollama, Triton) не входят в сферу охвата.

машинный переводПоказать оригиналСкрыть оригинал«Operate, configure, benchmark, and troubleshoot vLLM inference servers…»

Operate, configure, benchmark, and troubleshoot vLLM inference servers: Docker and Kubernetes deployment, quantization-aware model configuration (tensor parallelism, KV cache), OpenAI-compatible API serving, throughput and latency benchmarking, continuous batching tuning, GPU operation, and upgrade/rollback. Use when deploying or running a vLLM server (vllm serve, vllm/vllm-openai), sizing a model and its KV cache for GPUs, selecting quantization and parallelism, serving via /v1 endpoints, measuring serving throughput or latency, tuning batching, or diagnosing GPU, OOM, or startup failures in a vLLM deployment. Do not use for model training, fine-tuning, evaluation-set design, or engine-selection methodology (that is ml-engineering), or for operating the llama.cpp stack with GGUF models (that is llama-cpp); other inference engines (TGI, Ollama, Triton) are out of scope.

magnus919/agent-skills Agent Skills автор: magnus919 MIT 13 файлов · 1 скрипт тело ≈ 3 785 токенов Открыть источникgithub.com↗ проанализирован 26 ч назад

Эксплуатирует, конфигурирует, тестирует и устраняет неполадки серверов инференса vLLM: развертывание Docker и Kubernetes, конфигурация моделей с учетом…

Как процесс F 48/100 · Не запустится — Скилл ссылается на файлы, которых нет в архиве: ../ml-engineering/SKILL.md, ../llama-cpp/SKILL.md, ../kubernetes/SKILL.md

ИнтеграцияDockerKubernetesИнфраструктураИИ и агентытип и темы размечены автоматически по тексту скилла
JSON
Технический рейтинг
B
90/100
безопасность, качество, тесты
Безопасность 60%
100
Качество 40%
76
Прогон на моделях
не было
Процессный рейтинг
F
48/100
Не запустится
Скилл ссылается на файлы, которых нет в архиве: ../ml-engineering/SKILL.md, ../llama-cpp/SKILL.md, ../kubernetes/SKILL.md
Инструменты и файлы вес 18
0
Результат и критерий готовности вес 14
0
Входы и предусловия вес 11
0
три самых слабых из десяти параметров · все десять

Как улучшить

  1. В тексте есть ссылки на отсутствующие файлы: добавьте файлы или уберите ссылки.
Для прогона на моделях — необязательно
  • spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.

Находки guard · 0

✓ Критических и высоких находок нет

Просканировано файлов: 11. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.

По спецификации Agent Skills

  • предупреждение missing-ref ссылка на отсутствующий файл: ../ml-engineering/SKILL.md
  • предупреждение missing-ref ссылка на отсутствующий файл: ../llama-cpp/SKILL.md
  • предупреждение missing-ref ссылка на отсутствующий файл: ../kubernetes/SKILL.md
  • предупреждение missing-ref ссылка на отсутствующий файл: ../docker-compose/SKILL.md
  • предупреждение missing-ref ссылка на отсутствующий файл: ../platform-engineering/SKILL.md
  • предупреждение missing-ref ссылка на отсутствующий файл: scripts/vllm-health

Процессный рейтинг: все десять параметров 48/100

Не запустится. Скилл ссылается на файлы, которых нет в архиве: ../ml-engineering/SKILL.md, ../llama-cpp/SKILL.md, ../kubernetes/SKILL.md
  • 0Инструменты и файлы. Не хватает 6 файла(ов): ../ml-engineering/SKILL.md, ../llama-cpp/SKILL.md, ../kubernetes/SKILL.md
  • 0Результат и критерий готовности. Не сказано, что считать результатом
  • 0Входы и предусловия. Не сказано, что нужно иметь на входе
  • 30Повторный запуск. Изменяющих операций: 19, без проверки текущего состояния
  • 50Когда включается. Не сказано, при каком запросе скилл включается
  • 100Шаги. Шагов: 49
  • 100Ошибки и развилки. Развилок: 1, есть раздел про ошибки
  • 100Согласованность. Имя и обязательные поля на месте
  • 100Стоимость исполнения. Тело инструкции 3785 токенов
  • 100Отчётность по ходу. Скилл сообщает о ходе работы
  • medium Правила безопасности и запреты внутри скилла: их место в системном промпте, здесь они не защищают
  • low Разделов верхнего уровня: 15. Похоже на несколько доменов в одном скилле
  • low Скилл сам сортирует и ранжирует выдачу: это работа системы на той стороне, а не модели
  • medium Тестов 6, и все положительные: нет ни одного случая «должен отказать» или «должен переспросить»
  • low Среди тестов нет случая на инъекцию через данные

Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.

Сигналы качества

  • +5В description нет примеров фраз, по которым скилл должен срабатывать
  • +3Длина description 882: рекомендуется 120–800 символов
  • +3Формат ответа не описан: модель каждый раз решает сама
  • -2Ссылки на localhost: у другого пользователя не заработает
  • +2Инструкции на одном языке
  • +4Описание говорит, когда скилл НЕ применять
  • +4Структура: 16 заголовков
  • +3Пошаговые инструкции: 49 пунктов
  • +4Есть примеры (1 блоков кода)
  • +4Справочные файлы упоминаются в инструкциях (7 из 7)
  • +1Лицензия указана

База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 76.