BF vllm
Эксплуатирует, конфигурирует, тестирует и устраняет неполадки серверов инференса vLLM: развертывание Docker и Kubernetes, конфигурация моделей с учетом квантования (тензорный параллелизм, KV-кэш), обслуживание API, совместимого с OpenAI, тестирование пропускной способности и задержки, настройка непрерывного батчинга, работа с GPU, а также обновление/откат. Используйте при развертывании или запуске сервера vLLM (vllm serve, vllm/vllm-openai), подборе размера модели и ее KV-кэша для GPU, выборе квантования и параллелизма, обслуживании через конечные точки /v1, измерении пропускной способности или задержки обслуживания, настройке батчинга или диагностике сбоев GPU, OOM или запуска в развертывании vLLM. Не используйте для обучения моделей, дообучения, проектирования наборов для оценки или методологии выбора движка (это ml-engineering), или для эксплуатации стека llama.cpp с моделями GGUF (это llama-cpp); другие инференс-движки (TGI, Ollama, Triton) не входят в сферу охвата.
машинный переводПоказать оригиналСкрыть оригинал«Operate, configure, benchmark, and troubleshoot vLLM inference servers…»
Operate, configure, benchmark, and troubleshoot vLLM inference servers: Docker and Kubernetes deployment, quantization-aware model configuration (tensor parallelism, KV cache), OpenAI-compatible API serving, throughput and latency benchmarking, continuous batching tuning, GPU operation, and upgrade/rollback. Use when deploying or running a vLLM server (vllm serve, vllm/vllm-openai), sizing a model and its KV cache for GPUs, selecting quantization and parallelism, serving via /v1 endpoints, measuring serving throughput or latency, tuning batching, or diagnosing GPU, OOM, or startup failures in a vLLM deployment. Do not use for model training, fine-tuning, evaluation-set design, or engine-selection methodology (that is ml-engineering), or for operating the llama.cpp stack with GGUF models (that is llama-cpp); other inference engines (TGI, Ollama, Triton) are out of scope.
Эксплуатирует, конфигурирует, тестирует и устраняет неполадки серверов инференса vLLM: развертывание Docker и Kubernetes, конфигурация моделей с учетом…
Как процесс F 48/100 · Не запустится — Скилл ссылается на файлы, которых нет в архиве: ../ml-engineering/SKILL.md, ../llama-cpp/SKILL.md, ../kubernetes/SKILL.md
Как улучшить
- В тексте есть ссылки на отсутствующие файлы: добавьте файлы или уберите ссылки.
- spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.
Находки guard · 0
✓ Критических и высоких находок нет
Просканировано файлов: 11. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.
По спецификации Agent Skills
- предупреждение
missing-refссылка на отсутствующий файл: ../ml-engineering/SKILL.md - предупреждение
missing-refссылка на отсутствующий файл: ../llama-cpp/SKILL.md - предупреждение
missing-refссылка на отсутствующий файл: ../kubernetes/SKILL.md - предупреждение
missing-refссылка на отсутствующий файл: ../docker-compose/SKILL.md - предупреждение
missing-refссылка на отсутствующий файл: ../platform-engineering/SKILL.md - предупреждение
missing-refссылка на отсутствующий файл: scripts/vllm-health
Процессный рейтинг: все десять параметров 48/100
- 0Инструменты и файлы. Не хватает 6 файла(ов): ../ml-engineering/SKILL.md, ../llama-cpp/SKILL.md, ../kubernetes/SKILL.md
- 0Результат и критерий готовности. Не сказано, что считать результатом
- 0Входы и предусловия. Не сказано, что нужно иметь на входе
- 30Повторный запуск. Изменяющих операций: 19, без проверки текущего состояния
- 50Когда включается. Не сказано, при каком запросе скилл включается
- 100Шаги. Шагов: 49
- 100Ошибки и развилки. Развилок: 1, есть раздел про ошибки
- 100Согласованность. Имя и обязательные поля на месте
- 100Стоимость исполнения. Тело инструкции 3785 токенов
- 100Отчётность по ходу. Скилл сообщает о ходе работы
- medium Правила безопасности и запреты внутри скилла: их место в системном промпте, здесь они не защищают
- low Разделов верхнего уровня: 15. Похоже на несколько доменов в одном скилле
- low Скилл сам сортирует и ранжирует выдачу: это работа системы на той стороне, а не модели
- medium Тестов 6, и все положительные: нет ни одного случая «должен отказать» или «должен переспросить»
- low Среди тестов нет случая на инъекцию через данные
Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.
Сигналы качества
- +5В description нет примеров фраз, по которым скилл должен срабатывать
- +3Длина description 882: рекомендуется 120–800 символов
- +3Формат ответа не описан: модель каждый раз решает сама
- -2Ссылки на localhost: у другого пользователя не заработает
- +2Инструкции на одном языке
- +4Описание говорит, когда скилл НЕ применять
- +4Структура: 16 заголовков
- +3Пошаговые инструкции: 49 пунктов
- +4Есть примеры (1 блоков кода)
- +4Справочные файлы упоминаются в инструкциях (7 из 7)
- +1Лицензия указана
База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 76.