SKILLEMALL.ai

BF inference-aiops

Используйте этот навык, когда пользователю нужно управлять кластером GPU-инференса — vLLM (OpenAI API + Prometheus /metrics) и Ray Serve / Ray Jobs (Ray dashboard), а также однопроцессными серверами SGLang и TGI (Text Generation Inference): общий обзор кластера (развертывания + общее количество реплик + обратное давление в очереди), метрики запросов (TTFT / TPOT / общая задержка + общее количество токенов), глубина очереди, статистика KV-кэша (использование, коэффициент попадания в префиксный кэш, прерывания), анализ первопричин задержки (diagnose_latency_spike / diagnose_engine_latency) и анализ низкой утилизации, состояние независимо от движка + инвентаризация запущенных моделей в vLLM/SGLang/TGI, авто масштабирование Ray Serve и масштабирование (увеличение/уменьшение, масштабирование до нуля, опустошение реплики), загрузка/выгрузка LoRA, горячая замена базовой модели, развертывание/снятие/переразвертывание, маршрутизация с учетом префикса, утилизация GPU, задания Ray и стоимость за миллион токенов. Всегда используйте этот навык для запросов "почему инференс медленный", "скачок TTFT", "скачок задержки", "GPU недоиспользуется", "уменьшить масштаб развертывания", "масштабировать до нуля", "опустошить реплику перед перезагрузкой", "горячая замена базовой модели", "загрузить адаптер LoRA", "давление в KV-кэше", "коэффициент попадания в префиксный кэш", "обратное давление в очереди", "конфигурация авто масштабирования", "состояние SGLang", "метрики TGI" или "стоимость за токен", когда контекст — это кластер инференса vLLM / SGLang / TGI / Ray Serve. НЕ используйте для инфраструктуры, не связанной с инференсом (гипервизоры, системы хранения данных, резервное копирование, общие рабочие нагрузки контейнеров/кластеров, сетевые устройства или промышленное оборудование) — они относятся к другим AIops-инструментам; этот навык ограничен обслуживанием GPU-инференса (vLLM + Ray). Управляемые операции инференса vLLM + Ray со встроенным механизмом управления (аудит, политика, бюджет токенов, отмена, уровни риска).

машинный переводПоказать оригиналСкрыть оригинал«Use this skill whenever the user needs to operate a GPU inference clus…»

Use this skill whenever the user needs to operate a GPU inference cluster — vLLM (OpenAI API + Prometheus /metrics) and Ray Serve / Ray Jobs (Ray dashboard), plus the single-process serving engines SGLang and TGI (Text Generation Inference): a one-shot cluster overview (deployments + total replicas + queue backpressure), request metrics (TTFT / TPOT / e2e latency + token totals), queue depth, KV-cache stats (utilisation, prefix-cache hit rate, preemptions), the flagship latency root-cause analysis (diagnose_latency_spike / diagnose_engine_latency) and low-utilisation RCA, engine-agnostic health + running-model inventory across vLLM/SGLang/TGI, Ray Serve autoscaling and scaling (scale up/down, scale-to-zero, drain a replica), LoRA load/unload, base-model hot-swap, deploy/undeploy/redeploy, prefix-aware routing, GPU utilisation, Ray jobs, and cost per million tokens. Always use this skill for "why is inference slow", "TTFT spike", "latency spike", "GPU underutilised", "scale down the deployment", "scale to zero", "drain a replica before a reboot", "hot-swap the base model", "load a LoRA adapter", "KV cache pressure", "prefix cache hit rate", "queue backpressure", "autoscale config", "SGLang health", "TGI metrics", or "cost per token" when the context is a vLLM / SGLang / TGI / Ray Serve inference cluster. Do NOT use for non-inference infrastructure (hypervisors, storage appliances, backup products, general container/cluster workloads, network devices, or OT/industrial equipment) — those belong to other AIops-tools; this skill is scoped to GPU inference serving (vLLM + Ray). Governed vLLM + Ray inference operations with a built-in governance harness (audit, policy, token budget, undo, risk-tiers).

ClawHub Claude Code автор: wei zhou v0.10.0 MIT-0 6 файлов тело ≈ 2 954 токенов Открыть источникclawhub.ai проанализирован 2 дн назад

Используйте этот навык, когда пользователю нужно управлять кластером GPU-инференса — vLLM (OpenAI API + Prometheus /metrics) и Ray Serve / Ray Jobs (Ray…

Как процесс F 50/100 · Не запустится — Скилл ссылается на файлы, которых нет в архиве: references/capabilities.md, references/cli-reference.md, references/setup-guide.md

ПроцедураИИ и агентытип и темы размечены автоматически по тексту скилла
JSON
Технический рейтинг
B
76/100
безопасность, качество, тесты
Безопасность 60%
95
Качество 40%
48
Прогон на моделях
не было
Процессный рейтинг
F
50/100
Не запустится
Скилл ссылается на файлы, которых нет в архиве: references/capabilities.md, references/cli-reference.md, references/setup-guide.md
Инструменты и файлы вес 18
0
Результат и критерий готовности вес 14
0
Входы и предусловия вес 11
0
три самых слабых из десяти параметров · все десять

Чем это грозит

Находки средней серьёзности: скорее всего скилл честный, но прочитайте, что именно насторожило сканер.

Широкие права средняя серьёзность

Ниже описан худший случай для этой категории. Здесь находка средней серьёзности: guard увидел признак, но не доказательство.

Если установить

Скилл просит больше прав, чем нужно для задачи: широкий доступ к инструментам, секретные переменные окружения, бинарные файлы. Каждое лишнее право расширяет ущерб при ошибке или взломе.

Автору

Сузьте allowed-tools и список переменных до минимума, замените бинарники на исходники или скрипты, которые можно прочитать.

Как улучшить

  1. Сократите description до 1024 символов.
  2. В тексте есть ссылки на отсутствующие файлы: добавьте файлы или уберите ссылки.
Для прогона на моделях — необязательно
  • Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
  • spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.

Находки guard · 1

✓ Критических и высоких находок нет

Средние и низкие: 1
  • средняя Широкие права meta-broad-allowed-tools SKILL.md:1
    Заранее разрешены широкие инструменты: Bash
    allowed-tools: Bash

Просканировано файлов: 0. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.

По спецификации Agent Skills

  • ошибка description-long description 1724 символов, лимит 1024
  • предупреждение missing-ref ссылка на отсутствующий файл: references/capabilities.md
  • предупреждение missing-ref ссылка на отсутствующий файл: references/cli-reference.md
  • предупреждение missing-ref ссылка на отсутствующий файл: references/setup-guide.md
  • заметка description-budget description занимает 1724 из общего бюджета ~15000 символов на все скиллы
  • заметка frontmatter-key неизвестное поле фронтматтера "slug"
  • заметка frontmatter-key неизвестное поле фронтматтера "displayName"
  • заметка frontmatter-key неизвестное поле фронтматтера "summary"
  • заметка frontmatter-key неизвестное поле фронтматтера "homepage"
  • заметка frontmatter-key неизвестное поле фронтматтера "installer"

Процессный рейтинг: все десять параметров 50/100

Не запустится. Скилл ссылается на файлы, которых нет в архиве: references/capabilities.md, references/cli-reference.md, references/setup-guide.md
  • 0Инструменты и файлы. Не хватает 3 файла(ов): references/capabilities.md, references/cli-reference.md, references/setup-guide.md
  • 0Результат и критерий готовности. Не сказано, что считать результатом
  • 0Входы и предусловия. Не сказано, что нужно иметь на входе
  • 30Повторный запуск. Изменяющих операций: 21, без проверки текущего состояния
  • 55Ошибки и развилки. Развилок: 1
  • 100Шаги. Шагов: 44
  • 100Когда включается. Сказано, когда применять и когда не применять
  • 100Согласованность. Имя и обязательные поля на месте
  • 100Стоимость исполнения. Тело инструкции 2954 токенов
  • 100Отчётность по ходу. Скилл сообщает о ходе работы
  • low Ответ описан самодельной разметкой (5 тегов): типизированный вызов надёжнее

Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.

Сигналы качества

  • +3Длина description 1723: рекомендуется 120–800 символов
  • +3Формат ответа не описан: модель каждый раз решает сама
  • +2Инструкции на одном языке
  • +5В description 16 примера фраз-триггеров в кавычках
  • +4Описание говорит, когда скилл НЕ применять
  • +4Структура: 12 заголовков
  • +3Пошаговые инструкции: 44 пунктов
  • +4Есть примеры (1 блоков кода)
  • +1Лицензия указана

База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 48.

Внешние проверки

ClawHub: suspicious
The skill is coherently aimed at GPU inference operations, but it can perform disruptive cluster changes without a built-in approval or read-only gate and installs an unpinned external executable package.
LLM: suspicious (high) · 12 сент. 2026 г.