SKILLEMALL.ai

BB inference-aiops

Используйте этот навык, когда пользователю нужно управлять кластером GPU-инференса — vLLM (OpenAI API + Prometheus /metrics) и Ray Serve / Ray Jobs (Ray dashboard), а также однопроцессными серверами SGLang и TGI (Text Generation Inference): общий обзор кластера (развертывания + общее количество реплик + обратное давление в очереди), метрики запросов (TTFT / TPOT / общая задержка + общее количество токенов), глубина очереди, статистика KV-кэша (использование, коэффициент попадания в префиксный кэш, прерывания), анализ первопричин задержки (diagnose_latency_spike / diagnose_engine_latency) и анализ низкой утилизации, состояние независимо от движка + инвентаризация запущенных моделей в vLLM/SGLang/TGI, авто масштабирование Ray Serve и масштабирование (увеличение/уменьшение, масштабирование до нуля, опустошение реплики), загрузка/выгрузка LoRA, горячая замена базовой модели, развертывание/снятие/переразвертывание, маршрутизация с учетом префикса, утилизация GPU, задания Ray и стоимость за миллион токенов. Всегда используйте этот навык для запросов "почему инференс медленный", "скачок TTFT", "скачок задержки", "GPU недоиспользуется", "уменьшить масштаб развертывания", "масштабировать до нуля", "опустошить реплику перед перезагрузкой", "горячая замена базовой модели", "загрузить адаптер LoRA", "давление в KV-кэше", "коэффициент попадания в префиксный кэш", "обратное давление в очереди", "конфигурация авто масштабирования", "состояние SGLang", "метрики TGI" или "стоимость за токен", когда контекст — это кластер инференса vLLM / SGLang / TGI / Ray Serve. НЕ используйте для инфраструктуры, не связанной с инференсом (гипервизоры, системы хранения данных, резервное копирование, общие рабочие нагрузки контейнеров/кластеров, сетевые устройства или промышленное оборудование) — они относятся к другим AIops-инструментам; этот навык ограничен обслуживанием GPU-инференса (vLLM + Ray). Управляемые операции инференса vLLM + Ray со встроенным механизмом управления (аудит, политика, бюджет токенов, отмена, уровни риска).

машинный переводПоказать оригиналСкрыть оригинал«Use this skill whenever the user needs to operate a GPU inference clus…»

Use this skill whenever the user needs to operate a GPU inference cluster — vLLM (OpenAI API + Prometheus /metrics) and Ray Serve / Ray Jobs (Ray dashboard), plus the single-process serving engines SGLang and TGI (Text Generation Inference): a one-shot cluster overview (deployments + total replicas + queue backpressure), request metrics (TTFT / TPOT / e2e latency + token totals), queue depth, KV-cache stats (utilisation, prefix-cache hit rate, preemptions), the flagship latency root-cause analysis (diagnose_latency_spike / diagnose_engine_latency) and low-utilisation RCA, engine-agnostic health + running-model inventory across vLLM/SGLang/TGI, Ray Serve autoscaling and scaling (scale up/down, scale-to-zero, drain a replica), LoRA load/unload, base-model hot-swap, deploy/undeploy/redeploy, prefix-aware routing, GPU utilisation, Ray jobs, and cost per million tokens. Always use this skill for "why is inference slow", "TTFT spike", "latency spike", "GPU underutilised", "scale down the deployment", "scale to zero", "drain a replica before a reboot", "hot-swap the base model", "load a LoRA adapter", "KV cache pressure", "prefix cache hit rate", "queue backpressure", "autoscale config", "SGLang health", "TGI metrics", or "cost per token" when the context is a vLLM / SGLang / TGI / Ray Serve inference cluster. Do NOT use for non-inference infrastructure (hypervisors, storage appliances, backup products, general container/cluster workloads, network devices, or OT/industrial equipment) — those belong to other AIops-tools; this skill is scoped to GPU inference serving (vLLM + Ray). Governed vLLM + Ray inference operations with a built-in governance harness (audit, policy, token budget, undo, risk-tiers).

ClawHub Claude Code автор: wei zhou v0.10.2 MIT-0 6 файлов тело ≈ 3 032 токенов Открыть источникclawhub.ai проанализирован 12 ч назад

Используйте этот навык, когда пользователю нужно управлять кластером GPU-инференса — vLLM (OpenAI API + Prometheus /metrics) и Ray Serve / Ray Jobs (Ray…

Как процесс B 68/100 · Почти готов — слабые места: результат и критерий готовности, входы и предусловия, повторный запуск

ПроцедураИИ и агентытип и темы размечены автоматически по тексту скилла
JSON
Технический рейтинг
B
83/100
безопасность, качество, тесты
Безопасность 60%
95
Качество 40%
64
Прогон на моделях
не было
Процессный рейтинг
B
68/100
Почти готов
Результат и критерий готовности вес 14
0
Входы и предусловия вес 11
0
Повторный запуск вес 4
30
три самых слабых из десяти параметров · все десять

Чем это грозит

Находки средней серьёзности: скорее всего скилл честный, но прочитайте, что именно насторожило сканер.

Широкие права средняя серьёзность

Ниже описан худший случай для этой категории. Здесь находка средней серьёзности: guard увидел признак, но не доказательство.

Если установить

Скилл просит больше прав, чем нужно для задачи: широкий доступ к инструментам, секретные переменные окружения, бинарные файлы. Каждое лишнее право расширяет ущерб при ошибке или взломе.

Автору

Сузьте allowed-tools и список переменных до минимума, замените бинарники на исходники или скрипты, которые можно прочитать.

Как улучшить

  1. Сократите description до 1024 символов.
Для прогона на моделях — необязательно
  • Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
  • spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.

Находки guard · 1

✓ Критических и высоких находок нет

Средние и низкие: 1
  • средняя Широкие права meta-broad-allowed-tools SKILL.md:1
    Заранее разрешены широкие инструменты: Bash
    allowed-tools: Bash

Просканировано файлов: 6. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.

По спецификации Agent Skills

  • ошибка description-long description 1724 символов, лимит 1024
  • заметка description-budget description занимает 1724 из общего бюджета ~15000 символов на все скиллы
  • заметка frontmatter-key неизвестное поле фронтматтера "slug"
  • заметка frontmatter-key неизвестное поле фронтматтера "displayName"
  • заметка frontmatter-key неизвестное поле фронтматтера "summary"
  • заметка frontmatter-key неизвестное поле фронтматтера "homepage"
  • заметка frontmatter-key неизвестное поле фронтматтера "installer"

Процессный рейтинг: все десять параметров 68/100

  • 0Результат и критерий готовности. Не сказано, что считать результатом
  • 0Входы и предусловия. Не сказано, что нужно иметь на входе
  • 30Повторный запуск. Изменяющих операций: 21, без проверки текущего состояния
  • 55Ошибки и развилки. Развилок: 1
  • 100Инструменты и файлы. Инструменты объявлены во frontmatter
  • 100Шаги. Шагов: 44
  • 100Когда включается. Сказано, когда применять и когда не применять
  • 100Согласованность. Имя и обязательные поля на месте
  • 100Стоимость исполнения. Тело инструкции 3032 токенов
  • 100Отчётность по ходу. Скилл сообщает о ходе работы
  • low Ответ описан самодельной разметкой (5 тегов): типизированный вызов надёжнее

Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.

Сигналы качества

  • +3Длина description 1723: рекомендуется 120–800 символов
  • +3Формат ответа не описан: модель каждый раз решает сама
  • +2Инструкции на одном языке
  • +5В description 16 примера фраз-триггеров в кавычках
  • +4Описание говорит, когда скилл НЕ применять
  • +4Структура: 12 заголовков
  • +3Пошаговые инструкции: 44 пунктов
  • +4Есть примеры (2 блоков кода)
  • +4Справочные файлы упоминаются в инструкциях (3 из 4)
  • +1Лицензия указана

База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 64.

Внешние проверки

ClawHub: suspicious
The skill is transparent about managing inference clusters, but it exposes disruptive write controls without an enforced authorization or read-only gate and installs an unpinned external executable.
LLM: suspicious (high) · 12 сент. 2026 г.