BA datadog-monitor-designer
Разрабатывайте мониторы Datadog, которые выявляют реальные проблемы в продакшене, не срабатывая на ложные сигналы. Охватывает мониторинг на основе SLO с оповещениями о множественных окнах и множественных показателях выгорания, выбор между типами мониторов: пороговый/аномальный/прогнозный/выброс/композитный, маршрутизация на основе тегов, окна простоя, наследование шаблонов мониторов по уровням обслуживания, составление уведомлений и привязка к руководствам. Действует как старший SRE, который управлял более чем 4000 мониторами Datadog и сократил их до 600, которые по-прежнему выявляют каждый реальный инцидент. Знает рычаги управления биллингом Datadog (пользовательские метрики, индексированные журналы, полученные трассировки), как `from`/`group_by` взаимодействуют с оценкой отсутствия данных, разницу между простыми оповещениями и множественными оповещениями, а также какие типы мониторов являются дорогостоящими. Используйте, когда мониторы срабатывают на незначительные сбои, когда уровню обслуживания требуется согласованный набор мониторов, когда SLO необходимо преобразовать в оповещения о показателях выгорания или когда разрастание мониторов становится неуправляемым. Триггеры: "datadog", "datadog monitor", "monitor design", "slo", "burn rate", "anomaly monitor", "forecast monitor", "composite monitor", "alert routing", "runbook", "downtime", "noisy monitor", "monitor template", "service tier", "T0", "T1".
машинный переводПоказать оригиналСкрыть оригинал«Design Datadog monitors that catch real production issues without pagi…»
Design Datadog monitors that catch real production issues without paging on noise. Covers SLO-based monitoring with multi-window multi-burn-rate alerts, the decision between threshold/anomaly/forecast/outlier/composite monitor types, tag-driven routing, downtime windows, monitor template inheritance per service tier, notification message engineering, and runbook linking. Acts as a senior SRE who has owned 4,000+ Datadog monitors and pruned them down to 600 monitors that still catch every real incident. Knows the Datadog billing levers (custom metrics, indexed logs, ingested traces), how `from`/`group_by` interact with no-data evaluation, the difference between simple alerts and multi-alerts, and which monitor types are silently expensive. Use when monitors are paging on cosmetic blips, when a service tier needs a coherent monitor set, when SLOs need turning into burn-rate alerts, or when monitor sprawl is unmanageable. Triggers on "datadog", "datadog monitor", "monitor design", "slo", "burn rate", "anomaly monitor", "forecast monitor", "composite monitor", "alert routing", "runbook", "downtime", "noisy monitor", "monitor template", "service tier", "T0", "T1".
Разрабатывайте мониторы Datadog, которые выявляют реальные проблемы в продакшене, не срабатывая на ложные сигналы.
Как процесс A 81/100 · Дойдёт до конца — слабые места: результат и критерий готовности
Как улучшить
- Сократите description до 1024 символов.
- Тело SKILL.md длиннее 5 000 токенов: вынесите справочные детали в references/ и подключайте по необходимости.
- Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
- spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.
Находки guard · 0
✓ Критических и высоких находок нет
Просканировано файлов: 3. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.
По спецификации Agent Skills
- ошибка
description-longdescription 1177 символов, лимит 1024 - предупреждение
body-longтело SKILL.md ≈ 5977 токенов (рекомендуется < 5000); вынесите детали в references/ - заметка
edit-residueв тексте есть пометки об устаревшем (строки 97): проверьте, не остались ли старые правила рядом с новыми — полная проверка читает текст на противоречия
Процессный рейтинг: все десять параметров 81/100
- 0Результат и критерий готовности. Не сказано, что считать результатом
- 70Входы и предусловия. Входные данные и предусловия перечислены
- 70Стоимость исполнения. Тело инструкции 5977 токенов
- 100Инструменты и файлы. Внешние инструменты не нужны
- 100Шаги. Шагов: 81
- 100Когда включается. Сказано, когда применять и когда не применять
- 100Ошибки и развилки. Развилок: 2, есть раздел про ошибки
- 100Согласованность. Имя и обязательные поля на месте
- 100Повторный запуск. Изменяющие операции проверяют текущее состояние
- 100Отчётность по ходу. Скилл сообщает о ходе работы
- medium Правила безопасности и запреты внутри скилла: их место в системном промпте, здесь они не защищают
- low Разделов верхнего уровня: 14. Похоже на несколько доменов в одном скилле
- low Ответ описан самодельной разметкой (3 тегов): типизированный вызов надёжнее
Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.
Сигналы качества
- +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
- +3Длина description 1177: рекомендуется 120–800 символов
- +3Формат ответа не описан: модель каждый раз решает сама
- +1Лицензия не указана
- +2Инструкции на одном языке
- +5В description 13 примера фраз-триггеров в кавычках
- +4Структура: 18 заголовков
- +3Пошаговые инструкции: 81 пунктов
- +4Есть примеры (14 блоков кода)
База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 51.