SKILLEMALL.ai

AB red-team

Движок состязательных дебатов между несколькими агентами для стресс-тестирования решений, идей и стратегий. Оркестрирует несколько ИИ-агентов с конфликтующими мировоззрениями (бык, медведь, оператор, контриан и т. д.) для обсуждения вопроса в структурированных раундах, а затем синтезирует результаты в краткий отчет для принятия решений. Используйте для: анализа красной команды, состязательных дебатов, стресс-тестирования идей, адвоката дьявола, анализа «что может пойти не так», проверки решений, упражнений по премортему.

машинный переводПоказать оригиналСкрыть оригинал«Adversarial multi-agent debate engine for stress-testing decisions, id…»

Adversarial multi-agent debate engine for stress-testing decisions, ideas, and strategies. Orchestrates multiple AI agents with conflicting worldviews (bull, bear, operator, contrarian, etc.) to debate a question through structured rounds, then synthesizes results into a decision brief. Use for: red team analysis, adversarial debate, stress testing ideas, devil's advocate, "what could go wrong" analysis, decision validation, pre-mortem exercises.

modbender/skill-library-mcp Agent Skills автор: modbender MIT 4 файла тело ≈ 1 248 токенов Открыть источникgithub.com проанализирован 2 дн назад

Движок состязательных дебатов между несколькими агентами для стресс-тестирования решений, идей и стратегий.

Как процесс B 67/100 · Почти готов — слабые места: ошибки и развилки, повторный запуск, отчётность по ходу

АнализаторИИ и агентытип и темы размечены автоматически по тексту скилла
JSON
Технический рейтинг
A
93/100
безопасность, качество, тесты
Безопасность 60%
95
Качество 40%
90
Прогон на моделях
не было
Процессный рейтинг
B
67/100
Почти готов
Ошибки и развилки вес 10
0
Отчётность по ходу вес 2
0
Повторный запуск вес 4
30
три самых слабых из десяти параметров · все десять

Как улучшить

    Для прогона на моделях — необязательно
    • Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
    • spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.

    Находки guard · 5

    ✓ Критических и высоких находок нет

    Средние и низкие: 5
    • низкая Рискованное назначение intent-offensive-security README.md:1
      Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)
      # 🔴 Red Team — Adversarial Multi-Agent Debate Engine
    • низкая Рискованное назначение intent-offensive-security references/personas.md:1
      Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)
      # Red Team Persona Library
    • низкая Рискованное назначение intent-offensive-security SKILL.md:7
      Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)
      Use for: red team analysis, adversarial debate, stress testing ideas, devil's advocate,
    • низкая Рискованное назначение intent-offensive-security SKILL.md:11
      Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)
      # Red Team — Adversarial Debate Engine
    • низкая Рискованное назначение intent-offensive-security SKILL.md:52
      Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение) (в кавычках — упоминание, а не команда)
      When the user asks you to "red team" something, "stress test" an idea, play "devil's advocate", or asks "what could go wrong":
      в кавычках

    Просканировано файлов: 4. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.

    По спецификации Agent Skills

    ✓ По спецификации Agent Skills замечаний нет

    Процессный рейтинг: все десять параметров 67/100

    • 0Ошибки и развилки. Линейный процесс без обработки сбоев
    • 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
    • 30Повторный запуск. Изменяющих операций: 2, без проверки текущего состояния
    • 60Инструменты и файлы. Используются инструменты (python), но во frontmatter они не объявлены
    • 60Результат и критерий готовности. Формат результата описан, критерия завершения нет
    • 70Входы и предусловия. Входные данные и предусловия перечислены
    • 85Шаги. Шагов: 29, расплывчатых формулировок: 1
    • 100Когда включается. Сказано, когда применять и когда не применять
    • 100Согласованность. Имя и обязательные поля на месте
    • 100Стоимость исполнения. Тело инструкции 1248 токенов

    Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.

    Сигналы качества

    • +5В description нет примеров фраз, по которым скилл должен срабатывать
    • -41 справочных файлов, но SKILL.md на них не ссылается: модель их не откроет
    • +1Лицензия не указана
    • +2Инструкции на одном языке
    • +4Описание говорит, когда скилл НЕ применять
    • +3Длина description 450 символов: достаточно сигнала, не съедает бюджет
    • +4Структура: 10 заголовков
    • +3Пошаговые инструкции: 29 пунктов
    • +3Формат ответа описан явно
    • +4Есть примеры (2 блоков кода)
    • +3Все 1 скриптов описаны в инструкциях

    База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 90.