AB red-team
Движок состязательных дебатов между несколькими агентами для стресс-тестирования решений, идей и стратегий. Оркестрирует несколько ИИ-агентов с конфликтующими мировоззрениями (бык, медведь, оператор, контриан и т. д.) для обсуждения вопроса в структурированных раундах, а затем синтезирует результаты в краткий отчет для принятия решений. Используйте для: анализа красной команды, состязательных дебатов, стресс-тестирования идей, адвоката дьявола, анализа «что может пойти не так», проверки решений, упражнений по премортему.
машинный переводПоказать оригиналСкрыть оригинал«Adversarial multi-agent debate engine for stress-testing decisions, id…»
Adversarial multi-agent debate engine for stress-testing decisions, ideas, and strategies. Orchestrates multiple AI agents with conflicting worldviews (bull, bear, operator, contrarian, etc.) to debate a question through structured rounds, then synthesizes results into a decision brief. Use for: red team analysis, adversarial debate, stress testing ideas, devil's advocate, "what could go wrong" analysis, decision validation, pre-mortem exercises.
Движок состязательных дебатов между несколькими агентами для стресс-тестирования решений, идей и стратегий.
Как процесс B 67/100 · Почти готов — слабые места: ошибки и развилки, повторный запуск, отчётность по ходу
Как улучшить
- Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
- spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.
Находки guard · 5
✓ Критических и высоких находок нет
Средние и низкие: 5
-
низкая Рискованное назначение
intent-offensive-securityREADME.md:1Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)# 🔴 Red Team — Adversarial Multi-Agent Debate Engine
-
низкая Рискованное назначение
intent-offensive-securityreferences/personas.md:1Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)# Red Team Persona Library
-
низкая Рискованное назначение
intent-offensive-securitySKILL.md:7Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)Use for: red team analysis, adversarial debate, stress testing ideas, devil's advocate,
-
низкая Рискованное назначение
intent-offensive-securitySKILL.md:11Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)# Red Team — Adversarial Debate Engine
-
низкая Рискованное назначение
intent-offensive-securitySKILL.md:52Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение) (в кавычках — упоминание, а не команда)When the user asks you to "red team" something, "stress test" an idea, play "devil's advocate", or asks "what could go wrong":
в кавычках
Просканировано файлов: 4. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.
По спецификации Agent Skills
✓ По спецификации Agent Skills замечаний нет
Процессный рейтинг: все десять параметров 67/100
- 0Ошибки и развилки. Линейный процесс без обработки сбоев
- 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
- 30Повторный запуск. Изменяющих операций: 2, без проверки текущего состояния
- 60Инструменты и файлы. Используются инструменты (python), но во frontmatter они не объявлены
- 60Результат и критерий готовности. Формат результата описан, критерия завершения нет
- 70Входы и предусловия. Входные данные и предусловия перечислены
- 85Шаги. Шагов: 29, расплывчатых формулировок: 1
- 100Когда включается. Сказано, когда применять и когда не применять
- 100Согласованность. Имя и обязательные поля на месте
- 100Стоимость исполнения. Тело инструкции 1248 токенов
Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.
Сигналы качества
- +5В description нет примеров фраз, по которым скилл должен срабатывать
- -41 справочных файлов, но SKILL.md на них не ссылается: модель их не откроет
- +1Лицензия не указана
- +2Инструкции на одном языке
- +4Описание говорит, когда скилл НЕ применять
- +3Длина description 450 символов: достаточно сигнала, не съедает бюджет
- +4Структура: 10 заголовков
- +3Пошаговые инструкции: 29 пунктов
- +3Формат ответа описан явно
- +4Есть примеры (2 блоков кода)
- +3Все 1 скриптов описаны в инструкциях
База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 90.