BC war-room
Собирает панель экспертов из нескольких LLM для проверки сложных решений, которые трудно отменить.
машинный переводПоказать оригиналСкрыть оригинал«Convenes a multi-LLM expert panel to pressure-test hard-to-reverse dec…»
Convenes a multi-LLM expert panel to pressure-test hard-to-reverse decisions
Собирает панель экспертов из нескольких LLM для проверки сложных решений, которые трудно отменить.
Как процесс C 60/100 · Есть пробелы — слабые места: когда включается, входы и предусловия, согласованность
Как улучшить
Для прогона на моделях — необязательно
- Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
- spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.
Находки guard · 19
✓ Критических и высоких находок нет
Средние и низкие: 19
-
низкая Рискованное назначение
intent-offensive-securitymodules/deliberation-protocol.md:49Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)| Phase 4: Red Team | <-- Red Team Commander
-
низкая Рискованное назначение
intent-offensive-securitymodules/deliberation-protocol.md:222Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)### Phase 4: Red Team and Wargaming
-
низкая Рискованное назначение
intent-offensive-securitymodules/deliberation-protocol.md:226Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)**Expert**: Red Team Commander (Gemini Flash)
-
низкая Рискованное назначение
intent-offensive-securitymodules/deliberation-protocol.md:251Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)- All COAs with Red Team challenges
-
низкая Рискованное назначение
intent-offensive-securitymodules/deliberation-protocol.md:308Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)- Experts revise positions based on Red Team feedback
-
низкая Рискованное назначение
intent-offensive-securitymodules/discussion-publishing.md:114Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)| Red Team | ... | ... |
-
низкая Рискованное назначение
intent-offensive-securitymodules/discussion-publishing.md:128Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)4. **Red Team Challenges** — key challenges and responses (Phase 4)
-
низкая Рискованное назначение
intent-offensive-securitymodules/discussion-publishing.md:131Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение) (в кавычках — упоминание, а не команда)> Phases 5-6 (War Game execution and Decision Briefing) are internal deliberation artifacts that don't warrant separate comments. Their outputs are incorporated into the Red Team Challenges and Suprem
в кавычках -
низкая Рискованное назначение
intent-offensive-securitymodules/expert-roles.md:70Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение) (в кавычках — упоминание, а не команда)"role": "Red Team Commander",
в кавычках -
низкая Рискованное назначение
intent-offensive-securitymodules/expert-roles.md:205Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)| Red Team | Red Team Commander | - |
-
низкая Рискованное назначение
intent-offensive-securitymodules/expert-roles.md:257Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)- **Sonnet** for Strategist, Intel, Tactician, Red Team — strong reasoning at moderate cost
-
низкая Рискованное назначение
intent-offensive-securitymodules/merkle-dag.md:44Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение) (в кавычках — упоминание, а не команда)expert_role: str # "Intelligence Officer", "Red Team", etc.
в кавычках -
низкая Рискованное назначение
intent-offensive-securitymodules/merkle-dag.md:230Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)# Present to Red Team anonymized
-
низкая Рискованное назначение
intent-offensive-securitymodules/reversibility-assessment.md:142Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)*Recommendation*: Convene full council. Extensive Red Team review required.
-
низкая Рискованное назначение
intent-offensive-securitySKILL.md:76Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)| Red Team | Gemini Flash | Adversarial challenge, failure modes |
-
низкая Рискованное назначение
intent-offensive-securitySKILL.md:87Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)| Red Team Commander | Gemini Flash | Adversarial challenge |
-
низкая Рискованное назначение
intent-offensive-securitySKILL.md:102Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)- Phase 4: Red Team Review (all COAs)
-
низкая Рискованное назначение
intent-offensive-securitySKILL.md:278Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)- Red Team challenges
-
низкая Рискованное назначение
intent-offensive-securitySKILL.md:385Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)4. **Phase 4 (Red Team)**: Red-team teammate receives all COAs, posts challenges; other teammates can **respond to challenges in real-time**
Просканировано файлов: 8. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.
По спецификации Agent Skills
- заметка
frontmatter-keyнеизвестное поле фронтматтера "triggers" - заметка
frontmatter-keyнеизвестное поле фронтматтера "source" - заметка
frontmatter-keyнеизвестное поле фронтматтера "source_plugin"
Процессный рейтинг: все десять параметров 60/100
- 0Входы и предусловия. Не сказано, что нужно иметь на входе
- 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
- 20Когда включается. Не сказано, при каком запросе скилл включается
- 30Повторный запуск. Изменяющих операций: 13, без проверки текущего состояния
- 40Согласованность. Имя во frontmatter (war-room) не совпадает с папкой (nm-attune-war-room)
- 60Результат и критерий готовности. Формат результата описан, критерия завершения нет
- 60Ошибки и развилки. Развилок: 2
- 100Инструменты и файлы. Внешние инструменты не нужны
- 100Шаги. Шагов: 77
- 100Стоимость исполнения. Тело инструкции 3741 токенов
- low Разделов верхнего уровня: 16. Похоже на несколько доменов в одном скилле
- high Скилл велит модели самой совершать необратимое действие, без подтверждения человеком
Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.
Сигналы качества
- +5В description нет примеров фраз, по которым скилл должен срабатывать
- +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
- +3Длина description 76: рекомендуется 120–800 символов
- +1Лицензия не указана
- +2Инструкции на одном языке
- +4Структура: 47 заголовков
- +3Пошаговые инструкции: 77 пунктов
- +3Формат ответа описан явно
- +4Есть примеры (15 блоков кода)
База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 81.
Внешние проверки
ClawHub: suspicious
This decision-review skill is mostly transparent, but it defaults to publishing sensitive deliberations to GitHub and recommends permission-bypassing execution for one external model.
LLM: suspicious (high) · 26 авг. 2026 г.