BB war-room
Созывает экспертную панель из нескольких LLM для проверки сложных для реверсирования решений. Используется, когда оценка обратимости низкая и требуется враждебный обзор.
машинный переводПоказать оригиналСкрыть оригинал«Convenes a multi-LLM expert panel to pressure-test hard-to-reverse dec…»
Convenes a multi-LLM expert panel to pressure-test hard-to-reverse decisions. Use when reversibility score is low and adversarial review is warranted.
Созывает экспертную панель из нескольких LLM для проверки сложных для реверсирования решений.
Как процесс B 65/100 · Почти готов — слабые места: когда включается, входы и предусловия, повторный запуск
Как улучшить
- Для Hermes description должен быть одним предложением до 60 символов; условия применения вынесите в раздел «When to Use».
- Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
- spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.
Находки guard · 19
✓ Критических и высоких находок нет
Средние и низкие: 19
-
низкая Рискованное назначение
intent-offensive-securitymodules/deliberation-protocol.md:49Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)| Phase 4: Red Team | <-- Red Team Commander
-
низкая Рискованное назначение
intent-offensive-securitymodules/deliberation-protocol.md:222Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)### Phase 4: Red Team and Wargaming
-
низкая Рискованное назначение
intent-offensive-securitymodules/deliberation-protocol.md:226Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)**Expert**: Red Team Commander (Gemini Flash)
-
низкая Рискованное назначение
intent-offensive-securitymodules/deliberation-protocol.md:251Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)- All COAs with Red Team challenges
-
низкая Рискованное назначение
intent-offensive-securitymodules/deliberation-protocol.md:308Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)- Experts revise positions based on Red Team feedback
-
низкая Рискованное назначение
intent-offensive-securitymodules/discussion-publishing.md:114Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)| Red Team | ... | ... |
-
низкая Рискованное назначение
intent-offensive-securitymodules/discussion-publishing.md:128Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)4. **Red Team Challenges**: key challenges and responses (Phase 4)
-
низкая Рискованное назначение
intent-offensive-securitymodules/discussion-publishing.md:131Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение) (в кавычках — упоминание, а не команда)> Phases 5-6 (War Game execution and Decision Briefing) are internal deliberation artifacts that don't warrant separate comments. Their outputs are incorporated into the Red Team Challenges and Suprem
в кавычках -
низкая Рискованное назначение
intent-offensive-securitymodules/expert-roles.md:70Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение) (в кавычках — упоминание, а не команда)"role": "Red Team Commander",
в кавычках -
низкая Рискованное назначение
intent-offensive-securitymodules/expert-roles.md:205Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)| Red Team | Red Team Commander | - |
-
низкая Рискованное назначение
intent-offensive-securitymodules/expert-roles.md:257Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)- **Sonnet** for Strategist, Intel, Tactician, Red Team: strong reasoning at moderate cost
-
низкая Рискованное назначение
intent-offensive-securitymodules/merkle-dag.md:44Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение) (в кавычках — упоминание, а не команда)expert_role: str # "Intelligence Officer", "Red Team", etc.
в кавычках -
низкая Рискованное назначение
intent-offensive-securitymodules/merkle-dag.md:234Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)# Present to Red Team anonymized
-
низкая Рискованное назначение
intent-offensive-securitymodules/reversibility-assessment.md:142Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)*Recommendation*: Convene full council. Extensive Red Team review required.
-
низкая Рискованное назначение
intent-offensive-securitySKILL.md:81Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)| Red Team | Gemini Flash | Adversarial challenge, failure modes |
-
низкая Рискованное назначение
intent-offensive-securitySKILL.md:92Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)| Red Team Commander | Gemini Flash | Adversarial challenge |
-
низкая Рискованное назначение
intent-offensive-securitySKILL.md:107Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)- Phase 4: Red Team Review (all COAs)
-
низкая Рискованное назначение
intent-offensive-securitySKILL.md:305Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)- Red Team challenges
-
низкая Рискованное назначение
intent-offensive-securitySKILL.md:431Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)4. **Phase 4 (Red Team)**: Red-team teammate receives all COAs, posts challenges; other teammates can **respond to challenges in real-time**
Просканировано файлов: 7. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.
По спецификации Agent Skills
- предупреждение
description-long-hermesdescription 150 символов, а стандарт Hermes требует ≤ 60 (одно предложение, с точкой) - заметка
frontmatter-keyнеизвестное поле фронтматтера "alwaysApply" - заметка
frontmatter-keyнеизвестное поле фронтматтера "complexity" - заметка
frontmatter-keyнеизвестное поле фронтматтера "model_hint" - заметка
frontmatter-keyнеизвестное поле фронтматтера "estimated_tokens" - заметка
frontmatter-keyнеизвестное поле фронтматтера "progressive_loading" - заметка
frontmatter-keyнеизвестное поле фронтматтера "modules" - заметка
frontmatter-keyнеизвестное поле фронтматтера "dependencies" - заметка
frontmatter-keyнеизвестное поле фронтматтера "tools" - заметка
frontmatter-keyнеизвестное поле фронтматтера "role"
Процессный рейтинг: все десять параметров 65/100
- 0Входы и предусловия. Не сказано, что нужно иметь на входе
- 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
- 20Когда включается. Не сказано, при каком запросе скилл включается
- 30Повторный запуск. Изменяющих операций: 16, без проверки текущего состояния
- 60Результат и критерий готовности. Формат результата описан, критерия завершения нет
- 70Стоимость исполнения. Тело инструкции 4272 токенов
- 85Шаги. Шагов: 85, расплывчатых формулировок: 1
- 100Инструменты и файлы. Инструменты объявлены во frontmatter
- 100Ошибки и развилки. Развилок: 2, есть раздел про ошибки
- 100Согласованность. Имя и обязательные поля на месте
- low Разделов верхнего уровня: 17. Похоже на несколько доменов в одном скилле
- high Скилл велит модели самой совершать необратимое действие, без подтверждения человеком
Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.
Сигналы качества
- +5В description нет примеров фраз, по которым скилл должен срабатывать
- +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
- +1Лицензия не указана
- +2Инструкции на одном языке
- +3Длина description 150 символов: достаточно сигнала, не съедает бюджет
- +4Структура: 49 заголовков
- +3Пошаговые инструкции: 85 пунктов
- +3Формат ответа описан явно
- +4Есть примеры (15 блоков кода)
База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 78.