BB logic-hunter
Инструмент для проверки логики и отслеживания доказательств на основе фреймворка интеллектуального анализа знаний «Золотой треугольник».
машинный переводПоказать оригиналСкрыть оригинал«Hard-core logic verification and evidence tracing tool based on the "G…»
Hard-core logic verification and evidence tracing tool based on the "Golden Triangle" knowledge mining framework
Инструмент для проверки логики и отслеживания доказательств на основе фреймворка интеллектуального анализа знаний «Золотой треугольник».
Как процесс B 67/100 · Почти готов — слабые места: когда включается, ошибки и развилки, повторный запуск
Как улучшить
- Скажите в description, КОГДА применять скилл («используй, когда…», примеры запросов): это главный сигнал для агента.
- Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
- spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.
Находки guard · 8
✓ Критических и высоких находок нет
Средние и низкие: 8
-
низкая Рискованное назначение
intent-offensive-securityREADME.md:13Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)- **Red Team Challenge** — Automatically finds survivor bias, reverse causality, and other logical vulnerabilities
-
низкая Рискованное назначение
intent-offensive-securityREADME.md:78Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)🔴 Red Team Attack Points
-
низкая Рискованное назначение
intent-offensive-securityREADME.md:125Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)🔴 Red Team Attack Points
-
низкая Рискованное назначение
intent-offensive-securitySKILL.md:23Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)4. **Red Team Challenge**: Simulate opponent role to find "survivor bias" or "reverse causality" in current evidence chain
-
низкая Рискованное назначение
intent-offensive-securitySKILL.md:68Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)🔴 Red Team Attack Points
-
низкая Рискованное назначение
intent-offensive-securitySKILL.md:106Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)4. Execute red team attack to identify vulnerabilities
-
низкая Рискованное назначение
intent-offensive-securitySKILL.md:120Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)4. Red team attack: Find survivor bias, reverse causality
-
низкая Рискованное назначение
intent-offensive-securitySKILL.md:134Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)🔴 Red Team Attack Points
Просканировано файлов: 5. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.
По спецификации Agent Skills
- предупреждение
description-no-whendescription не говорит, КОГДА применять скилл (нет "use when / используй когда")
Процессный рейтинг: все десять параметров 67/100
- 0Ошибки и развилки. Линейный процесс без обработки сбоев
- 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
- 20Когда включается. Не сказано, при каком запросе скилл включается
- 30Повторный запуск. Изменяющих операций: 2, без проверки текущего состояния
- 60Результат и критерий готовности. Формат результата описан, критерия завершения нет
- 70Входы и предусловия. Входные данные и предусловия перечислены
- 100Инструменты и файлы. Внешние инструменты не нужны
- 100Шаги. Шагов: 20
- 100Согласованность. Имя и обязательные поля на месте
- 100Стоимость исполнения. Тело инструкции 1036 токенов
Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.
Сигналы качества
- +5В description нет примеров фраз, по которым скилл должен срабатывать
- +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
- +3Длина description 112: рекомендуется 120–800 символов
- +1Лицензия не указана
- +2Инструкции на одном языке
- +4Структура: 15 заголовков
- +3Пошаговые инструкции: 20 пунктов
- +3Формат ответа описан явно
- +4Есть примеры (2 блоков кода)
База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 72.