BD agent-redteam-kit
Используйте, когда пользователь говорит «проверь, безопасен ли этот ИИ», «можно ли его взломать», «можно ли заставить ИИ делать опасные вещи, будет ли он слушать», «провести тестирование на проникновение перед запуском» или хочет провести тестирование безопасности для агента/подсказки. Сканирование по китайским и английским базам данных на предмет запросов на взлом/опасные возможности (DAN/игнорирование инструкций/повышение привилегий/утечка данных/самосовершенствование и т. д.), выдача оценки риска + рекомендации по усилению, а также установка «ворот для опасных действий» (есть ворота). Может запускать скрипты (сканер redteam_scan). Теоретическая основа: три закона LGD о наличии ворот (опасные действия сначала проходят через ворота). Триггерные слова: red team, взлом, jailbreak, тестирование на проникновение, атака на подсказки, тестирование безопасности ИИ, опасные инструкции, оценка безопасности.
машинный переводПоказать оригиналСкрыть оригинал«当用户说『测一下这个AI安不安全』『会不会被越狱』『让AI干危险的事它听不听』『上线前做对抗测试』,或要给一个 agent/提示词做安全性红…»
当用户说『测一下这个AI安不安全』『会不会被越狱』『让AI干危险的事它听不听』『上线前做对抗测试』,或要给一个 agent/提示词做安全性红队时使用。中英双库扫描越狱/危险能力请求(DAN/忽略指令/提权/数据外泄/自改进等),给出风险分级+加固建议,并设「危险操作闸门」(有门禁)。可运行脚本(redteam_scan 扫描器)。理论根基:LGD 三律之有门禁(危险动作先过闸)。触发词:红队、red team、越狱、jailbreak、对抗测试、prompt攻击、AI安全测试、危险指令、安全评估。
Используйте, когда пользователь говорит «проверь, безопасен ли этот ИИ», «можно ли его взломать», «можно ли заставить ИИ делать опасные вещи, будет ли он…
Как процесс D 46/100 · Процесс не доведён — слабые места: результат и критерий готовности, когда включается, входы и предусловия
Как улучшить
- Скажите в description, КОГДА применять скилл («используй, когда…», примеры запросов): это главный сигнал для агента.
- Для Hermes description должен быть одним предложением до 60 символов; условия применения вынесите в раздел «When to Use».
- Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
- spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.
Находки guard · 7
✓ Критических и высоких находок нет
Средние и низкие: 7
-
низкая Рискованное назначение
intent-offensive-securityREADME.md:5Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение) (определение детектора / чёрного списка)**EN** — Red-team before launch: bilingual (zh+en) scanner for jailbreak / dangerous-capability requests (ignore-instructions, DAN, privilege escalation, data exfil, self-modify), with risk tiers and
детектор -
низкая Рискованное назначение
intent-offensive-securityskill-card.md:17Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)Developers and security reviewers use this skill to run local pre-release checks on agent prompts or prompt files for jailbreak, instruction override, data exfiltration, privilege escalation, and rela
-
низкая Рискованное назначение
intent-offensive-securitySKILL.md:4Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)display_name: AI红队对抗测试(Red Team Kit)
-
низкая Рискованное назначение
intent-offensive-securitySKILL.md:5Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)displayName: AI红队对抗测试(Red Team Kit)
-
низкая Рискованное назначение
intent-offensive-securitySKILL.md:6Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)title: AI红队对抗测试(Red Team Kit)
-
низкая Рискованное назначение
intent-offensive-securitySKILL.md:12Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение) (определение детектора / чёрного списка)description: 当用户说『测一下这个AI安不安全』『会不会被越狱』『让AI干危险的事它听不听』『上线前做对抗测试』,或要给一个 agent/提示词做安全性红队时使用。中英双库扫描越狱/危险能力请求(DAN/忽略指令/提权/数据外泄/自改进等),给出风险分级+加固建议,并设「危险操作闸门」(有门禁)。可运行脚本(redteam_scan 扫描器)。理论根基:LGD 三律之有门禁(危险动作先
детектор -
низкая Рискованное назначение
intent-offensive-securitySKILL.md:13Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)tags: [红队, red team, 越狱, jailbreak, 对抗测试, AI安全, 有门禁]
Просканировано файлов: 7. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.
По спецификации Agent Skills
- предупреждение
description-long-hermesdescription 251 символов, а стандарт Hermes требует ≤ 60 (одно предложение, с точкой) - предупреждение
description-no-whenни description, ни раздел "## When to Use" не говорят, когда применять скилл - заметка
frontmatter-keyнеизвестное поле фронтматтера "slug" - заметка
frontmatter-keyнеизвестное поле фронтматтера "display_name" - заметка
frontmatter-keyнеизвестное поле фронтматтера "displayName" - заметка
frontmatter-keyнеизвестное поле фронтматтера "title" - заметка
frontmatter-keyнеизвестное поле фронтматтера "display_name_en" - заметка
frontmatter-keyнеизвестное поле фронтматтера "summary" - заметка
frontmatter-keyнеизвестное поле фронтматтера "agent_created" - заметка
frontmatter-keyнеизвестное поле фронтматтера "copyright" - заметка
frontmatter-keyнеизвестное поле фронтматтера "read_when" - заметка
frontmatter-keyнеизвестное поле фронтматтера "homepage"
Процессный рейтинг: все десять параметров 46/100
- 0Результат и критерий готовности. Не сказано, что считать результатом
- 0Входы и предусловия. Не сказано, что нужно иметь на входе
- 0Ошибки и развилки. Линейный процесс без обработки сбоев
- 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
- 20Когда включается. Не сказано, при каком запросе скилл включается
- 60Инструменты и файлы. Используются инструменты (python), но во frontmatter они не объявлены
- 100Шаги. Шагов: 12
- 100Согласованность. Имя и обязательные поля на месте
- 100Стоимость исполнения. Тело инструкции 515 токенов
- 100Повторный запуск. Изменяющих операций нет
Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.
Сигналы качества
- +5В description нет примеров фраз, по которым скилл должен срабатывать
- +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
- +3Формат ответа не описан: модель каждый раз решает сама
- -31 из 1 скриптов не упомянуты в SKILL.md
- +2Инструкции на одном языке
- +3Длина description 251 символов: достаточно сигнала, не съедает бюджет
- +4Структура: 10 заголовков
- +3Пошаговые инструкции: 12 пунктов
- +4Есть примеры (1 блоков кода)
- +1Лицензия указана
База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 61.