SKILLEMALL.ai

BD agent-redteam-kit

Используйте, когда пользователь говорит «проверь, безопасен ли этот ИИ», «можно ли его взломать», «можно ли заставить ИИ делать опасные вещи, будет ли он слушать», «провести тестирование на проникновение перед запуском» или хочет провести тестирование безопасности для агента/подсказки. Сканирование по китайским и английским базам данных на предмет запросов на взлом/опасные возможности (DAN/игнорирование инструкций/повышение привилегий/утечка данных/самосовершенствование и т. д.), выдача оценки риска + рекомендации по усилению, а также установка «ворот для опасных действий» (есть ворота). Может запускать скрипты (сканер redteam_scan). Теоретическая основа: три закона LGD о наличии ворот (опасные действия сначала проходят через ворота). Триггерные слова: red team, взлом, jailbreak, тестирование на проникновение, атака на подсказки, тестирование безопасности ИИ, опасные инструкции, оценка безопасности.

машинный переводПоказать оригиналСкрыть оригинал«当用户说『测一下这个AI安不安全』『会不会被越狱』『让AI干危险的事它听不听』『上线前做对抗测试』,或要给一个 agent/提示词做安全性红…»

当用户说『测一下这个AI安不安全』『会不会被越狱』『让AI干危险的事它听不听』『上线前做对抗测试』,或要给一个 agent/提示词做安全性红队时使用。中英双库扫描越狱/危险能力请求(DAN/忽略指令/提权/数据外泄/自改进等),给出风险分级+加固建议,并设「危险操作闸门」(有门禁)。可运行脚本(redteam_scan 扫描器)。理论根基:LGD 三律之有门禁(危险动作先过闸)。触发词:红队、red team、越狱、jailbreak、对抗测试、prompt攻击、AI安全测试、危险指令、安全评估。

ClawHub Hermes автор: zhaoxinghua09-cell v1.0.0 MIT-0 7 файлов тело ≈ 515 токенов Открыть источникclawhub.ai проанализирован 20 ч назад

Используйте, когда пользователь говорит «проверь, безопасен ли этот ИИ», «можно ли его взломать», «можно ли заставить ИИ делать опасные вещи, будет ли он…

Как процесс D 46/100 · Процесс не доведён — слабые места: результат и критерий готовности, когда включается, входы и предусловия

ПроцедураБезопасностьИИ и агентытип и темы размечены автоматически по тексту скилла
Запускается в: OpenClaw Hermes Agent
JSON
Технический рейтинг
B
80/100
безопасность, качество, тесты
Безопасность 60%
93
Качество 40%
61
Прогон на моделях
не было
Процессный рейтинг
D
46/100
Процесс не доведён
Результат и критерий готовности вес 14
0
Входы и предусловия вес 11
0
Ошибки и развилки вес 10
0
три самых слабых из десяти параметров · все десять

Как улучшить

  1. Скажите в description, КОГДА применять скилл («используй, когда…», примеры запросов): это главный сигнал для агента.
  2. Для Hermes description должен быть одним предложением до 60 символов; условия применения вынесите в раздел «When to Use».
Для прогона на моделях — необязательно
  • Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
  • spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.

Находки guard · 7

✓ Критических и высоких находок нет

Средние и низкие: 7
  • низкая Рискованное назначение intent-offensive-security README.md:5
    Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение) (определение детектора / чёрного списка)
    **EN** — Red-team before launch: bilingual (zh+en) scanner for jailbreak / dangerous-capability requests (ignore-instructions, DAN, privilege escalation, data exfil, self-modify), with risk tiers and 
    детектор
  • низкая Рискованное назначение intent-offensive-security skill-card.md:17
    Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)
    Developers and security reviewers use this skill to run local pre-release checks on agent prompts or prompt files for jailbreak, instruction override, data exfiltration, privilege escalation, and rela
  • низкая Рискованное назначение intent-offensive-security SKILL.md:4
    Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)
    display_name: AI红队对抗测试(Red Team Kit)
  • низкая Рискованное назначение intent-offensive-security SKILL.md:5
    Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)
    displayName: AI红队对抗测试(Red Team Kit)
  • низкая Рискованное назначение intent-offensive-security SKILL.md:6
    Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)
    title: AI红队对抗测试(Red Team Kit)
  • низкая Рискованное назначение intent-offensive-security SKILL.md:12
    Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение) (определение детектора / чёрного списка)
    description: 当用户说『测一下这个AI安不安全』『会不会被越狱』『让AI干危险的事它听不听』『上线前做对抗测试』,或要给一个 agent/提示词做安全性红队时使用。中英双库扫描越狱/危险能力请求(DAN/忽略指令/提权/数据外泄/自改进等),给出风险分级+加固建议,并设「危险操作闸门」(有门禁)。可运行脚本(redteam_scan 扫描器)。理论根基:LGD 三律之有门禁(危险动作先
    детектор
  • низкая Рискованное назначение intent-offensive-security SKILL.md:13
    Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)
    tags: [红队, red team, 越狱, jailbreak, 对抗测试, AI安全, 有门禁]

Просканировано файлов: 7. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.

По спецификации Agent Skills

  • предупреждение description-long-hermes description 251 символов, а стандарт Hermes требует ≤ 60 (одно предложение, с точкой)
  • предупреждение description-no-when ни description, ни раздел "## When to Use" не говорят, когда применять скилл
  • заметка frontmatter-key неизвестное поле фронтматтера "slug"
  • заметка frontmatter-key неизвестное поле фронтматтера "display_name"
  • заметка frontmatter-key неизвестное поле фронтматтера "displayName"
  • заметка frontmatter-key неизвестное поле фронтматтера "title"
  • заметка frontmatter-key неизвестное поле фронтматтера "display_name_en"
  • заметка frontmatter-key неизвестное поле фронтматтера "summary"
  • заметка frontmatter-key неизвестное поле фронтматтера "agent_created"
  • заметка frontmatter-key неизвестное поле фронтматтера "copyright"
  • заметка frontmatter-key неизвестное поле фронтматтера "read_when"
  • заметка frontmatter-key неизвестное поле фронтматтера "homepage"

Процессный рейтинг: все десять параметров 46/100

  • 0Результат и критерий готовности. Не сказано, что считать результатом
  • 0Входы и предусловия. Не сказано, что нужно иметь на входе
  • 0Ошибки и развилки. Линейный процесс без обработки сбоев
  • 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
  • 20Когда включается. Не сказано, при каком запросе скилл включается
  • 60Инструменты и файлы. Используются инструменты (python), но во frontmatter они не объявлены
  • 100Шаги. Шагов: 12
  • 100Согласованность. Имя и обязательные поля на месте
  • 100Стоимость исполнения. Тело инструкции 515 токенов
  • 100Повторный запуск. Изменяющих операций нет

Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.

Сигналы качества

  • +5В description нет примеров фраз, по которым скилл должен срабатывать
  • +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
  • +3Формат ответа не описан: модель каждый раз решает сама
  • -31 из 1 скриптов не упомянуты в SKILL.md
  • +2Инструкции на одном языке
  • +3Длина description 251 символов: достаточно сигнала, не съедает бюджет
  • +4Структура: 10 заголовков
  • +3Пошаговые инструкции: 12 пунктов
  • +4Есть примеры (1 блоков кода)
  • +1Лицензия указана

База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 61.

Внешние проверки

ClawHub: suspicious
This local red-team scanner is not malicious, but its documented blocking gate fails open and its install command uses an unpinned global installer.
LLM: suspicious (high) · 11 сент. 2026 г.