SKILLEMALL.ai

BC ai-system-testing

Тестируйте функции AI/LLM, поставляемые в вашем продукте. Включает регрессионное тестирование промптов, оценку качества ответов, проверку вызовов инструментов, проверку галлюцинаций и обоснованности RAG, стратегии недетерминированного вывода, сканирование на уязвимости/безопасность, фреймворки оценки и внедрение агента как цели (косвенное внедрение через вывод инструмента / RAG / отчеты сканирования, самораспространяющиеся полезные нагрузки, извлечение данных через агента) плюс встроенный детектор недоверенного контента. Используйте, когда: «протестируйте нашу LLM-функцию», «регрессионный тест промпта», «фреймворк оценки», «тест на галлюцинации», «обоснованность RAG», «недетерминированный вывод», «тестирование AI-функций», «red-team нашего чат-бота», «косвенное внедрение промпта», «агент читает недоверенный вывод инструмента», «качество продакшн AI». Не используйте для: генерации кода тестов с помощью ИИ — используйте ai-test-generation. Не используйте для: классификации сбоев CI с помощью ИИ — используйте ai-bug-triage. Не используйте для: соответствия EU AI Act / GDPR AI-функции — используйте compliance-testing. Не используйте для: поэтапного развертывания AI-функции — используйте testing-in-production. Связанные: ai-test-generation, ai-qa-review, api-testing, compliance-testing, security-testing, risk-based-testing, test-data-management.

машинный переводПоказать оригиналСкрыть оригинал«Test AI/LLM features that ship in your product. Covers prompt regressi…»

Test AI/LLM features that ship in your product. Covers prompt regression testing, response quality evaluation, tool-call validation, hallucination and RAG grounding checks, nondeterministic-output strategies, red-team/safety scans, eval frameworks, and agent-as-target injection (indirect injection via tool output / RAG / scan reports, self-propagating payloads, data exfiltration via an agent) plus a bundled detector for untrusted content. Use when: "test our LLM feature," "prompt regression test," "eval framework," "hallucination test," "RAG grounding," "nondeterministic output," "AI feature testing," "red-team our chatbot," "indirect prompt injection," "agent reading untrusted tool output," "production AI quality." Not for: using AI to generate your own test code — use ai-test-generation. Not for: classifying CI failures with AI — use ai-bug-triage. Not for: EU AI Act / GDPR conformity of an AI feature — use compliance-testing. Not for: canary/flag rollout of an AI feature — use testing-in-production. Related: ai-test-generation, ai-qa-review, api-testing, compliance-testing, security-testing, risk-based-testing, test-data-management.

petrkindlmann/qa-skills Agent Skills автор: petrkindlmann MIT 7 файлов тело ≈ 7 805 токенов Открыть источникgithub.com проанализирован 2 дн назад

Тестируйте функции AI/LLM, поставляемые в вашем продукте.

Как процесс C 64/100 · Есть пробелы — слабые места: входы и предусловия, повторный запуск, отчётность по ходу

ИнтеграцияGitHubИИ и агентытип и темы размечены автоматически по тексту скилла
JSON
Технический рейтинг
B
82/100
безопасность, качество, тесты
Безопасность 60%
93
Качество 40%
66
Прогон на моделях
не было
Процессный рейтинг
C
64/100
Есть пробелы
Входы и предусловия вес 11
0
Отчётность по ходу вес 2
0
Повторный запуск вес 4
30
три самых слабых из десяти параметров · все десять

Как улучшить

  1. Сократите description до 1024 символов.
  2. Тело SKILL.md длиннее 5 000 токенов: вынесите справочные детали в references/ и подключайте по необходимости.
Для прогона на моделях — необязательно
  • Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
  • spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.

Находки guard · 7

✓ Критических и высоких находок нет

Средние и низкие: 7
  • низкая Подмена инструкций en-ignore-previous references/injection-detector.md:13
    Фраза-перехват ("ignore previous instructions") (строка таблицы в документации; документация security-скилла)
    | `instruction-override` | high | "Ignore all previous instructions / disregard the system prompt / forget everything" — hijack the agent away from its task. |
    таблицаsecurity-скилл
  • низкая Рискованное назначение intent-offensive-security SKILL.md:99
    Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)
    | **PyRIT** | Microsoft AI Red Team's orchestration framework | Orchestrated multi-turn attacks; complements Garak. https://github.com/Azure/PyRIT |

Ещё 5 совпадений отнесены к цитатам в документации скилла по безопасности и не считаются находками.

Просканировано файлов: 7. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.

По спецификации Agent Skills

  • ошибка description-long description 1153 символов, лимит 1024
  • предупреждение body-long тело SKILL.md ≈ 7805 токенов (рекомендуется < 5000); вынесите детали в references/

Процессный рейтинг: все десять параметров 64/100

  • 0Входы и предусловия. Не сказано, что нужно иметь на входе
  • 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
  • 30Повторный запуск. Изменяющих операций: 7, без проверки текущего состояния
  • 50Когда включается. Не сказано, при каком запросе скилл включается
  • 50Ошибки и развилки. Развилок: 0, есть раздел про ошибки
  • 60Инструменты и файлы. Используются инструменты (bash, web, python), но во frontmatter они не объявлены
  • 70Стоимость исполнения. Тело инструкции 7805 токенов
  • 100Шаги. Шагов: 68
  • 100Результат и критерий готовности. Формат результата и критерий готовности описаны
  • 100Согласованность. Имя и обязательные поля на месте
  • medium Правила безопасности и запреты внутри скилла: их место в системном промпте, здесь они не защищают
  • low Разделов верхнего уровня: 16. Похоже на несколько доменов в одном скилле

Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.

Сигналы качества

  • +3Длина description 1153: рекомендуется 120–800 символов
  • +2Инструкции на одном языке
  • +5В description 11 примера фраз-триггеров в кавычках
  • +4Описание говорит, когда скилл НЕ применять
  • +4Структура: 46 заголовков
  • +3Пошаговые инструкции: 68 пунктов
  • +3Формат ответа описан явно
  • +4Есть примеры (4 блоков кода)
  • +4Справочные файлы упоминаются в инструкциях (5 из 5)
  • +3Все 1 скриптов описаны в инструкциях
  • +1Лицензия указана

База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 66.