BC ai-system-testing
Тестируйте функции AI/LLM, поставляемые в вашем продукте. Включает регрессионное тестирование промптов, оценку качества ответов, проверку вызовов инструментов, проверку галлюцинаций и обоснованности RAG, стратегии недетерминированного вывода, сканирование на уязвимости/безопасность, фреймворки оценки и внедрение агента как цели (косвенное внедрение через вывод инструмента / RAG / отчеты сканирования, самораспространяющиеся полезные нагрузки, извлечение данных через агента) плюс встроенный детектор недоверенного контента. Используйте, когда: «протестируйте нашу LLM-функцию», «регрессионный тест промпта», «фреймворк оценки», «тест на галлюцинации», «обоснованность RAG», «недетерминированный вывод», «тестирование AI-функций», «red-team нашего чат-бота», «косвенное внедрение промпта», «агент читает недоверенный вывод инструмента», «качество продакшн AI». Не используйте для: генерации кода тестов с помощью ИИ — используйте ai-test-generation. Не используйте для: классификации сбоев CI с помощью ИИ — используйте ai-bug-triage. Не используйте для: соответствия EU AI Act / GDPR AI-функции — используйте compliance-testing. Не используйте для: поэтапного развертывания AI-функции — используйте testing-in-production. Связанные: ai-test-generation, ai-qa-review, api-testing, compliance-testing, security-testing, risk-based-testing, test-data-management.
машинный переводПоказать оригиналСкрыть оригинал«Test AI/LLM features that ship in your product. Covers prompt regressi…»
Test AI/LLM features that ship in your product. Covers prompt regression testing, response quality evaluation, tool-call validation, hallucination and RAG grounding checks, nondeterministic-output strategies, red-team/safety scans, eval frameworks, and agent-as-target injection (indirect injection via tool output / RAG / scan reports, self-propagating payloads, data exfiltration via an agent) plus a bundled detector for untrusted content. Use when: "test our LLM feature," "prompt regression test," "eval framework," "hallucination test," "RAG grounding," "nondeterministic output," "AI feature testing," "red-team our chatbot," "indirect prompt injection," "agent reading untrusted tool output," "production AI quality." Not for: using AI to generate your own test code — use ai-test-generation. Not for: classifying CI failures with AI — use ai-bug-triage. Not for: EU AI Act / GDPR conformity of an AI feature — use compliance-testing. Not for: canary/flag rollout of an AI feature — use testing-in-production. Related: ai-test-generation, ai-qa-review, api-testing, compliance-testing, security-testing, risk-based-testing, test-data-management.
Тестируйте функции AI/LLM, поставляемые в вашем продукте.
Как процесс C 64/100 · Есть пробелы — слабые места: входы и предусловия, повторный запуск, отчётность по ходу
Как улучшить
- Сократите description до 1024 символов.
- Тело SKILL.md длиннее 5 000 токенов: вынесите справочные детали в references/ и подключайте по необходимости.
- Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
- spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.
Находки guard · 7
✓ Критических и высоких находок нет
Средние и низкие: 7
-
низкая Подмена инструкций
en-ignore-previousreferences/injection-detector.md:13Фраза-перехват ("ignore previous instructions") (строка таблицы в документации; документация security-скилла)| `instruction-override` | high | "Ignore all previous instructions / disregard the system prompt / forget everything" — hijack the agent away from its task. |
таблицаsecurity-скилл -
низкая Рискованное назначение
intent-offensive-securitySKILL.md:99Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)| **PyRIT** | Microsoft AI Red Team's orchestration framework | Orchestrated multi-turn attacks; complements Garak. https://github.com/Azure/PyRIT |
Ещё 5 совпадений отнесены к цитатам в документации скилла по безопасности и не считаются находками.
Просканировано файлов: 7. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.
По спецификации Agent Skills
- ошибка
description-longdescription 1153 символов, лимит 1024 - предупреждение
body-longтело SKILL.md ≈ 7805 токенов (рекомендуется < 5000); вынесите детали в references/
Процессный рейтинг: все десять параметров 64/100
- 0Входы и предусловия. Не сказано, что нужно иметь на входе
- 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
- 30Повторный запуск. Изменяющих операций: 7, без проверки текущего состояния
- 50Когда включается. Не сказано, при каком запросе скилл включается
- 50Ошибки и развилки. Развилок: 0, есть раздел про ошибки
- 60Инструменты и файлы. Используются инструменты (bash, web, python), но во frontmatter они не объявлены
- 70Стоимость исполнения. Тело инструкции 7805 токенов
- 100Шаги. Шагов: 68
- 100Результат и критерий готовности. Формат результата и критерий готовности описаны
- 100Согласованность. Имя и обязательные поля на месте
- medium Правила безопасности и запреты внутри скилла: их место в системном промпте, здесь они не защищают
- low Разделов верхнего уровня: 16. Похоже на несколько доменов в одном скилле
Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.
Сигналы качества
- +3Длина description 1153: рекомендуется 120–800 символов
- +2Инструкции на одном языке
- +5В description 11 примера фраз-триггеров в кавычках
- +4Описание говорит, когда скилл НЕ применять
- +4Структура: 46 заголовков
- +3Пошаговые инструкции: 68 пунктов
- +3Формат ответа описан явно
- +4Есть примеры (4 блоков кода)
- +4Справочные файлы упоминаются в инструкциях (5 из 5)
- +3Все 1 скриптов описаны в инструкциях
- +1Лицензия указана
База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 66.