BB RAG
Проектирует, настраивает и отлаживает конвейеры генерации с дополненным поиском (RAG): чанкинг, эмбеддинги, гибридный поиск, реранжирование и обоснованные ответы. Используйте, когда система возвращает неправильные фрагменты, пропускает проиндексированный документ, не ссылается ни на что или галлюцинирует поверх хорошего контекста; при выборе векторного хранилища, модели эмбеддингов, размера чанка или реранкера; когда оценки сходства обрушиваются после смены модели; когда фильтр метаданных опустошает набор результатов; когда ответы игнорируют факты из середины контекста; когда последующие вопросы извлекают неправильные данные; при индексации PDF, сканированных страниц, таблиц, кода или транскриптов; когда проблема заключается в удалении данных по GDPR, изоляции арендаторов или внедрении подсказок из проиндексированных документов; или когда необходимо снизить стоимость за запрос или p95 задержку. Охватывает миграции переиндексации, свежесть корпуса, наборы оценки и агентский и графовый поиск. Не для внутренних компонентов сплиттера (`rag-chunking`), систем оценки (`rag-evaluation`) или API LangChain (`langchain`).
машинный переводПоказать оригиналСкрыть оригинал«Designs, tunes, and debugs retrieval-augmented generation (RAG) pipeli…»
Designs, tunes, and debugs retrieval-augmented generation (RAG) pipelines: chunking, embeddings, hybrid retrieval, reranking, and grounded answers. Use when a system returns the wrong passages, misses a document that is indexed, cites nothing, or hallucinates over good context; when choosing a vector store, an embedding model, a chunk size, or a reranker; when similarity scores collapse after a model swap; when a metadata filter empties the result set; when answers ignore mid-context facts; when follow-up questions retrieve the wrong thing; when indexing PDFs, scanned pages, tables, code, or transcripts; when GDPR erasure, tenant isolation, or prompt injection from indexed documents is the problem; or when per-query cost or p95 latency has to come down. Covers reindex migrations, corpus freshness, evaluation sets, and agentic and graph retrieval. Not for splitter internals (`rag-chunking`), scoring rubrics (`rag-evaluation`), or LangChain APIs (`langchain`).
Проектирует, настраивает и отлаживает конвейеры генерации с дополненным поиском (RAG): чанкинг, эмбеддинги, гибридный поиск, реранжирование и обоснованные…
Как процесс B 72/100 · Почти готов — слабые места: входы и предусловия, повторный запуск
Как улучшить
- Тело SKILL.md длиннее 5 000 токенов: вынесите справочные детали в references/ и подключайте по необходимости.
- Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
- spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.
Находки guard · 1
✓ Критических и высоких находок нет
Средние и низкие: 1
-
низкая Рискованное назначение
intent-offensive-securitysecurity.md:125Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение)| Permission filter derived from anything the user can type | Privilege escalation by prompt | Move derivation server-side, from the session, today |
Просканировано файлов: 20. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.
По спецификации Agent Skills
- предупреждение
name-formatname должен быть в kebab-case (строчные буквы, цифры, дефисы) - предупреждение
body-longтело SKILL.md ≈ 7390 токенов (рекомендуется < 5000); вынесите детали в references/ - заметка
frontmatter-keyнеизвестное поле фронтматтера "slug" - заметка
frontmatter-keyнеизвестное поле фронтматтера "homepage" - заметка
frontmatter-keyнеизвестное поле фронтматтера "changelog"
Процессный рейтинг: все десять параметров 72/100
- 0Входы и предусловия. Не сказано, что нужно иметь на входе
- 30Повторный запуск. Изменяющих операций: 17, без проверки текущего состояния
- 60Инструменты и файлы. Используются инструменты (web), но во frontmatter они не объявлены
- 60Результат и критерий готовности. Формат результата описан, критерия завершения нет
- 70Стоимость исполнения. Тело инструкции 7390 токенов
- 100Шаги. Шагов: 43
- 100Когда включается. Сказано, когда применять и когда не применять
- 100Ошибки и развилки. Развилок: 2, есть раздел про ошибки
- 100Согласованность. Имя и обязательные поля на месте
- 100Отчётность по ходу. Скилл сообщает о ходе работы
- medium Правила безопасности и запреты внутри скилла: их место в системном промпте, здесь они не защищают
- low Разделов верхнего уровня: 13. Похоже на несколько доменов в одном скилле
- low Скилл сам сортирует и ранжирует выдачу: это работа системы на той стороне, а не модели
Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.
Сигналы качества
- +5В description нет примеров фраз, по которым скилл должен срабатывать
- +3Длина description 972: рекомендуется 120–800 символов
- +4Нет примеров входа/выхода
- +1Лицензия не указана
- +2Инструкции на одном языке
- +4Описание говорит, когда скилл НЕ применять
- +4Структура: 13 заголовков
- +3Пошаговые инструкции: 43 пунктов
- +3Формат ответа описан явно
База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 66.