AF dataset-producer
Создавайте готовые к публикации наборы данных AI/ML в формате HuggingFace (шарды Parquet + README.md с YAML frontmatter + карточка датасета + скрипт происхождения). Используйте, когда пользователь хочет создать, собрать, подготовить, упаковать или опубликовать набор данных для обучения, дообучения, оценки или тестирования — включая instruction-tuning (SFT), чат/диалоги, предпочтения/DPO/RLHF, корпуса для предварительного обучения, тесты MCQ, наборы данных QA или любые структурированные данные, предназначенные для загрузки с помощью `datasets.load_dataset()` или отправки в HF. Активируйте по фразам вроде «сделай датасет из этих документов», «создай бенчмарк», «упакуй это для дообучения», «конвертируй этот JSONL в датасет HuggingFace», «создай датасет DPO/предпочтений/SFT», «я хочу опубликовать датасет». Обрабатывает дизайн схемы, валидацию, шардинг Parquet, статистику, генерацию карточки и происхождение — полный производственный конвейер. Предпочитайте это ручному написанию кода для датасетов, когда результатом является набор данных, который пользователь будет загружать, делиться или использовать для обучения.
машинный переводПоказать оригиналСкрыть оригинал«Produce complete, publish-ready AI/ML datasets in HuggingFace format (…»
Produce complete, publish-ready AI/ML datasets in HuggingFace format (parquet shards + README.md with YAML frontmatter + dataset card + provenance script). Use whenever the user wants to create, build, produce, assemble, package, or publish a dataset for training, fine-tuning, evaluation, or benchmarking — including instruction-tuning (SFT), chat/dialogue, preference/DPO/RLHF, pretraining corpora, MCQ benchmarks, QA datasets, or any structured data meant to be loaded by `datasets.load_dataset()` or pushed to HF. Trigger on phrases like "make a dataset from these documents", "build a benchmark", "package this for fine-tuning", "convert this JSONL to a HuggingFace dataset", "produce a DPO/preference/SFT dataset", "I want to publish a dataset". Handles schema design, validation, parquet sharding, statistics, card generation, and provenance — the full production pipeline. Prefer this over hand-rolling dataset code whenever the deliverable is a dataset the user will load, share, or train on.
Создавайте готовые к публикации наборы данных AI/ML в формате HuggingFace (шарды Parquet + README.md с YAML frontmatter + карточка датасета + скрипт…
Как процесс F 50/100 · Не запустится — Скилл ссылается на файлы, которых нет в архиве: assets/licenses/<spdx-id>.txt
Как улучшить
- Тело SKILL.md длиннее 5 000 токенов: вынесите справочные детали в references/ и подключайте по необходимости.
- В тексте есть ссылки на отсутствующие файлы: добавьте файлы или уберите ссылки.
- spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.
Находки guard · 0
✓ Критических и высоких находок нет
Просканировано файлов: 27. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.
По спецификации Agent Skills
- предупреждение
body-longтело SKILL.md ≈ 6415 токенов (рекомендуется < 5000); вынесите детали в references/ - предупреждение
missing-refссылка на отсутствующий файл: assets/licenses/<spdx-id>.txt
Процессный рейтинг: все десять параметров 50/100
- 0Инструменты и файлы. Не хватает 1 файла(ов): assets/licenses/<spdx-id>.txt
- 0Результат и критерий готовности. Не сказано, что считать результатом
- 0Входы и предусловия. Не сказано, что нужно иметь на входе
- 70Ошибки и развилки. Развилок: 6
- 70Стоимость исполнения. Тело инструкции 6415 токенов
- 85Шаги. Шагов: 105, расплывчатых формулировок: 1
- 100Когда включается. Сказано, когда применять и когда не применять
- 100Согласованность. Имя и обязательные поля на месте
- 100Повторный запуск. Изменяющие операции проверяют текущее состояние
- 100Отчётность по ходу. Скилл сообщает о ходе работы
- medium Правила безопасности и запреты внутри скилла: их место в системном промпте, здесь они не защищают
- low Ответ описан самодельной разметкой (13 тегов): типизированный вызов надёжнее
Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.
Сигналы качества
- +3Длина description 1001: рекомендуется 120–800 символов
- +3Формат ответа не описан: модель каждый раз решает сама
- -4Абсолютные локальные пути (C:\Users, /home/…): скилл не переносим
- +2Инструкции на одном языке
- +5В description 6 примера фраз-триггеров в кавычках
- +4Описание говорит, когда скилл НЕ применять
- +4Структура: 20 заголовков
- +3Пошаговые инструкции: 105 пунктов
- +4Есть примеры (8 блоков кода)
- +4Справочные файлы упоминаются в инструкциях (7 из 8)
- +3Все 5 скриптов описаны в инструкциях
- +1Лицензия указана
База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 78.