SKILLEMALL.ai

AF dataset-producer

Создавайте готовые к публикации наборы данных AI/ML в формате HuggingFace (шарды Parquet + README.md с YAML frontmatter + карточка датасета + скрипт происхождения). Используйте, когда пользователь хочет создать, собрать, подготовить, упаковать или опубликовать набор данных для обучения, дообучения, оценки или тестирования — включая instruction-tuning (SFT), чат/диалоги, предпочтения/DPO/RLHF, корпуса для предварительного обучения, тесты MCQ, наборы данных QA или любые структурированные данные, предназначенные для загрузки с помощью `datasets.load_dataset()` или отправки в HF. Активируйте по фразам вроде «сделай датасет из этих документов», «создай бенчмарк», «упакуй это для дообучения», «конвертируй этот JSONL в датасет HuggingFace», «создай датасет DPO/предпочтений/SFT», «я хочу опубликовать датасет». Обрабатывает дизайн схемы, валидацию, шардинг Parquet, статистику, генерацию карточки и происхождение — полный производственный конвейер. Предпочитайте это ручному написанию кода для датасетов, когда результатом является набор данных, который пользователь будет загружать, делиться или использовать для обучения.

машинный переводПоказать оригиналСкрыть оригинал«Produce complete, publish-ready AI/ML datasets in HuggingFace format (…»

Produce complete, publish-ready AI/ML datasets in HuggingFace format (parquet shards + README.md with YAML frontmatter + dataset card + provenance script). Use whenever the user wants to create, build, produce, assemble, package, or publish a dataset for training, fine-tuning, evaluation, or benchmarking — including instruction-tuning (SFT), chat/dialogue, preference/DPO/RLHF, pretraining corpora, MCQ benchmarks, QA datasets, or any structured data meant to be loaded by `datasets.load_dataset()` or pushed to HF. Trigger on phrases like "make a dataset from these documents", "build a benchmark", "package this for fine-tuning", "convert this JSONL to a HuggingFace dataset", "produce a DPO/preference/SFT dataset", "I want to publish a dataset". Handles schema design, validation, parquet sharding, statistics, card generation, and provenance — the full production pipeline. Prefer this over hand-rolling dataset code whenever the deliverable is a dataset the user will load, share, or train on.

ClawHub Agent Skills автор: DarkD v1.0.0 MIT-0 28 файлов тело ≈ 6 415 токенов Открыть источникclawhub.ai проанализирован 6 ч назад

Создавайте готовые к публикации наборы данных AI/ML в формате HuggingFace (шарды Parquet + README.md с YAML frontmatter + карточка датасета + скрипт…

Как процесс F 50/100 · Не запустится — Скилл ссылается на файлы, которых нет в архиве: assets/licenses/<spdx-id>.txt

ГенераторДанные и аналитикатип и темы размечены автоматически по тексту скилла
JSON
Технический рейтинг
A
91/100
безопасность, качество, тесты
Безопасность 60%
100
Качество 40%
78
Прогон на моделях
не было
Процессный рейтинг
F
50/100
Не запустится
Скилл ссылается на файлы, которых нет в архиве: assets/licenses/<spdx-id>.txt
Инструменты и файлы вес 18
0
Результат и критерий готовности вес 14
0
Входы и предусловия вес 11
0
три самых слабых из десяти параметров · все десять

Как улучшить

  1. Тело SKILL.md длиннее 5 000 токенов: вынесите справочные детали в references/ и подключайте по необходимости.
  2. В тексте есть ссылки на отсутствующие файлы: добавьте файлы или уберите ссылки.
Для прогона на моделях — необязательно
  • spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.

Находки guard · 0

✓ Критических и высоких находок нет

Просканировано файлов: 27. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.

По спецификации Agent Skills

  • предупреждение body-long тело SKILL.md ≈ 6415 токенов (рекомендуется < 5000); вынесите детали в references/
  • предупреждение missing-ref ссылка на отсутствующий файл: assets/licenses/<spdx-id>.txt

Процессный рейтинг: все десять параметров 50/100

Не запустится. Скилл ссылается на файлы, которых нет в архиве: assets/licenses/<spdx-id>.txt
  • 0Инструменты и файлы. Не хватает 1 файла(ов): assets/licenses/<spdx-id>.txt
  • 0Результат и критерий готовности. Не сказано, что считать результатом
  • 0Входы и предусловия. Не сказано, что нужно иметь на входе
  • 70Ошибки и развилки. Развилок: 6
  • 70Стоимость исполнения. Тело инструкции 6415 токенов
  • 85Шаги. Шагов: 105, расплывчатых формулировок: 1
  • 100Когда включается. Сказано, когда применять и когда не применять
  • 100Согласованность. Имя и обязательные поля на месте
  • 100Повторный запуск. Изменяющие операции проверяют текущее состояние
  • 100Отчётность по ходу. Скилл сообщает о ходе работы
  • medium Правила безопасности и запреты внутри скилла: их место в системном промпте, здесь они не защищают
  • low Ответ описан самодельной разметкой (13 тегов): типизированный вызов надёжнее

Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.

Сигналы качества

  • +3Длина description 1001: рекомендуется 120–800 символов
  • +3Формат ответа не описан: модель каждый раз решает сама
  • -4Абсолютные локальные пути (C:\Users, /home/…): скилл не переносим
  • +2Инструкции на одном языке
  • +5В description 6 примера фраз-триггеров в кавычках
  • +4Описание говорит, когда скилл НЕ применять
  • +4Структура: 20 заголовков
  • +3Пошаговые инструкции: 105 пунктов
  • +4Есть примеры (8 блоков кода)
  • +4Справочные файлы упоминаются в инструкциях (7 из 8)
  • +3Все 5 скриптов описаны в инструкциях
  • +1Лицензия указана

База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 78.

Внешние проверки

ClawHub: suspicious
This is a coherent dataset-packaging skill, but it needs review because its scripts can expose sensitive data in logs and can leave old dataset shards in publishable output folders.
LLM: suspicious (high) · 15 сент. 2026 г.