SKILLEMALL.ai

BB mineru-precision-extract

MinerU precision extract — высокоточная экстракция документов с полным набором функций. Конвертирует PDF, сканированные документы, изображения, Word (DOC/DOCX), PowerPoint (PPT/PPTX) и HTML файлы в Markdown, HTML, LaTeX, DOCX или JSON с распознаванием таблиц, формул (LaTeX) и продвинутым OCR. Выбирайте между моделью vlm для максимальной точности на сложных макетах, академических статьях и сложных таблицах, или моделью pipeline для надежной экстракции без галлюцинаций. Поддерживает пакетную обработку сотен файлов, сканирование веб-страниц в Markdown и многоформатный вывод в одной команде. Используйте этот навык, когда вам нужно: извлечь таблицы из PDF, распознать формулы в академических статьях, конвертировать PDF в HTML или LaTeX, пакетно обрабатывать файлы документов, выполнять OCR сканированных документов с высокой точностью, конвертировать документы в формат DOCX, сканировать веб-страницы в структурированный Markdown или обрабатывать документы со сложными макетами. Поддерживает более 80 языков в латинской, арабской, кириллической, деванагари, CJK и других семействах скриптов. Обрабатывает большие файлы без ограничений по размеру или количеству страниц, в отличие от режимов быстрой экстракции. Создан для исследователей, инженеров данных, академических учреждений и производственных конвейеров документов, требующих точности и надежности. Работает как навык Claude Code, инструмент MCP или автономный CLI. Высокоточная экстракция PDF, распознавание таблиц, распознавание формул, конвертация PDF в HTML, PDF в LaTeX, PDF в DOCX, пакетная обработка PDF, OCR сканированных документов, анализ академических статей, конвертация многоформатных документов. Поддерживает высокоточную модель VLM и модель Pipeline без галлюцинаций, поддержку более 80 языков, подходит для академических исследований, инженерии данных и обработки документов в производственной среде.

машинный переводПоказать оригиналСкрыть оригинал«MinerU precision extract — high-accuracy document extraction with full…»

MinerU precision extract — high-accuracy document extraction with full feature set. Convert PDFs, scanned documents, images, Word (DOC/DOCX), PowerPoint (PPT/PPTX), and HTML files into Markdown, HTML, LaTeX, DOCX, or JSON with table recognition, formula recognition (LaTeX), and advanced OCR. Choose between vlm model for highest accuracy on complex layouts, academic papers, and intricate tables, or pipeline model for zero-hallucination reliable extraction. Supports batch processing of hundreds of files, web page crawling to Markdown, and multi-format output in a single command. Use this skill when you need to: extract tables from PDFs, recognize formulas in academic papers, convert PDF to HTML or LaTeX, batch process document files, OCR scanned documents with high precision, convert documents to DOCX format, crawl web pages to structured Markdown, or process documents with complex layouts. Supports 80+ languages across Latin, Arabic, Cyrillic, Devanagari, CJK, and more script families. Handles large files with no size or page limits, unlike quick extraction modes. Built for researchers, data engineers, academic institutions, and production document pipelines that demand accuracy and reliability. Works as a Claude Code skill, MCP tool, or standalone CLI. 高精度PDF提取、表格识别、公式识别、PDF转HTML、PDF转LaTeX、PDF转DOCX、批量PDF处理、扫描件OCR、学术论文解析、多格式文档转换。支持VLM高精度模型和零幻觉Pipeline模型,80+语言支持,适用于学术研究、数据工程和生产环境文档处理。

ClawHub Agent Skills автор: MinerU-Extract v0.2.1 MIT-0 2 файла тело ≈ 2 940 токенов Открыть источникclawhub.ai проанализирован 2 дн назад

MinerU precision extract — высокоточная экстракция документов с полным набором функций.

Как процесс B 69/100 · Почти готов — слабые места: когда включается, входы и предусловия, повторный запуск

ИнтеграцияWordLaTeXPowerPointGitHubИнфраструктураИсследованияИИ и агентытип и темы размечены автоматически по тексту скилла
JSON
Технический рейтинг
B
83/100
безопасность, качество, тесты
Безопасность 60%
100
Качество 40%
58
Прогон на моделях
не было
Процессный рейтинг
B
69/100
Почти готов
Входы и предусловия вес 11
0
Отчётность по ходу вес 2
0
Когда включается вес 12
20
три самых слабых из десяти параметров · все десять

Как улучшить

  1. Сократите description до 1024 символов.
Для прогона на моделях — необязательно
  • Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
  • spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.

Находки guard · 0

✓ Критических и высоких находок нет

Просканировано файлов: 2. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.

По спецификации Agent Skills

  • ошибка description-long description 1406 символов, лимит 1024
  • заметка frontmatter-key неизвестное поле фронтматтера "read_when"

Процессный рейтинг: все десять параметров 69/100

  • 0Входы и предусловия. Не сказано, что нужно иметь на входе
  • 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
  • 20Когда включается. Не сказано, при каком запросе скилл включается
  • 30Повторный запуск. Изменяющих операций: 6, без проверки текущего состояния
  • 60Результат и критерий готовности. Формат результата описан, критерия завершения нет
  • 100Инструменты и файлы. Инструменты объявлены во frontmatter
  • 100Шаги. Шагов: 32
  • 100Ошибки и развилки. Развилок: 2, есть раздел про ошибки
  • 100Согласованность. Имя и обязательные поля на месте
  • 100Стоимость исполнения. Тело инструкции 2940 токенов
  • low Разделов верхнего уровня: 13. Похоже на несколько доменов в одном скилле

Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.

Сигналы качества

  • +5В description нет примеров фраз, по которым скилл должен срабатывать
  • +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
  • +3Длина description 1405: рекомендуется 120–800 символов
  • +1Лицензия не указана
  • +2Инструкции на одном языке
  • +4Структура: 26 заголовков
  • +3Пошаговые инструкции: 32 пунктов
  • +3Формат ответа описан явно
  • +4Есть примеры (12 блоков кода)

База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 58.

Внешние проверки

ClawHub: clean
This skill is a coherent MinerU document-extraction helper, with normal cautions around API tokens, remote processing, and URL crawling.
LLM: benign (high) · VirusTotal: · 29 мая 2026 г.