BB mineru-ai
MinerU AI документ парсер — интеллектуальное извлечение документов на базе ИИ. Парсите PDF, сканированные документы, изображения, файлы Word, слайды PowerPoint и веб-страницы в чистый Markdown, HTML, LaTeX или DOCX с использованием передовых моделей ИИ. Два режима извлечения: flash-extract для мгновенного парсинга без настройки (без входа, без токена, без конфигурации — просто запустите и получите результаты) и precision extract с распознаванием таблиц на базе ИИ, распознаванием математических формул (вывод LaTeX), OCR для сканированных PDF и изображений, VLM (Vision Language Model) для сложных макетов и пакетной обработки. Используйте этот навык, когда вам нужно: парсить PDF с помощью ИИ, интеллектуально извлекать текст из документов, конвертировать PDF в Markdown с помощью ИИ, выполнять OCR сканированного документа, распознавать таблицы в PDF, извлекать формулы LaTeX из научных статей, пакетно конвертировать документы, сканировать веб-страницы в Markdown, читать и парсить любой формат документа или получать понимание документов с помощью ИИ. Движок MinerU AI обрабатывает сложные макеты документов, смешанный язык, вложенные таблицы, математические формулы, рисунки и многоколоночные страницы, с которыми не справляются традиционные парсеры. Выбирайте модель vlm для максимальной точности или модель pipeline для надежности без галлюцинаций. Поддерживает более 80 языков, включая китайский, английский, японский, корейский, арабский, хинди, французский, немецкий, испанский, русский и все основные семейства письменностей. Работает с локальными файлами и URL. Создан для ИИ-разработчиков, исследователей, специалистов по данным и всех, кому нужен интеллектуальный парсинг документов. Работает как навык Claude Code, инструмент MCP или автономный CLI. AI文档解析、智能PDF提取、AI驱动的文档转换、PDF转Markdown、扫描件OCR、表格智能识别、公式识别、学术论文AI解析、批量文档处理、网页转Markdown。MinerU AI引擎,支持复杂排版、多语言、嵌套表格、数学公式,传统解析器无法处理的文档都能轻松搞定.
машинный переводПоказать оригиналСкрыть оригинал«MinerU AI document parser — intelligent document extraction powered by…»
MinerU AI document parser — intelligent document extraction powered by AI. Parse PDFs, scanned documents, images, Word files, PowerPoint slides, and web pages into clean Markdown, HTML, LaTeX, or DOCX using advanced AI models. Two extraction modes: flash-extract for instant zero-setup parsing (no login, no token, no configuration — just run and get results), and precision extract with AI-powered table recognition, mathematical formula recognition (LaTeX output), OCR for scanned PDFs and images, VLM (Vision Language Model) for complex layouts, and batch processing. Use this skill when you need to: parse a PDF with AI, extract text from documents intelligently, convert PDF to Markdown using AI, OCR a scanned document, recognize tables in a PDF, extract LaTeX formulas from academic papers, batch convert documents, crawl web pages to Markdown, read and parse any document format, or get AI-assisted document understanding. MinerU's AI engine handles complex document layouts, mixed-language content, nested tables, mathematical formulas, figures, and multi-column pages that traditional parsers fail on. Choose vlm model for highest accuracy or pipeline model for zero-hallucination reliability. Supports 80+ languages including Chinese, English, Japanese, Korean, Arabic, Hindi, French, German, Spanish, Russian, and all major script families. Works with local files and URLs. Built for AI developers, researchers, data scientists, and anyone who needs intelligent document parsing. Works as a Claude Code skill, MCP tool, or standalone CLI. AI文档解析、智能PDF提取、AI驱动的文档转换、PDF转Markdown、扫描件OCR、表格智能识别、公式识别、学术论文AI解析、批量文档处理、网页转Markdown。MinerU AI引擎,支持复杂排版、多语言、嵌套表格、数学公式,传统解析器无法处理的文档都能轻松搞定。
MinerU AI документ парсер — интеллектуальное извлечение документов на базе ИИ.
Как процесс B 69/100 · Почти готов — слабые места: когда включается, входы и предусловия, повторный запуск
Как улучшить
- Сократите description до 1024 символов.
- Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
- spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.
Находки guard · 0
✓ Критических и высоких находок нет
Просканировано файлов: 2. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.
По спецификации Agent Skills
- ошибка
description-longdescription 1689 символов, лимит 1024 - заметка
description-budgetdescription занимает 1689 из общего бюджета ~15000 символов на все скиллы - заметка
frontmatter-keyнеизвестное поле фронтматтера "read_when"
Процессный рейтинг: все десять параметров 69/100
- 0Входы и предусловия. Не сказано, что нужно иметь на входе
- 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
- 20Когда включается. Не сказано, при каком запросе скилл включается
- 30Повторный запуск. Изменяющих операций: 6, без проверки текущего состояния
- 60Результат и критерий готовности. Формат результата описан, критерия завершения нет
- 100Инструменты и файлы. Инструменты объявлены во frontmatter
- 100Шаги. Шагов: 44
- 100Ошибки и развилки. Развилок: 5, есть раздел про ошибки
- 100Согласованность. Имя и обязательные поля на месте
- 100Стоимость исполнения. Тело инструкции 3566 токенов
- medium Правила безопасности и запреты внутри скилла: их место в системном промпте, здесь они не защищают
- low Разделов верхнего уровня: 11. Похоже на несколько доменов в одном скилле
- low Ответ описан самодельной разметкой (4 тегов): типизированный вызов надёжнее
Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.
Сигналы качества
- +5В description нет примеров фраз, по которым скилл должен срабатывать
- +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
- +3Длина description 1688: рекомендуется 120–800 символов
- +1Лицензия не указана
- +2Инструкции на одном языке
- +4Структура: 28 заголовков
- +3Пошаговые инструкции: 44 пунктов
- +3Формат ответа описан явно
- +4Есть примеры (11 блоков кода)
База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 55.