SKILLEMALL.ai

BB pdf-miner

Извлекает текст и таблицы из PDF-файлов с надежной поддержкой форматов данных мирового рынка (валюты, проценты, единицы измерения). Используйте, когда: (1) Пользователь просит прочитать/извлечь контент из PDF-файла, (2) Пользователю нужен текст или таблицы из отраслевых отчетов, научных статей или финансовых документов, (3) web_fetch или scrapling не удались для PDF. Поддерживает: поиск по ключевым словам, извлечение метрик, определение оглавления, сравнение PDF, разбиение на части с помощью LLM, пакетную обработку, очистку верхних и нижних колонтитулов. НЕ для: OCR на сканированных PDF на основе изображений, редактирования/объединения PDF или создания новых PDF.

машинный переводПоказать оригиналСкрыть оригинал«Extract text and tables from PDF files with robust support for global…»

Extract text and tables from PDF files with robust support for global market data formats (currencies, percentages, units). Use when: (1) User asks to read/extract content from a PDF file, (2) User needs text or tables from industry reports, research papers, or financial documents, (3) web_fetch or scrapling fail on a PDF. Supports: keyword search, metrics extraction, table of contents detection, PDF diff/comparison, LLM chunk splitting, batch processing, header/footer cleaning. NOT for: OCR on scanned image-based PDFs, editing/merging PDFs, or creating new PDFs.

ClawHub Agent Skills автор: baichen v1.0.2 MIT-0 5 файлов тело ≈ 2 367 токенов Открыть источникclawhub.ai проанализирован 3 дн назад

Извлекает текст и таблицы из PDF-файлов с надежной поддержкой форматов данных мирового рынка (валюты, проценты, единицы измерения).

Как процесс B 75/100 · Почти готов — слабые места: повторный запуск, отчётность по ходу

АнализаторPDFДанные и аналитикаИИ и агентыИнфраструктуратип и темы размечены автоматически по тексту скилла
JSON
Технический рейтинг
B
88/100
безопасность, качество, тесты
Безопасность 60%
90
Качество 40%
86
Прогон на моделях
не было
Процессный рейтинг
B
75/100
Почти готов
Отчётность по ходу вес 2
0
Повторный запуск вес 4
30
Когда включается вес 12
50
три самых слабых из десяти параметров · все десять

Чем это грозит

Находки средней серьёзности: скорее всего скилл честный, но прочитайте, что именно насторожило сканер.

Утечка данных средняя серьёзность

Ниже описан худший случай для этой категории. Здесь находка средней серьёзности: guard увидел признак, но не доказательство.

Если установить

Инструкции или скрипты отправляют данные наружу: переменные окружения, ключи, содержимое файлов, историю чата. Вы можете не заметить этого в диалоге, потому что агент выполнит отправку как «часть задачи».

Автору

Если отправка не нужна для задачи, уберите её: каталоги помечают такие скиллы как подозрительные и снимают с выдачи. Если нужна, назовите адрес явно, объясните, что именно уходит, и дайте пользователю выключатель.

Как улучшить

    Для прогона на моделях — необязательно
    • Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
    • spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.

    Находки guard · 2

    ✓ Критических и высоких находок нет

    Средние и низкие: 2
    • средняя Утечка данных net-redirectable-api-key scripts/extract_pdf.py:97
      Скрипт отправляет API-ключ на хост из переменной окружения — ключ можно перенаправить на другой сервер
      API key + configurable base URL from environment
    • средняя Утечка данных net-redirectable-api-key scripts/ocr_engine.py:58
      Скрипт отправляет API-ключ на хост из переменной окружения — ключ можно перенаправить на другой сервер
      API key + configurable base URL from environment

    Просканировано файлов: 5. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.

    По спецификации Agent Skills

    ✓ По спецификации Agent Skills замечаний нет

    Процессный рейтинг: все десять параметров 75/100

    • 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
    • 30Повторный запуск. Изменяющих операций: 4, без проверки текущего состояния
    • 50Когда включается. Не сказано, при каком запросе скилл включается
    • 50Ошибки и развилки. Развилок: 0, есть раздел про ошибки
    • 60Результат и критерий готовности. Формат результата описан, критерия завершения нет
    • 70Входы и предусловия. Входные данные и предусловия перечислены
    • 100Инструменты и файлы. Внешние инструменты не нужны
    • 100Шаги. Шагов: 8
    • 100Согласованность. Имя и обязательные поля на месте
    • 100Стоимость исполнения. Тело инструкции 2367 токенов
    • low Разделов верхнего уровня: 10. Похоже на несколько доменов в одном скилле

    Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.

    Сигналы качества

    • +5В description нет примеров фраз, по которым скилл должен срабатывать
    • -226 эмодзи в инструкциях: шум для модели
    • -31 из 2 скриптов не упомянуты в SKILL.md
    • +1Лицензия не указана
    • +2Инструкции на одном языке
    • +4Описание говорит, когда скилл НЕ применять
    • +3Длина description 569 символов: достаточно сигнала, не съедает бюджет
    • +4Структура: 21 заголовков
    • +3Пошаговые инструкции: 8 пунктов
    • +3Формат ответа описан явно
    • +4Есть примеры (10 блоков кода)

    База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 86.

    Внешние проверки

    ClawHub: suspicious
    This PDF extraction skill needs review because it can automatically send PDF page images to an external OCR API even though its summary says scanned-PDF OCR is out of scope.
    LLM: suspicious (high) · VirusTotal: · 29 мая 2026 г.