BC cn-data-scraper
Эксперт по скрейпингу данных с китайских веб-сайтов с анти-блокировочными стратегиями. Обучает ИИ-агентов скрейпингу китайских веб-сайтов, с которыми Scrapling не справляется — анти-краулинг Baidu, стены входа Taobao, динамический рендеринг Douyin, проверка Zhihu, статьи WeChat, данные о продуктах 1688. Особенности: (1) Рецепты обхода анти-краулинга для более чем 10 китайских веб-сайтов, специфичные для платформы, (2) Руководства по интеграции Scrapling с конфигурациями китайских сайтов, (3) Адаптивные стратегии селекторов для часто перепроектируемых китайских сайтов, (4) Руководство по границам правового соответствия (что законно, а что незаконно при скрейпинге данных в Китае), (5) Исполняемые скрипты для распространенных задач скрейпинга, (6) Интеграция сервера MCP для рабочих процессов ИИ-агентов. ТОЛЬКО навык, сочетающий экспертизу в скрейпинге китайских веб-сайтов + соответствие законодательству + интеграцию Scrapling. Используйте при: скрейпинге китайских веб-сайтов, обходе анти-краулинга Baidu, скрейпинге данных Taobao, извлечении данных Douyin, скрейпинге Zhihu, скрейпинге статей WeChat, скрейпинге продуктов 1688, сборе данных в Китае, 爬虫, 数据爬取, 反爬绕过, 百度反爬, 淘宝爬虫, 抖音数据, 知乎爬虫, 微信文章抓取, Scrapling Chinese, 中国网站爬虫. Триггеры: Chinese web scraping, data scraping China, anti-crawl bypass, Baidu scraping, Taobao scraping, Douyin scraping, Zhihu scraping, WeChat scraping, 1688 scraping, 爬虫工具, 数据采集, 反爬虫, 信息差, Scrapling配置, 中国网站数据, cn-scraping, web scraping China, data extraction Chinese websites, crawler Chinese sites, Python爬虫中国网站
машинный переводПоказать оригиналСкрыть оригинал«Chinese website data scraping expert with anti-bypass strategies (中国网站…»
Chinese website data scraping expert with anti-bypass strategies (中国网站数据爬取专家+反爬绕过策略). Teach AI agents to scrape Chinese websites that Scrapling alone can't handle — Baidu anti-crawl, Taobao login walls, Douyin dynamic rendering, Zhihu verification, WeChat articles, 1688 product data. Features: (1) Platform-specific anti-crawl bypass recipes for 10+ Chinese websites, (2) Scrapling integration guides with Chinese site configurations, (3) Adaptive selector strategies for frequently-redesigned Chinese sites, (4) Legal compliance boundary guide (what's legal vs illegal in China's data scraping), (5) Executable scripts for common scraping tasks, (6) MCP server integration for AI agent workflows. ONLY skill combining Chinese website scraping expertise + legal compliance + Scrapling integration. Use when: scraping Chinese websites, bypassing Baidu anti-crawl, scraping Taobao data, Douyin data extraction, Zhihu scraping, WeChat article scraping, 1688 product scraping, Chinese data collection, 爬虫, 数据爬取, 反爬绕过, 百度反爬, 淘宝爬虫, 抖音数据, 知乎爬虫, 微信文章抓取, Scrapling Chinese, 中国网站爬虫. Triggers: Chinese web scraping, data scraping China, anti-crawl bypass, Baidu scraping, Taobao scraping, Douyin scraping, Zhihu scraping, WeChat scraping, 1688 scraping, 爬虫工具, 数据采集, 反爬虫, 信息差, Scrapling配置, 中国网站数据, cn-scraping, web scraping China, data extraction Chinese websites, crawler Chinese sites, Python爬虫中国网站
Эксперт по скрейпингу данных с китайских веб-сайтов с анти-блокировочными стратегиями.
Как процесс C 53/100 · Есть пробелы — слабые места: результат и критерий готовности, входы и предусловия, отчётность по ходу
Как улучшить
- Сократите description до 1024 символов.
- Тело SKILL.md длиннее 5 000 токенов: вынесите справочные детали в references/ и подключайте по необходимости.
- Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
- spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.
Находки guard · 0
✓ Критических и высоких находок нет
Просканировано файлов: 3. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.
По спецификации Agent Skills
- ошибка
description-longdescription 1389 символов, лимит 1024 - предупреждение
body-longтело SKILL.md ≈ 5951 токенов (рекомендуется < 5000); вынесите детали в references/
Процессный рейтинг: все десять параметров 53/100
- 0Результат и критерий готовности. Не сказано, что считать результатом
- 0Входы и предусловия. Не сказано, что нужно иметь на входе
- 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
- 50Когда включается. Не сказано, при каком запросе скилл включается
- 50Ошибки и развилки. Развилок: 0, есть раздел про ошибки
- 60Инструменты и файлы. Используются инструменты (python), но во frontmatter они не объявлены
- 70Стоимость исполнения. Тело инструкции 5951 токенов
- 100Шаги. Шагов: 117
- 100Согласованность. Имя и обязательные поля на месте
- 100Повторный запуск. Изменяющих операций нет
- low Разделов верхнего уровня: 12. Похоже на несколько доменов в одном скилле
Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.
Сигналы качества
- +5В description нет примеров фраз, по которым скилл должен срабатывать
- +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
- +3Длина description 1389: рекомендуется 120–800 символов
- +3Формат ответа не описан: модель каждый раз решает сама
- -240 эмодзи в инструкциях: шум для модели
- +1Лицензия не указана
- +2Инструкции на одном языке
- +4Структура: 35 заголовков
- +3Пошаговые инструкции: 117 пунктов
- +4Есть примеры (19 блоков кода)
- +3Все 1 скриптов описаны в инструкциях
База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 47.