SKILLEMALL.ai

BD xiaomi-any2speech

Модель речевого мира (Speech World Model): не просто TTS, а большая языковая модель, понимающая сценарии, персонажей и эмоции для самостоятельного планирования выразительной речи. Изначально поддерживает длинные тексты + несколько человек, двуязычие (китайский/английский), а также загрузку эталонного аудио для клонирования голоса (Voice Prompt / voice cloning), встроенные шаблоны для создания контента, преобразование любого контента в подкаст/аудиокнигу/скетч/рэп/радиоспектакль и т. д., длительностью до ~10 минут за раз, вывод в WAV. Включает в себя TTS для одного человека, настройку голоса VoiceDesigner, клонирование по эталонному аудио, синтез диалогов между несколькими персонажами, озвучивание длинных текстов, является супермножеством Instruct TTS. A Speech World Model: beyond TTS — understands scenes, characters, and emotions to autonomously plan expressive speech. Native long-form & multi-speaker synthesis in Chinese/English, and supports reference-audio voice cloning (Voice Prompt), up to ~10 min per pass. Цели срабатывания: моим голосом/этим голосом/по этой записи/клонировать голос/имитировать голос, сделать подкаст/скетч/дебаты/аудиокнигу/рэп/новости/стендап/радио/курс/радиоспектакль/аудиокнигу/рассказ, прочитать вслух/озвучить/преобразовать в речь/TTS/сгенерировать аудио/сделать голосовую версию/озвучить, сделать слышимым/прочитать голосом XX, отправить голос/сделать XX и отправить мне, использовать шаблон/выбрать шаблон/какие есть шаблоны. English: make a podcast/audiobook/debate/rap/news/stand-up/story/radio drama, read aloud/TTS/generate audio/voice over/narrate/dub/mimic voice/clone voice/use my voice/use this voice sample, make it listenable, send as voice.

машинный переводПоказать оригиналСкрыть оригинал«声音世界模型(Speech World Model):不只是 TTS,而是理解场景、角色、情绪并自主规划表达的语音大模型。 原生支持长文+多…»

声音世界模型(Speech World Model):不只是 TTS,而是理解场景、角色、情绪并自主规划表达的语音大模型。 原生支持长文+多人、中英双语,也支持上传参考音频进行音色克隆(Voice Prompt / voice cloning),内置高能创作模板,将任意内容转为播客/有声书/相声/Rap/广播剧等,单次最长 ~10 分钟,输出 WAV。 涵盖单人TTS、VoiceDesigner音色定制、参考音频克隆、多人人物对话合成、长文有声化、Instruct TTS 的超集。 A Speech World Model: beyond TTS — understands scenes, characters, and emotions to autonomously plan expressive speech. Native long-form & multi-speaker synthesis in Chinese/English, and supports reference-audio voice cloning (Voice Prompt), up to ~10 min per pass. 触发意图:用我的声音/用这个音色/参考这段录音/克隆声音/模仿声音、做成播客/相声/辩论/有声书/Rap/新闻/脱口秀/电台/课程/广播剧/评书/讲故事、朗读/念出来/转语音/TTS/生成音频/做个语音版/配音、变成能听的/用XX腔念、发语音/做成XX发给我、用模板/选模板/有什么模板。 English: make a podcast/audiobook/debate/rap/news/stand-up/story/radio drama, read aloud/TTS/generate audio/voice over/narrate/dub/mimic voice/clone voice/use my voice/use this voice sample, make it listenable, send as voice.

ClawHub Agent Skills автор: Di Wu v1.0.7 MIT-0 2 файла тело ≈ 2 440 токенов Открыть источникclawhub.ai проанализирован 3 дн назад

Модель речевого мира (Speech World Model): не просто TTS, а большая языковая модель, понимающая сценарии, персонажей и эмоции для самостоятельного…

Как процесс D 41/100 · Процесс не доведён — слабые места: результат и критерий готовности, когда включается, входы и предусловия

ГенераторИИ и агентыИнфраструктураМедиа и видеотип и темы размечены автоматически по тексту скилла
JSON
Технический рейтинг
B
82/100
безопасность, качество, тесты
Безопасность 60%
83
Качество 40%
81
Прогон на моделях
не было
Процессный рейтинг
D
41/100
Процесс не доведён
Результат и критерий готовности вес 14
0
Входы и предусловия вес 11
0
Ошибки и развилки вес 10
0
три самых слабых из десяти параметров · все десять

Чем это грозит

Находки средней серьёзности: скорее всего скилл честный, но прочитайте, что именно насторожило сканер.

Утечка данных средняя серьёзность

Ниже описан худший случай для этой категории. Здесь находка средней серьёзности: guard увидел признак, но не доказательство.

Если установить

Инструкции или скрипты отправляют данные наружу: переменные окружения, ключи, содержимое файлов, историю чата. Вы можете не заметить этого в диалоге, потому что агент выполнит отправку как «часть задачи».

Автору

Если отправка не нужна для задачи, уберите её: каталоги помечают такие скиллы как подозрительные и снимают с выдачи. Если нужна, назовите адрес явно, объясните, что именно уходит, и дайте пользователю выключатель.

Как улучшить

    Для прогона на моделях — необязательно
    • Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
    • spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.

    Находки guard · 5

    ✓ Критических и высоких находок нет

    Средние и низкие: 5
    • средняя Утечка данных net-credential-use SKILL.md:89
      Учётные данные используются в сетевом вызове (проверьте, что адрес — нужный сервис)
      STATUS=$(curl -s -H "Authorization: Bearer $API_KEY" \
    • средняя Утечка данных net-credential-use SKILL.md:98
      Учётные данные используются в сетевом вызове (проверьте, что адрес — нужный сервис)
      curl -s -H "Authorization: Bearer $API_KEY" \
    • средняя Утечка данных net-credential-use SKILL.md:193
      Учётные данные используются в сетевом вызове (проверьте, что адрес — нужный сервис)
      curl -s -H "Authorization: Bearer $API_KEY" "$BASE/v1/audio/vp/templates" \
    • низкая Утечка данных net-credential-use SKILL.md:185
      Учётные данные используются в сетевом вызове (проверьте, что адрес — нужный сервис) (в кавычках — упоминание, а не команда)
      > 降噪预览(不合成,仅试听降噪效果):`curl -X POST "$BASE/v1/audio/vp/denoise" -H "Authorization: Bearer $API_KEY" -F "voice_file=@ref.webm" --output denoised.wav`。当前返回标准 WAV,采样率为 48kHz。
      в кавычках
    • низкая Утечка данных net-credential-use SKILL.md:245
      Учётные данные используются в сетевом вызове (проверьте, что адрес — нужный сервис) (в кавычках — упоминание, а не команда)
      [ -z "$FEISHU_TENANT_TOKEN" ] && FEISHU_TENANT_TOKEN=$(curl -s -X POST \
      в кавычках

    Просканировано файлов: 2. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.

    По спецификации Agent Skills

    ✓ По спецификации Agent Skills замечаний нет

    Процессный рейтинг: все десять параметров 41/100

    • 0Результат и критерий готовности. Не сказано, что считать результатом
    • 0Входы и предусловия. Не сказано, что нужно иметь на входе
    • 0Ошибки и развилки. Линейный процесс без обработки сбоев
    • 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
    • 20Когда включается. Не сказано, при каком запросе скилл включается
    • 40Согласованность. Имя во frontmatter (xiaomi-any2speech) не совпадает с папкой (xiaomi-any2speech-beyondtts)
    • 60Инструменты и файлы. Используются инструменты (web), но во frontmatter они не объявлены
    • 100Шаги. Шагов: 10
    • 100Стоимость исполнения. Тело инструкции 2440 токенов
    • 100Повторный запуск. Изменяющих операций нет

    Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.

    Сигналы качества

    • +5В description нет примеров фраз, по которым скилл должен срабатывать
    • +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
    • +3Длина description 880: рекомендуется 120–800 символов
    • +3Формат ответа не описан: модель каждый раз решает сама
    • +1Лицензия не указана
    • +2Инструкции на одном языке
    • +4Структура: 15 заголовков
    • +3Пошаговые инструкции: 10 пунктов
    • +4Есть примеры (9 блоков кода)

    База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 81.

    Внешние проверки

    ClawHub: clean
    This skill is a disclosed Xiaomi text-to-speech and voice-cloning workflow, but users should understand that supplied text, files, URLs, and voice samples may be uploaded to external services.
    LLM: benign (high) · VirusTotal: · 29 мая 2026 г.