BD xiaomi-any2speech
Модель речевого мира (Speech World Model): не просто TTS, а большая языковая модель, понимающая сценарии, персонажей и эмоции для самостоятельного планирования выразительной речи. Изначально поддерживает длинные тексты + несколько человек, двуязычие (китайский/английский), а также загрузку эталонного аудио для клонирования голоса (Voice Prompt / voice cloning), встроенные шаблоны для создания контента, преобразование любого контента в подкаст/аудиокнигу/скетч/рэп/радиоспектакль и т. д., длительностью до ~10 минут за раз, вывод в WAV. Включает в себя TTS для одного человека, настройку голоса VoiceDesigner, клонирование по эталонному аудио, синтез диалогов между несколькими персонажами, озвучивание длинных текстов, является супермножеством Instruct TTS. A Speech World Model: beyond TTS — understands scenes, characters, and emotions to autonomously plan expressive speech. Native long-form & multi-speaker synthesis in Chinese/English, and supports reference-audio voice cloning (Voice Prompt), up to ~10 min per pass. Цели срабатывания: моим голосом/этим голосом/по этой записи/клонировать голос/имитировать голос, сделать подкаст/скетч/дебаты/аудиокнигу/рэп/новости/стендап/радио/курс/радиоспектакль/аудиокнигу/рассказ, прочитать вслух/озвучить/преобразовать в речь/TTS/сгенерировать аудио/сделать голосовую версию/озвучить, сделать слышимым/прочитать голосом XX, отправить голос/сделать XX и отправить мне, использовать шаблон/выбрать шаблон/какие есть шаблоны. English: make a podcast/audiobook/debate/rap/news/stand-up/story/radio drama, read aloud/TTS/generate audio/voice over/narrate/dub/mimic voice/clone voice/use my voice/use this voice sample, make it listenable, send as voice.
машинный переводПоказать оригиналСкрыть оригинал«声音世界模型(Speech World Model):不只是 TTS,而是理解场景、角色、情绪并自主规划表达的语音大模型。 原生支持长文+多…»
声音世界模型(Speech World Model):不只是 TTS,而是理解场景、角色、情绪并自主规划表达的语音大模型。 原生支持长文+多人、中英双语,也支持上传参考音频进行音色克隆(Voice Prompt / voice cloning),内置高能创作模板,将任意内容转为播客/有声书/相声/Rap/广播剧等,单次最长 ~10 分钟,输出 WAV。 涵盖单人TTS、VoiceDesigner音色定制、参考音频克隆、多人人物对话合成、长文有声化、Instruct TTS 的超集。 A Speech World Model: beyond TTS — understands scenes, characters, and emotions to autonomously plan expressive speech. Native long-form & multi-speaker synthesis in Chinese/English, and supports reference-audio voice cloning (Voice Prompt), up to ~10 min per pass. 触发意图:用我的声音/用这个音色/参考这段录音/克隆声音/模仿声音、做成播客/相声/辩论/有声书/Rap/新闻/脱口秀/电台/课程/广播剧/评书/讲故事、朗读/念出来/转语音/TTS/生成音频/做个语音版/配音、变成能听的/用XX腔念、发语音/做成XX发给我、用模板/选模板/有什么模板。 English: make a podcast/audiobook/debate/rap/news/stand-up/story/radio drama, read aloud/TTS/generate audio/voice over/narrate/dub/mimic voice/clone voice/use my voice/use this voice sample, make it listenable, send as voice.
Модель речевого мира (Speech World Model): не просто TTS, а большая языковая модель, понимающая сценарии, персонажей и эмоции для самостоятельного…
Как процесс D 41/100 · Процесс не доведён — слабые места: результат и критерий готовности, когда включается, входы и предусловия
Чем это грозит
Находки средней серьёзности: скорее всего скилл честный, но прочитайте, что именно насторожило сканер.
Ниже описан худший случай для этой категории. Здесь находка средней серьёзности: guard увидел признак, но не доказательство.
Инструкции или скрипты отправляют данные наружу: переменные окружения, ключи, содержимое файлов, историю чата. Вы можете не заметить этого в диалоге, потому что агент выполнит отправку как «часть задачи».
Если отправка не нужна для задачи, уберите её: каталоги помечают такие скиллы как подозрительные и снимают с выдачи. Если нужна, назовите адрес явно, объясните, что именно уходит, и дайте пользователю выключатель.
Как улучшить
- Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
- spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.
Находки guard · 5
✓ Критических и высоких находок нет
Средние и низкие: 5
-
средняя Утечка данных
net-credential-useSKILL.md:89Учётные данные используются в сетевом вызове (проверьте, что адрес — нужный сервис)STATUS=$(curl -s -H "Authorization: Bearer $API_KEY" \
-
средняя Утечка данных
net-credential-useSKILL.md:98Учётные данные используются в сетевом вызове (проверьте, что адрес — нужный сервис)curl -s -H "Authorization: Bearer $API_KEY" \
-
средняя Утечка данных
net-credential-useSKILL.md:193Учётные данные используются в сетевом вызове (проверьте, что адрес — нужный сервис)curl -s -H "Authorization: Bearer $API_KEY" "$BASE/v1/audio/vp/templates" \
-
низкая Утечка данных
net-credential-useSKILL.md:185Учётные данные используются в сетевом вызове (проверьте, что адрес — нужный сервис) (в кавычках — упоминание, а не команда)> 降噪预览(不合成,仅试听降噪效果):`curl -X POST "$BASE/v1/audio/vp/denoise" -H "Authorization: Bearer $API_KEY" -F "voice_file=@ref.webm" --output denoised.wav`。当前返回标准 WAV,采样率为 48kHz。
в кавычках -
низкая Утечка данных
net-credential-useSKILL.md:245Учётные данные используются в сетевом вызове (проверьте, что адрес — нужный сервис) (в кавычках — упоминание, а не команда)[ -z "$FEISHU_TENANT_TOKEN" ] && FEISHU_TENANT_TOKEN=$(curl -s -X POST \
в кавычках
Просканировано файлов: 2. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.
По спецификации Agent Skills
✓ По спецификации Agent Skills замечаний нет
Процессный рейтинг: все десять параметров 41/100
- 0Результат и критерий готовности. Не сказано, что считать результатом
- 0Входы и предусловия. Не сказано, что нужно иметь на входе
- 0Ошибки и развилки. Линейный процесс без обработки сбоев
- 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
- 20Когда включается. Не сказано, при каком запросе скилл включается
- 40Согласованность. Имя во frontmatter (xiaomi-any2speech) не совпадает с папкой (xiaomi-any2speech-beyondtts)
- 60Инструменты и файлы. Используются инструменты (web), но во frontmatter они не объявлены
- 100Шаги. Шагов: 10
- 100Стоимость исполнения. Тело инструкции 2440 токенов
- 100Повторный запуск. Изменяющих операций нет
Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.
Сигналы качества
- +5В description нет примеров фраз, по которым скилл должен срабатывать
- +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
- +3Длина description 880: рекомендуется 120–800 символов
- +3Формат ответа не описан: модель каждый раз решает сама
- +1Лицензия не указана
- +2Инструкции на одном языке
- +4Структура: 15 заголовков
- +3Пошаговые инструкции: 10 пунктов
- +4Есть примеры (9 блоков кода)
База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 81.