CC byted-las-asr-pro
Движок распознавания речи (ASR/STT), работающий на Volcengine LAS. Транскрибирует и преобразует речь в текст из аудио- и видеофайлов — извлекает произнесенные слова и генерирует текстовую расшифровку из любой записи. Поддерживает диктовку, создание субтитров и титров. Обрабатывает записи совещаний, заметки с совещаний, протоколы совещаний, сводки совещаний, транскрипцию интервью, транскрипцию подкастов, транскрипцию лекций, аудиозаписи колл-центров обслуживания клиентов, записи телефонных разговоров и другие аудиозаписи. Функции включают диаризацию дикторов и идентификацию дикторов (определение, кто что сказал), распознавание эмоций, определение тональности, распознавание пола и автоматическое многоязычное определение языка. Принимает форматы wav, mp3, m4a с асинхронным рабочим процессом submit-poll и пакетной обработкой для крупномасштабных задач транскрипции. Используйте этот навык, когда пользователь хочет транскрибировать аудио или видео в текст (ASR/речь в текст), создавать субтитры или титры из записей, выполнять диаризацию дикторов или анализ эмоций в записях совещаний/интервью/подкастов/лекций или извлекать произнесенный контент из любых аудио/видео медиафайлов.
машинный переводПоказать оригиналСкрыть оригинал«ASR / STT / speech recognition / voice recognition engine powered by V…»
ASR / STT / speech recognition / voice recognition engine powered by Volcengine LAS. Transcribes and converts speech to text from audio and video files — extracts spoken words and generates text transcription from any recording. Supports dictation, subtitle and caption generation. Handles meeting recordings, meeting notes, meeting minutes, meeting summary, interview transcription, podcast transcription, lecture transcription, customer service call center audio, phone call recording, and recorded audio files. Features speaker diarization and speaker identification (detect who said what), emotion recognition, sentiment detection, gender recognition, and multilingual multi-language auto-detection. Accepts wav, mp3, m4a formats with async submit-poll workflow and batch processing for large-scale transcription jobs. Use this skill when the user wants to transcribe audio or video to text (ASR/speech-to-text), generate subtitles or captions from recordings, do speaker diarization or emotion analysis on meeting/interview/podcast/lecture recordings, or extract spoken content from any audio/video media file.
Движок распознавания речи (ASR/STT), работающий на Volcengine LAS.
Как процесс C 61/100 · Есть пробелы — слабые места: результат и критерий готовности, входы и предусловия, ошибки и развилки
Чем это грозит
Скилл содержит фрагменты, которые в чужих руках стоят денег или данных. Ниже, что рискует потерять тот, кто установит, и что должен сделать автор.
Скилл содержит команды, которые удаляют файлы, переписывают диски или исполняют код, скачанный из сети. Агент может выполнить их без вопроса, если считает, что так требует инструкция.
Замените разрушительные команды на безопасные аналоги с подтверждением, ограничьте область действия конкретной папкой и не тяните код через curl | bash: укажите версию и контрольную сумму.
Как улучшить
- Разберите находки высокой серьёзности: каждая стоит 18 баллов безопасности. Если это ложное срабатывание, добавьте код правила в guard.allow в spec.yaml.
- Сократите description до 1024 символов.
- spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.
Находки guard · 2
-
высокая Опасные команды
cmd-install-from-urlscripts/env_init.sh:41Установка пакета по недоверенному URL / из архиваpip install --quiet --upgrade https://las-ai-cn-beijing-online.tos-cn-beijing.volces.com/operator_cards_serving/public/skills/sdk/las_…whl
Средние и низкие: 1
-
низкая Опасные команды
cmd-background-processSKILL.md:122Запуск фонового / автозапускаемого процесса./scripts/poll_background.sh {task_id} "./output/{task_id}" & disown
Просканировано файлов: 9. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.
По спецификации Agent Skills
- ошибка
description-longdescription 1115 символов, лимит 1024
Процессный рейтинг: все десять параметров 61/100
- 0Результат и критерий готовности. Не сказано, что считать результатом
- 0Входы и предусловия. Не сказано, что нужно иметь на входе
- 0Ошибки и развилки. Линейный процесс без обработки сбоев
- 70Когда включается. Сказано, когда применять, но не сказано, когда не стоит
- 100Инструменты и файлы. Внешние инструменты не нужны
- 100Шаги. Шагов: 40
- 100Согласованность. Имя и обязательные поля на месте
- 100Стоимость исполнения. Тело инструкции 1109 токенов
- 100Повторный запуск. Изменяющих операций нет
- 100Отчётность по ходу. Скилл сообщает о ходе работы
- medium Тестов 3, и все положительные: нет ни одного случая «должен отказать» или «должен переспросить»
Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.
Сигналы качества
- +5В description нет примеров фраз, по которым скилл должен срабатывать
- +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
- +3Длина description 1115: рекомендуется 120–800 символов
- +3Формат ответа не описан: модель каждый раз решает сама
- +1Лицензия не указана
- +2Инструкции на одном языке
- +4Структура: 12 заголовков
- +3Пошаговые инструкции: 40 пунктов
- +4Есть примеры (13 блоков кода)
- +4Справочные файлы упоминаются в инструкциях (2 из 2)
- +3Все 4 скриптов описаны в инструкциях
База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 63.