AC voice-recognition
Интеллектуальное преобразование речи в текст с использованием локального OpenAI Whisper (ключ API не требуется, полная конфиденциальность). Используйте, когда вам нужно транскрибировать аудиофайлы, преобразовывать голосовые сообщения в текст, распознавать произнесенный контент или обрабатывать речевой ввод на любом из 99+ языков. Ключевое отличие: интеллектуальный автоматический выбор модели анализирует длину и сложность аудио, чтобы выбрать оптимальную модель Whisper — короткие чистые клипы используют быструю базовую модель, длинные или смешанные языковые клипы автоматически обновляются до малых/средних для точности.
машинный переводПоказать оригиналСкрыть оригинал«Intelligent speech-to-text using local OpenAI Whisper (no API key need…»
Intelligent speech-to-text using local OpenAI Whisper (no API key needed, fully private). Use when you need to transcribe audio files, convert voice messages to text, recognize spoken content, or process speech input in any of 99+ languages. Key differentiator: smart auto-model selection analyzes audio length and complexity to choose the optimal Whisper model — short clean clips use the fast base model, long or mixed-language clips automatically upgrade to small/medium for accuracy.
Интеллектуальное преобразование речи в текст с использованием локального OpenAI Whisper (ключ API не требуется, полная конфиденциальность).
Как процесс C 60/100 · Есть пробелы — слабые места: когда включается, согласованность, повторный запуск
Как улучшить
- Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
- spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.
Находки guard · 0
✓ Критических и высоких находок нет
Просканировано файлов: 6. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.
По спецификации Agent Skills
✓ По спецификации Agent Skills замечаний нет
Процессный рейтинг: все десять параметров 60/100
- 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
- 20Когда включается. Не сказано, при каком запросе скилл включается
- 30Повторный запуск. Изменяющих операций: 1, без проверки текущего состояния
- 40Согласованность. Имя во frontmatter (voice-recognition) не совпадает с папкой (smart-voice-recognition)
- 50Ошибки и развилки. Развилок: 0, есть раздел про ошибки
- 60Инструменты и файлы. Используются инструменты (bash, python), но во frontmatter они не объявлены
- 60Результат и критерий готовности. Формат результата описан, критерия завершения нет
- 70Входы и предусловия. Входные данные и предусловия перечислены
- 100Шаги. Шагов: 14
- 100Стоимость исполнения. Тело инструкции 1571 токенов
- medium Правила безопасности и запреты внутри скилла: их место в системном промпте, здесь они не защищают
- low Разделов верхнего уровня: 11. Похоже на несколько доменов в одном скилле
Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.
Сигналы качества
- +5В description нет примеров фраз, по которым скилл должен срабатывать
- +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
- -237 эмодзи в инструкциях: шум для модели
- +1Лицензия не указана
- +2Инструкции на одном языке
- +3Длина description 487 символов: достаточно сигнала, не съедает бюджет
- +4Структура: 19 заголовков
- +3Пошаговые инструкции: 14 пунктов
- +3Формат ответа описан явно
- +4Есть примеры (7 блоков кода)
- +3Все 2 скриптов описаны в инструкциях
База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 88.