BF japanese-conversation-grader
Проверка аудиозаписей японской разговорной речи уровня A1/A2/B1 (примерно соответствует JLPT N5/N4/N3); транскрипция ASR на основе faster-whisper, система автоматически транскрибирует ответы студентов и проводит предварительное сопоставление содержания и трехмерную диагностику (полнота/точность/беглость содержания); неопределенное содержание не штрафуется, выводятся только подозрительные кандидаты для проверки преподавателем. Поддерживает индивидуальную/групповую проверку, обратную связь по исправлениям, архивирование результатов; предварительная проверка ИИ, ручная проверка преподавателем, максимальная оценка — 10 баллов.
машинный переводПоказать оригиналСкрыть оригинал«A1/A2/B1(约对应JLPT的N5/N4/N3)日语会话测试音频批改;基于faster-whisper实现ASR转写,系统自动转写学生回…»
A1/A2/B1(约对应JLPT的N5/N4/N3)日语会话测试音频批改;基于faster-whisper实现ASR转写,系统自动转写学生回答并做初步内容匹配与三维诊断(内容完整性/准确性/流利度);不确定内容不扣分,只输出可疑候选供教师复核。支持单人/批量批改、纠错反馈、成绩归档;AI预批改辅助,教师人工复核,满分10分。
Проверка аудиозаписей японской разговорной речи уровня A1/A2/B1 (примерно соответствует JLPT N5/N4/N3); транскрипция ASR на основе faster-whisper, система…
Как процесс F 31/100 · Не запустится — Скилл ссылается на файлы, которых нет в архиве: scripts/download_audio_submissions.py
Как улучшить
- Скажите в description, КОГДА применять скилл («используй, когда…», примеры запросов): это главный сигнал для агента.
- В тексте есть ссылки на отсутствующие файлы: добавьте файлы или уберите ссылки.
- Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
- spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.
Находки guard · 0
✓ Критических и высоких находок нет
Просканировано файлов: 2. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.
По спецификации Agent Skills
- предупреждение
description-no-whendescription не говорит, КОГДА применять скилл (нет "use when / используй когда") - предупреждение
missing-refссылка на отсутствующий файл: scripts/download_audio_submissions.py - заметка
frontmatter-keyнеизвестное поле фронтматтера "display_name" - заметка
frontmatter-keyнеизвестное поле фронтматтера "use_when" - заметка
frontmatter-keyнеизвестное поле фронтматтера "platform_independent" - заметка
frontmatter-keyнеизвестное поле фронтматтера "triggers"
Процессный рейтинг: все десять параметров 31/100
- 0Инструменты и файлы. Не хватает 1 файла(ов): scripts/download_audio_submissions.py
- 0Результат и критерий готовности. Не сказано, что считать результатом
- 0Входы и предусловия. Не сказано, что нужно иметь на входе
- 0Ошибки и развилки. Линейный процесс без обработки сбоев
- 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
- 20Когда включается. Не сказано, при каком запросе скилл включается
- 40Согласованность. Имя во frontmatter (japanese-conversation-grader) не совпадает с папкой (japanese-conversation-scorer)
- 100Шаги. Шагов: 102
- 100Стоимость исполнения. Тело инструкции 2080 токенов
- 100Повторный запуск. Изменяющих операций нет
- low Разделов верхнего уровня: 16. Похоже на несколько доменов в одном скилле
Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.
Сигналы качества
- +5В description нет примеров фраз, по которым скилл должен срабатывать
- +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
- +3Формат ответа не описан: модель каждый раз решает сама
- +1Лицензия не указана
- +2Инструкции на одном языке
- +3Длина description 163 символов: достаточно сигнала, не съедает бюджет
- +4Структура: 40 заголовков
- +3Пошаговые инструкции: 102 пунктов
- +4Есть примеры (5 блоков кода)
База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 63.