SKILLEMALL.ai

BC xiaozhi-teach-math-exam-designer

Разработка тестов для учителя математики: превращает «составление математических тестов на глаз» в диагностируемое задание с помощью двусторонней матрицы спецификаций. Активируется только тогда, когда учитель ставит четкую задачу по составлению математического теста, например «составь тест по разделу для восьмого класса», «создай двустороннюю матрицу спецификаций по математике», «рассчитай P/D по каждому вопросу для этого теста по математике»; не активируется при общих разговорах о математике, вопросах о решении конкретной задачи, вопросах о состоянии учеников. Выполняет только четыре действия: план составления теста и двусторонняя матрица спецификаций, подбор вопросов и указание авторских прав, статистический анализ вопросов (P/D и надежность по каждому вопросу), запись обратно после подтверждения учителем по каждому пункту. Не выполняет: классификацию причин ошибок и индивидуальную диагностику (перенаправление к xiaozhi-teach-math-error-analyzer), стратификацию учащихся (перенаправление к xiaozhi-teach-student-analyzer), корректирующие меры и педагогическое вмешательство (перенаправление к xiaozhi-teach-math-lesson-planner), общение с родителями (перенаправление к xiaozhi-teach-parent-communication), разработку тестов по не математическим дисциплинам (перенаправление к xiaozhi-teach-exam-designer).

машинный переводПоказать оригиналСкрыть оригинал«数学教师的测评设计:用双向细目表把"凭感觉出数学卷"变成可诊断的命题。仅在老师提出明确的数学命题任务时建议激活,例如"给八年级数学出一份单元…»

数学教师的测评设计:用双向细目表把"凭感觉出数学卷"变成可诊断的命题。仅在老师提出明确的数学命题任务时建议激活,例如"给八年级数学出一份单元测评""做一张数学双向细目表""算这次数学测评的逐题 P/D";泛泛聊数学、问某题怎么解、问学生近况都不激活。只做四件事:命题蓝图与双向细目表、题目选编与版权标注、题目统计(逐题 P/D 与信度)、经老师逐条确认后的写回。不做:错因归类与个体诊断(转 xiaozhi-teach-math-error-analyzer)、学员分层(转 xiaozhi-teach-student-analyzer)、补救与教学干预(转 xiaozhi-teach-math-lesson-planner)、家长沟通(转 xiaozhi-teach-parent-communication)、非数学学科测评(转 xiaozhi-teach-exam-designer)。

ClawHub Hermes автор: 小智伴学 v2.1.12 MIT-0 17 файлов тело ≈ 4 691 токенов Открыть источникclawhub.ai проанализирован 25 ч назад

Разработка тестов для учителя математики: превращает «составление математических тестов на глаз» в диагностируемое задание с помощью двусторонней матрицы…

Как процесс C 52/100 · Есть пробелы — слабые места: результат и критерий готовности, когда включается, входы и предусловия

АнализаторОбучениетип и темы размечены автоматически по тексту скилла
Запускается в: OpenClaw Hermes Agent
JSON
Технический рейтинг
B
88/100
безопасность, качество, тесты
Безопасность 60%
100
Качество 40%
71
Прогон на моделях
не было
Процессный рейтинг
C
52/100
Есть пробелы
Результат и критерий готовности вес 14
0
Входы и предусловия вес 11
0
Ошибки и развилки вес 10
0
три самых слабых из десяти параметров · все десять

Как улучшить

  1. Скажите в description, КОГДА применять скилл («используй, когда…», примеры запросов): это главный сигнал для агента.
  2. Для Hermes description должен быть одним предложением до 60 символов; условия применения вынесите в раздел «When to Use».
Для прогона на моделях — необязательно
  • Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
  • spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.

Находки guard · 0

✓ Критических и высоких находок нет

Просканировано файлов: 17. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.

По спецификации Agent Skills

  • предупреждение description-long-hermes description 397 символов, а стандарт Hermes требует ≤ 60 (одно предложение, с точкой)
  • предупреждение description-no-when ни description, ни раздел "## When to Use" не говорят, когда применять скилл
  • заметка frontmatter-key неизвестное поле фронтматтера "display_name"
  • заметка frontmatter-key неизвестное поле фронтматтера "grade_bands"
  • заметка frontmatter-key неизвестное поле фронтматтера "depends_on"
  • заметка frontmatter-key неизвестное поле фронтматтера "id"
  • заметка frontmatter-key неизвестное поле фронтматтера "min_platform_version"
  • заметка frontmatter-key неизвестное поле фронтматтера "max_round_limit"
  • заметка frontmatter-key неизвестное поле фронтматтера "slug"
  • заметка frontmatter-key неизвестное поле фронтматтера "displayName"
  • заметка frontmatter-key неизвестное поле фронтматтера "summary"

Процессный рейтинг: все десять параметров 52/100

  • 0Результат и критерий готовности. Не сказано, что считать результатом
  • 0Входы и предусловия. Не сказано, что нужно иметь на входе
  • 0Ошибки и развилки. Линейный процесс без обработки сбоев
  • 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
  • 20Когда включается. Не сказано, при каком запросе скилл включается
  • 70Стоимость исполнения. Тело инструкции 4691 токенов
  • 100Инструменты и файлы. Внешние инструменты не нужны
  • 100Шаги. Шагов: 18
  • 100Согласованность. Имя и обязательные поля на месте
  • 100Повторный запуск. Изменяющих операций нет

Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.

Сигналы качества

  • +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
  • +3Формат ответа не описан: модель каждый раз решает сама
  • -213 эмодзи в инструкциях: шум для модели
  • +2Инструкции на одном языке
  • +5В description 4 примера фраз-триггеров в кавычках
  • +3Длина description 397 символов: достаточно сигнала, не съедает бюджет
  • +4Структура: 22 заголовков
  • +3Пошаговые инструкции: 18 пунктов
  • +4Есть примеры (26 блоков кода)
  • +4Справочные файлы упоминаются в инструкциях (7 из 7)
  • +1Лицензия указана

База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 71.

Внешние проверки

ClawHub: suspicious
The skill is mostly a disclosed math assessment helper, but it can hand student item-score data to another skill without a clearly required sharing-consent check.
LLM: suspicious (high) · 7 сент. 2026 г.