AB results-analysis
Этот навык следует использовать, когда пользователь просит «проанализировать результаты экспериментов», «выполнить строгий статистический анализ», «сравнить производительность моделей», «создать научные графики», «проверить значимость», «провести анализ абляции» или упоминает интерпретацию экспериментальных данных с помощью строгой статистики и визуализации. Он фокусируется на строгих пакетах анализа, а не на прозе раздела результатов.
машинный переводПоказать оригиналСкрыть оригинал«This skill should be used when the user asks to "analyze experimental…»
This skill should be used when the user asks to "analyze experimental results", "run strict statistical analysis", "compare model performance", "generate scientific figures", "check significance", "do ablation analysis", or mentions interpreting experiment data with rigorous statistics and visualization. It focuses on strict analysis bundles, not Results-section prose.
Этот навык следует использовать, когда пользователь просит «проанализировать результаты экспериментов», «выполнить строгий статистический анализ», «сравнить…
Как процесс B 75/100 · Почти готов — слабые места: входы и предусловия, повторный запуск, отчётность по ходу
Такой же скилл встречается ещё в 1 месте: RA-Skills
Как улучшить
- Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
- spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.
Находки guard · 0
✓ Критических и высоких находок нет
Просканировано файлов: 11. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.
По спецификации Agent Skills
✓ По спецификации Agent Skills замечаний нет
Процессный рейтинг: все десять параметров 75/100
- 0Входы и предусловия. Не сказано, что нужно иметь на входе
- 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
- 30Повторный запуск. Изменяющих операций: 3, без проверки текущего состояния
- 60Результат и критерий готовности. Формат результата описан, критерия завершения нет
- 70Когда включается. Сказано, когда применять, но не сказано, когда не стоит
- 100Инструменты и файлы. Внешние инструменты не нужны
- 100Шаги. Шагов: 112
- 100Ошибки и развилки. Развилок: 3, есть раздел про ошибки
- 100Согласованность. Имя и обязательные поля на месте
- 100Стоимость исполнения. Тело инструкции 2236 токенов
Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.
Сигналы качества
- +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
- +1Лицензия не указана
- +2Инструкции на одном языке
- +5В description 6 примера фраз-триггеров в кавычках
- +3Длина description 371 символов: достаточно сигнала, не съедает бюджет
- +4Структура: 21 заголовков
- +3Пошаговые инструкции: 112 пунктов
- +3Формат ответа описан явно
- +4Есть примеры (2 блоков кода)
- +4Справочные файлы упоминаются в инструкциях (6 из 6)
База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 96.