SKILLEMALL.ai

BC model-evaluation

Вычисление и отчетность по корректным для задачи метрикам на отложенных данных для обученной модели медицинской визуализации — сегментация (Dice плюс метрика границы, такая как HD95 или NSD, для каждой структуры), классификация (AUROC плюс AUPRC и чувствительность/специфичность с доверительными интервалами Bootstrap при распространенности в реальных условиях), обнаружение (FROC или mAP с указанным критерием IoU), интерактивная/управляемая сегментация (количество взаимодействий, сходимость и время на случай, которое упускает статическая Dice), или оценка генеративных/синтетических изображений (сходство плюс эффективность последующей задачи, которую сходство само по себе не может установить) — плюс калибровка и срезы подгрупп. Выдает таблицу результатов для каждого случая, которую analyze-stats преобразует в публикационные таблицы, и проверяет выбор метрики по сравнению с Metrics Reloaded, CLAIM 2024 и Park et al. 2024 (нет точности пикселей для сегментации, нет голой точности при дисбалансе, нет статической Dice для интерактивного метода, нет утверждения только о сходстве для генеративной модели). Числа берутся только из выполненного кода, никогда не вводятся вручную.

машинный переводПоказать оригиналСкрыть оригинал«Compute and report task-correct held-out metrics for a trained medical…»

Compute and report task-correct held-out metrics for a trained medical-imaging model — segmentation (Dice plus a boundary metric such as HD95 or NSD, per structure), classification (AUROC plus AUPRC and sensitivity/specificity with bootstrap CIs at the deployment prevalence), detection (FROC or mAP with a stated IoU criterion), interactive/promptable segmentation (the interaction-count, convergence, and per-case-time axes a static Dice omits), or generative/synthesis image evaluation (similarity plus the downstream-task efficacy similarity alone cannot establish) — plus calibration and subgroup slices. Emits a per-case results table that analyze-stats turns into publication tables, and gates the metric choice against Metrics Reloaded, CLAIM 2024, and Park et al. 2024 (no pixel accuracy for segmentation, no bare accuracy under imbalance, no static Dice for an interactive method, no similarity-only claim for a generative model). Numbers come only from executed code, never hand-typed.

Aperivue/medsci-skills Agent Skills автор: Aperivue MIT 19 файлов · 3 скрипта тело ≈ 1 405 токенов Открыть источникgithub.com проанализирован 32 ч назад

Вычисление и отчетность по корректным для задачи метрикам на отложенных данных для обученной модели медицинской визуализации — сегментация (Dice плюс метрика…

Как процесс C 51/100 · Есть пробелы — слабые места: результат и критерий готовности, когда включается, входы и предусловия

АнализаторДанные и аналитикатип и темы размечены автоматически по тексту скилла
JSON
Технический рейтинг
B
94/100
безопасность, качество, тесты
Безопасность 60%
100
Качество 40%
86
Прогон на моделях
не было
Процессный рейтинг
C
51/100
Есть пробелы
Результат и критерий готовности вес 14
0
Входы и предусловия вес 11
0
Ошибки и развилки вес 10
0
три самых слабых из десяти параметров · все десять

Как улучшить

    Для прогона на моделях — необязательно
    • Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
    • spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.

    Находки guard · 0

    ✓ Критических и высоких находок нет

    Просканировано файлов: 18. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.

    По спецификации Agent Skills

    • заметка frontmatter-key неизвестное поле фронтматтера "triggers"
    • заметка frontmatter-key неизвестное поле фронтматтера "tools"

    Процессный рейтинг: все десять параметров 51/100

    • 0Результат и критерий готовности. Не сказано, что считать результатом
    • 0Входы и предусловия. Не сказано, что нужно иметь на входе
    • 0Ошибки и развилки. Линейный процесс без обработки сбоев
    • 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
    • 20Когда включается. Не сказано, при каком запросе скилл включается
    • 30Повторный запуск. Изменяющих операций: 2, без проверки текущего состояния
    • 100Инструменты и файлы. Инструменты объявлены во frontmatter
    • 100Шаги. Шагов: 16
    • 100Согласованность. Имя и обязательные поля на месте
    • 100Стоимость исполнения. Тело инструкции 1405 токенов

    Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.

    Сигналы качества

    • +5В description нет примеров фраз, по которым скилл должен срабатывать
    • +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
    • +3Длина description 996: рекомендуется 120–800 символов
    • +3Формат ответа не описан: модель каждый раз решает сама
    • +1Лицензия не указана
    • +2Инструкции на одном языке
    • +4Структура: 13 заголовков
    • +3Пошаговые инструкции: 16 пунктов
    • +4Есть примеры (2 блоков кода)
    • +4Справочные файлы упоминаются в инструкциях (2 из 2)
    • +3Все 1 скриптов описаны в инструкциях

    База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 86.