SKILLEMALL.ai

AC cogdx-calibration

Проведите аудит калибровки выходных данных ИИ-агента через API Cerebratech CogDx (0,05 доллара США за вызов, принимаются кредиты). Используйте, когда заявленная уверенность агента не соответствует фактической точности, когда последующие системы должны доверять оценкам неопределенности агента, при подготовке к развертыванию в критически важных сценариях или после обнаружения закономерностей чрезмерной или недостаточной уверенности. Использует чистые статистические методы (Brier scores, calibration curves) — без LLM на бэкенде. Активируется по фразам вроде «audit my calibration», «check my confidence», «am I overconfident», «calibration gap», «confidence accuracy mismatch» или любому запросу на проверку соответствия заявленной неопределенности реальной точности. После выполнения используйте навык cogdx-feedback (БЕСПЛАТНО) для проверки переобучения и получения кредитов.

машинный переводПоказать оригиналСкрыть оригинал«Run a calibration audit on an AI agent's outputs via Cerebratech CogDx…»

Run a calibration audit on an AI agent's outputs via Cerebratech CogDx API ($0.05 per call, credits accepted). Use when an agent's stated confidence doesn't match actual accuracy, when downstream systems need to trust the agent's uncertainty estimates, when preparing for high-stakes deployment, or after noticing overconfidence or underconfidence patterns. Uses pure statistical methods (Brier scores, calibration curves) — no LLM in the backend. Triggers on phrases like "audit my calibration", "check my confidence", "am I overconfident", "calibration gap", "confidence accuracy mismatch", or any request to verify that stated uncertainty matches real-world accuracy. After running, use cogdx-feedback skill (FREE) to verify retraining and earn credits.

ClawHub Agent Skills автор: Dr Amanda Kavner v1.0.1 MIT-0 3 файла тело ≈ 589 токенов Открыть источникclawhub.ai проанализирован 3 дн назад

Проведите аудит калибровки выходных данных ИИ-агента через API Cerebratech CogDx (0,05 доллара США за вызов, принимаются кредиты).

Как процесс C 61/100 · Есть пробелы — слабые места: входы и предусловия, ошибки и развилки, отчётность по ходу

АнализаторИИ и агентыИнфраструктуратип и темы размечены автоматически по тексту скилла
JSON
Технический рейтинг
A
98/100
безопасность, качество, тесты
Безопасность 60%
100
Качество 40%
96
Прогон на моделях
не было
Процессный рейтинг
C
61/100
Есть пробелы
Входы и предусловия вес 11
0
Ошибки и развилки вес 10
0
Отчётность по ходу вес 2
0
три самых слабых из десяти параметров · все десять

Как улучшить

    Для прогона на моделях — необязательно
    • Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
    • spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.

    Находки guard · 0

    ✓ Критических и высоких находок нет

    Просканировано файлов: 3. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.

    По спецификации Agent Skills

    • заметка frontmatter-key неизвестное поле фронтматтера "repository"

    Процессный рейтинг: все десять параметров 61/100

    • 0Входы и предусловия. Не сказано, что нужно иметь на входе
    • 0Ошибки и развилки. Линейный процесс без обработки сбоев
    • 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
    • 60Инструменты и файлы. Используются инструменты (bash, web), но во frontmatter они не объявлены
    • 60Результат и критерий готовности. Формат результата описан, критерия завершения нет
    • 70Когда включается. Сказано, когда применять, но не сказано, когда не стоит
    • 100Шаги. Шагов: 10
    • 100Согласованность. Имя и обязательные поля на месте
    • 100Стоимость исполнения. Тело инструкции 589 токенов
    • 100Повторный запуск. Изменяющие операции проверяют текущее состояние

    Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.

    Сигналы качества

    • +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
    • +2Инструкции на одном языке
    • +5В description 5 примера фраз-триггеров в кавычках
    • +3Длина description 756 символов: достаточно сигнала, не съедает бюджет
    • +4Структура: 7 заголовков
    • +3Пошаговые инструкции: 10 пунктов
    • +3Формат ответа описан явно
    • +4Есть примеры (4 блоков кода)
    • +4Справочные файлы упоминаются в инструкциях (1 из 1)
    • +1Лицензия указана

    База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 96.

    Внешние проверки

    ClawHub: clean
    This is an instruction-only calibration audit skill that clearly sends selected agent samples to a paid external API, so the main risk is data-sharing awareness rather than hidden or malicious behavior.
    LLM: benign (high) · VirusTotal: · 29 мая 2026 г.