AC cogdx-calibration
Проведите аудит калибровки выходных данных ИИ-агента через API Cerebratech CogDx (0,05 доллара США за вызов, принимаются кредиты). Используйте, когда заявленная уверенность агента не соответствует фактической точности, когда последующие системы должны доверять оценкам неопределенности агента, при подготовке к развертыванию в критически важных сценариях или после обнаружения закономерностей чрезмерной или недостаточной уверенности. Использует чистые статистические методы (Brier scores, calibration curves) — без LLM на бэкенде. Активируется по фразам вроде «audit my calibration», «check my confidence», «am I overconfident», «calibration gap», «confidence accuracy mismatch» или любому запросу на проверку соответствия заявленной неопределенности реальной точности. После выполнения используйте навык cogdx-feedback (БЕСПЛАТНО) для проверки переобучения и получения кредитов.
машинный переводПоказать оригиналСкрыть оригинал«Run a calibration audit on an AI agent's outputs via Cerebratech CogDx…»
Run a calibration audit on an AI agent's outputs via Cerebratech CogDx API ($0.05 per call, credits accepted). Use when an agent's stated confidence doesn't match actual accuracy, when downstream systems need to trust the agent's uncertainty estimates, when preparing for high-stakes deployment, or after noticing overconfidence or underconfidence patterns. Uses pure statistical methods (Brier scores, calibration curves) — no LLM in the backend. Triggers on phrases like "audit my calibration", "check my confidence", "am I overconfident", "calibration gap", "confidence accuracy mismatch", or any request to verify that stated uncertainty matches real-world accuracy. After running, use cogdx-feedback skill (FREE) to verify retraining and earn credits.
Проведите аудит калибровки выходных данных ИИ-агента через API Cerebratech CogDx (0,05 доллара США за вызов, принимаются кредиты).
Как процесс C 61/100 · Есть пробелы — слабые места: входы и предусловия, ошибки и развилки, отчётность по ходу
Как улучшить
- Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
- spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.
Находки guard · 0
✓ Критических и высоких находок нет
Просканировано файлов: 3. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.
По спецификации Agent Skills
- заметка
frontmatter-keyнеизвестное поле фронтматтера "repository"
Процессный рейтинг: все десять параметров 61/100
- 0Входы и предусловия. Не сказано, что нужно иметь на входе
- 0Ошибки и развилки. Линейный процесс без обработки сбоев
- 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
- 60Инструменты и файлы. Используются инструменты (bash, web), но во frontmatter они не объявлены
- 60Результат и критерий готовности. Формат результата описан, критерия завершения нет
- 70Когда включается. Сказано, когда применять, но не сказано, когда не стоит
- 100Шаги. Шагов: 10
- 100Согласованность. Имя и обязательные поля на месте
- 100Стоимость исполнения. Тело инструкции 589 токенов
- 100Повторный запуск. Изменяющие операции проверяют текущее состояние
Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.
Сигналы качества
- +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
- +2Инструкции на одном языке
- +5В description 5 примера фраз-триггеров в кавычках
- +3Длина description 756 символов: достаточно сигнала, не съедает бюджет
- +4Структура: 7 заголовков
- +3Пошаговые инструкции: 10 пунктов
- +3Формат ответа описан явно
- +4Есть примеры (4 блоков кода)
- +4Справочные файлы упоминаются в инструкциях (1 из 1)
- +1Лицензия указана
База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 96.