AC conjoint-diagnostics
Анализирует существующее конджойнт-исследование на предмет угроз для выводов и возвращает приоритетные результаты по целостности дизайна, оценке, ошибке измерения, внешней валидности и поведенческому бенчмаркингу, а также интерпретации. Охватывает атрибуты, ограничения, количество задач, удовлетворенность, рандомизацию, мощность, оцениваемые величины, референтные уровни, подгруппы, кластерные ошибки, множественное тестирование и защиту от интерпретации AMCE как большинства предпочтений. Используйте, когда пользователь спрашивает, выдерживает ли конджойнт-дизайн или анализ, имеет ли комментарии рецензента по конджойнту или хочет получить второе мнение об оценке или интерпретации. Новые дизайны направляются в conjoint-design, переработка — в conjoint-cleaning.
машинный переводПоказать оригиналСкрыть оригинал«Reviews an existing conjoint study for inferential threats and returns…»
Reviews an existing conjoint study for inferential threats and returns prioritized findings across design integrity, estimation, measurement error, external validity and behavioral benchmarking, and interpretation. Covers attributes, restrictions, task count, satisficing, randomization, power, estimands, reference levels, subgroups, clustered errors, multiple testing, and the guardrail against reading an AMCE as majority preference. Use when the user asks whether a conjoint design or analysis holds up, has referee comments on a conjoint, or wants a second opinion on estimation or interpretation. New designs go to conjoint-design, reshaping to conjoint-cleaning.
Анализирует существующее конджойнт-исследование на предмет угроз для выводов и возвращает приоритетные результаты по целостности дизайна, оценке, ошибке…
Как процесс C 58/100 · Есть пробелы — слабые места: результат и критерий готовности, входы и предусловия, отчётность по ходу
Как улучшить
- Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
- spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.
Находки guard · 0
✓ Критических и высоких находок нет
Просканировано файлов: 2. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.
По спецификации Agent Skills
✓ По спецификации Agent Skills замечаний нет
Процессный рейтинг: все десять параметров 58/100
- 0Результат и критерий готовности. Не сказано, что считать результатом
- 0Входы и предусловия. Не сказано, что нужно иметь на входе
- 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
- 60Инструменты и файлы. Используются инструменты (bash), но во frontmatter они не объявлены
- 60Ошибки и развилки. Развилок: 2
- 70Когда включается. Сказано, когда применять, но не сказано, когда не стоит
- 100Шаги. Шагов: 78
- 100Согласованность. Имя и обязательные поля на месте
- 100Стоимость исполнения. Тело инструкции 3577 токенов
- 100Повторный запуск. Изменяющие операции проверяют текущее состояние
Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.
Сигналы качества
- +5В description нет примеров фраз, по которым скилл должен срабатывать
- +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
- +3Формат ответа не описан: модель каждый раз решает сама
- +1Лицензия не указана
- +2Инструкции на одном языке
- +3Длина description 669 символов: достаточно сигнала, не съедает бюджет
- +4Структура: 28 заголовков
- +3Пошаговые инструкции: 78 пунктов
- +4Есть примеры (0 блоков кода)
- +4Справочные файлы упоминаются в инструкциях (1 из 1)
База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 88.