AC conjoint-diagnostics
Анализирует существующее конджойнт-исследование на предмет угроз для выводов и возвращает приоритетные результаты по пяти областям — целостность дизайна (атрибуты, ограничения профиля, количество задач и удовлетворенность, рандомизация, мощность), оценка (ясность оцениваемой величины, референтные уровни, подгруппы, кластерные стандартные ошибки, множественное тестирование), ошибка измерения, внешняя валидность и поведенческий бенчмаркинг, а также интерпретация, включая защиту от интерпретации AMCE как большинства предпочтений. Используйте, когда пользователь спрашивает, выдерживает ли конджойнт-дизайн или анализ, имеет ли комментарии рецензента по конджойнту или хочет получить второе мнение о выборе оценки и интерпретации. Создание дизайна с нуля направляется в conjoint-design, переработка данных — в conjoint-cleaning.
машинный переводПоказать оригиналСкрыть оригинал«Reviews an existing conjoint study for threats to inference and return…»
Reviews an existing conjoint study for threats to inference and returns prioritized findings across five areas — design integrity (attributes, profile restrictions, task count and satisficing, randomization, power), estimation (estimand clarity, reference levels, subgroups, clustered standard errors, multiple testing), measurement error, external validity and behavioral benchmarking, and interpretation, including the guard-rail against reading an AMCE as a majority preference. Use when the user asks whether a conjoint design or analysis holds up, has referee comments on a conjoint, or wants a second opinion on estimation and interpretation choices. Building a design from scratch goes to conjoint-design, reshaping the data to conjoint-cleaning.
Анализирует существующее конджойнт-исследование на предмет угроз для выводов и возвращает приоритетные результаты по пяти областям — целостность дизайна…
Как процесс C 58/100 · Есть пробелы — слабые места: результат и критерий готовности, входы и предусловия, отчётность по ходу
Как улучшить
- Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
- spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.
Находки guard · 0
✓ Критических и высоких находок нет
Просканировано файлов: 3. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.
По спецификации Agent Skills
✓ По спецификации Agent Skills замечаний нет
Процессный рейтинг: все десять параметров 58/100
- 0Результат и критерий готовности. Не сказано, что считать результатом
- 0Входы и предусловия. Не сказано, что нужно иметь на входе
- 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
- 60Инструменты и файлы. Используются инструменты (bash), но во frontmatter они не объявлены
- 60Ошибки и развилки. Развилок: 2
- 70Когда включается. Сказано, когда применять, но не сказано, когда не стоит
- 100Шаги. Шагов: 78
- 100Согласованность. Имя и обязательные поля на месте
- 100Стоимость исполнения. Тело инструкции 3578 токенов
- 100Повторный запуск. Изменяющие операции проверяют текущее состояние
Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.
Сигналы качества
- +5В description нет примеров фраз, по которым скилл должен срабатывать
- +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
- +3Формат ответа не описан: модель каждый раз решает сама
- +1Лицензия не указана
- +2Инструкции на одном языке
- +3Длина description 753 символов: достаточно сигнала, не съедает бюджет
- +4Структура: 28 заголовков
- +3Пошаговые инструкции: 78 пунктов
- +4Есть примеры (0 блоков кода)
- +4Справочные файлы упоминаются в инструкциях (1 из 1)
База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 88.