AB critical-thinking
Используйте этот навык, когда пользователь запрашивает критическое мышление (включая его название или указание на использование/применение/запуск с очевидными опечатками; решительность) или хочет оценить утверждение, аргумент, план или убеждение: уточняйте утверждения, взвешивайте доказательства, выявляйте предположения, проверяйте рассуждения на наличие пробелов или ошибок, сканируйте на предвзятость, рассматривайте альтернативы и тщательно проверяйте выводы — независимо от того, сформулировано ли это просто («красная команда», «адвокат дьявола», «что я упускаю», стальной/соломенный человек, сканирование на предвзятость) или косвенно (обзор качества решений, эпистемическая калибровка). Пропускайте для задач, ориентированных только на выполнение, без оценочного аспекта, или когда требуется только формулировка, тон, макет или мозговой штурм без запроса на проверку причин, предположений или доказательств.
машинный переводПоказать оригиналСкрыть оригинал«Use this skill when the user asks for critical thinking (including nam…»
Use this skill when the user asks for critical thinking (including naming it or directing use/apply/run with obvious misspellings; decisive) or wants to evaluate a claim, argument, plan, or belief: clarify assertions, weigh evidence, surface assumptions, test reasoning for gaps or fallacies, scan biases, consider alternatives, and stress-test conclusions—whether they phrase it plainly ("red team", "devil's advocate", "what am I missing", steel/straw man, bias scan) or indirectly (decision-quality review, epistemic calibration). Skip for execution-only tasks with no evaluative angle, or when they only want wording, tone, layout, or open-ended brainstorming with no request to audit reasons, assumptions, or evidence.
Используйте этот навык, когда пользователь запрашивает критическое мышление (включая его название или указание на использование/применение/запуск с очевидными…
Как процесс B 68/100 · Почти готов — слабые места: результат и критерий готовности, входы и предусловия, отчётность по ходу
Как улучшить
- Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
- spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.
Находки guard · 1
✓ Критических и высоких находок нет
Средние и низкие: 1
-
низкая Рискованное назначение
intent-offensive-securitySKILL.md:9Наступательная безопасность / двойное назначение (допустимо для авторизованного тестирования; проверьте назначение) (в кавычках — упоминание, а не команда)plainly ("red team", "devil's advocate", "what am I missing", steel/strawв кавычках
Просканировано файлов: 2. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.
По спецификации Agent Skills
✓ По спецификации Agent Skills замечаний нет
Процессный рейтинг: все десять параметров 68/100
- 0Входы и предусловия. Не сказано, что нужно иметь на входе
- 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
- 40Результат и критерий готовности. Не сказано, что считать результатом
- 55Ошибки и развилки. Развилок: 1
- 70Когда включается. Сказано, когда применять, но не сказано, когда не стоит
- 85Шаги. Шагов: 19, расплывчатых формулировок: 1
- 100Инструменты и файлы. Внешние инструменты не нужны
- 100Согласованность. Имя и обязательные поля на месте
- 100Стоимость исполнения. Тело инструкции 1189 токенов
- 100Повторный запуск. Изменяющих операций нет
Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.
Сигналы качества
- +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
- +3Формат ответа не описан: модель каждый раз решает сама
- +4Нет примеров входа/выхода
- +2Инструкции на одном языке
- +5В description 3 примера фраз-триггеров в кавычках
- +3Длина description 723 символов: достаточно сигнала, не съедает бюджет
- +4Структура: 11 заголовков
- +3Пошаговые инструкции: 19 пунктов
- +1Лицензия указана
База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 86.