BB impostor-hunt
Ищите самозванца в «завершенном» результате. Самозванец — это артефакт с правильным результатом, причинно-следственная связь которого НЕ соответствует требуемой пользователем цели — тестовый набор данных был утечкой, реализован только «счастливый путь», корреляция была перемаркирована как причина, файл конфигурации существует, но ни один путь кода его не читает, обертка ищет в stdout «OK», не проверяя код выхода, агент «может рефакторить» на основе одного выборочного примера. Вывод выглядит правильно. Логика, которая привела к «правильному» результату, является неправильной логикой. АВТОМАТИЧЕСКИЙ ЗАПУСК, когда ход объявляет о завершении И первоначальная цель пользователя может быть восстановлена из контекста. Сигналы завершения включают: «готово», «реализовано», «завершено», «теперь работает», «готово к слиянию», «все тесты пройдены», «задача выполнена», агент публикует сводку с галочками, описание PR, запись CHANGELOG или заключительное сообщение, утверждающее, что работа окончена. Первоначальная цель может быть восстановлена из: первого сообщения пользователя в ветке, текста проблемы/билета, заголовка и описания PR, сообщения коммита, открывшего ветку, заявленной цели README или явного запроса, который пользователь вставил в начале. Если присутствуют оба сигнала, запускайте без ожидания явного запроса. Также запускайте, когда пользователь явно просит проверить истинность завершения, обнаружить фальшивое завершение, проверить несоответствие скрытой цели, искать успех, обусловленный имитацией, утечку тестового набора, доставку только по «счастливой» траектории, корреляцию как причину, настроенные, но нечитаемые параметры, вывод журналов об успехе, но непроверенный код возврата, или подобные шаблоны. Триггеры на любом языке; отчет отражает язык пользователя. НЕ запускайте для обычной охоты за ошибками (направляйте в code-review), очистки стиля или рефакторинга (направляйте в simplify) или проверки поведения путем выполнения (направляйте в verify / run). НЕ запускайте, когда пользователь находится в процессе реализации и еще не объявил о завершении работы — прерывание текущей задачи аудитом завершения является шумом. НЕ запускайте, когда первоначальная цель не может быть восстановлена из контекста.
машинный переводПоказать оригиналСкрыть оригинал«Hunt the impostor in a "finished" deliverable. An impostor is a result…»
Hunt the impostor in a "finished" deliverable. An impostor is a result-correct artifact whose causal chain is NOT the one the user's purpose required — the test set leaked, only the happy path is wired, correlation got relabeled as cause, the config file exists but no code path reads it, the wrapper greps stdout for "OK" without checking the exit code, the agent "can refactor" backed by one cherry-picked example. The output looks right. The logic that produced "right" is the wrong logic. AUTO-INVOKE when a turn declares completion AND the user's original purpose is recoverable from context. Completion signals include: "done", "implemented", "finished", "works now", "ready to merge", "all tests pass", "task complete", "feature shipped", an agent posting a summary with checkmarks, a PR description, a CHANGELOG entry, or a closing message that asserts the work is over. Original purpose is recoverable from: the user's first message in the thread, the issue/ticket text, the PR title and description, the commit message that opened the branch, the README's stated goal, or an explicit prompt the user pasted at the start. If both signals are present, invoke without waiting for an explicit request. Also invoke when the user explicitly asks to audit completion truth, detect fake completion, check for hidden goal misalignment, look for mock-driven success, test-set leakage, happy-path-only delivery, correlation-as-causation, configured-but-unread settings, logs-say-success-but-return-code-unchecked, or similar patterns. Triggers in any language; the report mirrors the user's language. DO NOT invoke for ordinary bug hunting (route to code-review), style or refactor cleanup (route to simplify), or behavior-by-execution verification (route to verify / run). DO NOT invoke when the user is mid-implementation and has not yet declared the work done — interrupting an in-flight task with a completion audit is noise. DO NOT invoke when the original purpose is not recoverable from cont
Ищите самозванца в «завершенном» результате.
Как процесс B 75/100 · Почти готов — слабые места: входы и предусловия, повторный запуск, отчётность по ходу
Как улучшить
- Сократите description до 1024 символов.
- Свои кейсы (evals/evals.json, 4–6 реальных запросов с ожидаемыми ответами): тогда полная проверка прогонит именно их, а не черновик от модели.
- spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.
Находки guard · 0
✓ Критических и высоких находок нет
Просканировано файлов: 8. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.
По спецификации Agent Skills
- ошибка
description-longdescription 2043 символов, лимит 1024 - заметка
description-budgetdescription занимает 2043 из общего бюджета ~15000 символов на все скиллы
Процессный рейтинг: все десять параметров 75/100
- 0Входы и предусловия. Не сказано, что нужно иметь на входе
- 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
- 30Повторный запуск. Изменяющих операций: 6, без проверки текущего состояния
- 60Результат и критерий готовности. Формат результата описан, критерия завершения нет
- 70Когда включается. Сказано, когда применять, но не сказано, когда не стоит
- 100Инструменты и файлы. Внешние инструменты не нужны
- 100Шаги. Шагов: 38
- 100Ошибки и развилки. Развилок: 3, есть раздел про ошибки
- 100Согласованность. Имя и обязательные поля на месте
- 100Стоимость исполнения. Тело инструкции 2561 токенов
Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.
Сигналы качества
- +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
- +3Длина description 2042: рекомендуется 120–800 символов
- +1Лицензия не указана
- +2Инструкции на одном языке
- +5В description 9 примера фраз-триггеров в кавычках
- +4Структура: 22 заголовков
- +3Пошаговые инструкции: 38 пунктов
- +3Формат ответа описан явно
- +4Есть примеры (1 блоков кода)
- +4Справочные файлы упоминаются в инструкциях (6 из 6)
База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 65.