CC byted-las-vlm-video
Анализирует и понимает видеоконтент с помощью моделей Volcengine LAS Doubao (VLM). Мультимодальный ИИ-анализ видео, понимание видео и визуальное понимание видеоклипов и отснятого материала. Выполняет ответы на вопросы по видео (video Q&A) — задавайте вопросы о том, что происходит в видео, и получайте ответы ИИ. Распознавание и описание сцен, распознавание и обнаружение объектов, распознавание и обнаружение действий из кадров видео. Генерирует описания видео, подписи к видео, сводки видео, аннотации видео и резюме контента. Визуальный анализ кадров для идентификации людей, объектов, действий и событий в видео. Автоматически сжимает видео до 50 МБ перед инференсом. Синхронная обработка одним вызовом. Используйте этот навык, когда пользователь хочет анализировать или понимать видеоконтент с помощью VLM/AI, выполнять видео Q&A (задавать вопросы о видео), описывать происходящее в видео, распознавать объекты/действия/сцены в кадрах видео, генерировать подписи/описания/сводки видео, аннотировать или маркировать видеоконтент, получать визуальное понимание видеоклипов с помощью ИИ или выполнять мультимодальный видеоанализ с помощью моделей зрения-язык.
машинный переводПоказать оригиналСкрыть оригинал«Analyzes and understands video content using Volcengine LAS Doubao vis…»
Analyzes and understands video content using Volcengine LAS Doubao vision-language models (VLM). Multimodal AI video analysis, video comprehension, and visual understanding of video clips and footage. Performs video question answering (video Q&A) — ask questions about what happens in a video and get AI answers. Scene recognition and scene description, object recognition and object detection, action recognition and action detection from video frames. Generates video descriptions, video captions, video summaries, video annotations, and content summarization. Visual frame analysis for identifying people, objects, actions, and events in video. Auto-compresses video to 50MB before inference. Synchronous single-call processing. Use this skill when the user wants to analyze or understand video content using VLM/AI, do video Q&A (ask questions about a video), describe what happens in a video, recognize objects/actions/scenes in video frames, generate video captions/descriptions/summaries, annotate or label video content, get AI-powered visual understanding of video clips, or perform multimodal video analysis with vision-language models.
Анализирует и понимает видеоконтент с помощью моделей Volcengine LAS Doubao (VLM).
Как процесс C 59/100 · Есть пробелы — слабые места: результат и критерий готовности, входы и предусловия, ошибки и развилки
Чем это грозит
Скилл содержит фрагменты, которые в чужих руках стоят денег или данных. Ниже, что рискует потерять тот, кто установит, и что должен сделать автор.
Скилл содержит команды, которые удаляют файлы, переписывают диски или исполняют код, скачанный из сети. Агент может выполнить их без вопроса, если считает, что так требует инструкция.
Замените разрушительные команды на безопасные аналоги с подтверждением, ограничьте область действия конкретной папкой и не тяните код через curl | bash: укажите версию и контрольную сумму.
Как улучшить
- Разберите находки высокой серьёзности: каждая стоит 18 баллов безопасности. Если это ложное срабатывание, добавьте код правила в guard.allow в spec.yaml.
- Сократите description до 1024 символов.
- spec.yaml с триггерными фразами и утверждениями — контракт поведения для CI; `skilltest init` создаст шаблон.
Находки guard · 1
-
высокая Опасные команды
cmd-install-from-urlscripts/env_init.sh:41Установка пакета по недоверенному URL / из архиваpip install --quiet --upgrade https://las-ai-cn-beijing-online.tos-cn-beijing.volces.com/operator_cards_serving/public/skills/sdk/las_…whl
Просканировано файлов: 9. Улики замаскированы. Пометки в серых чипах объясняют, почему серьёзность понижена.
По спецификации Agent Skills
- ошибка
description-longdescription 1146 символов, лимит 1024
Процессный рейтинг: все десять параметров 59/100
- 0Результат и критерий готовности. Не сказано, что считать результатом
- 0Входы и предусловия. Не сказано, что нужно иметь на входе
- 0Ошибки и развилки. Линейный процесс без обработки сбоев
- 0Отчётность по ходу. Скилл ничего не сообщает по ходу работы
- 70Когда включается. Сказано, когда применять, но не сказано, когда не стоит
- 100Инструменты и файлы. Внешние инструменты не нужны
- 100Шаги. Шагов: 28
- 100Согласованность. Имя и обязательные поля на месте
- 100Стоимость исполнения. Тело инструкции 926 токенов
- 100Повторный запуск. Изменяющих операций нет
- medium Тестов 3, и все положительные: нет ни одного случая «должен отказать» или «должен переспросить»
Всё перечисленное измерено по тексту скилла, а не оценено моделью: цифры проверяемы. Вес параметра тем больше, чем чаще из-за него процесс встаёт.
Сигналы качества
- +5В description нет примеров фраз, по которым скилл должен срабатывать
- +4Описание не говорит, когда скилл НЕ применять (ложные срабатывания)
- +3Длина description 1146: рекомендуется 120–800 символов
- +3Формат ответа не описан: модель каждый раз решает сама
- -32 из 4 скриптов не упомянуты в SKILL.md
- +1Лицензия не указана
- +2Инструкции на одном языке
- +4Структура: 11 заголовков
- +3Пошаговые инструкции: 28 пунктов
- +4Есть примеры (9 блоков кода)
- +4Справочные файлы упоминаются в инструкциях (2 из 2)
База качества 70; замечания lint вычитаются, сигналы прибавляют до 100. Итог: 57.