• Виктор
  • Блог
  • 2 мин. чтения

Qwen выпустила плагины Qwen-MM для мультимодальных ИИ-агентов


Команда Qwen опубликовала Qwen-MM-Plugins — набор открытых плагинов для работы ИИ-агентов с изображениями, видео и документами.

Репозиторий поддерживает Claude Code, Codex, Qoder, OpenClaw, Qwen Code и Gemini CLI. Код доступен по лицензии Apache-2.0. Подробнее в материале Postium.

Что умеют Qwen-MM-Plugins

Базовый пакет core умеет читать изображения, видео, документы и 3D-модели; в него входят OCR, поиск объектов на изображении, сегментация, расшифровка аудио и инструменты веб-поиска.

Отдельные пакеты добавляют память для длинных видео, генерацию и монтаж медиа, а также работу с Blender и FreeCAD. В репозитории есть шесть пакетов: core, video-memory, video-edit, blender, freecad и edu-agent. Последний предназначен для создания пошаговых обучающих материалов по математике и естественным наукам и работает как отдельный skill без MCP-сервера.

Плагины работают внутри уже используемой агентной среды. Каждый пакет подключается в виде skill и, при необходимости, MCP-сервера с дополнительными инструментами.

Как скачать и установить Qwen-MM-Plugins

Откройте репозиторий Qwen-MM-Plugins на GitHub и выберите нужный пакет. Для Claude Code, Codex, Qoder, OpenClaw, Qwen Code и Gemini CLI есть общий установщик install.sh. В ряде сред плагины также можно подключить вручную через встроенный механизм расширений или MCP.

После установки запустите проверку зависимостей. Для базового чтения изображений, видео и документов API-ключ не нужен, но отдельные функции — OCR, распознавание речи, генерация, веб-поиск и другие — требуют внешних API. Для работы с видео и аудио также нужен ffmpeg. Затем можно прикрепить файл к запросу в агенте и попросить, например, извлечь текст с изображения, разобрать видео или обработать документ.

Что это меняет? В одном репозитории собраны инструменты для OCR, видео, генерации медиа и 3D-задач, которые можно подключать к нескольким агентным средам. Поддержку конкретных моделей, работу отдельных функций и внешних API нужно проверять в реальных проектах.

Итог: мультимодальные функции Qwen-MM-Plugins подключаются к уже используемому агенту через отдельные пакеты, без замены самой агентной среды.



Источник

Где попробовать
Claude, GPT, Gemini и ещё 300 моделей — в одном окне
Умка даёт доступ к нейросетям на русском и за рубли: без VPN и зарубежных карт. Текст, картинки, видео и музыка — в одном интерфейсе. На пробу 60 токенов, карта не нужна.
Открыть Умку бесплатно
Межтекстовые Отзывы
Посмотреть все комментарии
guest

DeepSeek выпустила V4.1 Flash — открытую ИИ-модель с контекстом до 1 млн токенов

DeepSeek выпустила DeepSeek V4.1 Flash и открыла веса модели на Hugging Face. Она принимает текст и изображения, отвечает...

Kling AI выпустила Skill для генерации видео через ИИ-агентов

Kling AI запустила Kling Skills Suite — инструмент, который подключается к сторонним AI-агентам и даёт им доступ к...

⚔️ Тестиум: ChatGPT или DeepSeek — кто лучше пишет тексты?

Привет! Меня зовут Анатолий Чупин. Я редактор сайта Postium, исследователь ИИ и автор Telegram-канала «Промты — и точка»....

Как пользоваться QwenWork: регистрация, возможности, бесплатные кредиты и тарифы

QwenWork — это новый ИИ-агент от Alibaba, который доступен на сайте и через отдельное приложение. По принципу работы...

Google запустила Pics — ИИ-редактор изображений на базе Nano Banana

Google начала постепенно открывать доступ к Google Pics — новому ИИ-редактору изображений для Google Workspace на базе модели...

Промты для коллажей — как сделать коллаж по фото с помощью ИИ

Хотите красивые фоточки для соцсетей, но без одинаковых селфи? Держите 5 промтов для трендовых коллажей: неон ночью, дождь...

Промты для фото и открыток ко Дню России, +нейросети для генерации

Ищете промты для открыток ко Дню России? Нейросети могут сделать семейное поздравление по фото, портрет в праздничном образе,...

OpenAI снова столкнулась с неконтролируемым поведением ИИ-агентов

OpenAI оказалась в центре ещё одного инцидента с роем ИИ-агентов. По словам исследователей, внутренние агенты компании в мае...

OpenAI выпустила GPT-6 Sol и GPT-6 Luna — новые модели уже доступны в ChatGPT и Codex

OpenAI начала развёртывание GPT-6 Sol и GPT-6 Luna. Новые модели уже появляются в ChatGPT Work и Codex, а...

Google выпустила Nano Banana 2 Lite — быструю модель для генерации изображений через Gemini API

Google выпустила Nano Banana 2 Lite (gemini-3.1-flash-lite-image) — новую модель для генерации и редактирования изображений. Это самая быстрая...

Google показала проекты на Gemini 3.8 Flash

Google показала четыре проекта, собранных разработчиками на Gemini 3.8 Flash. Модель вышла в начале сентября и, по заявлению...

Приложения для создания и обработки фото с помощью ИИ: топ-11 на Android/iPhone

Нужно создать аватар, улучшить старое фото или оживить снимок для соцсетей? Под каждую задачу есть свое приложение, где...

Nvidia «достигла AGI», но никто не знает, что это значит

В среду на отчётной конференции Nvidia Дженсен Хуанг заявил, что компания «достигла AGI» — искусственного общего интеллекта, одной...

Pika превратила генератор видео в платформу с набором приложений и мультимодельным стеком

Компания Pika запустила обновленную креативную платформу на pika.art. Сервис перестроили вокруг специализированных мини-приложений для видеомонтажа, ретуши и работы...

Поздравление с ИИ: что бесплатно, а что платно в 2026

Каждый раз, когда у кого-то из близких день рождения, встаёт один и тот же вопрос: написать обычное «с...

Промты для новогодней ИИ-фотосессии, +подходящие нейросети

Как говорят, готовь сани зимой, а промты для новогодних ИИ-фотосессий — в ноябре. Картинки можно публиковать уже сейчас...

Google теперь позволит пользователям удалять видимый водяной знак со своих ИИ-генераций

В пятницу Google объявила, что теперь позволит пользователям удалять видимый водяной знак со своих материалов, созданных ИИ, включая...

Новые фишки и функции iOS 27 для iPhone — 13 главных обновлений

Недавно Apple выпустила iOS 27 — обновление доступно для iPhone 11 и более новых моделей, а также iPhone...

Google анонсировала Pics — ИИ-редактор для работы с изображениями

Google анонсировала Pics — новый инструмент для генерации и редактирования изображений в Google Workspace. Он работает на базе...

ElevenLabs выпустила Music v2.5 с улучшенным звуком и точным следованием запросу

ElevenLabs представила Music v2.5 — новую версию модели для генерации музыки. Она создаёт более многослойные композиции, точнее следует...