• Виктор
  • Блог
  • 2 мин. чтения

Qwen выпустила плагины Qwen-MM для мультимодальных ИИ-агентов


Команда Qwen опубликовала Qwen-MM-Plugins — набор открытых плагинов для работы ИИ-агентов с изображениями, видео и документами.

Репозиторий поддерживает Claude Code, Codex, Qoder, OpenClaw, Qwen Code и Gemini CLI. Код доступен по лицензии Apache-2.0. Подробнее в материале Postium.

Что умеют Qwen-MM-Plugins

Базовый пакет core умеет читать изображения, видео, документы и 3D-модели; в него входят OCR, поиск объектов на изображении, сегментация, расшифровка аудио и инструменты веб-поиска.

Отдельные пакеты добавляют память для длинных видео, генерацию и монтаж медиа, а также работу с Blender и FreeCAD. В репозитории есть шесть пакетов: core, video-memory, video-edit, blender, freecad и edu-agent. Последний предназначен для создания пошаговых обучающих материалов по математике и естественным наукам и работает как отдельный skill без MCP-сервера.

Плагины работают внутри уже используемой агентной среды. Каждый пакет подключается в виде skill и, при необходимости, MCP-сервера с дополнительными инструментами.

Как скачать и установить Qwen-MM-Plugins

Откройте репозиторий Qwen-MM-Plugins на GitHub и выберите нужный пакет. Для Claude Code, Codex, Qoder, OpenClaw, Qwen Code и Gemini CLI есть общий установщик install.sh. В ряде сред плагины также можно подключить вручную через встроенный механизм расширений или MCP.

После установки запустите проверку зависимостей. Для базового чтения изображений, видео и документов API-ключ не нужен, но отдельные функции — OCR, распознавание речи, генерация, веб-поиск и другие — требуют внешних API. Для работы с видео и аудио также нужен ffmpeg. Затем можно прикрепить файл к запросу в агенте и попросить, например, извлечь текст с изображения, разобрать видео или обработать документ.

Что это меняет? В одном репозитории собраны инструменты для OCR, видео, генерации медиа и 3D-задач, которые можно подключать к нескольким агентным средам. Поддержку конкретных моделей, работу отдельных функций и внешних API нужно проверять в реальных проектах.

Итог: мультимодальные функции Qwen-MM-Plugins подключаются к уже используемому агенту через отдельные пакеты, без замены самой агентной среды.



Источник

Где попробовать
Claude, GPT, Gemini и ещё 300 моделей — в одном окне
Умка даёт доступ к нейросетям на русском и за рубли: без VPN и зарубежных карт. Текст, картинки, видео и музыка — в одном интерфейсе. На пробу 60 токенов, карта не нужна.
Открыть Умку бесплатно
Межтекстовые Отзывы
Посмотреть все комментарии
guest

Поздравление с ИИ: что бесплатно, а что платно в 2026

Каждый раз, когда у кого-то из близких день рождения, встаёт один и тот же вопрос: написать обычное «с...

Suno вводит лимиты на скачивание — до 7 треков бесплатно

Suno объявила, что с 3 сентября введёт лимиты на скачивание созданной музыки. На бесплатном тарифе пользователи, зарегистрировавшиеся до...

ImagineArt запустила Ads Studio для генерации UGC-рекламы из ссылки на продукт

ImagineArt запустила Ads Studio - инструмент для генерации рекламных роликов из ссылки на товар. Сервис собирает UGC-видео, ролики...

Alibaba представила Qwen 3.8‑Max на 2,4 трлн параметров — открытые веса выйдут на следующей неделе

Alibaba представила Qwen3.8‑Max — новую флагманскую ИИ-модель с 2,4 трлн параметров. Сейчас она доступна в Qwen Studio и...

NotebookLM научился делать минутные вертикальные видео из документов

Google добавила в NotebookLM новый формат - Short Video Overviews. Сервис автоматически собирает из загруженных документов короткое вертикальное...

Krea открыла API для Krea 2 с переносом стиля и мудбордами

Krea открыла API для Krea 2 - своей первой базовой модели генерации изображений, обученной с нуля. Анонс опубликован...

DeepSeek выпустила Harness v0.2 — приложение для macOS и Windows

У ИИ-агента DeepSeek Harness появилась настольная версия. Теперь его можно установить как обычную программу и поручать ему работу...

ImagineArt показала модель 2.0

ImagineArt представила модель ImagineArt 2.0 и делает ставку на то, что в генерации изображений пользователям важен уже не...

MiniMax Hub добавил аудиомодели и готовые процессы для производства видео

MiniMax обновила творческую платформу MiniMax Hub. В ней появились аудиомодели ElevenLabs Music v2 и Seed Audio 1.0, готовые...

15 главных сериалов октября 2026 года, которые нельзя пропустить

Октябрь — самое время доставать плед, заваривать что-нибудь горячее и устраивать длинные вечера за просмотром сериалов. Тем более...

Pika запустила Relight Media для изменения света в фото и видео

Pika открыла Relight Media — приложение, которое меняет освещение в готовом фото или видеоролике. Пользователь загружает файл, выбирает...

DeepSeek представила DeepSeek-OCR — новую модель для сжатия визуального контекста в LLM

Компания DeepSeek показала DeepSeek-OCR — OCR-модель, созданную специально для больших языковых моделей. Вместо обычного распознавания текста она сжимает...

Обзор платформы lava.top

lava.top — это международная платформа для продажи контента, позволяющая создавать и продавать цифровые продукты без подключения дополнительных платежных...

ByteDance выпустила Seedream 4.0 — ИИ модель для генерации изображений, обгоняющую Nano Banana

ByteDance представила Seedream 4.0 — новую модель генерации и редактирования изображений, которая работает быстрее и стабильнее конкурентов. По...

Comfy MCP: ComfyUI подключает ИИ-агентов к своим пайплайнам генерации

Команда ComfyUI открыла публичную бету Comfy MCP - коннектор, через который ИИ-агенты вроде Claude, Codex, Cursor и Hermes...

Сверхработоспособный Qwen 3.7 Max. Китайский ИИ, который трудится 35 часов без остановки

Среди всего того, что Alibaba представила на своем облачном саммите в мае 2026 года, флагманская языковая модель Qwen...

Alibaba сообщила о падении прибыли на 75% из-за крупных инвестиций в ИИ-инфраструктуру

Китайский технологический гигант Alibaba в четверг сообщил о падении прибыли за последний квартал на 75% на фоне крупных...

Нейросеть Sora 2: как пользоваться, где взять инвайт, возможности, как скачать

OpenAI представила Sora 2 — новую версию своей видеомодели, которая автоматически генерирует короткие ролики со звуком и синхронной...

Лимиты использования в ChatGPT/Codex: где посмотреть и как сбросить

Даже на платных тарифах ChatGPT действуют лимиты на использование. Если они заканчиваются, сервис может прямо во время работы...

Veo 3.1 уже доступна на WaveSpeedAI — создаёт видео из текста и картинок

Платформа WaveSpeedAI представила интеграцию с новой моделью Google Veo 3.1 — одной из самых продвинутых ИИ-моделей для генерации...