Qwen выпустил мультимодальный tool layer для AI-агентов

Идея в том, чтобы мультимодальные возможности подключались к агенту как набор инструментов, а не были жёстко зашиты в конкретную модель.

Агент, запущенный внутри Claude Code, Codex, Qwen Code, Gemini CLI или другого harness, может сам обнаружить нужный capability, вызвать его и встроить результат в более длинный workflow.

GitHub-репозиторий при этом устроен как коллекция отдельных plugins/capabilities.

Например, базовый плагин даёт агенту инструменты вроде:

- read_image

- read_video

- visualize

- OCR

- object grounding

- segmentation

- speech transcription

- cropping

То есть вместо схемы:

агент → одна мультимодальная модель

получается:

агент → набор специализированных multimodal tools → цепочка действий

Например, агент может:

1. прочитать изображение;

2. найти нужный объект;

3. вырезать конкретную область;

4. прогнать OCR;

5. сопоставить результат с видео;

6. транскрибировать аудио;

7. собрать всё в единый ответ.

https://github.com/QwenLM/Qwen-MM-Plugins

2