Qwen выпустил мультимодальный tool layer для AI-агентов
Идея в том, чтобы мультимодальные возможности подключались к агенту как набор инструментов, а не были жёстко зашиты в конкретную модель.
Агент, запущенный внутри Claude Code, Codex, Qwen Code, Gemini CLI или другого harness, может сам обнаружить нужный capability, вызвать его и встроить результат в более длинный workflow.
GitHub-репозиторий при этом устроен как коллекция отдельных plugins/capabilities.
Например, базовый плагин даёт агенту инструменты вроде:
- read_image
- read_video
- visualize
- OCR
- object grounding
- segmentation
- speech transcription
- cropping
То есть вместо схемы:
агент → одна мультимодальная модель
получается:
агент → набор специализированных multimodal tools → цепочка действий
Например, агент может:
1. прочитать изображение;
2. найти нужный объект;
3. вырезать конкретную область;
4. прогнать OCR;
5. сопоставить результат с видео;
6. транскрибировать аудио;
7. собрать всё в единый ответ.
https://github.com/QwenLM/Qwen-MM-Plugins