Текстовая модель получила глаза напрокат: как работает Vision Bridge в Qwen Code
Картинку разбирает vision-модель, а основной текстовый мозг получает её описание.
Не каждая хорошая модель умеет видеть. Qwen Code решил не менять мозг целиком, а просто позвать отдельную пару глаз.
Как устроен мост
Когда пользователь прикладывает изображение к текстовой модели, Qwen Code передаёт его другой модели, которая умеет видеть. Она описывает картинку словами, и уже это описание получает основной текстовый мозг.
Картинка не пересылается между разными компаниями автоматически. Но правила хранения данных выбранного сервиса всё равно стоит проверить.
Ограничения
Если основная модель уже поддерживает изображения, мост не нужен. В non-interactive и SDK-режимах функция по умолчанию недоступна — автоматизацию надо проверять отдельно.
Источник материалаQwen Code Weekly