Как поднять локальную модель с глазами за один вечер — и не поссориться с видеокартой
Ставим Ollama, выбираем модель под 8 ГБ VRAM и отправляем ей первую картинку.
Нам не нужен серверный шкаф, диплом математика и ритуальная установка семнадцати версий CUDA. Нужны Windows, Ollama, свободное место и готовность не скачивать модель размером с твою самооценку.
Шаг 1. Проверь железо
Главная цифра — видеопамять, или VRAM. Для ноутбучной RTX 4060 это обычно 8 ГБ. Начни с модели на 4 миллиарда параметров в сжатой версии. Модель 8B иногда помещается, но длинный разговор и картинки быстро съедают свободную память.
Шаг 2. Поставь Ollama
Установи Ollama для Windows и убедись, что команда отвечает в терминале. Затем скачай Qwen3-VL 4B — она понимает текст и изображения.
ollama pull qwen3-vl:4b-instruct
ollama run qwen3-vl:4b-instructШаг 3. Не корми модель фото размером с билборд
Перед анализом уменьши длинную сторону изображения до 1024–1280 пикселей. На нашем тесте полный кадр не уложился в три минуты, а уменьшенная копия дала ответ примерно за сто секунд.
Шаг 4. Говори конкретно
Плохой запрос: «что тут?». Нормальный: «перечисли видимые объекты, прочитай текст, отметь сомнительные детали и не додумывай невидимое». Модель не становится умнее, но получает понятную работу.