Компания Google анонсировала Agentic Vision — новую функцию для Gemini, которая позволяет модели не просто «смотреть» на изображение, а работать с ним: приближать детали, вырезать фрагменты и перепроверять выводы на основе того, что реально видно.

Функция уже доступна разработчикам через Gemini API в Google AI Studio и Vertex AI. В приложении Gemini инструмент Agentic Vision начинает появляться при выборе режима «Thinking» — раскатка идёт постепенно. Подробности в материале Postium.

Реклама. Erid 2Vtzqw9oHvr. ООО «Клик.ру». Промопульт
Реклама. Erid 2Vtzqve9YHx. ООО «Клик.ру». Промопульт

Читайте также: Нейросети для распознавания текста на фото

Agentic Vision в Gemini — что это и как работает

Agentic Vision меняет сам подход к визуальному анализу. Вместо одного прохода по изображению модель действует итеративно: формирует план, выполняет действие над визуальным входом и снова анализирует результат.

Agentic Vision в Gemini — что это и как работает

В роли «действий» используется выполнение кода — Gemini может сама сгенерировать Python-код, чтобы приблизить участок картинки, обрезать его, повернуть, разметить, посчитать объекты или извлечь данные, а затем уже выдать ответ.

Ключевая идея — не догадываться, а проверять. Если на изображении есть мелкие цифры, подписи или плотные таблицы, модель сначала приближает нужный участок и только потом делает вывод.

Раньше мультимодальные модели часто ошибались на мелких деталях и сложных визуальных данных, потому что «смотрели» на изображение целиком. Agentic Vision добавляет промежуточные шаги и вычисления, из-за чего ответы становятся более проверяемыми.

Как пользоваться

Разработчикам нужно включить инструмент Code Execution в AI Studio или использовать API через Vertex AI — после этого нейросеть сможет сама выполнять визуальные операции.

В приложении Gemini функция доступна через выбор модели и режим «Thinking», без дополнительных настроек.

Почему это важно? Agentic Vision — это шаг от «угадывания» к более точному анализу изображений. В задачах, где ошибка в одной цифре влияет на результат — документы, схемы, таблицы, визуальная математика, — возможность приблизить и пересчитать важнее красивого, но неточного ответа.

Таким образом, Google учит ИИ-модель не просто принимать информацию, а активно искать недостающие фрагменты внутри предоставленных файлов, конкурируя с решениями от OpenAI и Anthropic в точности «зрения».

Итог: Gemini получила «активное зрение»: модель теперь сама приближает, обрабатывает и проверяет изображения, что делает анализ визуальных данных заметно точнее.

⭐ Наш Telegram-канал, где мы показываем, как применять ИИ в работе: промты, кейсы, гайды и рабочие схемы. Подписывайтесь → «Промты — и точка».

⭐ Наш Telegram-канал, где мы показываем, как применять ИИ в работе: промты, кейсы, гайды и рабочие схемы. Подписывайтесь → «Промты — и точка».

Комментарии: Google представила Agentic Vision — Gemini научилась «зумить» изображения для точного анализа
⚡ В тренде
YouTube стал источником хорошего дохода для блогеров. Больше всех зарабатывают лидеры по количеству подписчиков. Рассказываем, как они пришли к этому успеху, это важно знать, даже если вы начинаете канал с нуля. Это рейтинг самых популярных ютуберов мира по числу подписчиков. В 2026 году в верхней части списка всё больше индийских каналов, а рядом с ними […]
Gemini Notebook — нейросеть Google для работы с документами, сайтами, видео и другими источниками. Раньше сервис назывался NotebookLM, но в 2026 году Google переименовала его в Gemini Notebook. В сервис можно загружать свои материалы, задавать по ним вопросы, получать ответы со ссылками на источники, делать аудио- и видеопересказы, презентации, инфографику, карточки и тесты. В статье […]
В России есть и крупные бренды одежды с десятками и сотнями магазинов, и небольшие дизайнерские марки. Они конкурируют ассортиментом, ценой и стилем, а для продвижения используют соцсети, коллаборации, работу с блогерами и собственные форматы магазинов. В этой статье — топ-10 популярных российских брендов одежды для женщин и мужчин. Рассказываем, что они выпускают, чем отличаются и […]
OpenAI выпустила GPT-6 Astra. Модель умеет искать информацию, работать в браузере и приложениях, разбирать файлы, писать и проверять код, а затем доводить работу до результата. Astra может взять на себя заметную часть задачи и выполнить несколько связанных этапов. Ниже разберём, где Astra уже доступна и как её использовать в ChatGPT, Codex и через API. Заодно […]
Xiaomi представила Mini Twin-Tub Washer-Dryer — компактную стирально-сушильную машину шириной 60 см с двумя полностью независимыми барабанами. Каждый барабан рассчитан на 2,5 кг белья при стирке и 1,5 кг при сушке. В машине можно одновременно стирать разные категории вещей — например, нижнее бельё и повседневную одежду. Новинка уже доступна для предзаказа в Китае за 3499 […]
Блоги компаний
Новости
Свежие статьи