• Виктор
  • Блог
  • 3 мин. чтения

DeepSeek тестирует режим «Распознавание» изображений


В интерфейсе чат-бота DeepSeek появился новый режим «Распознавание» — рядом с режимами «Быстрый» и «Эксперт». В этом режиме можно загрузить и проанализировать изображения: описать сцену или объект, распознать текст на фото, разобрать интерфейс или скриншот, и прочее.

Сейчас функция доступна в тестовом режиме в веб-версии и мобильном приложении DeepSeek после обновления. Компания публично запуск пока не анонсировала. Детали в материале Postium.

«Распознавание» изображений в DeepSeek — что и как работает

«Распознавание» в DeepSeek — это режим понимания изображений внутри чат-бота. Он добавляет в обычный чат работу с визуальными данными: пользователь может загрузить фотографию, документ, таблицу, скриншот или изображение сайта, а модель анализирует содержимое и отвечает по нему.

Режим умеет распознавать текст на изображениях, разбирать интерфейсы и структурированные данные, описывать сцены и объекты, а также работать с документами и таблицами прямо в диалоге. Можно загрузить загрузить до 50 документов или изображений, до 100 МБ каждый.

Как распознать текст на фото с помощью DeepSeek

Если режим появился в аккаунте, выберите «Распознавание» рядом с «Быстрым» и «Экспертом». После этого загрузите изображение в чат через иконку скрепки.

Дальше напишите, что нужно сделать. Например: «Распознай текст на фото и пришли его в ответе». DeepSeek проанализирует изображение и вернёт текст прямо в чате.

В режиме глубокого мышления можно давать более сложные задачи. Например: сначала попросить модель описать картинку, а затем — написать промт для генерации похожего изображения.

Ещё один пример запроса: «Проанализируй скриншот интерфейса и напиши HTML-код для похожей страницы».

Если режима нет, включить его вручную пока нельзя. Доступ зависит от тестирования.

Почему это важно? Новый режим закрывает задачи, где пользователю проще показать изображение, чем писать запрос с нуля. Это может быть скриншот интерфейса, таблица, документ, страница сайта или фотография.

Для DeepSeek это ещё один шаг в сторону мультимодального чат-бота. Сервис начинает работать не только с текстом, но и с визуальными данными внутри одного диалога.

Ранее компания выпустила ИИ-модели линейки DeepSeek-V4. В неё вошли две MoE-модели: V4-Pro с 1,6 трлн параметров и V4-Flash с 284 млрд параметров.

Итог: DeepSeek начал открывать доступ к новому режиму «Распознавание», который добавляет в чат анализ изображений, документов, таблиц и интерфейсов.



Источник

Где попробовать
Claude, GPT, Gemini и ещё 300 моделей — в одном окне
Умка даёт доступ к нейросетям на русском и за рубли: без VPN и зарубежных карт. Текст, картинки, видео и музыка — в одном интерфейсе. На пробу 60 токенов, карта не нужна.
Открыть Умку бесплатно
Межтекстовые Отзывы
Посмотреть все комментарии
guest

ImagineArt запустила Ads Studio для генерации UGC-рекламы из ссылки на продукт

ImagineArt запустила Ads Studio - инструмент для генерации рекламных роликов из ссылки на товар. Сервис собирает UGC-видео, ролики...

YouTube позволит генерировать Shorts с помощью Veo 3

На мероприятии «Made on YouTube» 16 сентября компания представила большое обновление для Shorts и YouTube Studio. В сервис...

Гайд по размерам для YouTube: шапка канала, обложка видео, Shorts, аватар, лого

Если вы загружаете ролики на YouTube и оформляете канал, размеры лучше определить заранее. Иначе шапка обрежется на смартфоне,...

Сбой в xAI заставил чат-бот Grok выдавать пользователям бессвязный текст

Необычный сбой привёл к тому, что чат-бот Grok компании xAI начал выдавать многим пользователям бессвязный текст. После просьбы...

Промты для коллажей — как сделать коллаж по фото с помощью ИИ

Хотите красивые фоточки для соцсетей, но без одинаковых селфи? Держите 5 промтов для трендовых коллажей: неон ночью, дождь...

OpenAI выпустила ChatGPT Images 2.5 — генерация стала быстрее, а изображения можно точечно доработать

OpenAI выпустила ChatGPT Images 2.5 — обновлённую модель для генерации и редактирования изображений в ChatGPT. Компания заявляет, что...

История Starbucks: кто основал компанию, как появился логотип и кому принадлежит бренд

Сегодня Starbucks — одна из самых узнаваемых кофейных сетей мира: зелёную сирену знают даже те, кто ни разу...

DeepSeek API: как получить ключ, как пользоваться бесплатно, как оплатить из России

DeepSeek API – это облачный сервис, который позволяет подключать ИИ-модели к внешним проектам. С его помощью можно интегрировать...

OpenAI представила обновлённый ChatGPT Images: до 4× быстрее и с новым творческим пространством

OpenAI выпустила обновлённую функцию ChatGPT Images - новый встроенный генератор изображений, который стал быстрее, точнее и удобнее для...

Как пользоваться QwenWork: регистрация, возможности, бесплатные кредиты и тарифы

QwenWork — это новый ИИ-агент от Alibaba, который доступен на сайте и через отдельное приложение. По принципу работы...

Razer выпустила одноручный кейпад Tartarus V2 Pro

Razer начала продажи Tartarus V2 Pro — одноручного игрового кейпада с 31 программируемым элементом управления. Устройство рассчитано на...

DeepSeek представила DeepSeek-OCR — новую модель для сжатия визуального контекста в LLM

Компания DeepSeek показала DeepSeek-OCR — OCR-модель, созданную специально для больших языковых моделей. Вместо обычного распознавания текста она сжимает...

adidas и Arte Antwerp выпустят две новые версии F50 Motion

adidas и бельгийский бренд Arte Antwerp представили две новые версии кроссовок F50 Motion — лакированную чёрную и серебристую....

OpenAI выпустила GPT Image 2 и ChatGPT Images 2.0

OpenAI представила GPT Image 2 для API и одновременно обновила генерацию изображений в ChatGPT до версии Images 2.0....

ElevenLabs выпустила Music v2.5 с улучшенным звуком и точным следованием запросу

ElevenLabs представила Music v2.5 — новую версию модели для генерации музыки. Она создаёт более многослойные композиции, точнее следует...

Tencent выпустила Hy Image 3.5 Preview для генерации и редактирования изображений

Tencent открыла доступ к Hy Image 3.5 Preview — модели, которая создаёт изображения по тексту и референсам, а...

DeepSeek выпустила Harness v0.2 — приложение для macOS и Windows

У ИИ-агента DeepSeek Harness появилась настольная версия. Теперь его можно установить как обычную программу и поручать ему работу...

Sora 2 увеличила длину видео до 25 секунд и позволила прописывать сценарий по кадрам

Компания OpenAI обновила видеогенератор «Sora 2»: базовые пользователи теперь могут создавать ролики до 15 секунд, а подписчики «ChatGPT...

OpenAI выпустила GPT-6 Sol и Luna и вдвое снизила цены

OpenAI выпустила GPT-6 Sol и GPT-6 Luna, среднюю и младшую модели поколения GPT-6. Они построены на наработках флагманской...

Qwen выпустила плагины Qwen-MM для мультимодальных ИИ-агентов

Команда Qwen опубликовала Qwen-MM-Plugins — набор открытых плагинов для работы ИИ-агентов с изображениями, видео и документами. Репозиторий поддерживает...