• Виктор
  • Блог
  • 3 мин. чтения

DeepSeek тестирует режим «Распознавание» изображений


В интерфейсе чат-бота DeepSeek появился новый режим «Распознавание» — рядом с режимами «Быстрый» и «Эксперт». В этом режиме можно загрузить и проанализировать изображения: описать сцену или объект, распознать текст на фото, разобрать интерфейс или скриншот, и прочее.

Сейчас функция доступна в тестовом режиме в веб-версии и мобильном приложении DeepSeek после обновления. Компания публично запуск пока не анонсировала. Детали в материале Postium.

«Распознавание» изображений в DeepSeek — что и как работает

«Распознавание» в DeepSeek — это режим понимания изображений внутри чат-бота. Он добавляет в обычный чат работу с визуальными данными: пользователь может загрузить фотографию, документ, таблицу, скриншот или изображение сайта, а модель анализирует содержимое и отвечает по нему.

Режим умеет распознавать текст на изображениях, разбирать интерфейсы и структурированные данные, описывать сцены и объекты, а также работать с документами и таблицами прямо в диалоге. Можно загрузить загрузить до 50 документов или изображений, до 100 МБ каждый.

Как распознать текст на фото с помощью DeepSeek

Если режим появился в аккаунте, выберите «Распознавание» рядом с «Быстрым» и «Экспертом». После этого загрузите изображение в чат через иконку скрепки.

Дальше напишите, что нужно сделать. Например: «Распознай текст на фото и пришли его в ответе». DeepSeek проанализирует изображение и вернёт текст прямо в чате.

В режиме глубокого мышления можно давать более сложные задачи. Например: сначала попросить модель описать картинку, а затем — написать промт для генерации похожего изображения.

Ещё один пример запроса: «Проанализируй скриншот интерфейса и напиши HTML-код для похожей страницы».

Если режима нет, включить его вручную пока нельзя. Доступ зависит от тестирования.

Почему это важно? Новый режим закрывает задачи, где пользователю проще показать изображение, чем писать запрос с нуля. Это может быть скриншот интерфейса, таблица, документ, страница сайта или фотография.

Для DeepSeek это ещё один шаг в сторону мультимодального чат-бота. Сервис начинает работать не только с текстом, но и с визуальными данными внутри одного диалога.

Ранее компания выпустила ИИ-модели линейки DeepSeek-V4. В неё вошли две MoE-модели: V4-Pro с 1,6 трлн параметров и V4-Flash с 284 млрд параметров.

Итог: DeepSeek начал открывать доступ к новому режиму «Распознавание», который добавляет в чат анализ изображений, документов, таблиц и интерфейсов.



Источник

Где попробовать
Claude, GPT, Gemini и ещё 300 моделей — в одном окне
Умка даёт доступ к нейросетям на русском и за рубли: без VPN и зарубежных карт. Текст, картинки, видео и музыка — в одном интерфейсе. На пробу 60 токенов, карта не нужна.
Открыть Умку бесплатно
Межтекстовые Отзывы
Посмотреть все комментарии
guest

OpenAI выпустила ChatGPT Images 2.5 — генерация стала быстрее, а изображения можно точечно доработать

OpenAI выпустила ChatGPT Images 2.5 — обновлённую модель для генерации и редактирования изображений в ChatGPT. Компания заявляет, что...

Alibaba выпустила Qwen-Image 2.1 с генерацией прозрачных изображений

Команда Qwen выпустила Qwen-Image 2.1 — модель для генерации и редактирования изображений. Веса опубликованы 20 сентября 2026 года...

Grok научился расшифровывать речь вдвое точнее и за те же деньги

SpaceXAI выпустила Grok Voice Transcribe 2.0, модель для перевода речи в текст. По внутренним тестам компании она вдвое...

Глава Microsoft AI назвал новые отчёты OpenAI серьёзной ситуацией

Мустафа Сулейман, глава Microsoft AI, назвал в эфире CNBC 18 сентября раскрытые OpenAI случаи странного поведения моделей «довольно...

Kling AI выпустила Skill для генерации видео через ИИ-агентов

Kling AI запустила Kling Skills Suite — инструмент, который подключается к сторонним AI-агентам и даёт им доступ к...

Яндекс сводит аналитику данных в одну платформу

Yandex B2B Tech анонсировала DataLens Platform, платформу для работы с корпоративными данными от загрузки и хранения до отчётов...

OpenAI интегрировала ChatGPT в Microsoft Word через общую офисную надстройку

OpenAI выпустила интеграцию ChatGPT для текстового редактора Microsoft Word. Инструмент встраивается в боковую панель программы и доступен на...

Razer выпустила одноручный кейпад Tartarus V2 Pro

Razer начала продажи Tartarus V2 Pro — одноручного игрового кейпада с 31 программируемым элементом управления. Устройство рассчитано на...

ElevenLabs представила Composer — редактор песен по секциям

ElevenLabs добавила Composer в сервис Eleven Music. Редактор позволяет начать песню с чистого листа, текстового запроса, собственных слов...

Portable Computer от Perplexity доехал до AMD

Perplexity открыла Portable Computer на Windows-компьютерах с процессорами AMD Ryzen AI Max. Подписчики сервиса запускают локальные ИИ-задачи и...

Krea AI представила Krea 2 – собственную модель для генерации изображений

Krea AI 12 мая 2026 года анонсировала Krea 2 — новую модель для генерации изображений. В ветке компания...

DeepSeek выпустила Harness v0.2 — приложение для macOS и Windows

У ИИ-агента DeepSeek Harness появилась настольная версия. Теперь его можно установить как обычную программу и поручать ему работу...

Runway выпустила Aleph 2.0: точечное ИИ-редактирование видео по одному кадру

Американская компания Runway представила Aleph 2.0 - крупное обновление своей ИИ-модели для точечного изменения видеоматериалов. Инструмент, встроенный в...

Google довела ролики Gemini Omni до сорока секунд и сделала черновики втрое дешевле

Gemini Omni 1.1 Flash научилась достраивать снятую сцену продолжениями и доводить ролик до сорока секунд, а перед чистовой...

Яндекс Люмен: что за подписка, сколько стоит, как подключить/отключить

«Яндекс Люмен» появился летом 2026 года. Сначала его запустили в Яндекс Музыке, затем добавили функции в Яндекс Книги....

DeepSeek API: как получить ключ, как пользоваться бесплатно, как оплатить из России

DeepSeek API – это облачный сервис, который позволяет подключать ИИ-модели к внешним проектам. С его помощью можно интегрировать...

OpenAI выпустила приложение Sora на Android — пока только в 7 странах

OpenAI представила Android-версию приложения Sora — инструмента для генерации коротких видео с помощью искусственного интеллекта. Скачать ИИ-генератор видео...

«Ёбидоёби» запустила коллаборацию с Atomic Heart

Служба доставки «Ёбидоёби» запустила коллаборацию с Atomic Heart. В меню появился одноимённый набор из 40 роллов в лимитированной...

ElevenLabs выпустила Music v2.5 с улучшенным звуком и точным следованием запросу

ElevenLabs представила Music v2.5 — новую версию модели для генерации музыки. Она создаёт более многослойные композиции, точнее следует...

YouTube позволит генерировать Shorts с помощью Veo 3

На мероприятии «Made on YouTube» 16 сентября компания представила большое обновление для Shorts и YouTube Studio. В сервис...