• Виктор
  • Блог
  • 2 мин. чтения

DeepSeek выпустила V4.1 Flash — открытую ИИ-модель с контекстом до 1 млн токенов


DeepSeek выпустила DeepSeek V4.1 Flash и открыла веса модели на Hugging Face. Она принимает текст и изображения, отвечает текстом и поддерживает контекст до 1 млн токенов.

Главное отличие от DeepSeek V4 Flash — новая архитектура и более компактная память для длинных запросов. Глобальный KV-кэш занимает 890 байт на токен — примерно в четыре раза меньше, чем у предыдущей Flash-модели.

Нейросеть DeepSeek V4.1 Flash: что умеет и как работает

В основе модели — 552 млрд параметров. Дополнительно архитектура использует 196 млрд параметров Engram — отдельного механизма памяти, который обращается к данным разреженно. При обработке входных данных модель задействует 8 млрд параметров на токен, а при генерации ответа — 16 млрд. Такой подход сокращает вычисления: модель не использует всю сеть для каждого фрагмента запроса.

Архитектура состоит из 40 слоёв: 20-слойного causal encoder и 20-слойного decoder. Декодер получает уже подготовленные состояния из энкодера и не создаёт отдельный полный кэш на каждом слое. Дополнительное сжатие и повторное использование данных уменьшают расход памяти при работе с большими документами и длинными цепочками действий.

DeepSeek V4.1 Flash можно передавать текст и изображения в одном запросе, в том числе чередовать их внутри диалога. Модель анализирует визуальные и текстовые данные вместе, но выдаёт только текст.

Разработчики также добавили числовую настройку глубины рассуждения от 1 до 100. Чем выше значение, тем больше вычислений модель тратит на ответ. Параметр позволяет отдельно настраивать быстрые запросы и сложные задачи с инструментами.

Что показали тесты DeepSeek на бенчмарках

DeepSeek проверяла модель при максимальной глубине рассуждения (reasoning_effort=100) и контексте до 1 млн токенов. В DeepSWE v1.1 она решила 74,2% задач против 54,4% у DeepSeek V4 Flash. В Terminal-Bench 2.1 результат вырос с 82,7% до 90,6%.

Компания также сравнила разные оболочки для программирующих агентов. В DeepSWE v1.1 лучший результат модели составил 74,2% с mini-SWE-agent (выше, чем у Claude Opus 5 и GPT-5.6 Sol), а в Terminal-Bench 2.1 — 90,6% с минимальной оболочкой DeepSeek Harness.

Как получить доступ

Скачать веса DeepSeek V4.1 Flash и код для самостоятельного запуска можно на странице модели на Hugging Face. Репозиторий распространяется по лицензии MIT. Для запуска доступны инструкции для Transformers, vLLM, SGLang и Docker. Модель также доступна через API DeepSeek.

Ранее писали, что DeepSeek прокачала V4-Pro — она получила контекстное окно на 1 млн токенов, максимальный объём ответа до 384 тыс. токенов и управление глубиной рассуждений через API.

Источник / изображения: huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash



Источник

Где попробовать
Claude, GPT, Gemini и ещё 300 моделей — в одном окне
Умка даёт доступ к нейросетям на русском и за рубли: без VPN и зарубежных карт. Текст, картинки, видео и музыка — в одном интерфейсе. На пробу 60 токенов, карта не нужна.
Открыть Умку бесплатно
Межтекстовые Отзывы
Посмотреть все комментарии
guest

Стал известен размер экрана iPhone 20 Pro и Pro Max

В сети появились первые подробности об экранах iPhone 20 Pro и iPhone 20 Pro Max. По данным инсайдера...

OpenAI уберёт GPT-5.5 из ChatGPT и Codex 14 октября

OpenAI предупредила о завершении поддержки GPT-5.5 в ChatGPT, ChatGPT Work и Codex. Модель уберут из этих продуктов 14...

Нейросеть Veo 3.1: как пользоваться и создавать видео бесплатно

Google обновила свою модель для генерации видео — Veo 3.1, и теперь создание роликов со звуком и озвучкой...

ByteDance открыла публичный API Seedance 2.5

7 августа Volcano Engine открыла публичный API Seedance 2.5 - видеомодели ByteDance, которая одним проходом собирает 30-секундный ролик...

OpenAI интегрировала ChatGPT в Microsoft Word через общую офисную надстройку

OpenAI выпустила интеграцию ChatGPT для текстового редактора Microsoft Word. Инструмент встраивается в боковую панель программы и доступен на...

OpenAI выпустила GPT Image 2 и ChatGPT Images 2.0

OpenAI представила GPT Image 2 для API и одновременно обновила генерацию изображений в ChatGPT до версии Images 2.0....

Perplexity открыла исходный код Lily — движка для локальной работы ИИ на Mac

Perplexity открыла исходный код Lily — лёгкого движка инференса для локальной работы с моделями в Perplexity Computer. Он...

Промты для создания стикеров по фото в ChatGPT, +лучшие ИИ для стикеров

С помощью ИИ теперь можно за несколько минут сделать собственный набор стикеров для Telegram, Discord или соцсетей —...

Сверхработоспособный Qwen 3.7 Max. Китайский ИИ, который трудится 35 часов без остановки

Среди всего того, что Alibaba представила на своем облачном саммите в мае 2026 года, флагманская языковая модель Qwen...

Nvidia «достигла AGI», но никто не знает, что это значит

В среду на отчётной конференции Nvidia Дженсен Хуанг заявил, что компания «достигла AGI» — искусственного общего интеллекта, одной...

YouTube запустил генерацию видео с помощью Veo 2 для Shorts

YouTube представил новую функцию для генерации коротких роликов в Shorts, интегрировав ИИ-модель Veo 2 от Google в инструмент...

Как пользоваться Nano Banana 2 Lite бесплатно — гайд

Недавно Google выпустил нейросеть Nano Banana 2 Lite — облегчённую версию генератора изображений на базе Gemini. ИИ-модель быстро...

ElevenLabs запустила Flows Agent в ElevenCreative — агент строит workflow по текстовому запросу

ElevenLabs представила Flows Agent в ElevenCreative. Пользователь описывает, что хочет создать, а ИИ-агент подбирает модели, добавляет узлы на...

Miu Miu и New Balance выпустили балетную версию кроссовок 530 SL

Miu Miu и New Balance выпустили балетки на основе 530 SL. От кроссовок модели достались шнуровка, резиновая подошва...

Claude Fable 5. Модель ИИ, которой можно сказать «разберись» и уйти пить кофе

Есть такой тип людей, которым нельзя давать простые задачи. Они все равно решат их как-то по-своему, с избыточным...

Обновлённый Reve: свобода творчества без технических барьеров

Reve представила обновлённую платформу для генерации и редактирования изображений, стремясь сделать визуальное творчество доступным без технических барьеров. Новый...

Perplexity встроила слайдер вычислительных усилий в агентный сервис Computer

Perplexity добавила слайдер управления вычислительными усилиями в агентный сервис Computer. Пользователи веб-версии платформы могут выбирать глубину рассуждений и...

Как повторить тренд из «Форсажа» с помощью ИИ — гайд

В соцсетях завирусился ИИ-тренд по мотивам «Форсажа»: пользователи пересобирают культовые сцены из Tokyo Drift, подставляя в кадр собственные...

Qwen выпустила плагины Qwen-MM для мультимодальных ИИ-агентов

Команда Qwen опубликовала Qwen-MM-Plugins — набор открытых плагинов для работы ИИ-агентов с изображениями, видео и документами. Репозиторий поддерживает...

Google показала проекты на Gemini 3.8 Flash

Google показала четыре проекта, собранных разработчиками на Gemini 3.8 Flash. Модель вышла в начале сентября и, по заявлению...