DeepSeek V3.2-Exp: мало внимания, длинный контекст и более дешёвый API

Последнее обновление: 30/09/2025
Автор: Исаак
  • V3.2‑Exp дебютирует с DSA: детальное разреженное внимание к длинному контексту.
  • Сравнимая производительность с V3.1‑Terminus и на 50% меньшая стоимость API.
  • Доступно в виде приложения, веб-сайта и API; лицензия MIT и открытые ядра.
  • Поддержка vLLM с первого дня и простое развертывание с помощью SGLang и Hugging Face.

Модель ИИ и рассеянное внимание

В то время как генеративный ИИ не демонстрирует признаков замедления, DeepSeek сделал свой шаг, выпустив модель, напрямую ориентированную на повышение эффективности и учет долгосрочного контекста. DeepSeek-V3.2-Exp — это экспериментальная модель, призванная подтвердить существенное изменение в производстве: новый распределенный механизм внимания, который обещает ускорить обучение и вывод без ущерба для качества выходных данных.

Новая модель не начинается с нуля; она основана на V3.1-Terminus, но вводит ключевой механизм под названием DeepSeek Sparse Attention (DSA) . DeepSeek утверждает, что с помощью DSA можно сократить вычислительные затраты и, как следствие, снизить стоимость API более чем на 50% с немедленным вступлением в силу, сохраняя при этом производительность, сопоставимую с предшественником, в различных задачах.

Что такое DeepSeek-V3.2-Exp и почему это важно

DeepSeek определяет V3.2-Exp как промежуточный шаг на пути к своей следующей архитектуре, шаг, предназначенный для тестирования и демонстрации конкретных оптимизаций эффективности в сценариях с длинным контекстом . По словам компании, цель состоит в ускорении как обучения, так и вывода результатов при обработке обширных текстовых последовательностей, где традиционные трансформеры обычно увеличивают затраты.

Главное, что этот запуск носит экспериментальный характер , но не является единичным случаем: он доступен в приложении DeepSeek, на веб-сайте и в API с первого дня, открывая разработчикам, командам обработки данных и исследователям возможность протестировать его в реальных условиях с большим объемом контекстной информации.

DeepSeek V3.2-Exp в длинном контексте

Технически, версия V3.2-Exp наследует основы V3.1-Terminus для поддержания качества и обеспечения справедливого сравнения. DeepSeek указывает, что намеренно согласовала конфигурации обучения с Terminus, чтобы измерить истинное влияние алгоритмов поиска и анализа, а внутренние тесты показывают сопоставимые результаты в поиске, программировании и математике.

Помимо цифр, важен рыночный контекст: объявление о X подчеркивает его доступность и снижение цены API более чем на 50%. Послание ясно : повышение эффективности приводит к снижению затрат, оказывая давление на конкурентов в Китае и за рубежом, таких как Qwen от Alibaba или американские аналоги.

Что представляет DeepSeek Sparse Attention (DSA)

DSA — это мелкозернистый, разреженный механизм внимания , ориентированный на длинные контекстные окна. Вместо того чтобы уделять внимание всем токенам одинаково, он отдает приоритет действительно релевантным фрагментам и сокращает ненужную работу, сохраняя при этом практически идентичное качество выходных данных.

Для достижения этой цели DeepSeek использует модуль под названием Lightning Indexer , функция которого заключается в определении приоритетности определенных областей контекстного окна. Этот шаг предшествует поиску и действует как интеллектуальный фильтр, отделяющий важное от лишнего.

После первоначального отбора модель применяет процесс детального выбора токенов . На практике это означает, что не все токены конкурируют за внимание: только те, которые определены как наиболее информативные, попадают в окно распределенного внимания, что снижает потребление памяти и вычислительных ресурсов.

  Macrohard: план Илона Маска конкурировать с Microsoft с помощью ИИ

Положительным побочным эффектом является то, что система может учитывать большой объем контекста и поддерживать несколько линий рассуждений одновременно, не перегружаясь. Это особенно полезно в длительных рабочих процессах, при сложном анализе документов или продолжительных многопоточных обсуждениях.

Как это работает: индексатор Lightning и выбор токенов

Концептуальный конвейер, описанный DeepSeek, можно упростить до нескольких взаимосвязанных этапов, каждый из которых играет определенную роль для максимизации эффективности в долгосрочных условиях. Оптимизация основана на принятии более обоснованных решений, а не на обработке большего объема данных.

  • Быстрая приоритизация: Индексатор молнии Он сканирует окно и выделяет фрагменты-кандидаты с высокой семантической или структурной релевантностью.
  • Тонкая утонченность: детальный выбор токенов, который определяет, какие токены фактически попадают в фокус рассеянного внимания.
  • Эффективный уход: DSA применяет внимание только к выбранному подмножеству, экономя вычисления и память по сравнению с традиционным плотным вниманием.
  • Сопоставимый результат: качество модели поддерживается на практике на основе внутренних тестов с V3.1-Terminus.

DeepSeek подчеркивает, что эта стратегия не является разовой уловкой: цель состоит в том, чтобы подтвердить и закрепить улучшения в эффективности для будущей архитектуры. Другими словами, V3.2-Exp — это реальная площадка для тестирования, но уже пригодная для использования в производственной среде.

Кроме того, компания отмечает, что такой подход позволяет модели самостоятельно проверять определенные параметры во время обучения в сценариях с длительным контекстом, динамически регулируя вычислительные затраты в зависимости от того, что фактически предоставляет информацию.

Производительность, тесты и стоимость: на 50% меньше на API

Одним из наиболее поразительных результатов является то, что производительность V3.2-Exp сопоставима с V3.1-Terminus в ключевых областях: в качестве поискового агента, в задачах программирования и в математических задачах. Сохранение аналогичных результатов при меньшей вычислительной мощности позволяет снизить цену.

Компания DeepSeek объявила о немедленном снижении цен на API более чем на 50% благодаря повышению эффективности, достигнутому с помощью алгоритмов DSA. Это решение не только делает технологию более доступной, но и повышает ее конкурентоспособность для конкурентов, которым приходится обосновывать более высокие затраты на использование.

С точки зрения практического опыта, улучшение особенно заметно в сценариях с длинным контекстом : обширный анализ данных, обработка юридических или технических документов, операции бэк-офиса с длительной историей и любой конвейер обработки данных, основанный на очень длинных текстовых последовательностях.

Гипотеза DeepSeek ясна: если модель сможет избирательно обращать внимание на то, что важно, организация сможет выполнять больший объем работы с той же инфраструктурой или ту же рабочую нагрузку с меньшими затратами, не теряя при этом надежности результата.

Доступность, открытый исходный код и лицензирование

Версия V3.2-Exp доступна в приложении DeepSeek, веб-версии и API . Модель является открытым исходным кодом, и любой желающий может оценить её работу. Репозиторий и веса модели распространяются под лицензией MIT , что поощряет исследования и коммерческое использование.

  Лучший способ заблокировать распознанные и неизвестные вызовы на iPhone

Такая открытость контрастирует с более закрытыми подходами и демократизирует доступ к передовым возможностям. Она также укрепляет роль Китая в гонке за искусственный интеллект , упрощая университетам, стартапам, а также местным и международным компаниям использование и модификацию существующего технологического стека.

Компания подчеркивает экспериментальный характер релиза: он служит предварительным показом того, что может появиться в архитектуре следующего поколения. Тем не менее, стабильный релиз на трех основных каналах свидетельствует о достаточном уровне зрелости для реального использования.

Справочные ссылки: репозиторий и техническая документация на GitHub, модель на Hugging Face , а также контактная информация службы поддержки по адресу [email protected] Весь пакет направлен на содействие его внедрению в сообществе.

Краткое руководство по локальному запуску

DeepSeek предлагает обновленную демонстрацию процесса инференции, разработанную для ускорения запуска и помощи сообществу в понимании архитектуры. Рабочий процесс с использованием функции Hugging Face и преобразования весов прост и поддерживает параллельную обработку моделей в зависимости от используемых графических процессоров.

cd inference
export EXPERTS=256
python convert.py --hf-ckpt-path ${HF_CKPT_PATH} --save-path ${SAVE_PATH} --n-experts ${EXPERTS} --model-parallel ${MP}

export CONFIG=config_671B_v3.2.json
torchrun --nproc-per-node ${MP} generate.py --ckpt-path ${SAVE_PATH} --config ${CONFIG} --interactive

Для тех, кто предпочитает использовать модель на основе SGLang, доступны образы Docker для различных архитектур. Теги охватывают графические процессоры NVIDIA , ROCm и NPU , включая конкретные варианты.

# H200
docker pull lmsysorg/sglang:dsv32
# MI350 (ROCm)
docker pull lmsysorg/sglang:dsv32-rocm
# NPUs
docker pull lmsysorg/sglang:dsv32-a2
docker pull lmsysorg/sglang:dsv32-a3

# Lanzar servidor
python -m sglang.launch_server --model deepseek-ai/DeepSeek-V3.2-Exp --tp 8 --dp 8 --page-size 64

Если вы используете vLLM, проект объявляет о поддержке версии V3.2-Exp с первого дня . Актуальную информацию о конфигурации, постраничной навигации ключ-значение и параметрах производительности можно найти в официальных рецептах.

Во всех случаях рекомендуется настраивать MP в соответствии с количеством доступных графических процессоров и отслеживать фактическое использование памяти. Это позволяет достичь оптимального баланса между задержкой, пропускной способностью и стоимостью запроса.

Открытые ядра и поддержка экосистемы

Компания DeepSeek выпустила несколько компонентов, которые упрощают исследовательскую и производственную деятельность. Тем, кто уделяет первостепенное внимание читаемости и дизайну в исследовательских целях, в качестве отправной точки рекомендуется TileLang .

Для обеспечения максимальной производительности CUDA в DeepGEMM доступны ядра индексатора с логистической регрессией (включая страничные варианты). В то же время в FlashMLA опубликованы ядра с разреженным вниманием , предназначенные для повышения эффективности на современных графических процессорах.

Этот модульный подход позволяет комбинировать компоненты по мере необходимости: для повышения читаемости кода при прототипировании и обучении, или для высокопроизводительных ядер, необходимых для выполнения сложных вычислений в реальных условиях. Это именно то, что нужно для перехода от тестирования к производству без перестройки всего конвейера.

Кроме того, публикация этих ядер с акцентом на долгосрочный контекст дополняет инициативу DSA, замыкая круг между прикладными исследованиями , сравнительным анализом и внедрением в реальных условиях.

Стратегическое воздействие и что дальше

Тот факт, что экспериментальная модель запускается в виде приложения, веб-приложения и API с немедленным снижением цены, является явным заявлением о намерениях. DeepSeek не просто изучает новое направление исследований; она превращает его в продукт и передает сэкономленные средства конечному пользователю.

  .OPF вариант № Для чего он нужен и как его открыть

Этот шаг усиливает давление на конкурентов в китайской экосистеме, таких как Qwen от Alibaba и ее американские аналоги. Если показатели останутся на уровне более дорогих альтернатив, цена может переломить ситуацию в секторах, чувствительных к издержкам.

Еще одним следствием является эффект открытого исходного кода : разрешительные лицензии, общедоступные ядра и широкая поддержка ускоряют внедрение и облегчают аудит, обучение и внесение вклада. Это резко контрастирует с закрытыми моделями и открывает двери для малых и средних предприятий и университетских лабораторий.

С точки зрения повествования, интересно, как DeepSeek представляет V3.2-Exp как взгляд в будущее : он подтверждает тонко настроенные механизмы внимания и сравнивает их влияние, сохраняя при этом все остальные факторы неизменными. Такая сравнительная строгость придает результатам достоверность.

Также важна способность обрабатывать несколько параллельных линий рассуждений . Умение поддерживать несколько цепочек рассуждений без существенного увеличения затрат открывает возможности в сложных агентах, многоэтапных рассуждениях и системах, сочетающих поиск, синтез и проверку.

Ссылки, цитирование и контакты

Для тех, кто хочет углубиться в тему, DeepSeek предоставляет ссылки на модель на Hugging Face и технический отчет на GitHub. Также доступен блок цитирования в формате BibTeX и адрес электронной почты для связи со службой поддержки и ответов на вопросы.

@misc{deepseekai2024deepseekv32,
  title={DeepSeek-V3.2-Exp: Boosting Long-Context Efficiency with DeepSeek Sparse Attention},
  author={DeepSeek-AI},
  year={2025}
}

В кратком изложении объявления на канале X компания сообщила: представлен DeepSeek-V3.2-Exp , доступный через приложение, веб-сайт и API, при этом цена API снижена более чем на 50%. Основное внимание по-прежнему уделяется долгосрочному контексту и сквозной эффективности.

Тем временем технологические СМИ осветили запуск, позиционируя его как важный шаг после успеха V3 и R1 и предполагая, что, если он оправдает ожидания, то поднимет планку качества и цены по сравнению с основными игроками в этом секторе.

Чтобы замкнуть круг, стоит вспомнить недавний период: с момента запуска ChatGPT в 2022 году и до сегодняшнего дня генеративный ИИ развивался беспрецедентными темпами. Версия 3.2-Exp вписывается в эту тенденцию: больше контекста, меньшая стоимость и архитектура, которая учится на собственных экспериментах.

V3.2-Exp позиционируется как жизнеспособный вариант для проектов, требующих обширных контекстов, скорости и контроля затрат . Его мелкозернистый, распределенный подход к вниманию, поддержка экосистемы (vLLM, SGLang, открытые ядра) и лицензия MIT делают его особенно привлекательным как для прикладных исследований, так и для корпоративных развертываний, где каждая миллисекунда и каждый евро имеют значение.

Какой ИИ лучше всего подходит для каждого приложения (чат, генерация изображений, видео, исследования, программирование и т. д.)
Связанная статья:
Лучший ИИ для любой задачи: чат, изображения, видео, код и многое другое