Dots3-note Preview: обзор открытой MoE-модели 280B для долгих мультимодальных задач

2026-08-19
Что такое dots3-note Preview? Разбираем модель MoE 280B от dots studio: контекст 512K, мультимодальное мышление, TEMPO reinforcement learning и бенчмарки длинных задач.
Dots3-note Preview — это первая открытая модель из семейства dots3, разработанная лабораторией dots studio (Xiaohongshu AI). Это мультимодальная MoE-модель с 280 миллиардами параметров, из которых при обработке запроса активируются 16 миллиардов, и контекстным окном до 512K токенов. Она обрабатывает текст, изображения, видео и аудио, а ответы генерирует в текстовом виде. Релиз состоялся 14 августа 2026 года под лицензией Apache 2.0.
Модель привлекла внимание не размером, а подходом. Вместо соревнования с гигантами вроде GPT-5 по параметрам, она фокусируется на долгосрочных задачах из реальной жизни: планировании поездок, подготовке мероприятий, ведении бизнеса. Ниже разбираем архитектуру, метод обучения с подкреплением TEMPO, результаты бенчмарков и способы запуска.
Что такое Dots3-note Preview и зачем она нужна
Dots3-note Preview — первый открытый релиз из серии моделейDots3, разработанный командой dots studio из Xiaohongshu AI, с весами на HuggingFace, кодом и документацией на GitHub под лицензией Apache 2.0, которая позволяет бесплатное использование даже в коммерческих проектах.
Главная идея — сместить фокус с задач, у которых есть однозначный правильный ответ, на задачи из реальной жизни. Поездка в другой город, ремонт квартиры, организация свадьбы: у этих задач нет единственно верного решения, условия меняются по ходу дела, а результат растянут во времени. Модель Dots3 создана именно для таких сценариев.
У серии уже есть громкий результат. В июле 2026 года модель dots-note-3.0 из того же семейства получила официальный максимальный балл 42/42 на Международной математической олимпиаде — первый ИИ, добившийся этого. Preview-версия, открытая в августе, самая лёгкая в серии и работает для другого класса задач.
Архитектура MoE 280B: как работает смешивание экспертов
Модель построена на архитектуре Mixture-of-Experts (MoE), что означает, что не все 280 миллиардов параметров используются одновременно, а при обработке каждого токена активируются только 16 миллиардов. Вычислительная стоимость одного прохода поэтому ближе к модели с 16 миллиардами активных параметров, хотя для хранения весов всё равно требуется инфраструктура, рассчитанная на модель размером 280B.
Параметры из официального репозитория на GitHub:
| Параметр | Значение |
|---|---|
| Архитектура | Мультимодальная MoE |
| Всего параметров | 280B |
| Активируемых параметров | 16B |
| Слои | 1 плотный + 45 MoE |
| Эксперты | 256 маршрутизируемых + 1 общий, топ-8 |
| MTP | 1 общий слой, 1.13B |
| Энкодер зрения | MoE ViT, 7B всего, 1.2B активируется |
| Аудиальный энкодер | Плотный, 800M |
| Точность | BF16, FP8 |
| Размер словаря | 152K токенов |
Что делает архитектуру интересной — соотношение общего и активируемого. 280B дают модели большой запас знаний, но 16B активации означают, что один прямой проход обходится дёшево. Параметров много, но при каждом вызове используются только необходимые.
Для развёртывания рекомендуется FP8-квантованная версия на одном узле из 8 GPU с нативной поддержкой в vLLM, а для SGLang и Transformers поддержка пока в процессе интеграции в основные репозитории. Huawei Ascend Atlas 800 A3 и Atlas 900 A3 SuperPod также получили адаптацию в день релиза. Несмотря на 16B активируемых параметров, полный набор весов модели остаётся крупным, поэтому для FP8-развёртывания рекомендуется узел из восьми GPU.
Мультимодальное мышление: текст, изображения, видео и аудио
Модель принимает четыре типа входных данных: текст, изображения, видео и аудио, а ответ всегда текстовый, причём мультимодальность встроена в саму архитектуру, а не добавлена поверх в виде отдельного модуля.
Визуальный энкодер — MoE ViT с 7B общих параметров (1.2B активируемых), а аудиоэнкодер — плотная сеть на 800M параметров, при этом видео подаётся вместе с аудиодорожкой, когда она есть. Модель может посмотреть ролик, услышать звук и сделать вывод по обоим каналам.
На практике это даёт возможность работать с реальными документами. Считать данные с графика, разобрать скриншот с ценами на авиабилеты, прослушать голосовую заметку. Для задач вроде планирования поездки модель сама ищет информацию, читает таблицы и картинки, а не ждёт, что ей всё принесут в текстовом виде.
Контекст 512K и долгосрочный агент
Контекстное окно в 512K токенов — одна из ключевых характеристик. Это примерно полмиллиона слов, то есть несколько полных книг в один проход. Но дело не в том, чтобы просто вместить много текста.
В долгосрочных агентных задачах модель может работать часами. За это время накапливается история вызовов инструментов, промежуточные выводы и факты, которые могут устареть. Если контекст короткий, ранние записи выпадают и модель теряет нить. 512K дают запас, но, как отмечают сами разработчики, одного контекстного окна мало. Нужно, чтобы модель могла оценить: то, что она записала два часа назад, всё ещё верно?
Именно поэтому модель использует механизм самокритики — периодическую самопроверку с обновлением памяти. В официальном демо разработчики показали файл memory.md, куда модель записывает правила и наблюдения по ходу задачи, а потом может их переписать, если они перестали работать.
TEMPO: как обучение с подкреплением учит агента исправляться
TEMPO (Training with Extended Macro-step Policy Optimization) — метод обучения с подкреплением для долгосрочных задач. Метод TEMPO разбивает длинную траекторию выполнения на макрошаги. В конце каждого шага модель переключается в режим самооценки: оценивает текущее состояние и вероятность успеха, потом решает, как продолжать.
Это решает проблему разреженного вознаграждения: в классическом обучении с подкреплением модель получает сигнал только в конце задачи, и если задача идёт 10 часов и проваливается, непонятно, на каком именно шаге произошла ошибка. TEMPO даёт сигнал на каждом этапе — модель учится не только действовать, но и оценивать себя.
На бенчмарке ARC-AGI-3 модель с TEMPO показала средний результат на 31.5% выше, чем у базовой версии модели, и на 20.6% выше, чем при GRPO. Числа конкретные, но взяты из отчёта самой команды. Внешних независимых тестов пока немного — модель вышла несколько дней назад.
Остаётся открытым вопрос: если инструмент сломается, а сохранённые наблюдения устареют — сможет ли агент восстановиться и продолжить? Это вопрос к будущим тестам.
Результаты бенчмарков: VibeSearchBench, VibeLifeBench и другие тесты
Вместе с моделью dots studio открыла два новых бенчмарка для оценки долгосрочных задач.
VibeSearchBench проверяет способность вести многораундовое исследование, когда пользователь не раскрывает все ограничения сразу. 20 областей, 200 задач, оценка по метрике Triplet F1. Лучший результат среди протестированных моделей — у Claude Opus 5 с 31.14 балла. Все модели далеко от уровня практического применения.
VibeLifeBench ближе к реальной жизни: смоделированы временные линии и меняющиеся условия. 10 областей, 20 задач, каждая задача разделена на 20–30 этапов, проверка через 1247 атомарных проверок. Ни одна из 7 протестированных моделей-лидеров не достигла проходного балла.
На стандартных бенчмарках картина лучше. Terminal-Bench 2.1 — 75.1 балла, на 4.9 балла выше, чем у лучшей американской модели с открытыми весами в сравнении SemiAnalysis. Модель прошла 33 уровня Slay the Spire 2 без специального обучения, изучая правила игры через контекст. На ARC-AGI-3 при вычислительном бюджете в 500 долларов она обошла несколько закрытых моделей.
Цифры выглядят сильно, но важно помнить, что бенчмарки выбраны и опубликованы самой командой, а независимые репликации пока единичны, хотя открытость весов и кода позволяет любому исследователю это проверить.
Как получить доступ к dots3-note Preview и запустить модель
Модель открыта под лицензией Apache 2.0. Вот где её найти:
| Ресурс | Адрес |
|---|---|
| Веса (HuggingFace) | dots-studio/dots3-note-prev |
| Веса FP8 (HuggingFace) | dots-studio/dots3-note-prev-fp8 |
| Веса (ModelScope) | dots-studio/dots3-note-prev |
| API | dots.ai/platform |
| Код и документация | github.com/studio-dots-ai/dots3-note-prev |
Для развёртывания рекомендуется FP8-квантованную версию модели на одном узле из 8 GPU с нативной поддержкой в vLLM, а минимальный запуск через Transformers выглядит так: загрузить FP8-квантованную контрольную точку, передать промт, получить ответ. Для многопользовательского использования нужен vLLM или SGLang — они дают API, совместимый с OpenAI. Поддержка инструментальных вызовов включается параметром --tool-call-parser dots, а спекулятивное декодирование (MTP) снижает время генерации одного токена более чем на 50%.
Контакт для обратной связи: dots-model-feedback@xiaohongshu.com.
Заключение
Dots3-note Preview — попытка сместить фокус ИИ с задач, у которых есть правильный ответ, на задачи из жизни, где правильного ответа нет, а условия постоянно меняются. Архитектура MoE 280B/16B, контекст 512K, мультимодальное мышление и метод обучения с подкреплением TEMPO работают вместе, чтобы модель могла вести длительные агентные сценарии, не теряя нить. Бенчмарки от самой команды выглядят многообещающе, но настоящий тест — это независимая проверка на тех самых реальных задачах, для которых модель создавалась. Поскольку веса, код и бенчмарки опубликованы открыто, независимые исследователи могут проверить заявленные результаты самостоятельно.