Dots3-note Preview: O Modelo de IA de 280B da Xiaohongshu
O que é o dots3-note Preview? Modelo MoE de 280B da Xiaohongshu com contexto 512K, raciocínio multimodal e método TEMPO.
dots3-note Preview é um modelo de inteligência artificial open source desenvolvido pelo dots studio, o laboratório de Xiaohongshu AI (também conhecida como RedNote), lançado em 14 de agosto de 2026. O modelo usa arquitetura Mixture of Experts (MoE) com 280 bilhões de parâmetros totais, dos quais apenas 16 bilhões são ativados durante a inferência, e suporta uma janela de contexto de 512K tokens. Se você ouviu falar desse modelo recentemente, é porque ele faz parte da mesma série que conquistou a medalha de ouro com pontuação perfeita (42/42) na Olimpíada Internacional de Matemática de 2026. Neste artigo, vamos explicar o que ele é, como funciona, e por que um modelo feito por uma plataforma de conteúdo social está chamando atenção da comunidade de IA.
O Que É o dots3-note Preview?
O dots3-note Preview é o primeiro modelo open source da série dots3, desenvolvido pelo dots studio da Xiaohongshu. Ele foi projetado para um tipo de tarefa que a maioria dos modelos de IA ainda não resolve bem: tarefas longas e complexas que duram horas, dias ou até semanas, sem uma única resposta correta.
Pense em planejar uma viagem, organizar um casamento ou abrir uma loja. Esses são problemas reais que não têm uma resposta fixa como uma equação matemática. O modelo dots3 foi treinado especificamente para esses cenários, onde precisa acompanhar mudanças, corrigir seus próprios erros e manter o contexto ao longo de muitas etapas.
A versão Preview é exatamente isso: uma prévia do que o laboratório está construindo. O modelo está disponível sob licença Apache 2.0, com pesos abertos no HuggingFace e código no GitHub. Qualquer pessoa pode baixar, estudar e usar.
Como a Arquitetura MoE de 280B Funciona no dots3-note
A sigla MoE significa Mixture of Experts, um tipo de arquitetura onde o modelo tem muitos especialistas internos, mas só ativa uma pequena fração deles para cada token processado. No caso do dots3-note Preview, os números chamam atenção pelo contraste: 280 bilhões de parâmetros totais, mas apenas 16 bilhões ativados por token.
Isso significa algo simples na prática. O modelo dots3 tem a capacidade de conhecimento de um modelo de 280 bilhões de parâmetros, mas roda com o custo computacional de um modelo muito menor. Funciona como uma enciclopédia na estante: você só abre as páginas relevantes para cada pergunta.
Para entender a escala, o modelo anterior do mesmo laboratório, o dots.llm1, tinha 142B de parâmetros totais com 14B ativados. O dots3-note Preview praticamente dobrou o tamanho total, mas manteve a ativação baixa. A relação entre parâmetros totais e ativados é o que torna esse modelo interessante do ponto de vista de eficiência. Na maioria das tarefas de agente, ele alcançou resultados comparáveis a modelos várias vezes maiores, gastando uma fração do custo de inferência.
Contexto de 512K no dots3-note Preview: Por Que Importa
A janela de contexto de um modelo de IA determina quanta informação ele consegue processar de uma vez. O dots3-note Preview suporta 512K tokens de contexto, o que equivale a algumas centenas de páginas de texto.
Mas por que isso importa para um agente de IA? Em tarefas curtas, como responder uma pergunta ou escrever um parágrafo, uma janela de contexto grande não faz diferença. Mas em tarefas longas, onde o modelo precisa manter o histórico de dezenas de interações, resultados de buscas, documentos lidos e decisões tomadas, o contexto se esgota rápido.
Imagine um agente planejando uma viagem de duas semanas. Ele precisa lembrar de voos pesquisados, preços que mudaram, preferências do usuário que surgiram ao longo da conversa, horários de restaurantes, previsão do tempo. Tudo isso ocupa espaço. Com 512K tokens, o dots3-note Preview consegue manter muito mais informação ativa na memória de trabalho antes de precisar esquecer algo.
A diferença fica clara quando comparado ao dots.llm1 anterior, que tinha 32K tokens de contexto. O salto para 512K representa um aumento de 16 vezes, o que muda fundamentalmente o tipo de tarefa que o modelo consegue executar sem perder informação no caminho.
TEMPO: O Método de Reinforcement Learning do dots3-note
TEMPO é a sigla para Test-time-scaled Value Estimation with Macro-step Policy Optimization, e é provavelmente a inovação mais importante deste modelo. É um método de reinforcement learning (aprendizado por reforço) criado pelo laboratório dots para treinar agentes em tarefas de longa duração.
O problema que TEMPO resolve é direto. Em reinforcement learning tradicional, o modelo recebe uma recompensa no final de uma tarefa. Se a tarefa dura 10 horas e o modelo cometeu um erro na terceira hora, o sistema de treinamento não consegue identificar onde errou. O sinal chega tarde demais.
TEMPO divide a tarefa em macro-steps, ou grandes etapas. Ao final de cada macro-step, o próprio modelo muda de papel: deixa de executar e passa a avaliar. Ele estima qual é a probabilidade de sucesso a partir dali, gera um sinal de recompensa intermediário, e usa esse sinal para ajustar sua estratégia. Depois volta a executar.
O detalhe importante é que ator e crítico compartilham os mesmos parâmetros. O mesmo modelo que executa a tarefa também a avalia. Não há dois modelos separados. A ideia é elegante. Isso significa que a capacidade de autoavaliação fica incorporada no próprio modelo, não em um sistema externo.
Em testes no benchmark ARC-AGI 3, modelos treinados com TEMPO tiveram um desempenho médio 31,5% superior ao checkpoint de baseline e 20,6% superior ao GRPO (Group Relative Policy Optimization, um método de RL amplamente usado). Esses números ainda são preliminares, mas indicam que a abordagem de avaliar durante a execução é mais eficaz do que esperar o final.
Raciocínio Multimodal do dots3-note: Texto, Imagem, Vídeo e Áudio
O dots3-note Preview consegue processar texto, imagens, vídeo e áudio. Isso é o que significa raciocínio multimodal: o modelo não se limita a ler texto, mas entende informações visuais e sonoras dentro do mesmo fluxo de raciocínio.
Na prática, isso abre possibilidades que um modelo só de texto não consegue cobrir. Um agente de viagem pode ler uma captura de tela de preços de voos, entender um mapa de rotas, interpretar um vídeo de review de um hotel e ouvir uma nota de voz em áudio do usuário, tudo na mesma conversa.
A capacidade multimodal foi construída de forma nativa, não como um módulo adicional. O modelo foi treinado desde o início com dados de múltiplas modalidades, o que significa que a compreensão visual e auditiva está integrada no raciocínio, não acrescentada por cima. O Huawei Ascend confirmou isso na prática. Ao completar a adaptação do modelo no mesmo dia do lançamento, mostrou que o pipeline inclui codificador visual, extração de características de áudio e o tronco principal do LLM, todos funcionando de ponta a ponta.
Para o usuário final, isso se traduz em um agente que consegue olhar para o mundo da mesma forma que um humano olha: lendo, vendo e ouvindo ao mesmo tempo.
Agente de Longo Alcance: O Foco Principal do dots3-note
A expressão "agente de longo alcance" descreve um modelo de IA que consegue executar tarefas que se estendem por longos períodos, mantendo coerência, corrigindo erros e adaptando-se a mudanças no caminho. Este é o foco central do dots3-note Preview.
A maioria dos modelos de IA atuais é boa em tarefas de curto prazo: responder uma pergunta, escrever um texto, gerar uma imagem. Mas quando a tarefa dura horas ou dias, os modelos começam a perder o fio. Esquecem decisões anteriores, não percebem que uma informação ficou desatualizada, repetem erros.
O dots3-note Preview aborda isso com três mecanismos que trabalham juntos. Primeiro, a memória ativa: o modelo decide o que vale a pena lembrar e o que pode descartar. Segundo, a autoavaliação (Self-Critique): em intervalos regulares, o modelo para de executar e avalia se o plano atual ainda faz sentido. Se uma premissa mudou, ele ajusta. Terceiro, o aprendizado durante a execução: o modelo pode descobrir regras de um ambiente desconhecido através de observação e experimentação.
O laboratório demonstrou isso de forma concreta. O modelo jogou Slay the Spire II, um jogo que nunca tinha visto antes, e chegou até a fase 33. Ninguém ensinou as regras a ele.
O modelo observou, fez hipóteses sobre o que cada carta fazia, testou, conferiu o resultado e guardou o que aprendeu na memória. Também completou o ARC-AGI 3, um benchmark projetado para testar exatamente essa capacidade de aprender regras em ambientes desconhecidos, com desempenho comparável a modelos fechados muito maiores.
Performance do dots3-note: Benchmarks e o Recorde na IMO 2026
Os números do dots3-note Preview chamam atenção, mas o contexto é tão importante quanto os números. No Terminal-Bench 2.1, o modelo pontuou 75,1, superando o melhor modelo open source dos Estados Unidos em 4,9 pontos. No ARC-AGI 3, ficou comparável a modelos fechados como Claude Opus 4.8 e GPT-5.5, mas com um orçamento de inferência de 500 dólares, foi o melhor desempenho dentro desse limite.
O feito mais notável da série dots3 veio antes do lançamento do Preview. Em julho de 2026, uma versão derivada do dots3-note conquistou 42 de 42 pontos na IMO (Olimpíada Internacional de Matemática), tornando-se o primeiro modelo de IA a receber certificação oficial de pontuação máxima. Naquele ano, apenas 7 dos participantes humanos alcançaram pontuação perfeita. A linha de corte para medalha de ouro foi 29 pontos.
Mas o laboratório não usou esse resultado como argumento principal de venda do modelo. Em vez disso, posicionou o dots3-note Preview em um território mais desafiador: tarefas de vida real sem resposta única. Junto com o modelo, o time abriu dois benchmarks próprios, VibeSearchBench e VibeLifeBench, que medem capacidade de pesquisa em múltiplas rodadas e execução de tarefas em ambientes dinâmicos, respectivamente. No VibeSearchBench, que cobre 20 domínios e 200 tarefas, nenhum modelo participante atingiu a nota de aprovação. Ninguém passou. No VibeLifeBench, que simula linhas do tempo reais com 20 a 30 fases por tarefa, todos os sete modelos de ponta testados ficaram abaixo da linha de aprovação.
Esses resultados dizem algo importante. Os modelos atuais, incluindo o dots3-note Preview, ainda não dominam tarefas longas e abertas de vida real. Mas o dots3-note Preview é um dos primeiros a tentar medir isso de forma sistemática.
Como Acessar o dots3-note Preview
O dots3-note Preview está disponível em três canais principais. Os pesos do modelo podem ser baixados no HuggingFace nos formatos BF16 e FP8. O código-fonte está no GitHub, ambos sob licença Apache 2.0. Para quem prefere não rodar localmente, o laboratório oferece acesso via API na plataforma dots.ai.
O modelo também foi integrado ao OpenRouter, um agregador de APIs de modelos de IA, o que facilita o acesso para desenvolvedores que já usam essa plataforma. No lado da infraestrutura, o Huawei Ascend completou a adaptação no dia do lançamento, oferecendo suporte via vLLM Ascend para quem usa hardware Ascend.
Não existe um aplicativo Android independente para o dots3-note Preview. É um modelo, não um app. A ferramenta é para desenvolvedores e pesquisadores, acessada via API ou através de hospedagem própria. Usuários finais que quiserem experimentar as capacidades do modelo podem acessar via plataforma dots.ai quando disponível.
O dots3-note Preview é um modelo que aposta em uma direção diferente da maioria. Em vez de competir apenas em tamanho ou em benchmarks de tarefas fechadas, ele foca em tarefas longas, abertas e reais, onde o sucesso depende de manter contexto, avaliar progresso e corrigir curso. A arquitetura MoE de 280B com apenas 16B ativados, o contexto de 512K e o método TEMPO são as ferramentas técnicas que sustentam essa aposta. Para desenvolvedores e pesquisadores que trabalham com agentes de IA, o modelo oferece pesos abertos, licença permissiva, multimodalidade nativa e uma abordagem nova para reinforcement learning em tarefas longas. A série dots3 ainda está no início, e o Preview é exatamente isso, uma prévia. Mas a direção está clara. Modelos que não apenas respondem perguntas, mas completam tarefas. Se você quer explorar, comece pelo GitHub ou pelo HuggingFace, onde os pesos e o código estão disponíveis sem custo.
