dots3-note Preview: Modelo IA de 280B Parametros

2026-08-19
Que es dots3-note Preview? Conoce el modelo de IA de codigo abierto de Xiaohongshu con 280B parametros, contexto 512K y TEMPO, diseñado para agentes de largo alcance en tareas reales.
dots3-note Preview es un modelo de inteligencia artificial de codigo abierto desarrollado por dots, el laboratorio de modelos de Xiaohongshu (conocida internacionalmente como RedNote). Pertenece a la familia dots3 y se publico el 14 de agosto de 2026 bajo licencia Apache-2.0. Es un modelo Mixture-of-Experts (MoE) con 280 mil millones de parametros totales y 16 mil millones activados, soporta una ventana de contexto de 512K tokens y comprende texto, imagenes, video y audio. Su objetivo no es responder preguntas de examen, sino manejar tareas largas y abiertas como planificar un viaje, organizar una boda o gestionar una tienda a lo largo de horas o dias. En este articulo explicamos como funciona, que lo hace diferente y por que importa.
1. Que es dots3-note Preview?
dots3-note Preview es el primer modelo de peso abierto de la serie dots3, publicado por dots studio, el laboratorio de Xiaohongshu AI. Xiaohongshu es una de las plataformas de contenido social mas grandes de China, con mas de diez años acumulando datos sobre preferencias esteticas, presupuestos y decisiones cotidianas de sus usuarios. Ese bagaje de datos alimentó el entrenamiento del modelo.
La serie dots3 gano notoriedad en julio de 2026, cuando la version interna dots-note-3.0 se convirtio en la primera IA en lograr 42 de 42 puntos en la Olimpiada Internacional de Matematica (IMO). Ese año, solo siete humanos alcanzaron la puntuacion maxima. dots3-note Preview es la version abierta de esa misma familia. Y es el modelo mas ligero de la serie.
El modelo esta disponible en HuggingFace y ModelScope. Su API se puede probar en dots.ai/platform y tambien se ha integrado en OpenRouter.
2. Arquitectura MoE del modelo dots3: 280B Parametros, 16B activados
El modelo MoE de 280B parametros usa una arquitectura Mixture-of-Experts, donde cada token activa solo 8 de 256 expertos disponibles mas un experto compartido. En total hay 280 mil millones de parametros, pero cada operacion individual solo mueve 16 mil millones. La diferencia entre parametros totales y activados es lo que permite que un modelo de este tamaño funcione con hardware accesible. La version cuantizada FP8 corre en un solo nodo de 8 GPUs.
La arquitectura tiene 46 capas (1 densa + 45 MoE), un tamaño oculto de 5120 y un vocabulario de 152K tokens. La atencion combina Deep Sparse Attention (13 capas) con Sliding Window Attention (33 capas) en una proporcion de 1:3. Esto permite manejar contextos muy largos sin que el coste computacional explote.
El vision encoder es tambien un MoE ViT con 7B parametros totales y 1.2B activados. El audio encoder es denso, con 800M. El modelo puede procesar una imagen, un documento o un clip de video con la misma eficiencia con la que procesa texto.
3. Contexto de 512K y razonamiento multimodal en el modelo dots3
La ventana de contexto de 512K tokens equivale a unas 400 mil palabras en español, mas o menos un libro completo. Esto permite al modelo mantener el hilo de conversaciones o tareas que se extienden por horas sin perder informacion previa.
El razonamiento multimodal va mas alla de procesar texto. dots3-note Preview puede leer un plano de arquitectura, interpretar una cotizacion de precios, transcribir un mensaje de voz y analizar un video, todo dentro de la misma sesion. En tareas de planificacion, puede mirar una captura de pantalla de vuelos, cruzarla con un presupuesto y ajustar el plan sin que el usuario tenga que explicar cada paso.
Esta capacidad no es un extra decorativo. En tareas reales de largo alcance, la informacion llega en formatos mezclados: texto del chat, imagenes de productos, audio de notas de voz, documentos adjuntos. Si un modelo solo entiende texto, se pierde la mitad del contexto.
4. TEMPO: Similar a dots3-note, maneja tareas de largo alcance
TEMPO (Test-time-scaled Value Estimation con Macro-step Policy Optimization) es el metodo de aprendizaje por refuerzo que dots desarrollo para tareas largas. La idea central es simple: en lugar de esperar a que la tarea termine para dar una recompensa, el modelo corta la tarea en etapas y evalua su progreso al final de cada una.
En cada corte, el mismo modelo cambia de modo ejecucion a modo evaluacion. Usa herramientas y razonamiento para estimar si va por buen camino, y esa evaluacion se convierte en señal de entrenamiento. Esto resuelve un problema real: en una tarea que dura horas, si solo das feedback al final, el modelo no sabe que hizo bien y que hizo mal en los pasos intermedios.
Los resultados respaldan el enfoque. En experimentos de ARC-AGI-3, TEMPO mejoro el puntaje promedio un 31.5% sobre el modelo base y un 20.6% sobre GRPO, el metodo de entrenamiento estandar. Estos numeros no significan que el agente de largo alcance ya sea fiable en todo. Pero indican que evaluar a mitad de camino funciona mejor que esperar al final.
5. Self-Critiquing y memoria activa en el modelo dots3
El Self-Critiquing es el mecanismo que permite a dots3-note Preview detectar sus propios errores durante la ejecucion. Cuando el modelo encuentra una situacion donde algo que asumia ya no es valido (un precio cambio, una pagina web ya no carga, una regla del entorno es distinta a lo que pensaba), activa un proceso de autocorreccion y actualiza su memoria.
La memoria activa funciona como un archivo que el modelo va escribiendo mientras trabaja. Registra lo que aprendio del entorno, las reglas que descubrio y las suposiciones que deben revisarse. No es solo almacenar conversaciones pasadas. Es decidir que vale la pena recordar y que hay que descartar.
En una demostracion oficial, el modelo jugo Slay the Spire 2 sin entrenamiento previo y llego al nivel 33. No es un record mundial. Pero muestra algo: el modelo no habia memorizado las reglas del juego, las aprendio jugando, ajustando su estrategia a medida que descubria que funcionaba y que no. El ARC Prize Foundation, que organiza el benchmark ARC-AGI de razonamiento abstracto, compartio el modelo en sus redes sociales como ejemplo de este enfoque.
6. VibeSearchBench y VibeLifeBench: Evaluando el Agente de largo alcance
dots studio publico dos benchmarks de codigo abierto junto con el modelo, diseñados para evaluar lo que los benchmarks existentes no miden: tareas reales y de larga duracion.
VibeSearchBench evalua busquedas multi-turno donde el usuario no dice todo al principio. Cubre 20 dominios y 200 tareas, usando un simulador de usuario basado en personas para crear interacciones realistas. Se mide con Triplet F1. Claude Opus 5, uno de los mejores modelos actuales, obtuvo 31.14 puntos. Ningun modelo llego a un nivel considerado aceptable para uso real.
VibeLifeBench es mas exigente. Simula entornos con tiempo real y servicios que cambian. Tiene 10 dominios, 20 tareas, cada una con 20 a 30 etapas, y 1.247 comprobaciones atomicas para verificar que el modelo mantiene el estado y responde a cambios. Los siete modelos principales que participaron no alcanzaron la nota minima.
Que los benchmarks existentes no capturen este tipo de capacidad no es casualidad. La mayoria mide tareas con respuesta unica y tiempo limite corto. dots studio abrio estos benchmarks para que la comunidad pueda verificar si los agentes realmente piensan en tareas largas o solo parecen hacerlo en demos controladas.
7. Rendimiento y disponibilidad del modelo dots3
En los benchmarks publicos, dots3-note Preview obtuvo 75.1 puntos en Terminal-Bench 2.1, superando al mejor modelo de peso abierto de Estados Unidos por 4.9 puntos segun datos compartidos por SemiAnalysis. En tareas de razonamiento y agentes, el modelo compite con modelos varias veces mas grandes en parametros totales. Su capacidad visual se situa por encima de modelos de su mismo rango de activacion, segun los datos oficiales.
Para desarrolladores que quieran probarlo, el modelo esta disponible en HuggingFace (dots-studio/dots3-note-prev y dots-studio/dots3-note-prev-fp8) y en ModelScope. Se puede desplegar con vLLM, SGLang o Transformers. La version FP8 corre en un nodo de 8 GPUs. Huawei Ascend tambien completo la adaptacion el dia del lanzamiento, con soporte para Atlas 800 A3 y Atlas 900 A3 SuperPoD.
dots3-note Preview es un modelo de preview, no la version final. El laboratorio ha indicado que la familia dots3 incluira modelos con diferentes balances entre capacidad, latencia y coste. Este es el mas ligero. Si te interesa la IA orientada a agentes y las tareas de largo alcance, puedes probar la API en dots.ai o descargar los pesos desde HuggingFace para desplegarlo localmente.
