Our website uses necessary cookies to enable basic functions and optional cookies to help us to enhance your user experience. Learn more about our cookie policy by clicking "Learn More".
Accept All Only Necessary Cookies
NEWSREVIEWSHOWTO

Qwen3.8-27B: O modelo multimodal da Alibaba explicado

Diego Oliveira Goncalves

O que é o Qwen3.8-27B? Conheça o modelo de IA de código aberto da Alibaba com 27 bilhões de parâmetros, contexto de 262K, visão e vídeo nativos, e licença Apache 2.0.

Catálogo

    O Qwen3.8-27B é um modelo de linguagem de código aberto lançado pela Alibaba em 14 de agosto de 2026, com 27 bilhões de parâmetros e arquitetura densa. É um modelo Qwen3.8 multimodal: entende texto, imagens e vídeos sem precisar de módulos externos. O contexto nativo de 262K tokens, que pode chegar a 1 milhão com a técnica YaRN, permite processar documentos longos ou repositórios de código inteiros em uma única chamada. A licença de modelo Apache 2.0 libera download, uso e comercialização sem taxas. Neste artigo, você vai encontrar como o modelo funciona por dentro, o que ele consegue fazer, onde ele supera o Qwen3.7-Plus, como rodar no seu PC e quais limitações ainda existem.

    O que é o Qwen3.8-27B?

    O Qwen3.8-27B é o modelo denso Qwen mais recente do programa de código aberto da Alibaba Qwen. A sigla "27B" significa 27 bilhões de parâmetros, o que coloca esse modelo na faixa que a comunidade de IA considera o tamanho ideal: grande o suficiente para tarefas complexas, pequeno o suficiente para rodar em uma GPU de consumo depois da quantização.

    A arquitetura é densa (dense), não MoE (Mixture of Experts). Em modelos MoE como o Qwen3.8-Max de 2,4 trilhões de parâmetros, apenas uma fração dos parâmetros é ativada por token. No Qwen3.8-27B, todos os 27 bilhões de parâmetros rodam a cada inferência. Sim, todos. Isso torna a implantação mais simples. Não há roteamento de especialistas para configurar. Ferramentas como llama.cpp e Ollama funcionam de forma nativa.

    O modelo é nativamente multimodal. Não é um modelo de texto com um codificador de visão colado depois. O Qwen3.8-27B foi treinado desde o início com texto, imagens e vídeo, o que significa que ele consegue ler um PDF com gráficos, analisar um vídeo longo ou interpretar um diagrama científico sem trocar de modelo.

    Como o Qwen3.8-27B funciona por dentro

    A arquitetura do Qwen3.8-27B tem 64 camadas de rede com dimensão oculta de 5120. O desenho usa uma mistura de dois tipos de atenção: 48 camadas usam Gated DeltaNet (atenção linear, que processa sequências longas com custo constante de memória) e 16 camadas usam Gated Attention (atenção completa tradicional). O padrão se repete 16 vezes em blocos de quatro camadas, com três DeltaNet seguidas de uma Attention. Soa complexo. Mas o princípio é simples.

    Essa escolha de design tem um efeito prático direto. Em modelos de atenção completa, o consumo de memória cresce de forma quadrática com o tamanho do contexto. Com 262K tokens, isso seria inviável para uma GPU comum. As 48 camadas lineares quebram essa barreira, mantendo o cache de contexto em tamanho constante. As 16 camadas de atenção completa preservam a capacidade de capturar relações de longa distância no texto.

    O modelo também usa Multi-Token Prediction (MTP), uma técnica que acelera a geração prevendo vários tokens por passo em vez de um. Na prática, isso reduz o tempo de resposta. Combinado com a função reasoning_effort, que permite escolher entre três níveis de profundidade de pensamento (alto, médio e baixo), o Qwen3.8-27B consegue gastar menos computação em perguntas simples e mais em raciocínio complexo.

    O que o modelo Qwen3.8-27B consegue fazer

    A Alibaba projetou o Qwen3.8-27B com foco em três áreas: programação, trabalho de escritório e tarefas de agente autônomo. Os números dos benchmarks oficiais mostram o salto.

    Na programação, o modelo pontuou 61,7 no SWE-bench Pro, uma benchmark de engenharia de software realista, contra 53,5 da geração anterior, Qwen3.6-27B. No Terminal Bench 2.1, que testa código via terminal, subiu de 63,4 para 73,0. O DeepSWE 1.1, que mede capacidade de engenharia de software profunda, saltou de 13,3 para 42,2. São saltos de 15 a 217%. Nada marginal.

    No trabalho de escritório, o JobBench passou de 21,8 para 33,4, cerca de 50% de melhoria. O CoWorkBench, que simula tarefas colaborativas de longa duração, chegou a 70,7, acima do Qwen3.7-Plus (65,1) e do Claude Opus 4.6 Max (68,2).

    As capacidades multimodais incluem leitura de documentos (OmniDocBench 1.5: 88.9), análise de vídeo (VideoMME: 87.0) e matemática visual (MathVision: 90.0). O modelo também controla computadores, navegadores e celulares: OSWorld-Verified 84.3, WebArena-Verified 64.8, AndroidWorld 81.9. Isso significa que ele consegue clicar em botões, preencher formulários e executar sequências de ações em interfaces gráficas. Ressalva importante: todos esses números vêm dos testes oficiais da equipe Qwen. Um blogueiro de IA citado pela imprensa observou que os resultados ainda precisam de verificação independente. Até agora, a comunidade está testando em projetos reais, mas não publicou avaliações formais de terceiros.

    Qwen3.8-27B vs Qwen3.7: o que mudou de verdade

    A comparação Qwen3.8 vs Qwen3.7 não é só uma questão de números maiores. A diferença está no que mudou na prática para quem usa o modelo. Vale a pena trocar? Sim, por vários motivos.

    O Qwen3.7-Plus era um modelo maior, com mais parâmetros ativos. O Qwen3.8-27B, mesmo com menos parâmetros, supera o Qwen3.7-Plus na maioria das benchmarks de programação e escritório. No SWE-bench Pro, o Qwen3.8-27B faz 61.7 contra 57.6 do Qwen3.7-Plus. No Terminal Bench 2.1, 73,0 contra um número não divulgado publicamente, mas as fontes indicam que a margem é similar. Ganhou em quase tudo.

    O que mudou não foi só tamanho. A arquitetura híbrida com Gated DeltaNet é nova nesta geração. A função reasoning_effort também não existia no Qwen3.7. E o treinamento de visão foi integrado desde o começo, não adicionado depois.

    Para quem já usava a série Qwen, a vantagem prática é clara: o Qwen3.8-27B roda em hardware mais barato e, ainda assim, entrega resultados melhores nas tarefas que mais pesam (código, raciocínio longo, uso de ferramentas). Para quem não usava, o ponto de entrada ficou mais acessível.

    Como rodar o Qwen3.8-27B no seu computador

    O Qwen3.8-27B com pesos abertos foi desenhado para rodar localmente. Depois da quantização (redução da precisão dos pesos de BF16 para INT4 ou FP8), o modelo cabe em cerca de 17 GB de memória. Uma RTX 4090 com 24 GB, uma RTX 5090 ou um Mac com 24 GB de memória unificada consegue carregar o modelo e ainda sobra espaço para contexto.

    O caminho mais simples para a maioria dos usuários é o Ollama, que tem suporte nativo para o formato GGUF. O Unsloth publicou um guia de implantação local com arquivos de quantização prontos. O vLLM e o SGLang também suportam o modelo e foram otimizados desde o primeiro dia.

    Para quem não quer rodar localmente, a Alibaba confirmou que uma versão API do Qwen3.8-27B será lançada com contexto de 1 milhão de tokens e ferramentas integradas. Até lá, o modelo está disponível no Hugging Face e no ModelScope para download direto.

    Se você quer conversar com o Qwen no celular, o aplicativo Qwen Studio está disponível para Android. Ele dá acesso ao modelo sem precisar configurar nada localmente.

    Qwen Studio APK

    Qwen Studio é seu assistente de IA pessoal definitivo.

    Produtividade

    Produtividade

    O ecossistema de pesos abertos do Qwen

    Os pesos abertos Qwen não são um evento isolado. A Alibaba já publicou mais de 460 modelos da série Qwen desde 2023. Em julho de 2026, um relatório da Hugging Face chamado "Estado dos Modelos Open Source: Observações de Verão de 2026" apontou o Qwen como modelo base da comunidade open source global.

    Os números do relatório são expressivos. Olhe as comparações. Nos primeiros sete meses de 2026, os modelos Qwen foram baixados 2.045 bilhões de vezes na Hugging Face, contra 418 milhões do Google e 227 milhões da Meta. A comunidade criou mais de 151 mil modelos derivados a partir do Qwen, crescendo a uma taxa de 180 a 210 por dia.

    O Qwen3.8-27B seguiu esse padrão. Dois dias após a liberação dos pesos, o modelo passou de 1 milhão de downloads. A comunidade já contribuiu com mais de 500 versões quantizadas. Sem precedentes. Companhias como Pinterest e Airbnb declararam publicamente que usam modelos Qwen em produção, citando custo e performance como motivos.

    Toda a cadeia de hardware se adaptou. Rápido. Nvidia, AMD, MediaTek e outros fabricantes de chip fizeram adaptação no dia zero. Frameworks de inferência como vLLM, SGLang, TokenSpeed, Ollama e LM Studio lançaram otimizações na mesma semana. Ferramentas de código como Kilo Code, Cline e Hermes Agent integraram o modelo em produção no OpenRouter no primeiro dia.

    O que o Qwen3.8-27B ainda não faz bem

    Apesar dos resultados positivos, o Qwen3.8-27B tem limites que valem ser conhecidos.

    No GPQA Diamond, uma benchmark de raciocínio científico de nível PhD, o modelo pontuou 89.2, abaixo do Qwen3.7-Plus (90.3) e do Claude Opus 4.6 Max (91.3). Na HLE, 30.8 contra 40.0 do Opus 4.6 Max. A diferença é grande. Em raciocínio puramente científico de alto nível, modelos maiores ainda têm vantagem.

    Os benchmarks oficiais são da própria Alibaba. Até que grupos independentes publiquem resultados, os números precisam ser lidos com cautela. A comunidade está testando em projetos reais, mas uma avaliação formal e independente ainda não saiu.

    O modelo também precisa de hardware específico. 17 GB de memória é o piso, não o teto. Na prática, 24 GB é mais realista para ter margem de contexto e KV cache. Se você não tem uma GPU com essa memória, vai precisar da versão API ou de um serviço de hospedagem.

    Por fim, o modelo é denso. Isso é bom para simplicidade de implantação, mas significa que cada token processado ativa todos os 27 bilhões de parâmetros. Em servidores com alto tráfego, um modelo MoE de tamanho similar pode ser mais econômico por requisição, já que só ativa parte dos parâmetros.

    Conclusão

    O Qwen3.8-27B é um modelo denso de 27 bilhões de parâmetros que entrega capacidade de programação, visão e raciocínio de longo prazo com licença Apache 2.0 e contexto de 262K tokens. Para quem quer experimentar IA local sem alugar um cluster de servidores, esse é o primeiro modelo open source que chega perto de modelos fechados de ponta em tarefas reais de código e escritório. Se você tem uma GPU com 24 GB ou quer usar a versão API quando sair, vale acompanhar de perto. Para começar a conversar com o Qwen agora no seu Android, baixe o Qwen Studio no APKPure. A versão mais recente está disponível sem configuração complicada e funciona direto no celular.

    Back to top

    Featured lists

    NEWSNEWSREVIEWSREVIEWSHOWTOHOWTO
    Últimas Críticas
    Dynamite Blue: O gacha da Kosmo's12 explicado
    VoiceStudio: A alternativa open source ao ElevenLabs
    Análise de Transformers: Eternal War 2026: vale a pena jogar no Android?
    FFXIV Mobile encerra: as melhores alternativas de MMORPG para Android em 2026
    Melhores Críticas
    Cat Resolution Pro Funciona? Review do App de Tela Esticada para Celular
    Summer Life in the Countryside: uma experiência encantadora de romance visual
    Google Discover AI: Como o Novo Smart Feed Funciona
    Five Nights at Freddy's (FNAF 1): O Jogo de Terror Que Começou Tudo
    XChat vs. WhatsApp, Telegram e Signal: comparação completa
    Revisão da atualização do Subway Surfers 3.29.1
    Análise GTA San Andreas: Ainda É o Melhor Mundo Aberto no Android?
    177: O Jogo de Arcade Controverso de 1986 que Abordou Temas Sombrio
    Inscrever-se no APKPure
    Seja o primeiro a ter acesso ao lançamento antecipado, notícias e guias dos melhores jogos e aplicativos para Android.
    Não, obrigado
    Inscrever-se
    Inscreva-se com sucesso!
    Agora você está inscrito no APKPure.