Our website uses necessary cookies to enable basic functions and optional cookies to help us to enhance your user experience. Learn more about our cookie policy by clicking "Learn More".
Accept All Only Necessary Cookies
NEWSREVIEWSHOWTO

GLM-5.3-Flash: O novo modelo multimodal da Z.ai chega com licença MIT

Eduarda Goncalves Correia

O GLM-5.3-Flash é o primeiro modelo nativamente multimodal da Z.ai, com 320B de parâmetros, contexto de 1 milhão de tokens e licença MIT.

Catálogo

    A Z.ai revelou no dia 26 de agosto de 2026 o GLM-5.3-Flash, primeiro modelo nativamente multimodal da série GLM-5. Antes do anúncio oficial, o modelo circulou de forma anônima na plataforma OpenRouter sob o nome "Ox Alpha", chamando a atenção por seus resultados em testes de agentes autônomos. Agora disponível com pesos abertos no Hugging Face sob licença MIT, o GLM-5.3-Flash combina 320 bilhões de parâmetros totais com ativação de apenas 18 bilhões por token. Este artigo detalha as especificações técnicas, o desempenho em benchmarks e as formas de acesso ao novo modelo de IA da Z.ai.

    Arquitetura e especificações técnicas do GLM-5.3-Flash

    O GLM-5.3-Flash usa uma arquitetura Mixture-of-Experts com 288 especialistas, dos quais 8 são ativados por token. São 45 camadas de atenção híbrida que combinam dois mecanismos: KDA linear-attention e NoPE sparse MLA. Esse design reduz drasticamente o custo computacional sem sacrificar qualidade.

    O sistema IndexPool é o responsável por cortar o cálculo de atenção em aproximadamente 3 vezes e reduzir o cache KV em 4,4 vezes comparado a arquiteturas tradicionais. Para quem não está familiarizado com os detalhes, isso significa que o modelo processa mais dados com menos memória, uma vantagem direta em inferência de longa duração.

    Outro componente importante é o mHC (Manifold-Constrained Hyper-Connections), que otimiza o fluxo de informação entre camadas sem inflar o número de parâmetros. Os pesos são distribuídos em FP8 nativo, formato que economiza memória sem perda significativa de precisão. Há também uma camada de rascunho MTP (Multi-Token Prediction) que acelera a geração ao especular tokens futuros.

    O treinamento completo usou um corpus multimodal de 30 trilhões de tokens, integrando texto, imagem e vídeo desde o primeiro dia. Não é um modelo de texto que ganhou visão depois. A multimodalidade faz parte da fundação.

    Desempenho em benchmarks do GLM 5.3

    Os números do GLM-5.3-Flash em benchmarks são expressivos. Na Artificial Analysis Intelligence Index, marcou 57 pontos, o mesmo número do Claude Opus 4.8. No Terminal-Bench 2.1, que mede capacidade de agentes em tarefas reais de terminal, alcançou 84,3 (Opus 4.8 fez 85,0). A diferença é mínima e, na prática, imperceptível para a maioria dos casos de uso.

    O salto maior aparece no DeepSWE v1.1, benchmark de engenharia de software: 63,4 pontos, contra 46,2 do GLM-5.2 anterior. Quase 17 pontos de melhoria numa única geração. Se você acompanhava o GLM 5.3 desde os rumores, esse foi o número que chamou a atenção.

    Outros resultados: AutomationBench registrou 48,8, e o HLE (Humanity's Last Exam) ficou em 55,3. Um resultado que surpreendeu a comunidade foi o OfficeQA Pro: 62,4 pontos, à frente do Claude Opus 4.8. O modelo da Z.ai custa 40 vezes menos por token e ainda vence em categorias específicas.

    Em velocidade, o GLM-5.3-Flash gera 48,7 tokens por segundo com tempo de primeiro token de 1,52 segundos. Não é o mais rápido do mercado, mas o equilíbrio entre preço e desempenho é difícil de igualar.

    Janela de contexto de 1 milhão de tokens do GLM-5.3

    O GLM 5.3 traz uma janela de contexto de 1.048.576 tokens, ou 1 milhão na prática. Isso significa que você pode processar livros inteiros, repositórios de código extensos ou horas de vídeo em uma única chamada de API.

    Para desenvolvedores, a vantagem é direta: não precisam dividir documentos longos em fragmentos nem perder contexto entre chamadas. Para usuários de negócios, relatórios financeiros completos, contratos e bases documentais inteiras cabem numa única requisição.

    A eficiência do cache KV, 4,4 vezes menor graças ao IndexPool, faz com que esse contexto gigante não transforme a inferência em algo impraticável. Modelos concorrentes com janelas similares frequentemente enfrentam degradação de velocidade exponencial à medida que o contexto cresce. O GLM-5.3-Flash mantém velocidade de processamento razoável mesmo perto do limite.

    Capacidades multimodais do modelo Z.ai

    Diferente de modelos que ganham visão como um adaptador depois do treinamento, o GLM-5.3-Flash é nativamente multimodal. Imagem e vídeo entram no treinamento desde o início, não como uma camada adicionada depois.

    Isso importa na prática. Modelos com visão adaptada posteriormente frequentemente erram em detalhes visuais sutis ou não conseguem manter consistência entre texto e imagem ao longo de uma conversa longa. O treinamento conjunto desde o início reduz esses problemas.

    As aplicações vão desde análise de documentos escaneados e interpretação de gráficos até entendimento de conteúdo de vídeo. Com 1 milhão de tokens de contexto, é possível alimentar o modelo com um vídeo longo e fazer perguntas específicas sobre momentos diferentes sem reprocessar tudo.

    O fato de ter rodado em chips chineses de IA produzidos nacionalmente também chama a atenção. A Z.ai não divulgou detalhes sobre o hardware exato, mas confirmou que o treinamento não dependeu de GPUs de fornecedores ocidentais. Isso tem implicações para a disponibilidade e independência tecnológica do modelo no longo prazo.

    Preços e planos de acesso ao GLM-5.3-Flash

    A política de preços do GLM-5.3-Flash é agressiva. A API padrão cobra US$ 0,15 por milhão de tokens de entrada, US$ 0,03 por milhão de tokens em cache e US$ 0,50 por milhão de tokens de saída. Para comparar, o Claude Opus 4.8 custa aproximadamente 40 vezes mais.

    Os pesos estão disponíveis para download no Hugging Face sob licença MIT, o que significa que qualquer pessoa pode baixar, modificar e usar comercialmente sem restrições significativas. Para quem quer rodar localmente, os requisitos de hardware são substanciais devido aos 320 bilhões de parâmetros, mesmo com a eficiência do MoE.

    O modelo também está integrado à plataforma ZCode, que traz o GLM-5.3-Flash para usuários sem infraestrutura própria. Os planos do ZCode são:

    • Lite: US$ 18 por mês, ideal para experimentação e projetos pequenos
    • Pro: US$ 80 por mês, para uso regular com volumes médios
    • Max: US$ 168 por mês, para aplicações de alta demanda

    Como acessar o GLM-5.3 no celular pelo ZCode

    Para usuários de celular, o ZCode funciona diretamente no navegador, sem necessidade de instalar aplicativo. Você pode acessar o GLM-5.3-Flash pelo navegador do telefone Android ou iPhone, sem baixar nada.

    A interface web é responsiva e cobre as funcionalidades principais. A vantagem para usuários móveis é clara: em vez de esperar um aplicativo dedicado, você abre o navegador, faz login e conversa com o modelo. Sem atualizações para baixar, sem armazenamento ocupado, sem problemas de compatibilidade de versão.

    O modelo roda nos servidores da Z.ai, então o desempenho não depende do processador do celular. Isso é relevante porque modelos de 320 bilhões de parâmetros simplesmente não cabem num telefone. A computação acontece na nuvem, e você recebe apenas o texto ou a análise de imagem de volta.

    Para quem já usa o celular como ferramenta de trabalho principal, o ZCode elimina uma barreira comum: a necessidade de um computador para acessar modelos de IA de grande porte. Tudo passa pelo navegador, com a mesma qualidade de resposta.

    Impacto do open source AI model na comunidade

    A decisão de liberar os pesos sob licença MIT coloca o GLM-5.3 entre os poucos modelos open source de ponta. A maioria dos concorrentes de desempenho similar mantém os pesos fechados ou usa licenças restritivas.

    Para a comunidade de pesquisa, ter um modelo de 320 bilhões de parâmetros com visão nativa e licença MIT abre caminhos que modelos fechados não permitem: ajuste fino especializado, estudo da arquitetura, reprodução de resultados. Para empresas, a licença MIT remove barreiras legais que frequentemente atrapalham a adoção de modelos de código aberto.

    O mistério do "Ox Alpha" na OpenRouter também é parte da história. Durante semanas antes do anúncio, usuários notaram um modelo anônimo com desempenho surpreendente em tarefas de agente. Quando a Z.ai confirmou que era o GLM-5.3-Flash, a comunidade já tinha gerado benchmarks independentes e casos de uso reais. Essa estratégia de teste silencioso validou o modelo de uma forma que anúncios tradicionais não conseguem.

    O GLM-5.3 chega num momento em que o mercado de modelos de IA procura alternativas mais baratas e abertas. Pelos números que temos até agora, o modelo da Z.ai pode redefinir o que os desenvolvedores esperam de um open source AI model.

    O GLM-5.3-Flash da Z.ai chega como um modelo que combina desempenho de ponta com preço acessível e licença aberta. Os benchmarks mostram que ele compete de igual para igual com modelos que custam dezenas de vezes mais, e a janela de 1 milhão de tokens abre possibilidades que poucos concorrentes oferecem. Para quem quer começar com modelos de IA de código aberto, o ZCode no navegador do celular é o ponto de entrada mais rápido. Se você já paga por APIs de modelos fechados, vale a pena testar a alternativa open source e reduzir custos sem perder qualidade.

    Back to top

    Featured lists

    NEWSNEWSREVIEWSREVIEWSHOWTOHOWTO
    Artigos Relacionados
    Bilibili Global: o aplicativo agora está disponível em todo o mundoNotícias
    FC Mobile Beta 27: Novidades, Como Participar no Android e iOS e Países DisponíveisNotícias
    EXODUS, o novo RPG de Ação Sci-Fi, será lançado em 7 de abril de 2027Notícias
    Últimas Notícias
    Instagram: contas de adolescentes e chamadas de WhatsApp no app
    Google Messages: temas de conversa chegam às conversas do Android
    Neverness to Everness 1.4 For Whom the Verses Mourn: datas, banners e novidades
    Minecraft Dungeons II: lançamento, plataformas e o que muda no gameplay cooperativo
    Melhores Notícias
    Minecraft 1.21.72 APK: Detalhes da Atualização e Principais Correções de Bugs
    Notas de atualização do Minecraft 1.21.31 apk
    Minecraft 1.21.81 APK: Nova atualização com correções e melhorias após a versão 1.21.80
    Minecraft 1.21.80 APK: Notas de atualização do patch
    Atualização do Minecraft 1.21.71 APK: O que Mudou e Como Baixar
    Minecraft 1.21.92 APK: Atualização de Correção com Melhorias Técnicas e Visuais
    Notas de atualização do Minecraft 1.21.62 APK
    Notas de atualização do Minecraft 1.21.21 APK
    Inscrever-se no APKPure
    Seja o primeiro a ter acesso ao lançamento antecipado, notícias e guias dos melhores jogos e aplicativos para Android.
    Não, obrigado
    Inscrever-se
    Inscreva-se com sucesso!
    Agora você está inscrito no APKPure.