Empresas chinesas ampliam aposta em modelos de IA com trilhões de parâmetros
Empresas chinesas como DeepSeek, Moonshot AI e Alibaba vêm ampliando a escala de seus modelos: o DeepSeek-V3 tem 671 bilhões de parâmetros, o Kimi K2 chegou a 1 trilhão, o Kimi K3 a 2,8 trilhões e o Qwen3.8-Max a 2,4 trilhões. No caso do Qwen3.8-Max, cerca de 95 bilhões de parâmetros são ativados por etapa, em uma arquitetura Mixture of Experts, segundo o Xataka.
A Alibaba confirmou em 22 de setembro que o Qwen 4 está em treinamento e que seu roteiro para o Qwen 4.5 e o Qwen 5 prevê modelos de 5 a 10 trilhões de parâmetros. A ByteDance estaria buscando escala semelhante, segundo o Financial Times, sem confirmação pública da empresa. O Xataka ressalta que mais parâmetros não garantem melhor desempenho e que modelos pequenos continuam úteis por exigirem menos memória, computação e custo.
Por que importa · interpretação editorial
A escala bilionária e trilionária descrita pode elevar as exigências de memória e computação, embora o uso de Mixture of Experts ative apenas parte dos parâmetros por etapa. Como observa a Xataka, modelos maiores não garantem desempenho superior, mantendo espaço para alternativas menores e mais econômicas.