O Kimi K3 é o novo modelo de linguagem da chinesa Moonshot AI, lançado em 16 de julho de 2026, e o maior modelo open-source já disponibilizado. São 2,8 trilhões de parâmetros numa arquitetura Mixture-of-Experts esparsa, com 1 milhão de tokens de contexto. Na prática, o Kimi K3 rivaliza com Claude e GPT nos benchmarks e ainda entrega pesos abertos.

O que é o Kimi K3?

O Kimi K3 é um modelo de linguagem de larga escala criado pela Moonshot AI, laboratório chinês por trás da família Kimi. Além disso, ele foi anunciado como o maior modelo open-source já lançado até hoje, com pesos abertos prometidos até cerca de 27 de julho de 2026. Portanto, qualquer desenvolvedor poderá baixar e rodar o modelo, algo incomum para um sistema dessa dimensão.

Em números, o Kimi K3 traz 2,8 trilhões de parâmetros totais e uma janela de contexto de 1 milhão de tokens. Dessa forma, ele consegue ler bases de código inteiras, contratos longos ou dezenas de documentos numa única conversa. Segundo a Artificial Analysis, o modelo aparece entre os três ou quatro melhores do mundo em inteligência geral. Portanto, ele já estreia no topo do mercado.

Vale notar o contexto competitivo. A Moonshot AI descreve o K3 como um salto de eficiência sobre o K2, e não apenas um modelo maior. Por isso, o lançamento chamou atenção não só pelo tamanho, mas pela promessa de rodar mais rápido e mais barato. Inclusive, o pesquisador Simon Willison classificou o movimento como um marco para os modelos de pesos abertos.

Como o Kimi K3 consegue tanto poder?

O Kimi K3 usa uma arquitetura MoE esparsa que ativa apenas 16 de 896 especialistas por token. Em outras palavras, mesmo com 2,8 trilhões de parâmetros totais, só uma fração roda a cada passo. Consequentemente, o custo de computação despenca sem sacrificar a qualidade das respostas. Essa é a chave para entregar poder de fronteira a um preço competitivo.

Além do MoE, a Moonshot combinou quatro técnicas centrais: KDA, AttnRes, Stable LatentMoE e QAT. Primeiro, o KDA melhora a atenção linear e sustenta o contexto de 1 milhão de tokens. Em seguida, o AttnRes e o Stable LatentMoE estabilizam o treino em escala massiva. Por fim, o QAT (treino consciente de quantização) reduz o peso do modelo na hora de rodar.

O resultado prático aparece em dois números. De acordo com a Moonshot AI, o conjunto de técnicas entrega cerca de 2,5 vezes mais eficiência de escala em relação ao K2. Da mesma forma, o modelo chega a ser até 6,3 vezes mais rápido na etapa de decoding. Ou seja, na geração das respostas. Por isso, recomendamos olhar o Kimi K3 não só como um modelo grande, mas como um projeto focado em custo por token.

Por que a arquitetura esparsa importa?

A arquitetura esparsa importa porque separa o tamanho do modelo do custo de uso. Assim, você ganha o conhecimento de um modelo gigante pagando quase como um modelo médio. Na prática, isso viabiliza atendimento em escala, agentes autônomos e pipelines de código sem estourar o orçamento de inferência.

Publicidade

Kimi K3 vs Claude e GPT: quem ganha?

Comparativo Kimi K3 vs Claude vs GPT em desempenho, preço, velocidade, qualidade e custo-benefício.
Comparativo visual entre Kimi K3, Claude e GPT — desempenho, preço, velocidade, qualidade e custo-benefício.

No comparativo Kimi K3 vs Claude e GPT, o modelo da Moonshot fica no pelotão de frente, mas não isolado na liderança. Segundo o Artificial Analysis Intelligence Index, o Kimi K3 marca cerca de 57 pontos. Assim, ele fica entre os três ou quatro melhores modelos do mundo. Dessa forma, ele supera o Claude Opus 4.8 e o GPT-5.5, porém fica atrás do Claude Fable 5 e do GPT-5.6 Sol.

Em tarefas específicas, o desempenho impressiona ainda mais. Por exemplo, o Kimi K3 lidera o Frontend Code Arena, benchmark focado em código de interface. Além disso, ele registra 88,3% no Terminal-Bench, 91,2% no BrowseComp e 93,5% no GPQA-Diamond. Portanto, em programação, uso de terminal e raciocínio científico, ele briga de igual para igual com o topo do mercado.

Veja abaixo o resumo dos principais benchmarks do Kimi K3, conforme dados reportados pela Artificial Analysis e pela imprensa especializada (VentureBeat, TechCrunch e The Decoder):

BenchmarkResultado do Kimi K3O que mede
Intelligence Index~57 pontos (top 3-4)Inteligência geral agregada
Frontend Code Arena1º lugarCódigo de interface (frontend)
Terminal-Bench88,3%Uso de terminal e comandos
BrowseComp91,2%Navegação e busca na web
GPQA-Diamond93,5%Raciocínio científico avançado
Benchmarks do Kimi K3 conforme Artificial Analysis e imprensa especializada.

A leitura editorial é direta. Consideramos o Kimi K3 forte principalmente em código e tarefas agênticas, onde ele lidera ou empata com os melhores. No entanto, para o raciocínio geral mais exigente, o Claude Fable 5 e o GPT-5.6 Sol ainda mantêm uma vantagem fina. Como diz o pesquisador Simon Willison sobre a leva de modelos abertos, “the best open weight models are now genuinely competitive with the best proprietary models”. Se você já usa o GPT-5.6 Sol, vale comparar as duas opções na sua carga de trabalho real.

Quanto custa usar o Kimi K3?

O Kimi K3 cobra US$ 3 por milhão de tokens de entrada e US$ 15 por milhão de tokens de saída na API. Além disso, tokens em cache saem por cerca de US$ 0,30 por milhão, o que barateia bastante prompts repetidos. Dessa forma, o preço fica competitivo diante de rivais proprietários da mesma faixa de capacidade.

Porém, preço de API não conta a história toda. O que importa no dia a dia é o custo para completar uma tarefa inteira. Afinal, modelos mais eficientes usam menos tokens no total. Por isso, um benchmark de custo-por-tarefa costuma ser mais revelador do que a tabela de preços por token.

Nesse ponto, um teste interessante mede o custo para completar uma única tarefa agêntica específica: construir uma ponte num simulador. Segundo o benchmark Atomic Chat, compartilhado pela RoundtableSpace, os valores ficaram assim (rótulos conforme o benchmark):

ModeloCusto da tarefa (US$)
GPT 5.60,096
Kimi K30,185
Opus 50,458
Fable 51,071
Custo para completar uma tarefa agêntica única (construir uma ponte em simulador) — benchmark Atomic Chat, via RoundtableSpace.

A leitura honesta é a seguinte. O GPT 5.6 saiu mais barato nessa tarefa específica, com US$ 0,096. Contudo, o Kimi K3 ficou muito competitivo em US$ 0,185, bem abaixo do Opus 5 e do Fable 5, que custaram várias vezes mais. Portanto, para fluxos agênticos e automação, apontamos o Kimi K3 como uma escolha de ótimo custo-benefício. Vale lembrar que esse número reflete uma tarefa isolada, e não um preço fixo de API.

Quando vale a pena usar o Kimi K3?

O Kimi K3 vale a pena quando você precisa de poder de fronteira com liberdade de pesos abertos e custo por tarefa controlado. Como o modelo terá pesos abertos, você pode rodá-lo em infraestrutura própria, ajustá-lo ao seu domínio e evitar dependência de um único fornecedor. Dessa forma, empresas com times de dados ganham controle total sobre dados sensíveis.

Na prática, alguns casos de uso se destacam. Primeiro, geração e revisão de código, já que o modelo lidera o Frontend Code Arena. Em seguida, agentes autônomos que navegam na web ou usam terminal, dado o forte resultado em BrowseComp e Terminal-Bench. Por fim, análise de documentos extensos, graças ao contexto de 1 milhão de tokens.

Existe ainda o caminho de rodar localmente. Assim como ocorre com outros modelos abertos, ferramentas como o Ollama devem facilitar o uso do Kimi K3 no seu hardware. Contudo, o tamanho exige máquinas robustas. Além disso, para extrair o melhor do modelo, recomendamos investir em engenharia de prompt, que continua sendo decisiva mesmo com modelos de ponta.

Por outro lado, nem todo projeto precisa do maior modelo. Se o seu caso for raciocínio geral extremamente exigente, o Claude Fable 5 ou o GPT-5.6 Sol podem entregar um pouco mais. Todavia, para a maioria das tarefas de código, automação e leitura longa, o Kimi K3 já cobre com folga e a um custo atraente.

Conclusão

Portanto, o Kimi K3 marca um momento importante para a IA aberta. Ele reúne escala massiva, contexto gigante, benchmarks de topo e uma arquitetura esparsa que segura o custo por tarefa. Além disso, a promessa de pesos abertos amplia o acesso a um poder que antes ficava restrito a poucos laboratórios.

Lembre-se de avaliar o Kimi K3 pela sua carga real de trabalho, e não só pela tabela de preços. Primeiro, teste em tarefas de código e automação, onde ele brilha. Em seguida, compare o custo-por-tarefa com Claude e GPT no seu caso. Por fim, considere rodar localmente se o controle de dados for prioridade. Dessa forma, você decide com base em números concretos, e não em hype.

Publicidade

O Kimi K3 é gratuito?
O Kimi K3 terá pesos abertos, prometidos até cerca de 27 de julho de 2026, então você poderá baixar e rodar o modelo por conta própria. Já a API oficial é paga, com preços por token de entrada e saída.
O Kimi K3 é melhor que o Claude e o GPT?
Depende da tarefa. O Kimi K3 lidera em código de frontend e é muito forte em tarefas agênticas, superando o Claude Opus 4.8 e o GPT-5.5. Porém, em raciocínio geral, o Claude Fable 5 e o GPT-5.6 Sol ainda ficam um pouco à frente.
Quanto custa a API do Kimi K3?
A API do Kimi K3 cobra US$ 3 por milhão de tokens de entrada e US$ 15 por milhão de tokens de saída. Tokens em cache saem por cerca de US$ 0,30 por milhão, o que reduz o custo em prompts repetidos.
Quem criou o Kimi K3?
O Kimi K3 foi criado pela Moonshot AI, um laboratório de inteligência artificial da China responsável pela família de modelos Kimi. O lançamento aconteceu em 16 de julho de 2026.
Dá para rodar o Kimi K3 localmente?
Sim, como o modelo terá pesos abertos, será possível rodá-lo em infraestrutura própria, inclusive com ferramentas como o Ollama. Contudo, o tamanho de 2,8 trilhões de parâmetros exige hardware robusto para uso local.