Paulo Vila AI Tier 0: 96.2% | Economizado: 148,50 USD
situação → complicação → resolução

O panorama open-weight de agosto de 2026

Open-weight é uma etiqueta sobre a licença, não sobre o hardware necessário. Os três modelos mais comentados deste semestre deixam isso claro.

Qwen3.6 — o que de verdade você pode rodar.

Alibaba manteve o ritmo de releases mais ativo do semestre: Qwen3.5 em fevereiro, Qwen3.6 em abril. A variante densa de 27B é o ponto de equilíbrio real — roda em uma ou duas GPUs de consumo em quantização Q4, com 262K de contexto nativo e capacidade multimodal. É, hoje, a opção mais prática para quem quer self-hosting de verdade sem comprar um rack.

Kimi K3 — aberto, mas em escala de datacenter

Moonshot AI lançou o Kimi K3 em julho: 2,8 bilhões de parâmetros em arquitetura MoE, com 104B ativos por token e uma janela de contexto de aproximadamente 1M de tokens. É, segundo suas próprias métricas, o modelo open-source mais grande lançado até a data. Mas "lançado" não significa "executável em seu desktop" — ativar 104B de parâmetros por token ainda é uma carga que exige infraestrutura de datacenter, não uma GPU de consumo.

DeepSeek V4 — a história de eficiência mais forte do lote

DeepSeek mudou sua arquitetura para atenção híbrida em abril: a variante V4-Pro chega a 1.6 trilhões de parâmetros totais com 49B ativos, e a variante V4-Flash fica em 284B totais / 13B ativos. Mesmo a variante "pequena" (Flash) exige em torno de 170GB de VRAM em quantização Q4 — fora do alcance de uma GPU individual, mas viável em um servidor dedicado multi-GPU.

O resumo honesto

Se você possui uma ou duas GPUs e deseja executar algo hoje: Qwen3.6 27B. Se deseja a capacidade máxima de pesos abertos e não se importa em pagar a um provedor para hospedar: Kimi K3 ou DeepSeek V4 via API. A palavra "aberto" indica o que você pode fazer com a licença — não o que pode executar em sua máquina.