Modelos locais · fontes consultadas em 07/09/2026

Qual modelo vale testar no seu hardware?

Decisões para um Xeon X99 com 128 GB de RAM. A placa de 16 GB considerada aqui é a RTX 5060 Ti.

Ordem de testes na RTX 3060

  1. Controle: mantenha o Qwen3.6 35B IQ1 que já funcionou.
  2. Código: Ornith 1.5 9B Q6; documentos e visão: Qwen3.5 9B Q6.
  3. Compressão: Ternary Bonsai 27B; voz: Kokoro ou Qwen3-TTS.

Recomendações de teste, não velocidades garantidas. O catálogo destaca a configuração selecionada. Resultados locais relatados · Como comparar

01 · O que as GPUs mudam

Mais VRAM permite preservar mais qualidade

Para escolher o arquivo, deixe espaço para o sistema, o cache da conversa, os buffers de execução e, quando houver, o projetor de visão. O tamanho do GGUF é apenas uma parte da memória necessária.

Orçamentos conservadores de partida, não limites fixos
ConfiguraçãoOrçamento inicial para pesos¹Melhor uso do hardware
3060 12 GB≈9–10 GiB9B em Q5/Q6, Bonsai ou 35B MoE muito comprimido. Q4 maior pode usar CPU/RAM.
5060 Ti 16 GB≈13–14 GiBSubir o 35B de IQ1 para IQ3; testar 27B IQ3; reservar folga para contexto e imagens.
3060 + 5060 Ti≈23–24 GiB somados35B MoE Q4 ou 27B Q4/Q5 distribuídos; alternativamente, dois serviços separados.

¹ Estimativas para contexto inicial curto, a ajustar pelo pico real. Os arquivos abaixo estão em GB decimais; o monitor de memória frequentemente usa GiB. Exemplo: 22,13 GB ≈ 20,61 GiB. Não compare os números sem converter.

Uma 5060 Ti não implica 2× tok/s

A banda nominal passa de 360 para 448 GB/s: +24,4%. É uma pista para geração limitada por leitura de pesos, não uma previsão de velocidade. Kernels, quantização, processamento do prompt e offload podem mudar muito o resultado. [fonte] [fonte]

O grande salto pode vir de retirar trabalho da CPU, ou de usar uma quantização melhor com a mesma latência. Recursos FP4 da Blackwell só ajudam quando o formato e o backend realmente os utilizam; GGUF Q4 não é automaticamente NVFP4.

Duas GPUs: capacidade ou simultaneidade

12 + 16 GB não formam uma GPU única de 28 GB. O runtime precisa distribuir pesos; cada placa precisa de folga. Em divisão por camadas, as etapas de um token têm dependências: as bandas de memória não simplesmente se somam. [fonte]

Se cabe na 5060 Ti, teste nela sozinha primeiro. Use ambas para subir a precisão ou evitar CPU. Para produtividade simultânea, experimente LLM na 5060 Ti e TTS/visão/LLM auxiliar na 3060.

No X99, confirme a largura e a geração efetivas de cada slot PCIe. CPU, RAM e transferências podem dominar quando muitos pesos ficam fora da VRAM. O tempo para ler um documento longo (prefill) e a velocidade de gerar a resposta (decode) devem ser medidos separadamente.

02 · Catálogo para decidir

Texto, código e documentos: 15 candidatos

Comece pelos cartões com prioridade. As recomendações de encaixe são inferências a partir do tamanho dos arquivos; não são benchmarks destas placas.

15 modelos

Controle de velocidade

Qwen3.6-35B-A3B

Seu ponto de referência para código, agentes e uso geral. MoE: 35B armazenados, cerca de 3B ativos por token.

Limite: O IQ1 cabe melhor, mas respostas longas, argumentos de ferramentas e casos raros precisam de validação.

RTX 3060 · 12 GBIQ1_M · 10,05 GB. Reproduza primeiro a configuração já usada; reduza contexto ou transfira MoE para CPU se necessário.

RTX 5060 Ti · 16 GBIQ3_S · 13,68 GB. Bom teste para trocar parte da velocidade por fidelidade; comece com 8K de contexto.

As duas · 12 + 16 GBQ4_K_M · 22,13 GB. Prioridade alta: compare com IQ1 usando as mesmas tarefas e tempo total.

Unsloth / llama.cpp · GGUF

Prioridade com duas GPUs

Ornith 1.5 35B-A3B

Candidato para corrigir bugs, modificar vários arquivos e operar ferramentas. Compare com o Qwen3.6 35B original.

Limite: O Q4 oficial exige offload em uma placa. O ganho publicado do modelo não mede a qualidade de um GGUF Q1.

RTX 3060 · 12 GBQ4_K_M · 21,71 GB + RAM. Priorize o 9B se precisar de baixa latência.

RTX 5060 Ti · 16 GBQ4_K_M · 21,71 GB + RAM. Vale experimentar, mas não é execução integral na GPU.

As duas · 12 + 16 GBQ4_K_M · 21,71 GB. Primeiro desafiante de coding; Q5_K_M de 25,35 GB só depois de verificar a folga.

Unsloth / llama.cpp compatível · GGUF

Primeiro download para código

Ornith 1.5 9B

Testar scripts Python, ajustes de HTML/JS, testes unitários e chamadas de ferramentas com pouca VRAM.

Limite: É um modelo denso menor. Não herda automaticamente os resultados do Ornith 35B; valide português e tarefas longas.

RTX 3060 · 12 GBQ6_K · 7,56 GB. Boa folga inicial; use Q4_K_M de 5,78 GB se o contexto ou outro processo precisar de VRAM.

RTX 5060 Ti · 16 GBQ6_K · 7,56 GB ou Q8_0 · 9,79 GB. Use a sobra para contexto antes de subir a precisão sem necessidade.

As duas · 12 + 16 GBRode em uma GPU; deixe a outra para imagem, voz ou outro LLM. Dividi-lo raramente é a primeira escolha.

Unsloth / llama.cpp compatível · GGUF

Generalista compacto

Qwen3.5 9B

Extração em JSON, resumos em português, leitura de capturas de tela e perguntas sobre documentos.

Limite: Para visão, carregue também o projetor multimodal. Ler imagem não significa gerar imagem.

RTX 3060 · 12 GBQ6_K · 7,46 GB; Q4_K_M · 5,68 GB se usar imagens ou contexto maior.

RTX 5060 Ti · 16 GBQ6_K com mais folga. Compare a taxa de extrações corretas com o Ornith 9B, não só o estilo da resposta.

As duas · 12 + 16 GBUse uma GPU. É um bom auxiliar enquanto a outra executa um especialista.

Unsloth / llama.cpp · GGUF + mmproj para visão

Prioridade de qualidade

Qwen3.8 27B

Candidato para raciocínio, análise de documentos e código difícil. Teste novamente com template correto e esforço controlado.

Limite: Denso: lê muito mais pesos por token que um MoE 35B-A3B. O seu teste anterior desfavorável continua relevante.

RTX 3060 · 12 GBIQ2_S · 8,37 GB, ou Q4 + RAM para qualidade. É exploratório; não substitua automaticamente o Qwen3.6 que já funciona.

RTX 5060 Ti · 16 GBIQ3_S · 12,04 GB. Q4_K_M · 16,46 GB deixa pouco espaço e costuma exigir ajuste/offload.

As duas · 12 + 16 GBQ4_K_XL · 17,56 GB ou Q5_K_XL · 20,88 GB. Meu teste seguinte após o confronto Ornith/Qwen 35B.

Unsloth atualizado / llama.cpp com suporte · GGUF

Controle de geração anterior

Qwen3.6 27B

Controle para descobrir se o Qwen3.8 realmente melhora suas tarefas na mesma precisão e orçamento.

Limite: Uma comparação com Qwen3.6 35B-A3B muda também a arquitetura. Este 27B ajuda a isolar a mudança de geração.

RTX 3060 · 12 GBQ4_K_XL · 17,6 GB + RAM. Bonsai é a alternativa comprimida a testar em paralelo.

RTX 5060 Ti · 16 GBQ4_K_XL · 17,6 GB + RAM; para residência integral, escolha um arquivo menor e verifique a memória de execução.

As duas · 12 + 16 GBQ4_K_XL · 17,6 GB. Mesmo formato e contexto que o Qwen3.8 para uma comparação útil.

Unsloth / llama.cpp · GGUF

Qualidade por memória

Ternary Bonsai 27B

Resumos, rascunhos, transformação de texto e código curto quando o espaço é o principal limite.

Limite: Formato ternário com treinamento específico. Exige suporte aos tipos Q2_0/PQ2_0; o nome Q2 não equivale a IQ2_XXS.

RTX 3060 · 12 GBQ2_0 · 7,17 GB atual. O resultado local relatado de 30–31 tok/s é de um arquivo anterior de 8,52 GB.

RTX 5060 Ti · 16 GBCabe com mais contexto. Teste o mesmo arquivo nas duas GPUs antes de adicionar DSpark.

As duas · 12 + 16 GBUse uma placa; só divida se um contexto maior realmente exigir.

Runtime indicado pela PrismML; confirmar kernel no Unsloth

Auxiliar econômico

Bonsai 27B binário

Classificação, normalização de texto, resumos preliminares e tarefas repetitivas verificáveis.

Limite: Maior compressão sacrifica capacidade. Não seria minha primeira escolha para debugging complexo ou cálculos sem ferramenta.

RTX 3060 · 12 GBQ1_0 · 3,80 GB atual. Deixa espaço para outros processos; o arquivo anterior relatado tinha 4,73 GB.

RTX 5060 Ti · 16 GBCabe com folga. Compare com Qwen3.5 9B Q4: modelo menor em precisão maior pode ser mais confiável.

As duas · 12 + 16 GBUma GPU ou CPU, conforme a latência. Não há motivo inicial para ocupar ambas.

Runtime com Q1_0 da PrismML; confirmar suporte

Alternativa sem thinking

Qwen3-Coder 30B-A3B Instruct

Código direto e agentes em que uma resposta curta e rápida é preferível a uma deliberação extensa.

Limite: Geração mais antiga, mas o modo sem thinking pode reduzir o tempo de conclusão. Não trate ausência de thinking como pior qualidade por definição.

RTX 3060 · 12 GBIQ3_XXS · 12,85 GB exige offload/ajuste. Compare primeiro Ornith 9B Q6.

RTX 5060 Ti · 16 GBIQ3_XXS · 12,85 GB; Q4_K_XL · 17,67 GB já exige ajuste/offload.

As duas · 12 + 16 GBQ4_K_XL · 17,67 GB. Compare correção, chamadas inválidas e tempo até o código passar.

Unsloth / llama.cpp · GGUF

Experimento com RAM

Qwen3-Coder-Next 80B-A3B

Segundo experimento de agente grande, antes de recorrer a modelos muito maiores. É diferente do Flash Next 125B.

Limite: 80B totais e 3B ativos; só modo não-thinking. Q4 depende da RAM mesmo usando as duas placas.

RTX 3060 · 12 GBQ4_K_M · 48,53 GB + RAM. Deve ser medido como tarefa completa; a CPU pode dominar.

RTX 5060 Ti · 16 GBMesmo Q4 + RAM, com mais pesos na GPU. Não extrapole velocidade de uma máquina DDR5.

As duas · 12 + 16 GBQ4 + RAM continua necessário. IQ3_XXS · 28,48 GB também fica sem folga para execução integral.

Unsloth / llama.cpp atualizado · GGUF

Controle de outra família

gpt-oss-20b

Teste de raciocínio e uso de ferramentas fora da família Qwen. Útil para verificar se erros são específicos do modelo.

Limite: Use o template Harmony e suporte nativo ao formato dos experts. A sigla F16 do arquivo não implica que todos os pesos sejam FP16.

RTX 3060 · 12 GBGGUF Q4_K_M · 11,62 GB: muito apertado com buffers e contexto; provável offload.

RTX 5060 Ti · 16 GBGGUF Q4_K_M · 11,62 GB: bom candidato para 8K inicial.

As duas · 12 + 16 GBUma GPU tende a bastar. O ganho de duas está em manter outro serviço ativo.

Unsloth / llama.cpp com suporte gpt-oss

Controle para visão e texto

Gemma 3 12B QAT

Alternativa para redação, leitura de imagens e síntese em português, comparada aos Qwen e Bonsai.

Limite: QAT ajusta o modelo para tolerar quantização. Arquivo de pesos, projetor e memória de execução são parcelas distintas.

RTX 3060 · 12 GBCandidato em QAT Q4, com contexto curto. Confira tamanho do pacote e pico de VRAM ao adicionar imagens.

RTX 5060 Ti · 16 GBMais folga para visão e contexto. O relato local de 33,5 tok/s não identifica suficientemente a versão.

As duas · 12 + 16 GBPrefira uma GPU para esse modelo; compare qualidade com Qwen3.5 9B.

llama.cpp / Unsloth compatível · GGUF QAT + projetor

Experimento avançado

Qwen3.8-Flash-Next 125B-A6B

Teste de capacidade para tarefas difíceis que justificam esperar. Há ganhos publicados, especialmente em tarefas profissionais.

Limite: 125B + 51B de n-gramas; arquivo IQ1_S de 72,55 GB. Nenhuma das suas combinações o comporta integralmente na VRAM.

RTX 3060 · 12 GBIQ1_S · 72,55 GB + RAM. Use os 5–6 tok/s relatados como controle provisório, sem prometer ganho.

RTX 5060 Ti · 16 GBIQ1_S + RAM. Os 4 GB extras são uma fração pequena do arquivo; o benefício depende do que deixa a CPU.

As duas · 12 + 16 GBIQ1_S ou Q2_K_XL · 78,87 GB + RAM. Compare ambos; o Q2 aumenta pouco o download total. Veja a análise abaixo.

Unsloth / llama.cpp com suporte específico ao Flash Next

Baixa prioridade neste PC

DeepSeek V4 Flash 0731

Referência de capacidade e teste de pesquisa após estabilizar modelos de 9–35B e o Flash Next.

Limite: 284B/13B ativos na comparação do Qwen. A configuração relatada de cerca de 102 GB exige quantização extrema e muita RAM.

RTX 3060 · 12 GBMaior parte na RAM. Não escolheria como assistente interativo inicial.

RTX 5060 Ti · 16 GBContinua fortemente dependente de CPU/RAM. Confirme modelo 0731 e quant exatos antes de baixar.

As duas · 12 + 16 GBMelhora a capacidade de offload; não demonstra equivalência aos scores publicados do modelo original.

Runtime com suporte DeepSeek V4 e encoding próprio

Buscar antes de responder

Qwen3-Embedding 0.6B

Busca semântica em documentos locais: recupera trechos relevantes para um LLM responder com a fonte.

Limite: Não é um chatbot. Pode melhorar respostas documentais mais do que trocar o gerador por um modelo enorme sem recuperação.

RTX 3060 · 12 GBCPU ou GPU; pesos BF16 da ordem de 1,2 GB, estimativa por parâmetros. Use lotes pequenos.

RTX 5060 Ti · 16 GBCPU ou uma fração da GPU; não precisa reservar a placa inteira.

As duas · 12 + 16 GBColoque na CPU ou na placa auxiliar enquanto o LLM principal ocupa a outra.

sentence-transformers; backend de embeddings compatível

Tamanhos de pesos consultados nos repositórios dos cartões; projetores, drafts, cache e buffers são adicionais. Os arquivos mudam: registre nome, revisão e hash ao comparar.

03 · Qwen3.8-Flash-Next

Vale testar o 125B, mas com uma hipótese clara

A arquitetura tem 125B no modelo principal, 6B ativos por token, mais 51B em embeddings de n-gramas e um módulo MTP de 4B descrito no card. Esses embeddings são tabelas consultadas por combinações de tokens: ocupam muito espaço, mas não precisam ser processados integralmente a cada token. [fonte]

Tamanhos somados de todos os shards do mesmo formato
GGUF UnslothDownload dos pesos²Uso neste PC
UD-IQ1_S72,55 GBControle próximo do arquivo de cerca de 73 GB já relatado.
UD-IQ1_M74,54 GBSó +1,99 GB frente ao IQ1_S; teste de fidelidade com custo de memória próximo.
UD-Q2_K_XL78,87 GB+6,32 GB (+8,7%) frente ao IQ1_S. Próximo experimento de quantização.
UD-IQ3_XXS81,96 GBCandidato adicional se a latência do Q2 for aceitável.
UD-Q4_K_XL111,33 GBMais margem de qualidade; confira RAM livre, buffers, contexto e paginação antes de carregar.

² Exclui projetor e drafts MTP separados. Valores de 07/09/2026, somados por variante no repositório. [fonte]

Insight: “Q1 → Q2” não duplica o arquivo. Formatos dinâmicos usam precisões diferentes por tensor; grandes componentes pesam na conta. Em 128 GB de RAM, comparar IQ1_S com Q2_K_XL pode ensinar mais do que tentar extrair alguns tok/s de uma quantização que comete mais erros. A melhora de qualidade deve ser medida, não presumida.

Colocação: mantenha as tabelas grandes na RAM quando o backend permitir; use a VRAM para tensores mais reutilizados e parte dos experts. Confirme o destino dos tensores no log. Não confunda os embeddings de n-gramas do modelo com a opção de geração especulativa ngram-mod: são mecanismos distintos.

Seu relato de 5–6 tok/s é o controle disponível. Não encontrei nesta revisão um benchmark reproduzível com exatamente X99 + 3060 + 5060 Ti para prometer um novo número. Por exemplo, 1.000 tokens a 6 tok/s levam cerca de 167 s, sem contar leitura do prompt, ferramentas e deliberação adicional.

Modelo original; não são resultados do GGUF Q1/Q2
Teste publicado pelo QwenFlash NextQwen3.8 27BDiferença
SWE-bench Pro62,561,7+0,8 p.p.
DeepSWE 1.158,742,2+16,5 p.p.
JobBench55,733,4+22,3 p.p.
GPQA Diamond91,789,2+2,5 p.p.

Fonte: Qwen. DeepSWE 1.1 reporta o melhor de dois harnesses; o Flash Next se saiu melhor no mini-SWE-agent. Portanto, nem essa comparação isola apenas os pesos. O pequeno ganho em SWE-bench Pro pode não compensar a espera; tarefas profissionais e problemas difíceis são uma hipótese mais forte para teste. [fonte]

04 · Ornith vs Qwen original

Há evidência de vantagem em agentes; falta demonstrá-la no seu GGUF

Benchmark publicado pelo desenvolvedor do Ornith
Mesmo quadro dos autores do OrnithOrnith 1.0 35BOrnith 1.5 35BQwen3.6 35BΔ 1.5 vs Qwen
Terminal-Bench 2.1 · Terminus-264,267,852,5+15,3 p.p.
SWE-bench Verified75,679,073,4+5,6 p.p.
SWE-bench Pro50,459,649,5+10,1 p.p.
NL2Repo34,646,229,4+16,8 p.p.
GPQA Diamond86,289,286,0+3,2 p.p.

Ornith 1.5: médias de cinco execuções. Terminal usa contexto de 128K; SWE usa OpenHands e 256K. Isso difere de um GGUF comprimido a 8K–32K no PC. Os números não são medição independente da sua configuração. [fonte]

Por que pode melhorar?

Os autores descrevem treinamento adicional sobre a família anterior, com geração de tarefas, construção de estratégias de uso das ferramentas e reforço por resultado. Isso pode ensinar a explorar um repositório, corrigir erros de execução e terminar uma tarefa com menos tentativas. [fonte]

O 35B deriva da linha Qwen3.5; comparar com Qwen3.6 é comparar dois caminhos de treinamento posteriores. Não é apenas “o mesmo Qwen, mas quantizado de outro jeito”. O mecanismo proposto explica uma especialização plausível; não prova cada ganho isoladamente.

O que ainda não está demonstrado?

Superioridade geral em português, extração de tabelas, visão, perguntas factuais ou em seu IQ1. Uma preferência de estilo não é precisão maior. Benchmarks de agentes também avaliam a combinação de modelo, template, ferramentas, orçamento e ambiente.

Decisão: teste Ornith 1.5 35B Q4 contra Qwen3.6 35B Q4 nas duas GPUs. Com 12 GB, comece por Ornith 9B Q6 e mantenha o Qwen IQ1 como controle. São dois testes diferentes: efeito do treinamento e utilidade dentro do limite de memória.

Qwen3.8 27B também merece o confronto, mas comparar seu score em outra publicação com o do Ornith não resolve a disputa. Para seu uso, vence quem entrega mais tarefas corretas por hora, incluindo leitura, raciocínio, ferramentas e correções.

05 · Quantização sem falsa precisão

Perda de score é diferente de “perda de inteligência”

Resultados dos autores da compressão; não extrapolar para outros modelos
Variante · avaliação PrismMLScore médio / 15 testesΔ vs Qwen FP16Memória: qual número é este?
Qwen3.6 27B FP1685,07Referência≈54 GB de pesos.
Qwen3.6 27B Q4_K_XL84,99−0,08 ponto17,6 GB de pesos.
Qwen3.6 27B IQ2_XXS72,73−12,34 pontos9,4 GB na publicação.
Ternary Bonsai 27B80,49−4,58 pontos5,9 GB teóricos; ≈7,17 GB no GGUF atual.
Bonsai 27B binário76,11−8,96 pontos≈3,9 GB na publicação; 3,80 GB no GGUF atual.

84,99 ÷ 85,07 dá 99,9%, mas isso é razão entre médias de testes, não “99,9% de inteligência” nem garantia de comportamento igual. Bonsai inclui treinamento para poucos bits; não isola apenas uma quantização pós-treino. [fonte] [fonte]

Mesmo um 9B merece cuidado abaixo de Q4

Medições do próprio publicador das quantizações
Ornith 1.5 9B · quants Atomic ChatArquivoDivergência KL ↓Coincidência do próximo token ↑
Q6_K7,4 GB0,00604596,54%
Q5_K_M6,5 GB0,02988392,80%
AD-IQ3_S-IQ3_XXS4,3 GB0,14413283,44%
AD-IQ2_S-IQ2_XS3,4 GB0,44158071,17%

Esses tamanhos são da Atomic Chat, não dos GGUFs oficiais do catálogo. KL mede mudança na distribuição de probabilidades; coincidência de token não é porcentagem de tarefas resolvidas. A tabela é um motivo para testar Q6 em 12 GB antes de comprimir o 9B agressivamente. [fonte]

Q4 / Q5 / Q6

Q4 é um ponto de partida prático, não uma regra universal. Suba a precisão quando houver erros que desapareçam no modelo mais fiel e VRAM suficiente. Q6 não ajuda se forçar um offload que torna a tarefa inviável.

Q3 / Q2 / IQ1

Permitem testar modelos maiores. Examine números, JSON, chamadas de ferramentas, instruções negativas e código com dependências. Não existe um percentual único de perda por bit aplicável a todas as famílias.

UD, IQ e nomes “XL”

São receitas de compressão, não notas de qualidade. Tensors sensíveis podem ficar em precisão maior; calibração e backend importam. Compare o arquivo e sua revisão. “Top-1 recovery” também não é acurácia da tarefa. [fonte]

Cache, pesos e contexto

Quantizar o cache é uma segunda mudança. Primeiro compare os pesos com cache igual; depois teste Q8 de cache e, só se necessário, Q4 suportado. Contexto maior consome memória e pode piorar velocidade. Não force YaRN para 1M em testes de 8K.

Exemplo matemático, não benchmark: uma chance de acerto por etapa de 98% resulta em 0,98²⁰ ≈ 66,8% de sucesso em 20 etapas independentes; com 95%, cai para 35,8%. Em agentes, pequenas perdas podem se acumular. As etapas reais são correlacionadas, mas a conta mostra por que “parece escrever igual” é uma validação fraca.

06 · Qual modelo para qual trabalho

Escolha pela tarefa que você consegue verificar

Recomendações editoriais para testar, não ranking universal
TrabalhoPrimeiro testeComparação decisiva
Alterar o site, corrigir Python, criar testesOrnith 9B Q6; nas duas GPUs, Ornith 35B Q4Mesmas issues no Qwen3.6 35B Q4; testes passados e tempo até concluir.
Agente que usa terminal e ferramentasOrnith 35B Q4 ou Qwen3-Coder 30BChamadas inválidas, loops, recuperação após erro e tarefa realmente concluída.
Raciocínio técnico, planilha e númerosQwen3.8 27B Q4/Q5 + calculadora/PythonNão pontue plausibilidade: compare valores, unidades e restrições. Flash Next se a dificuldade justificar.
Resumo e extração de documentos em portuguêsQwen3.5 9B Q6; Qwen3.8 27B para casos difíceisFatos preservados, campos ausentes, JSON válido e referência ao trecho. Embeddings para localizar evidência.
Ler gráfico, tabela escaneada ou screenshotQwen3.5 9B ou Gemma 3 12B QATProjetor correto, resolução legível e conferência manual. Testar visão separadamente do texto.
Rascunhos, classificação e transformação em loteTernary/Bonsai ou Qwen3.5 9BCusto por mil itens corretos, não elegância de um exemplo.
Narrar apresentações e textosKokoro; Qwen3-TTS para controle de vozPronúncia de siglas, números, nomes e estabilidade em trechos longos.
Ilustrações e vídeos curtosFLUX.2 klein / SDXL; Wan2.1 1.3BAderência ao pedido, artefatos, pico de VRAM e segundos/minutos por saída.

07 · Além do chat

Voz, imagem e vídeo: nove opções de teste

Entender imagem, voz ou vídeo não implica conseguir gerá-los. Use a área de mídia do runtime compatível. O Unsloth atual anuncia LLMs, difusão e áudio; a compatibilidade de cada checkpoint depende da versão instalada. [fonte] [fonte]

Compatibilidade prática e requisitos publicados
Modelo e função3060 · 12 GB5060 Ti · 16 GBPrograma / teste inicial
Kokoro 82M · texto → vozCPU ou GPU; prioridade alta.Não precisa ocupar a placa inteira.Pacote kokoro/ONNX. Vozes pt-BR, sem clonagem nativa arbitrária. Narrar 60 s com números e siglas.
Qwen3-TTS 0.6B CustomVoice · voz leveCandidato com folga em lotes pequenos¹.Mais folga, sem necessidade de duas GPUs.qwen-tts / backend compatível. Português, vozes predefinidas; testar latência e naturalidade.
Qwen3-TTS 1.7B · voz expressivaCandidato em lotes pequenos¹; liberar o LLM antes.Preferência para experimentar maior qualidade e trechos mais longos.CustomVoice: vozes; VoiceDesign: descrição de voz; Base: referência de áudio. Escolha a variante correta.
Whisper large-v3-turbo · voz → textoBom teste de transcrição¹.Pode dividir o trabalho por arquivos com outro serviço.Whisper / faster-whisper. Transcrever áudio pt-BR; não gera narração.
SDXL Base 1.0 · imagemBoa entrada em 1024 px, batch 1¹.Mais folga para resolução e controles.Unsloth Diffusion / ComfyUI / Diffusers. Comece sem refiner, ControlNet ou upscale.
FLUX.2 klein 4B · imagem e ediçãoA referência de ≈13 GB excede 12 GB: offload/quantização.Minha primeira opção nova de imagem; ≈13 GB publicados, com ajustes conforme a resolução.Unsloth compatível / ComfyUI / Diffusers. Texto → imagem e edição com referência.
Z-Image-Turbo 6B · imagemExploratório com quantização/offload.Prioridade alta; autores indicam execução em 16 GB.Unsloth Diffusion / ComfyUI / Diffusers. 8 avaliações do modelo; testar fotografia e texto.
Wan2.1 T2V-1.3B · texto → vídeoPrimeiro teste de vídeo: referência publicada de 8,19 GB de VRAM.Mais folga; não significa geração em tempo real.ComfyUI / pipeline Wan / Unsloth compatível. Clipe de 5 s, 480p. Os ≈4 min publicados são em RTX 4090, não nestas GPUs.
Wan2.2 TI2V-5B · texto/imagem → vídeoExploratório: exige workflow de pouca memória.Exploratório com offload/quantização; não é a receita oficial de 24 GB.Começar só depois do Wan1.3B. O comando oficial 720p exige ≥24 GB; validar o workflow adaptado.

¹ Adequação estimada para inferência pequena, não pico medido nestas placas. Áudio longo, batch, resolução, quantidade de frames, decodificador de vídeo e modelos auxiliares podem alterar a memória. Fontes: [fonte] [fonte] [fonte] [fonte] [fonte] [fonte]

Com as duas GPUs: o uso mais simples é gerar imagem/vídeo na 5060 Ti e manter voz ou um LLM pequeno na 3060. Dividir um pipeline de difusão exige suporte explícito. Os 28 GB somados não satisfazem automaticamente uma exigência de 24 GB em uma única placa.

08 · Como começar

Um baseline simples antes das otimizações

  1. No Unsloth, procure o repositório exato do cartão. Para inferência, escolha o GGUF e registre seu nome completo. Formatos de treino e GGUF não são intercambiáveis.
  2. Comece em 8.192 tokens de contexto, uma requisição por vez, sem draft especulativo e sem extensão YaRN. Suba para 16K/32K só depois de medir.
  3. Confira no log: backend CUDA, GPU usada, camadas/tensores em cada dispositivo, cache e pico de VRAM/RAM. Uma barra de carregamento concluída não informa onde o modelo está executando.
  4. Use o template do modelo. Qwen3.8: teste esforço medium antes de xhigh; ajuste disponível depende do frontend. Ornith: preset geral publicado de temperatura 0,6, top-p 0,95, top-k 20. [fonte] [fonte]
  5. Para imagem e áudio, selecione o backend/modalidade apropriado. Se sua versão não expuser o modelo, os programas da tabela são alternativas locais concretas.
“5 MoE na CPU”: em --n-cpu-moe 5, são os pesos MoE das primeiras cinco camadas na CPU. Não são cinco experts individuais. O parâmetro não escolhe os experts mais usados em programação. [fonte]

Comandos de partida para llama.cpp

Exemplos de inferência, não instalação. Use build CUDA com suporte à arquitetura; -hf baixa o arquivo se necessário. Comece sem outros modelos ocupando VRAM. Em Windows, o executável pode ser llama-server.exe.

3060 · Ornith 9B Q6

llama-server -hf ornith-ai/Ornith-1.5-9B-GGUF:Q6_K -ngl 99 -c 8192 -np 1 -fa on --jinja --temp 0.6 --top-p 0.95 --top-k 20 --spec-type none --host 127.0.0.1 --port 8080

5060 Ti · Qwen3.8 27B IQ3_S

llama-server -hf unsloth/Qwen3.8-27B-GGUF:UD-IQ3_S -ngl 99 -c 8192 -np 1 -fa on --jinja --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0 --presence-penalty 0 --repeat-penalty 1 --spec-type none --host 127.0.0.1 --port 8080

Duas GPUs · Ornith 35B Q4

llama-server -hf ornith-ai/Ornith-1.5-35B-A3B-GGUF:Q4_K_M -ngl 99 -sm layer -ts 16,12 -c 8192 -np 1 -fa on --jinja --temp 0.6 --top-p 0.95 --top-k 20 --spec-type none --host 127.0.0.1 --port 8080

Ordem das placas: rode llama-server --list-devices. O exemplo -ts 16,12 pressupõe que a primeira GPU seja a 5060 Ti e a segunda, a 3060; inverta para 12,16 se necessário. As proporções devem acompanhar a memória livre, não só a nominal. Nas receitas de uma placa, selecione o dispositivo correto no frontend ou com --device.

Se faltar memória, reduza contexto, libere outros processos e ajuste offload. Para MoE, aumentar gradualmente --n-cpu-moe pode preservar mais precisão às custas da CPU. -ub regula blocos do processamento do prompt: aumentar não garante mais tok/s de geração. [fonte]

Depois do baseline: cache e geração especulativa

Teste uma alteração por vez: cache Q8; distribuição de camadas; offload MoE; e só então MTP, DSpark ou ngram-mod, se disponíveis para o modelo e build. Drafts consomem memória e fazem trabalho extra para o modelo principal verificar. Meça tokens aceitos e tempo total: uma baixa aceitação pode piorar o desempenho.

Não copie receitas de H100 ou DGX para estas placas como garantia. Uma versão antiga do Unsloth pode usar uma versão antiga do llama.cpp; confirme as opções em --help.

09 · Ponto de partida empírico

Resultados locais relatados, ainda sem protocolo uniforme

Relatos do uso local, não novas medições feitas para esta revisão
Modelo / relatoVelocidade relatadaO que falta controlar
Qwen3.6 35B-A3B UD-IQ1_M · 3060≈53 tok/sRelato: 41 camadas GPU, 5 camadas MoE CPU, contexto 27.648, KV F16, especulativo desligado. Confirmar versão e hash.
Ternary Bonsai 27B · arquivo de 8,52 GB≈30–31 tok/sO pacote atual é diferente; não atribuir automaticamente a ele o mesmo resultado.
Gemma 12B QAT≈33,5 tok/sVersão, contexto e configuração exatos não foram preservados no relato.
Qwen3.8 Flash Next · Q1, cerca de 73 GB≈5–6 tok/sConfirmar variante Q1, cache, profundidade do contexto, offload e tempo de prefill.

O teste anterior do Qwen3.8 27B teve erros e resultado pior que o Qwen3.6 nas tarefas usadas. Preserve esse controle. Um novo teste deve mudar fatores identificáveis — arquivo, template, esforço de raciocínio — em vez de presumir que o modelo novo é melhor.

10 · Roteiro de decisão

Teste em etapas; baixe o próximo modelo para responder uma dúvida

Ordem proposta; interrompa a sequência quando já houver um vencedor útil
EtapaO que compararDecisão que o teste resolve
1 · Com a 3060Qwen3.6 IQ1 atual × Ornith 9B Q6 × Qwen3.5 9B Q6Um menor mais fiel já resolve melhor código e documentos?
2 · Com a 5060 TiMesmo Qwen3.6 IQ1 × Qwen3.6 IQ3_SQuanto os bits extras melhoram a taxa de acerto e quanto custam em tempo?
3 · Com ambasOrnith 1.5 35B Q4 × Qwen3.6 35B Q4A especialização do Ornith melhora seu trabalho num orçamento de memória próximo?
4 · Qualidade em 27BQwen3.8 27B Q4/Q5 × Qwen3.6 27B Q4A geração nova e o modo de thinking compensam a maior latência?
5 · Tarefa difícilFlash Next IQ1_S × Q2_K_XL × melhor 27/35BO maior modelo resolve casos adicionais suficientes para justificar a espera?
6 · MídiaKokoro → Qwen3-TTS; SDXL → FLUX.2; Wan1.3B por últimoQualidade perceptiva, facilidade de uso e tempo por saída.

Conjunto enxuto de 20 tarefas reais

6 de código (bug, mudança de interface, parsing, cálculo, testes, múltiplos arquivos); 6 de documentos (resumo fiel, tabela, JSON, fonte, contradição, informação ausente); 4 de raciocínio com resposta verificável; 4 de ferramentas (chamada simples, argumentos aninhados, erro e recuperação, sequência de ações).

Use o mesmo conjunto, contexto, ferramentas e limite de tempo por tarefa. Faça três execuções das tarefas críticas com sampling. Julgue sem olhar o nome do modelo quando possível. Teste também uma conversa mais longa; o ganho de um prompt vazio pode desaparecer quando há histórico.

tempo total = leitura do prompt + geração de todos os tokens + ferramentas + correções

Registre tarefas corretas / 20, tempo mediano, pior caso, tokens totais, velocidade de prefill/decode, pico de RAM/VRAM, chamadas inválidas, loops e falhas de memória. Para voz: tempo de geração / duração do áudio; para imagem/vídeo: tempo por saída no mesmo tamanho e número de passos.

Copiar cabeçalho para registrar resultados em CSV
data,modelo,revisao,arquivo,sha256,runtime_build,gpus,offload,contexto,cache,sampling,thinking,tarefa,repeticao,acertou,tempo_total_s,prefill_tps,decode_tps,tokens_gerados,pico_vram_gib,pico_ram_gib,erros_ferramentas,observacoes
Critério sugerido: escolha o modelo mais rápido que alcance a qualidade necessária. Para promover um desafiante, exija melhora em tarefas importantes sem regressão crítica; uma diferença de uma resposta em 20 ainda é evidência fraca. Não use um score publicitário para substituir o resultado local.

Referência de fronteira: útil como teto, não como promessa local

DeepSeek V4 Flash 0731 e Opus 4.8 na publicação do DeepSeek
Resultados publicados; não os do modelo local quantizado
TesteDeepSeekOpus 4.8Diferença
Terminal-Bench 2.182,785,0−2,3 p.p.
NL2Repo54,269,7−15,5 p.p.
DeepSWE54,458,0−3,6 p.p.
Toolathlon-Verified70,376,2−5,9 p.p.

Os autores usam seu próprio harness e esforço max. O tamanho do gap varia por tarefa; não se pode converter essas razões de scores em “porcentagem da inteligência de fronteira”. Para este PC, memória, precisão e tempo de resposta são restrições adicionais. [fonte]

Como ler a evidência

Publicado: model cards, arquivos e documentação dos autores. Relatado: resultados de uso local fornecidos anteriormente, sem logs completos. Estimado: encaixe na memória e prioridade de teste, derivados dos tamanhos e da arquitetura. Nenhum tok/s foi inventado para a 5060 Ti ou para as duas placas.

Scores de diferentes suites e harnesses não formam uma escala única. Tamanhos atuais podem divergir dos seus downloads antigos. Medidas de coincidência de tokens, perplexidade e KL são diagnósticos de fidelidade; a decisão final é acertar sua tarefa dentro do tempo disponível.

Referências

Fontes primárias e arquivos para conferir

As tabelas identificam a procedência. Os cartões levam aos repositórios específicos; a lista reúne as fontes das análises. Consulta: 07/09/2026.