Para escolher o arquivo, deixe espaço para o sistema, o cache da conversa, os buffers de execução e, quando houver, o projetor de visão. O tamanho do GGUF é apenas uma parte da memória necessária.
Orçamentos conservadores de partida, não limites fixos
Configuração
Orçamento inicial para pesos¹
Melhor uso do hardware
3060 12 GB
≈9–10 GiB
9B em Q5/Q6, Bonsai ou 35B MoE muito comprimido. Q4 maior pode usar CPU/RAM.
5060 Ti 16 GB
≈13–14 GiB
Subir o 35B de IQ1 para IQ3; testar 27B IQ3; reservar folga para contexto e imagens.
3060 + 5060 Ti
≈23–24 GiB somados
35B MoE Q4 ou 27B Q4/Q5 distribuídos; alternativamente, dois serviços separados.
¹ Estimativas para contexto inicial curto, a ajustar pelo pico real. Os arquivos abaixo estão em GB decimais; o monitor de memória frequentemente usa GiB. Exemplo: 22,13 GB ≈ 20,61 GiB. Não compare os números sem converter.
Uma 5060 Ti não implica 2× tok/s
A banda nominal passa de 360 para 448 GB/s: +24,4%. É uma pista para geração limitada por leitura de pesos, não uma previsão de velocidade. Kernels, quantização, processamento do prompt e offload podem mudar muito o resultado. [fonte][fonte]
O grande salto pode vir de retirar trabalho da CPU, ou de usar uma quantização melhor com a mesma latência. Recursos FP4 da Blackwell só ajudam quando o formato e o backend realmente os utilizam; GGUF Q4 não é automaticamente NVFP4.
Duas GPUs: capacidade ou simultaneidade
12 + 16 GB não formam uma GPU única de 28 GB. O runtime precisa distribuir pesos; cada placa precisa de folga. Em divisão por camadas, as etapas de um token têm dependências: as bandas de memória não simplesmente se somam. [fonte]
Se cabe na 5060 Ti, teste nela sozinha primeiro. Use ambas para subir a precisão ou evitar CPU. Para produtividade simultânea, experimente LLM na 5060 Ti e TTS/visão/LLM auxiliar na 3060.
No X99, confirme a largura e a geração efetivas de cada slot PCIe. CPU, RAM e transferências podem dominar quando muitos pesos ficam fora da VRAM. O tempo para ler um documento longo (prefill) e a velocidade de gerar a resposta (decode) devem ser medidos separadamente.
02 · Catálogo para decidir
Texto, código e documentos: 15 candidatos
Comece pelos cartões com prioridade. As recomendações de encaixe são inferências a partir do tamanho dos arquivos; não são benchmarks destas placas.
15 modelos
Controle de velocidade
Qwen3.6-35B-A3B
Seu ponto de referência para código, agentes e uso geral. MoE: 35B armazenados, cerca de 3B ativos por token.
Limite: O IQ1 cabe melhor, mas respostas longas, argumentos de ferramentas e casos raros precisam de validação.
RTX 3060 · 12 GBIQ1_M · 10,05 GB. Reproduza primeiro a configuração já usada; reduza contexto ou transfira MoE para CPU se necessário.
RTX 5060 Ti · 16 GBIQ3_S · 13,68 GB. Bom teste para trocar parte da velocidade por fidelidade; comece com 8K de contexto.
As duas · 12 + 16 GBQ4_K_M · 22,13 GB. Prioridade alta: compare com IQ1 usando as mesmas tarefas e tempo total.
Código direto e agentes em que uma resposta curta e rápida é preferível a uma deliberação extensa.
Limite: Geração mais antiga, mas o modo sem thinking pode reduzir o tempo de conclusão. Não trate ausência de thinking como pior qualidade por definição.
Tamanhos de pesos consultados nos repositórios dos cartões; projetores, drafts, cache e buffers são adicionais. Os arquivos mudam: registre nome, revisão e hash ao comparar.
03 · Qwen3.8-Flash-Next
Vale testar o 125B, mas com uma hipótese clara
A arquitetura tem 125B no modelo principal, 6B ativos por token, mais 51B em embeddings de n-gramas e um módulo MTP de 4B descrito no card. Esses embeddings são tabelas consultadas por combinações de tokens: ocupam muito espaço, mas não precisam ser processados integralmente a cada token. [fonte]
Tamanhos somados de todos os shards do mesmo formato
GGUF Unsloth
Download dos pesos²
Uso neste PC
UD-IQ1_S
72,55 GB
Controle próximo do arquivo de cerca de 73 GB já relatado.
UD-IQ1_M
74,54 GB
Só +1,99 GB frente ao IQ1_S; teste de fidelidade com custo de memória próximo.
UD-Q2_K_XL
78,87 GB
+6,32 GB (+8,7%) frente ao IQ1_S. Próximo experimento de quantização.
UD-IQ3_XXS
81,96 GB
Candidato adicional se a latência do Q2 for aceitável.
UD-Q4_K_XL
111,33 GB
Mais margem de qualidade; confira RAM livre, buffers, contexto e paginação antes de carregar.
² Exclui projetor e drafts MTP separados. Valores de 07/09/2026, somados por variante no repositório. [fonte]
Insight: “Q1 → Q2” não duplica o arquivo. Formatos dinâmicos usam precisões diferentes por tensor; grandes componentes pesam na conta. Em 128 GB de RAM, comparar IQ1_S com Q2_K_XL pode ensinar mais do que tentar extrair alguns tok/s de uma quantização que comete mais erros. A melhora de qualidade deve ser medida, não presumida.
Colocação: mantenha as tabelas grandes na RAM quando o backend permitir; use a VRAM para tensores mais reutilizados e parte dos experts. Confirme o destino dos tensores no log. Não confunda os embeddings de n-gramas do modelo com a opção de geração especulativa ngram-mod: são mecanismos distintos.
Seu relato de 5–6 tok/s é o controle disponível. Não encontrei nesta revisão um benchmark reproduzível com exatamente X99 + 3060 + 5060 Ti para prometer um novo número. Por exemplo, 1.000 tokens a 6 tok/s levam cerca de 167 s, sem contar leitura do prompt, ferramentas e deliberação adicional.
Modelo original; não são resultados do GGUF Q1/Q2
Teste publicado pelo Qwen
Flash Next
Qwen3.8 27B
Diferença
SWE-bench Pro
62,5
61,7
+0,8 p.p.
DeepSWE 1.1
58,7
42,2
+16,5 p.p.
JobBench
55,7
33,4
+22,3 p.p.
GPQA Diamond
91,7
89,2
+2,5 p.p.
Fonte: Qwen. DeepSWE 1.1 reporta o melhor de dois harnesses; o Flash Next se saiu melhor no mini-SWE-agent. Portanto, nem essa comparação isola apenas os pesos. O pequeno ganho em SWE-bench Pro pode não compensar a espera; tarefas profissionais e problemas difíceis são uma hipótese mais forte para teste. [fonte]
04 · Ornith vs Qwen original
Há evidência de vantagem em agentes; falta demonstrá-la no seu GGUF
Benchmark publicado pelo desenvolvedor do Ornith
Mesmo quadro dos autores do Ornith
Ornith 1.0 35B
Ornith 1.5 35B
Qwen3.6 35B
Δ 1.5 vs Qwen
Terminal-Bench 2.1 · Terminus-2
64,2
67,8
52,5
+15,3 p.p.
SWE-bench Verified
75,6
79,0
73,4
+5,6 p.p.
SWE-bench Pro
50,4
59,6
49,5
+10,1 p.p.
NL2Repo
34,6
46,2
29,4
+16,8 p.p.
GPQA Diamond
86,2
89,2
86,0
+3,2 p.p.
Ornith 1.5: médias de cinco execuções. Terminal usa contexto de 128K; SWE usa OpenHands e 256K. Isso difere de um GGUF comprimido a 8K–32K no PC. Os números não são medição independente da sua configuração. [fonte]
Por que pode melhorar?
Os autores descrevem treinamento adicional sobre a família anterior, com geração de tarefas, construção de estratégias de uso das ferramentas e reforço por resultado. Isso pode ensinar a explorar um repositório, corrigir erros de execução e terminar uma tarefa com menos tentativas. [fonte]
O 35B deriva da linha Qwen3.5; comparar com Qwen3.6 é comparar dois caminhos de treinamento posteriores. Não é apenas “o mesmo Qwen, mas quantizado de outro jeito”. O mecanismo proposto explica uma especialização plausível; não prova cada ganho isoladamente.
O que ainda não está demonstrado?
Superioridade geral em português, extração de tabelas, visão, perguntas factuais ou em seu IQ1. Uma preferência de estilo não é precisão maior. Benchmarks de agentes também avaliam a combinação de modelo, template, ferramentas, orçamento e ambiente.
Decisão: teste Ornith 1.5 35B Q4 contra Qwen3.6 35B Q4 nas duas GPUs. Com 12 GB, comece por Ornith 9B Q6 e mantenha o Qwen IQ1 como controle. São dois testes diferentes: efeito do treinamento e utilidade dentro do limite de memória.
Qwen3.8 27B também merece o confronto, mas comparar seu score em outra publicação com o do Ornith não resolve a disputa. Para seu uso, vence quem entrega mais tarefas corretas por hora, incluindo leitura, raciocínio, ferramentas e correções.
05 · Quantização sem falsa precisão
Perda de score é diferente de “perda de inteligência”
Resultados dos autores da compressão; não extrapolar para outros modelos
Variante · avaliação PrismML
Score médio / 15 testes
Δ vs Qwen FP16
Memória: qual número é este?
Qwen3.6 27B FP16
85,07
Referência
≈54 GB de pesos.
Qwen3.6 27B Q4_K_XL
84,99
−0,08 ponto
17,6 GB de pesos.
Qwen3.6 27B IQ2_XXS
72,73
−12,34 pontos
9,4 GB na publicação.
Ternary Bonsai 27B
80,49
−4,58 pontos
5,9 GB teóricos; ≈7,17 GB no GGUF atual.
Bonsai 27B binário
76,11
−8,96 pontos
≈3,9 GB na publicação; 3,80 GB no GGUF atual.
84,99 ÷ 85,07 dá 99,9%, mas isso é razão entre médias de testes, não “99,9% de inteligência” nem garantia de comportamento igual. Bonsai inclui treinamento para poucos bits; não isola apenas uma quantização pós-treino. [fonte][fonte]
Mesmo um 9B merece cuidado abaixo de Q4
Medições do próprio publicador das quantizações
Ornith 1.5 9B · quants Atomic Chat
Arquivo
Divergência KL ↓
Coincidência do próximo token ↑
Q6_K
7,4 GB
0,006045
96,54%
Q5_K_M
6,5 GB
0,029883
92,80%
AD-IQ3_S-IQ3_XXS
4,3 GB
0,144132
83,44%
AD-IQ2_S-IQ2_XS
3,4 GB
0,441580
71,17%
Esses tamanhos são da Atomic Chat, não dos GGUFs oficiais do catálogo. KL mede mudança na distribuição de probabilidades; coincidência de token não é porcentagem de tarefas resolvidas. A tabela é um motivo para testar Q6 em 12 GB antes de comprimir o 9B agressivamente. [fonte]
Q4 / Q5 / Q6
Q4 é um ponto de partida prático, não uma regra universal. Suba a precisão quando houver erros que desapareçam no modelo mais fiel e VRAM suficiente. Q6 não ajuda se forçar um offload que torna a tarefa inviável.
Q3 / Q2 / IQ1
Permitem testar modelos maiores. Examine números, JSON, chamadas de ferramentas, instruções negativas e código com dependências. Não existe um percentual único de perda por bit aplicável a todas as famílias.
UD, IQ e nomes “XL”
São receitas de compressão, não notas de qualidade. Tensors sensíveis podem ficar em precisão maior; calibração e backend importam. Compare o arquivo e sua revisão. “Top-1 recovery” também não é acurácia da tarefa. [fonte]
Cache, pesos e contexto
Quantizar o cache é uma segunda mudança. Primeiro compare os pesos com cache igual; depois teste Q8 de cache e, só se necessário, Q4 suportado. Contexto maior consome memória e pode piorar velocidade. Não force YaRN para 1M em testes de 8K.
Exemplo matemático, não benchmark: uma chance de acerto por etapa de 98% resulta em 0,98²⁰ ≈ 66,8% de sucesso em 20 etapas independentes; com 95%, cai para 35,8%. Em agentes, pequenas perdas podem se acumular. As etapas reais são correlacionadas, mas a conta mostra por que “parece escrever igual” é uma validação fraca.
06 · Qual modelo para qual trabalho
Escolha pela tarefa que você consegue verificar
Recomendações editoriais para testar, não ranking universal
Trabalho
Primeiro teste
Comparação decisiva
Alterar o site, corrigir Python, criar testes
Ornith 9B Q6; nas duas GPUs, Ornith 35B Q4
Mesmas issues no Qwen3.6 35B Q4; testes passados e tempo até concluir.
Agente que usa terminal e ferramentas
Ornith 35B Q4 ou Qwen3-Coder 30B
Chamadas inválidas, loops, recuperação após erro e tarefa realmente concluída.
Raciocínio técnico, planilha e números
Qwen3.8 27B Q4/Q5 + calculadora/Python
Não pontue plausibilidade: compare valores, unidades e restrições. Flash Next se a dificuldade justificar.
Resumo e extração de documentos em português
Qwen3.5 9B Q6; Qwen3.8 27B para casos difíceis
Fatos preservados, campos ausentes, JSON válido e referência ao trecho. Embeddings para localizar evidência.
Ler gráfico, tabela escaneada ou screenshot
Qwen3.5 9B ou Gemma 3 12B QAT
Projetor correto, resolução legível e conferência manual. Testar visão separadamente do texto.
Rascunhos, classificação e transformação em lote
Ternary/Bonsai ou Qwen3.5 9B
Custo por mil itens corretos, não elegância de um exemplo.
Narrar apresentações e textos
Kokoro; Qwen3-TTS para controle de voz
Pronúncia de siglas, números, nomes e estabilidade em trechos longos.
Ilustrações e vídeos curtos
FLUX.2 klein / SDXL; Wan2.1 1.3B
Aderência ao pedido, artefatos, pico de VRAM e segundos/minutos por saída.
07 · Além do chat
Voz, imagem e vídeo: nove opções de teste
Entender imagem, voz ou vídeo não implica conseguir gerá-los. Use a área de mídia do runtime compatível. O Unsloth atual anuncia LLMs, difusão e áudio; a compatibilidade de cada checkpoint depende da versão instalada. [fonte][fonte]
Exploratório com offload/quantização; não é a receita oficial de 24 GB.
Começar só depois do Wan1.3B. O comando oficial 720p exige ≥24 GB; validar o workflow adaptado.
¹ Adequação estimada para inferência pequena, não pico medido nestas placas. Áudio longo, batch, resolução, quantidade de frames, decodificador de vídeo e modelos auxiliares podem alterar a memória. Fontes: [fonte][fonte][fonte][fonte][fonte][fonte]
Com as duas GPUs: o uso mais simples é gerar imagem/vídeo na 5060 Ti e manter voz ou um LLM pequeno na 3060. Dividir um pipeline de difusão exige suporte explícito. Os 28 GB somados não satisfazem automaticamente uma exigência de 24 GB em uma única placa.
08 · Como começar
Um baseline simples antes das otimizações
No Unsloth, procure o repositório exato do cartão. Para inferência, escolha o GGUF e registre seu nome completo. Formatos de treino e GGUF não são intercambiáveis.
Comece em 8.192 tokens de contexto, uma requisição por vez, sem draft especulativo e sem extensão YaRN. Suba para 16K/32K só depois de medir.
Confira no log: backend CUDA, GPU usada, camadas/tensores em cada dispositivo, cache e pico de VRAM/RAM. Uma barra de carregamento concluída não informa onde o modelo está executando.
Use o template do modelo. Qwen3.8: teste esforço medium antes de xhigh; ajuste disponível depende do frontend. Ornith: preset geral publicado de temperatura 0,6, top-p 0,95, top-k 20. [fonte][fonte]
Para imagem e áudio, selecione o backend/modalidade apropriado. Se sua versão não expuser o modelo, os programas da tabela são alternativas locais concretas.
“5 MoE na CPU”: em --n-cpu-moe 5, são os pesos MoE das primeiras cinco camadas na CPU. Não são cinco experts individuais. O parâmetro não escolhe os experts mais usados em programação. [fonte]
Comandos de partida para llama.cpp
Exemplos de inferência, não instalação. Use build CUDA com suporte à arquitetura; -hf baixa o arquivo se necessário. Comece sem outros modelos ocupando VRAM. Em Windows, o executável pode ser llama-server.exe.
Ordem das placas: rode llama-server --list-devices. O exemplo -ts 16,12 pressupõe que a primeira GPU seja a 5060 Ti e a segunda, a 3060; inverta para 12,16 se necessário. As proporções devem acompanhar a memória livre, não só a nominal. Nas receitas de uma placa, selecione o dispositivo correto no frontend ou com --device.
Se faltar memória, reduza contexto, libere outros processos e ajuste offload. Para MoE, aumentar gradualmente --n-cpu-moe pode preservar mais precisão às custas da CPU. -ub regula blocos do processamento do prompt: aumentar não garante mais tok/s de geração. [fonte]
Depois do baseline: cache e geração especulativa
Teste uma alteração por vez: cache Q8; distribuição de camadas; offload MoE; e só então MTP, DSpark ou ngram-mod, se disponíveis para o modelo e build. Drafts consomem memória e fazem trabalho extra para o modelo principal verificar. Meça tokens aceitos e tempo total: uma baixa aceitação pode piorar o desempenho.
Não copie receitas de H100 ou DGX para estas placas como garantia. Uma versão antiga do Unsloth pode usar uma versão antiga do llama.cpp; confirme as opções em --help.
09 · Ponto de partida empírico
Resultados locais relatados, ainda sem protocolo uniforme
Relatos do uso local, não novas medições feitas para esta revisão
Modelo / relato
Velocidade relatada
O que falta controlar
Qwen3.6 35B-A3B UD-IQ1_M · 3060
≈53 tok/s
Relato: 41 camadas GPU, 5 camadas MoE CPU, contexto 27.648, KV F16, especulativo desligado. Confirmar versão e hash.
Ternary Bonsai 27B · arquivo de 8,52 GB
≈30–31 tok/s
O pacote atual é diferente; não atribuir automaticamente a ele o mesmo resultado.
Gemma 12B QAT
≈33,5 tok/s
Versão, contexto e configuração exatos não foram preservados no relato.
Qwen3.8 Flash Next · Q1, cerca de 73 GB
≈5–6 tok/s
Confirmar variante Q1, cache, profundidade do contexto, offload e tempo de prefill.
O teste anterior do Qwen3.8 27B teve erros e resultado pior que o Qwen3.6 nas tarefas usadas. Preserve esse controle. Um novo teste deve mudar fatores identificáveis — arquivo, template, esforço de raciocínio — em vez de presumir que o modelo novo é melhor.
10 · Roteiro de decisão
Teste em etapas; baixe o próximo modelo para responder uma dúvida
Ordem proposta; interrompa a sequência quando já houver um vencedor útil
Etapa
O que comparar
Decisão que o teste resolve
1 · Com a 3060
Qwen3.6 IQ1 atual × Ornith 9B Q6 × Qwen3.5 9B Q6
Um menor mais fiel já resolve melhor código e documentos?
2 · Com a 5060 Ti
Mesmo Qwen3.6 IQ1 × Qwen3.6 IQ3_S
Quanto os bits extras melhoram a taxa de acerto e quanto custam em tempo?
3 · Com ambas
Ornith 1.5 35B Q4 × Qwen3.6 35B Q4
A especialização do Ornith melhora seu trabalho num orçamento de memória próximo?
4 · Qualidade em 27B
Qwen3.8 27B Q4/Q5 × Qwen3.6 27B Q4
A geração nova e o modo de thinking compensam a maior latência?
5 · Tarefa difícil
Flash Next IQ1_S × Q2_K_XL × melhor 27/35B
O maior modelo resolve casos adicionais suficientes para justificar a espera?
6 · Mídia
Kokoro → Qwen3-TTS; SDXL → FLUX.2; Wan1.3B por último
Qualidade perceptiva, facilidade de uso e tempo por saída.
Conjunto enxuto de 20 tarefas reais
6 de código (bug, mudança de interface, parsing, cálculo, testes, múltiplos arquivos); 6 de documentos (resumo fiel, tabela, JSON, fonte, contradição, informação ausente); 4 de raciocínio com resposta verificável; 4 de ferramentas (chamada simples, argumentos aninhados, erro e recuperação, sequência de ações).
Use o mesmo conjunto, contexto, ferramentas e limite de tempo por tarefa. Faça três execuções das tarefas críticas com sampling. Julgue sem olhar o nome do modelo quando possível. Teste também uma conversa mais longa; o ganho de um prompt vazio pode desaparecer quando há histórico.
tempo total = leitura do prompt + geração de todos os tokens + ferramentas + correções
Registre tarefas corretas / 20, tempo mediano, pior caso, tokens totais, velocidade de prefill/decode, pico de RAM/VRAM, chamadas inválidas, loops e falhas de memória. Para voz: tempo de geração / duração do áudio; para imagem/vídeo: tempo por saída no mesmo tamanho e número de passos.
Critério sugerido: escolha o modelo mais rápido que alcance a qualidade necessária. Para promover um desafiante, exija melhora em tarefas importantes sem regressão crítica; uma diferença de uma resposta em 20 ainda é evidência fraca. Não use um score publicitário para substituir o resultado local.
Referência de fronteira: útil como teto, não como promessa local
DeepSeek V4 Flash 0731 e Opus 4.8 na publicação do DeepSeek
Resultados publicados; não os do modelo local quantizado
Teste
DeepSeek
Opus 4.8
Diferença
Terminal-Bench 2.1
82,7
85,0
−2,3 p.p.
NL2Repo
54,2
69,7
−15,5 p.p.
DeepSWE
54,4
58,0
−3,6 p.p.
Toolathlon-Verified
70,3
76,2
−5,9 p.p.
Os autores usam seu próprio harness e esforço max. O tamanho do gap varia por tarefa; não se pode converter essas razões de scores em “porcentagem da inteligência de fronteira”. Para este PC, memória, precisão e tempo de resposta são restrições adicionais. [fonte]
Como ler a evidência
Publicado: model cards, arquivos e documentação dos autores. Relatado: resultados de uso local fornecidos anteriormente, sem logs completos. Estimado: encaixe na memória e prioridade de teste, derivados dos tamanhos e da arquitetura. Nenhum tok/s foi inventado para a 5060 Ti ou para as duas placas.
Scores de diferentes suites e harnesses não formam uma escala única. Tamanhos atuais podem divergir dos seus downloads antigos. Medidas de coincidência de tokens, perplexidade e KL são diagnósticos de fidelidade; a decisão final é acertar sua tarefa dentro do tempo disponível.
Referências
Fontes primárias e arquivos para conferir
As tabelas identificam a procedência. Os cartões levam aos repositórios específicos; a lista reúne as fontes das análises. Consulta: 07/09/2026.