Laboratório local · revisão em 05/09/2026

5060 Ti + 3060.
O que muda no seu X99.

Xeon E5-2695, 128 GB DDR4 e 28 GB de VRAM distribuída. Primeiro, alimentação correta; depois, escolher onde cada modelo trabalha melhor.

16 + 12 GBmemórias separadas
350 WGPUs em potência nominal de referência
3 cenáriosuma GPU · duas · híbrido
650 W é plausível, mas identifique a fonte e o chicote antes de ligar. A MAG A650BN original tem dois conectores PCIe 6+2; eles podem atender à quantidade de plugs se cada placa exigir um 8-pin, mas é preciso verificar como o cabo é construído. Limite por software não substitui capacidade de cabo ou margem elétrica. [1–4]

01 · Antes de energizar

650 W pode bastar; os cabos ainda precisam ser conferidos

Correção do hardware: a placa comprada é a RTX 5060 Ti 16 GB. A análise anterior usava uma 5070 Ti: retiramos aqueles benchmarks, a potência de 300 W e a recomendação de 850 W para o conjunto.

Uma boa fonte de 650 W pode ser suficiente para este conjunto; não há motivo para exigir 850 W apenas pela soma das placas. A aprovação depende do modelo, estado, capacidade em +12 V e cabeamento. Se precisar trocar por falta de cabos ou margem, 750 W de boa qualidade é um alvo razoável; 850 W é opcional para expansões. ATX 3.1 é desejável numa compra nova, não requisito universal para uma 5060 Ti com 8-pin. O selo 80 PLUS mede eficiência, não garante qualidade elétrica.

A 5060 Ti de referência tem 180 W; a 3060, 170 W. Assumindo 120 W para o processador e 50–90 W para placa-mãe, RAM, discos, ventoinhas e perdas dos reguladores, a conta chega a 520–560 W DC. TDP de CPU não é medição de consumo máximo: esta é uma triagem, não um teto certificado. Modelos OC podem consumir mais. [2,3,5]

Uma configuração limitada a 150 + 120 W, com CPU a 120 W e demais componentes a 70 W, soma 460 W DC. Isso melhora a folga aritmética de 650 W, mas não aprova a instalação: faltam capacidade dos cabos, estado da fonte, limites reais e transientes. Inicialização, reset de driver ou perfil perdido podem remover o limite.

Estimador de carga da fonte

Valores hipotéticos em watts entregues aos componentes. Não é uma medição nem um teste de segurança.

540 W DC

Folga aritmética: 110 W (83% de carga). Não certifica cabos nem transientes.

Escuro: 5060 TiVerde: 3060Claro: CPU e demais

Qual “terminação” você tem?

Ligação consideradaDecisão
Segundo plugue do mesmo chicote que alimenta a 3060Não presumir capacidade para as duas placas. Os dois plugues compartilham parte da fiação. Preferir cabos independentes; usar o chicote compartilhado somente se houver confirmação do fabricante para a carga combinada. Parte da potência vem dos slots, mas não se pode presumir que cada slot fornecerá 75 W para aliviar o cabo.
Cabo PCIe separado + adaptador que acompanha a GPUA 5060 Ti pode usar um único 8-pin: a MSI Ventus 2X OC Plus é um exemplo. A MSI Gaming OC usa 16-pin. Conferir o modelo comprado e alimentar todas as entradas do adaptador exigidas pelo manual; não transferir a exigência de cabos da 5070 Ti.
Cabo 12V-2x6 nativo da fonteOpção para modelos com conector de 16 pinos; não é necessário para uma placa de 8 pinos. Com potência e compatibilidade confirmadas, inserir até travar, sem folga, sem pressão lateral ou dobra junto ao conector; respeitar o manual.
SATA/Molex → PCIe, divisor genérico ou EPS/CPU 8-pinNão usar nessa instalação. EPS e PCIe não são intercambiáveis.
Cabo modular de outra fonteNão reutilizar sem compatibilidade expressa para o modelo exato. A pinagem do lado da fonte pode mudar mesmo entre produtos da mesma marca.

A MAG A650BN original declara 54 A/648 W em +12 V e dois PCIe 6+2. Existem variantes MAG PCIE5 com conectores diferentes. Foto da etiqueta e dos cabos é necessária para identificar a sua. [1,4]

02 · Compatibilidade física e elétrica

Sequência de instalação

  1. Identifique os quatro componentes: modelo completo da fonte, modelo da 5060 Ti, placa-mãe X99 e revisão do Xeon (v3 ou v4). Verifique idade da fonte, conectores da 3060 e eventual desbloqueio de turbo da CPU.
  2. Confira espaço e pistas: a espessura da 5060 Ti varia entre modelos. Verifique comprimento, espessura, entrada de ar e folga para o cabo. Use suporte para o peso. Um slot fisicamente x16 pode operar em x4 ou compartilhar pistas com o NVMe.
  3. Com o PC desligado, fonte desligada e cabo da tomada removido: instale a 5060 Ti no slot de maior largura elétrica ligado à CPU, normalmente o superior. Não abra a fonte. Não force conectores e não faça conexão com o sistema energizado.
  4. Comece apenas com a 5060 Ti numa alimentação aprovada. Confira vídeo, driver e temperaturas; depois inclua a 3060 com cabo adequado. As duas podem usar o mesmo driver NVIDIA que suporte ambas; SLI/NVLink não é necessário.
  5. Se a segunda GPU não aparecer: confira manual/BIOS, mapeamento PCIe e opção Above 4G Decoding. Não altere CSM ou modo de boot às cegas: isso pode impedir o sistema atual de iniciar. ReBAR não é pré-requisito universal de llama.cpp.
  6. Valide sob carga gradualmente: primeiro cada GPU, depois inferência conjunta e CPU. Reinício, erro de GPU, cheiro, ruído elétrico anormal ou conector danificado exigem interromper o teste. Fonte insuficiente pode desligar por proteção; não conte com a proteção como estratégia de operação.

Monitore utilização, potência e largura do link sob carga. GPU-Z/HWiNFO ajudam no Windows; no Linux, lspci -vv mostra LnkCap/LnkSta. O link pode baixar de geração em repouso. Evite riser de mineração x1 para esta aplicação com transferência de experts.

03 · Onde o tempo é gasto

28 GB de capacidade não viram uma GPU de 28 GB

ComponenteCapacidade / bandaConsequência
RTX 5060 Ti16 GB; cerca de 448 GB/sPrioridade para modelos que caibam nela; maior banda e computação que a 3060.
RTX 306012 GB; cerca de 360 GB/sAmplia capacidade ou executa outro modelo; pode alongar o caminho de uma única resposta.
E5-2695 v4 + DDR44 canais, até 76,8 GB/s teóricos a 2400 MT/s; 18 núcleos/36 threads128 GB dão capacidade. Quatro canais ativos dão banda. Medir a banda sustentada; não assumir o máximo.
E5-2695 v3Até cerca de 68 GB/s em 4 canais DDR4-2133Identificação da revisão muda os parâmetros de referência.
PCIe 3.0 do X99x16 ≈15,75; x8 ≈7,88; x4 ≈3,94 GB/s por sentido, antes de overhead de protocoloÉ muito mais lento que VRAM. Pesos residentes evitam transferência integral a cada token.

Especificações e referências: [2,3,5,6]. A 5060 Ti usa apenas oito pistas: no X99, no máximo PCIe 3.0 x8 ≈7,88 GB/s por sentido, mesmo num slot x16. Isso não reduz a banda interna de 448 GB/s da VRAM. Pode limitar transferências de experts; com pesos residentes, o impacto pode ser menor. A 3060 admite x16, mas a placa-mãe define a distribuição efetiva.

Modelo denso

Em geração de uma resposta, quase todos os pesos participam a cada token. Dividir camadas mantém pesos nas respectivas GPUs e transfere ativações entre trechos. O tempo dos trechos tende a se somar; somar 448 + 360 GB/s não prevê tokens/s.

Exemplo idealizado: com 60% dos bytes na 5060 Ti e 40% na 3060, a banda efetiva serial seria 1/(0,6/448 + 0,4/360) ≈ 408 GB/s, antes de computação e comunicação. Isso pode ser pior que uma 5060 Ti sozinha, mas muito melhor que deixar grande parte de um denso na RAM.

Modelo MoE

MoE é uma mistura de especialistas: o roteador escolhe parte dos experts para cada token. Todos os pesos precisam estar acessíveis, mas apenas um subconjunto é calculado. Attention, roteadores e outros tensores também custam memória e tempo.

Guardar experts na RAM não implica copiar todos os pesos à GPU a cada token. O backend pode calcular na CPU durante geração e transferir operações à GPU em lotes durante leitura do prompt. Essa política depende da versão e dos kernels. [9,10]

Prefill é processamento da entrada; decode é geração dos novos tokens. O primeiro favorece computação em lote; o segundo frequentemente esbarra em banda, latência e desquantização. CPU pouco utilizada pode estar esperando RAM; GPU pouco utilizada pode estar esperando CPU. Nem todo gargalo é PCIe.

Não reduzir o número de experts ativados pelo modelo para “otimizar”. Isso altera o cálculo e pode degradar a resposta. --n-cpu-moe 5 significa os pesos MoE das primeiras cinco camadas na CPU, não cinco experts individuais. [9]

04 · Escolha por tamanho real

O que faz sentido rodar

Reserve inicialmente 2–4 GB somados para buffers, contexto e sistema gráfico; a necessidade real pode ser maior. Use os tamanhos em bytes/MiB do arquivo e dos logs: “GB” do download e “GiB” de ferramentas não são a mesma unidade. 24 GB de pesos é alvo inicial, não garantia de caber.

Modelo / famíliaOnde começarCritério
Llama 3.1 8B Q4; Qwen2.5 14B Q45060 Ti sozinhaCandidatos para medir ganho sem CPU calculando pesos. Não há medição desses dois modelos na 5060 Ti nesta página.
Seu Qwen3.6-35B-A3B IQ1_M (~10 GB relatados)5060 Ti sozinha, sem experts na CPU se couberRepetir seu teste de ~53 t/s com o mesmo arquivo, prompt e contexto. O tamanho e a velocidade anteriores são relatos seus, não medições desta página.
Seu Qwen3.6-35B-A3B Q4_K_M (~22,07 GB relatados)Duas GPUs, todas as camadas e experts em VRAMCandidato prioritário para elevar qualidade em relação a Q1 e evitar a RAM. Confirmar buffers e KV.
Seu Qwen3.8-27B Q4 (~17,74 GB relatados); densos 27–32B Q4Duas GPUs; conferir GGUF exatoGanho potencial por eliminar offload. O 27B não cabe só pelos pesos nos 16 GB.
Seu Bonsai 27B Q2 (~8,52 GB relatados)5060 Ti ou modelo independente na 3060Permite comparar latência individual com produtividade de dois agentes.
Densos 70B Q4 (~40–45 GB, ordem de grandeza)RAM + GPUsCabem na capacidade do sistema, mas terão dependência forte da CPU. Não são a escolha inicial para máxima velocidade.
Qwen3.8-Flash-NextHíbrido: GPU para partes compartilhadas e buffers; experts majoritariamente na RAMMesmo Q1 excede muito os 28 GB de VRAM.

Flash-Next: tamanhos publicados pela Unsloth

QuantizaçãoTamanho listadoDecisão para 128 GB RAM + 28 GB VRAM
UD-IQ1_S / UD-IQ1_M72,5 / 74,5 GBComeçar pelo arquivo já usado, para isolar o ganho de hardware.
UD-Q2_K_XL / UD-IQ3_XXS78,9 / 82 GBCandidatos de comparação de qualidade; Q1 → Q2 pode aumentar pouco o tamanho total.
UD-IQ4_XS93,7 GBCabe em princípio no conjunto, com controle de memória; é a quantização do teste com duas 3060.
UD-Q4_K_XL111 GBMais apertado; verificar RAM residente, buffers e eventual duplicação CPU/GPU antes de adotar.
UD-Q5_K_XL158 GBNão é candidato confortável: o arquivo sozinho já supera a soma nominal 128 + 28, antes de reservas.

Fonte: repositório Unsloth. O catálogo exibe 177B parâmetros enquanto o modelo é divulgado como 125B; não equiparar automaticamente contagem de tensores empacotados à contagem anunciada. Para capacidade, use o arquivo exato. “Q1” dinâmico não significa todos os tensores em um bit.

Melhor escolha inicial: Qwen3.6 Q4 inteiramente nas duas GPUs para uso diário e Flash-Next híbrido quando a qualidade justificar a latência. Para dois trabalhos simultâneos, um modelo por GPU evita comunicação entre elas; os dois ainda compartilham CPU, RAM, refrigeração e fonte.

05 · Medição publicada ≠ previsão

Benchmarks úteis, com limites explícitos

Não foi localizado um teste controlado do conjunto exato E5-2695 + 5060 Ti + 3060 no Flash-Next. Esta é uma seleção das evidências relevantes encontradas, não um inventário exaustivo da internet.

Teste e origemLeitura do promptGeraçãoLimitação
5060 Ti 16 GB · Llama 2 7B Q4_0 · FA ligado · llama.cpp 89d10294.195,53 t/s (pp512)93,46 t/s (tg128)Microbenchmark; contexto curto.
3060 12 GB · mesmo modelo/FA · baa92552.407,67 t/s76,92 t/sOutro host e commit: não é comparação controlada.
2×3060 + 7800X3D · Flash-Next IQ4_XS · llama.cpp · -ub 2048303 t/s12 t/sPrompt sintético 8k; contexto alocado 131k.
Mesmo host/modelo · ik_llama.cpp · -ub 2048407 t/s13 t/sGeração curta, 64 tokens; relato de uma máquina.

Fontes: placar CUDA e autor do teste Flash-Next.

O placar CUDA sugere ganho de 1,22× na geração e 1,74× no prefill entre essas entradas da 5060 Ti e da 3060. São hosts e commits diferentes; não é promessa para outro modelo. A banda teórica aumenta 24,4% (448/360), muito menos que na 5070 Ti. O principal ganho dos 16 GB pode ser eliminar offload para a CPU.

Achado transferível para testar: no relato Flash-Next, trocar divisão tensor por camadas e aumentar o microbatch trouxe grande ganho de prefill. Todos os experts em RAM deixaram espaço para buffers. O efeito na geração foi bem menor. A configuração deve ser retestada em cada versão.

Memória mapeada (mmap) pode aparecer como cache recuperável do sistema. Um painel mostrando “32 GB usados” não significa que um arquivo de 94 GB passou a precisar de apenas 32 GB físicos para rodar bem. Observe memória disponível, paginação e leitura de disco durante inferência. [9,10]

Power limit: não encontrei uma curva controlada de watts × prefill × decode para esta dupla. O relato de uma 3060 a 145 W no Flash-Next não tem comparação A/B que prove perda zero. O exemplo “180 W versus 250 W” do placar CUDA refere-se a outra GPU, não comprova esse resultado na 5060 Ti. Relato de 145 W.

06 · Pontos de partida

Configurações para comparar, sem promessa de ótimo

Use um build CUDA recente com suporte à arquitetura do GGUF e às duas GPUs. No Linux Mint, o caminho nativo facilita comparar com os relatos. No Windows, use o executável correspondente e driver compatível; em LM Studio/Unsloth, confira a versão do backend e o log de carregamento. Um menu de GPU não comprova que todos os tensores foram para VRAM.

Primeiro execute llama-server --list-devices e llama-server --help. Abaixo, CUDA0 deve ser a 5060 Ti e CUDA1 a 3060; ajuste a ordem pelo resultado real. Troque modelo.gguf pelo caminho do arquivo (primeiro shard, se dividido). Opções não reconhecidas exigem revisar o build, não ignorar erros.

A · Só a 5060 Ti: mínimo de comunicação
llama-server -m modelo.gguf --device CUDA0 -ngl 999 -sm none -c 8192 -b 2048 -ub 512 -fa on -ctk q8_0 -ctv q8_0 -t 18 -tb 18 --parallel 1 --host 127.0.0.1 --port 8080

Não aplicar --cpu-moe neste perfil. Se o cache Q8 não for suportado pela arquitetura/build, voltar a F16 e reavaliar a memória. Começar com contexto pequeno facilita distinguir limite de pesos de limite de cache.

B · Duas GPUs: modelo inteiro em VRAM
llama-server -m modelo.gguf --device CUDA0,CUDA1 -ngl 999 -sm layer -ts 60,40 -c 8192 -b 2048 -ub 512 -fa on -ctk q8_0 -ctv q8_0 -t 18 -tb 18 --parallel 1 --host 127.0.0.1 --port 8080

60,40 é hipótese inicial de distribuição. Testar também 55,45 e 65,35 conforme VRAM livre. Mais trabalho na 5060 Ti pode ajudar, mas não adianta provocar falta de memória. A divisão é por camadas discretas, não percentual exato de watts, banda ou utilização. Verifique no log se ainda restaram camadas na CPU.

C · Flash-Next: partes compartilhadas na GPU, experts na RAM
llama-server -m modelo.gguf --device CUDA0,CUDA1 -ngl 999 -sm layer -ts 60,40 --cpu-moe -c 8192 -b 4096 -ub 512 -fa on -ctk q8_0 -ctv q8_0 -t 18 -tb 18 --parallel 1 --host 127.0.0.1 --port 8080

Primeiro confirme que carrega e gera corretamente. Depois teste microbatch 1024 e 2048. Compare todos os experts na RAM com --n-cpu-moe N, removendo --cpu-moe. Comece N no total de camadas do arquivo e reduza em passos de 2, registrando VRAM e ambas as velocidades. Não inventar N com base no número de experts ativados.

Semântica das opções: documentação do llama-server. Estas linhas são propostas para seu hardware, não comandos executados nele.

O que fazer com o ik_llama.cpp?

Vale um teste separado para o Flash-Next: existe implementação específica na PR #2365. Registre o commit e leia o help do próprio fork. Não copiar indiscriminadamente flags entre projetos. Compare qualidade, RAM residente, prefill e decode; o fork que vence em um contexto pode perder em outro.

FP4 e especulação: um GGUF Q4 não usa automaticamente os Tensor Cores FP4 da Blackwell. A 3060 também não tem o mesmo suporte nativo. Comece com CUDA/GGUF comum; investigue NVFP4 apenas com modelo e backend compatíveis. Teste MTP/draft/ngram somente depois da base estável: medindo aceitação, memória adicional e tempo final da resposta. Mais tokens propostos não significam mais tokens aceitos por segundo.

07 · Encontrar o melhor ponto no seu PC

Otimizar por medição

Ordem de experimentos

  1. Fixar GGUF, versão, prompt, contexto, cache e amostragem. Comparar 3060, 5060 Ti e dupla.
  2. No Flash-Next, incluir referência só CPU (-ngl 0 --device none) e híbrida só 5060 Ti. Todos os experts na CPU é diferente de modelo inteiro na CPU.
  3. Testar -t em 8, 12 e 18 no v4; depois 36 como controle. Mais threads podem aumentar contenção. No v3, incluir 14 núcleos físicos. Variar -tb separadamente.
  4. Varrer microbatch 512, 1024 e 2048, mantendo batch ≥ microbatch. Depois ajustar experts na VRAM. Reservar espaço para os buffers necessários.
  5. Somente com alimentação aprovada, testar 5060 Ti a 180/160/150/130 W e 3060 a 170/145/120 W, respeitando limites aceitos pelo VBIOS. Alterar uma variável de cada vez.
  6. Repetir três vezes após aquecimento. Medir prompt curto e 8k, gerar pelo menos 256 tokens e também testar a profundidade de contexto realmente usada.

O que registrar

Prefill, decode, tempo até primeiro token, duração total, pico de VRAM, RAM disponível, paginação, potência média de cada GPU, consumo na tomada e qualidade da resposta.

Eficiência: tokens/s ÷ watts na tomada = tokens por joule. Exemplo hipotético: 10 t/s a 400 W dá 0,025 token/J; 9,5 t/s a 300 W dá 0,0317 token/J, ganho de 27% em eficiência com perda de 5% em velocidade.

Use mediana das repetições; empate de poucos por cento não justifica complexidade. Avalie programação com o mesmo conjunto de tarefas e testes de resultado, especialmente ao comparar Q1 com Q4.

Modelo inteiro na CPU? Útil como controle, ou se liberar as GPUs para outro trabalho compensar. Não é a recomendação padrão para aproveitar a 5060 Ti. Se vencer o híbrido, investigue build, kernels, offload, RAM e PCIe antes de concluir que GPU não ajuda.

Monitorar e limitar potência

nvidia-smi --query-gpu=index,uuid,name,power.draw,power.limit,memory.used,temperature.gpu --format=csv
nvidia-smi -q -d POWER
nvidia-smi topo -m

# Administrador/root; substituir pelos UUIDs reais.
# Exemplos de ensaio, apenas com alimentação validada:
nvidia-smi -i GPU-UUID-DA-5060TI -pl 150
nvidia-smi -i GPU-UUID-DA-3060 -pl 120

O nvidia-smi exige suporte do dispositivo e limites entre mínimo e máximo reportados. UUID evita trocar as placas quando a enumeração muda. No Linux, executar alterações com sudo; no Windows, terminal como administrador. Para restaurar, use o Default Power Limit lido antes do teste, não um valor nominal presumido. Documentação NVIDIA.

Persistência: revalide após reinício e reset/atualização de driver. Depois de estabilizar, o Agendador de Tarefas do Windows ou um serviço systemd pode reaplicar o limite com privilégio adequado e registrar falhas. A fonte e os cabos devem suportar a instalação mesmo se essa automação não executar. MSI Afterburner não exige que a placa seja MSI; compatibilidade e controles dependem do modelo.

A leitura de potência da GPU não mede a fonte inteira nem sua estabilidade. Para consumo AC, use wattímetro adequado à tomada. Leituras de +12 V de software não validam ripple ou transientes; isso exige instrumentação apropriada. Não abrir a fonte para medir.

Expectativa de velocidade sem falsa precisão

Para modelos que cabem na 5060 Ti, as medições publicadas demonstram ganho moderado de geração sobre a 3060 no microbenchmark, mas variam muito por modelo. Para o Flash-Next, não há base para prometer que os seus ~5–8 t/s virarão 20–30 t/s. Os 16 GB novos podem melhorar prefill, permitir quantização melhor e reduzir trabalho na CPU; o ganho de decode depende de quanto do caminho crítico realmente migrou.

Se 70% do tempo continuar na CPU/RAM e os 30% restantes ficarem 2,5× mais rápidos, a aceleração total ideal é 1/(0,7 + 0,3/2,5) = 1,22×. É um exemplo matemático, não uma estimativa medida do seu PC. A prioridade é descobrir essa parcela com os testes.

08 · Rastreabilidade

Fontes e pendências

Consulta em 05/09/2026. Especificações de fabricante, dados submetidos pelos autores e hipóteses de dimensionamento têm pesos diferentes. Nenhum benchmark desta página foi executado no computador do proprietário.

  1. MSI — MAG A650BN original: capacidade e conectores. Variante PCIE5 III: produto diferente.
  2. NVIDIA — família RTX 5060: 180 W de referência. MSI Ventus 2X OC Plus: PCIe x8, 8-pin, memória de 28 Gbps × 128 bits ÷ 8 = 448 GB/s. MSI Gaming OC: exemplo com 16-pin.
  3. NVIDIA — família RTX 3060: potência e memória de referência.
  4. Corsair — diferenças entre cabos e adaptadores 12V-2x6.
  5. Intel E5-2695 v4 e v3: memória, núcleos e PCIe.
  6. AMD 7800X3D: suporta AVX-512, ao contrário do Xeon E5 v4; os hosts não são equivalentes.
  7. llama.cpp — medições CUDA.
  8. Unsloth — arquivos Flash-Next: tamanhos e quantizações. Guia de execução.
  9. llama-server — opções atuais.
  10. ik_llama.cpp — implementação Flash-Next e teste do autor com duas 3060.
  11. NVIDIA-SMI: monitoramento e limites de potência.
Para fechar a instalação: foto legível da etiqueta da fonte, foto dos cabos PCIe e seus ramos, modelo completo da 5060 Ti e da placa-mãe. Para fechar os parâmetros: nome exato do GGUF, runtime/versão e log de carregamento. Até lá, não considerar aprovada a ligação à fonte de 650 W.