01 · Antes de energizar
650 W pode bastar; os cabos ainda precisam ser conferidos
Correção do hardware: a placa comprada é a RTX 5060 Ti 16 GB. A análise anterior usava uma 5070 Ti: retiramos aqueles benchmarks, a potência de 300 W e a recomendação de 850 W para o conjunto.
Uma boa fonte de 650 W pode ser suficiente para este conjunto; não há motivo para exigir 850 W apenas pela soma das placas. A aprovação depende do modelo, estado, capacidade em +12 V e cabeamento. Se precisar trocar por falta de cabos ou margem, 750 W de boa qualidade é um alvo razoável; 850 W é opcional para expansões. ATX 3.1 é desejável numa compra nova, não requisito universal para uma 5060 Ti com 8-pin. O selo 80 PLUS mede eficiência, não garante qualidade elétrica.
A 5060 Ti de referência tem 180 W; a 3060, 170 W. Assumindo 120 W para o processador e 50–90 W para placa-mãe, RAM, discos, ventoinhas e perdas dos reguladores, a conta chega a 520–560 W DC. TDP de CPU não é medição de consumo máximo: esta é uma triagem, não um teto certificado. Modelos OC podem consumir mais. [2,3,5]
Uma configuração limitada a 150 + 120 W, com CPU a 120 W e demais componentes a 70 W, soma 460 W DC. Isso melhora a folga aritmética de 650 W, mas não aprova a instalação: faltam capacidade dos cabos, estado da fonte, limites reais e transientes. Inicialização, reset de driver ou perfil perdido podem remover o limite.
Estimador de carga da fonte
Valores hipotéticos em watts entregues aos componentes. Não é uma medição nem um teste de segurança.
Folga aritmética: 110 W (83% de carga). Não certifica cabos nem transientes.
Qual “terminação” você tem?
| Ligação considerada | Decisão |
|---|---|
| Segundo plugue do mesmo chicote que alimenta a 3060 | Não presumir capacidade para as duas placas. Os dois plugues compartilham parte da fiação. Preferir cabos independentes; usar o chicote compartilhado somente se houver confirmação do fabricante para a carga combinada. Parte da potência vem dos slots, mas não se pode presumir que cada slot fornecerá 75 W para aliviar o cabo. |
| Cabo PCIe separado + adaptador que acompanha a GPU | A 5060 Ti pode usar um único 8-pin: a MSI Ventus 2X OC Plus é um exemplo. A MSI Gaming OC usa 16-pin. Conferir o modelo comprado e alimentar todas as entradas do adaptador exigidas pelo manual; não transferir a exigência de cabos da 5070 Ti. |
| Cabo 12V-2x6 nativo da fonte | Opção para modelos com conector de 16 pinos; não é necessário para uma placa de 8 pinos. Com potência e compatibilidade confirmadas, inserir até travar, sem folga, sem pressão lateral ou dobra junto ao conector; respeitar o manual. |
| SATA/Molex → PCIe, divisor genérico ou EPS/CPU 8-pin | Não usar nessa instalação. EPS e PCIe não são intercambiáveis. |
| Cabo modular de outra fonte | Não reutilizar sem compatibilidade expressa para o modelo exato. A pinagem do lado da fonte pode mudar mesmo entre produtos da mesma marca. |
A MAG A650BN original declara 54 A/648 W em +12 V e dois PCIe 6+2. Existem variantes MAG PCIE5 com conectores diferentes. Foto da etiqueta e dos cabos é necessária para identificar a sua. [1,4]
02 · Compatibilidade física e elétrica
Sequência de instalação
- Identifique os quatro componentes: modelo completo da fonte, modelo da 5060 Ti, placa-mãe X99 e revisão do Xeon (v3 ou v4). Verifique idade da fonte, conectores da 3060 e eventual desbloqueio de turbo da CPU.
- Confira espaço e pistas: a espessura da 5060 Ti varia entre modelos. Verifique comprimento, espessura, entrada de ar e folga para o cabo. Use suporte para o peso. Um slot fisicamente x16 pode operar em x4 ou compartilhar pistas com o NVMe.
- Com o PC desligado, fonte desligada e cabo da tomada removido: instale a 5060 Ti no slot de maior largura elétrica ligado à CPU, normalmente o superior. Não abra a fonte. Não force conectores e não faça conexão com o sistema energizado.
- Comece apenas com a 5060 Ti numa alimentação aprovada. Confira vídeo, driver e temperaturas; depois inclua a 3060 com cabo adequado. As duas podem usar o mesmo driver NVIDIA que suporte ambas; SLI/NVLink não é necessário.
- Se a segunda GPU não aparecer: confira manual/BIOS, mapeamento PCIe e opção Above 4G Decoding. Não altere CSM ou modo de boot às cegas: isso pode impedir o sistema atual de iniciar. ReBAR não é pré-requisito universal de llama.cpp.
- Valide sob carga gradualmente: primeiro cada GPU, depois inferência conjunta e CPU. Reinício, erro de GPU, cheiro, ruído elétrico anormal ou conector danificado exigem interromper o teste. Fonte insuficiente pode desligar por proteção; não conte com a proteção como estratégia de operação.
Monitore utilização, potência e largura do link sob carga. GPU-Z/HWiNFO ajudam no Windows; no Linux, lspci -vv mostra LnkCap/LnkSta. O link pode baixar de geração em repouso. Evite riser de mineração x1 para esta aplicação com transferência de experts.
03 · Onde o tempo é gasto
28 GB de capacidade não viram uma GPU de 28 GB
| Componente | Capacidade / banda | Consequência |
|---|---|---|
| RTX 5060 Ti | 16 GB; cerca de 448 GB/s | Prioridade para modelos que caibam nela; maior banda e computação que a 3060. |
| RTX 3060 | 12 GB; cerca de 360 GB/s | Amplia capacidade ou executa outro modelo; pode alongar o caminho de uma única resposta. |
| E5-2695 v4 + DDR4 | 4 canais, até 76,8 GB/s teóricos a 2400 MT/s; 18 núcleos/36 threads | 128 GB dão capacidade. Quatro canais ativos dão banda. Medir a banda sustentada; não assumir o máximo. |
| E5-2695 v3 | Até cerca de 68 GB/s em 4 canais DDR4-2133 | Identificação da revisão muda os parâmetros de referência. |
| PCIe 3.0 do X99 | x16 ≈15,75; x8 ≈7,88; x4 ≈3,94 GB/s por sentido, antes de overhead de protocolo | É muito mais lento que VRAM. Pesos residentes evitam transferência integral a cada token. |
Especificações e referências: [2,3,5,6]. A 5060 Ti usa apenas oito pistas: no X99, no máximo PCIe 3.0 x8 ≈7,88 GB/s por sentido, mesmo num slot x16. Isso não reduz a banda interna de 448 GB/s da VRAM. Pode limitar transferências de experts; com pesos residentes, o impacto pode ser menor. A 3060 admite x16, mas a placa-mãe define a distribuição efetiva.
Modelo denso
Em geração de uma resposta, quase todos os pesos participam a cada token. Dividir camadas mantém pesos nas respectivas GPUs e transfere ativações entre trechos. O tempo dos trechos tende a se somar; somar 448 + 360 GB/s não prevê tokens/s.
Exemplo idealizado: com 60% dos bytes na 5060 Ti e 40% na 3060, a banda efetiva serial seria 1/(0,6/448 + 0,4/360) ≈ 408 GB/s, antes de computação e comunicação. Isso pode ser pior que uma 5060 Ti sozinha, mas muito melhor que deixar grande parte de um denso na RAM.
Modelo MoE
MoE é uma mistura de especialistas: o roteador escolhe parte dos experts para cada token. Todos os pesos precisam estar acessíveis, mas apenas um subconjunto é calculado. Attention, roteadores e outros tensores também custam memória e tempo.
Guardar experts na RAM não implica copiar todos os pesos à GPU a cada token. O backend pode calcular na CPU durante geração e transferir operações à GPU em lotes durante leitura do prompt. Essa política depende da versão e dos kernels. [9,10]
Prefill é processamento da entrada; decode é geração dos novos tokens. O primeiro favorece computação em lote; o segundo frequentemente esbarra em banda, latência e desquantização. CPU pouco utilizada pode estar esperando RAM; GPU pouco utilizada pode estar esperando CPU. Nem todo gargalo é PCIe.
Não reduzir o número de experts ativados pelo modelo para “otimizar”. Isso altera o cálculo e pode degradar a resposta. --n-cpu-moe 5 significa os pesos MoE das primeiras cinco camadas na CPU, não cinco experts individuais. [9]
04 · Escolha por tamanho real
O que faz sentido rodar
Reserve inicialmente 2–4 GB somados para buffers, contexto e sistema gráfico; a necessidade real pode ser maior. Use os tamanhos em bytes/MiB do arquivo e dos logs: “GB” do download e “GiB” de ferramentas não são a mesma unidade. 24 GB de pesos é alvo inicial, não garantia de caber.
| Modelo / família | Onde começar | Critério |
|---|---|---|
| Llama 3.1 8B Q4; Qwen2.5 14B Q4 | 5060 Ti sozinha | Candidatos para medir ganho sem CPU calculando pesos. Não há medição desses dois modelos na 5060 Ti nesta página. |
| Seu Qwen3.6-35B-A3B IQ1_M (~10 GB relatados) | 5060 Ti sozinha, sem experts na CPU se couber | Repetir seu teste de ~53 t/s com o mesmo arquivo, prompt e contexto. O tamanho e a velocidade anteriores são relatos seus, não medições desta página. |
| Seu Qwen3.6-35B-A3B Q4_K_M (~22,07 GB relatados) | Duas GPUs, todas as camadas e experts em VRAM | Candidato prioritário para elevar qualidade em relação a Q1 e evitar a RAM. Confirmar buffers e KV. |
| Seu Qwen3.8-27B Q4 (~17,74 GB relatados); densos 27–32B Q4 | Duas GPUs; conferir GGUF exato | Ganho potencial por eliminar offload. O 27B não cabe só pelos pesos nos 16 GB. |
| Seu Bonsai 27B Q2 (~8,52 GB relatados) | 5060 Ti ou modelo independente na 3060 | Permite comparar latência individual com produtividade de dois agentes. |
| Densos 70B Q4 (~40–45 GB, ordem de grandeza) | RAM + GPUs | Cabem na capacidade do sistema, mas terão dependência forte da CPU. Não são a escolha inicial para máxima velocidade. |
| Qwen3.8-Flash-Next | Híbrido: GPU para partes compartilhadas e buffers; experts majoritariamente na RAM | Mesmo Q1 excede muito os 28 GB de VRAM. |
Flash-Next: tamanhos publicados pela Unsloth
| Quantização | Tamanho listado | Decisão para 128 GB RAM + 28 GB VRAM |
|---|---|---|
| UD-IQ1_S / UD-IQ1_M | 72,5 / 74,5 GB | Começar pelo arquivo já usado, para isolar o ganho de hardware. |
| UD-Q2_K_XL / UD-IQ3_XXS | 78,9 / 82 GB | Candidatos de comparação de qualidade; Q1 → Q2 pode aumentar pouco o tamanho total. |
| UD-IQ4_XS | 93,7 GB | Cabe em princípio no conjunto, com controle de memória; é a quantização do teste com duas 3060. |
| UD-Q4_K_XL | 111 GB | Mais apertado; verificar RAM residente, buffers e eventual duplicação CPU/GPU antes de adotar. |
| UD-Q5_K_XL | 158 GB | Não é candidato confortável: o arquivo sozinho já supera a soma nominal 128 + 28, antes de reservas. |
Fonte: repositório Unsloth. O catálogo exibe 177B parâmetros enquanto o modelo é divulgado como 125B; não equiparar automaticamente contagem de tensores empacotados à contagem anunciada. Para capacidade, use o arquivo exato. “Q1” dinâmico não significa todos os tensores em um bit.
Melhor escolha inicial: Qwen3.6 Q4 inteiramente nas duas GPUs para uso diário e Flash-Next híbrido quando a qualidade justificar a latência. Para dois trabalhos simultâneos, um modelo por GPU evita comunicação entre elas; os dois ainda compartilham CPU, RAM, refrigeração e fonte.
05 · Medição publicada ≠ previsão
Benchmarks úteis, com limites explícitos
Não foi localizado um teste controlado do conjunto exato E5-2695 + 5060 Ti + 3060 no Flash-Next. Esta é uma seleção das evidências relevantes encontradas, não um inventário exaustivo da internet.
| Teste e origem | Leitura do prompt | Geração | Limitação |
|---|---|---|---|
5060 Ti 16 GB · Llama 2 7B Q4_0 · FA ligado · llama.cpp 89d1029 | 4.195,53 t/s (pp512) | 93,46 t/s (tg128) | Microbenchmark; contexto curto. |
3060 12 GB · mesmo modelo/FA · baa9255 | 2.407,67 t/s | 76,92 t/s | Outro host e commit: não é comparação controlada. |
2×3060 + 7800X3D · Flash-Next IQ4_XS · llama.cpp · -ub 2048 | 303 t/s | 12 t/s | Prompt sintético 8k; contexto alocado 131k. |
Mesmo host/modelo · ik_llama.cpp · -ub 2048 | 407 t/s | 13 t/s | Geração curta, 64 tokens; relato de uma máquina. |
Fontes: placar CUDA e autor do teste Flash-Next.
O placar CUDA sugere ganho de 1,22× na geração e 1,74× no prefill entre essas entradas da 5060 Ti e da 3060. São hosts e commits diferentes; não é promessa para outro modelo. A banda teórica aumenta 24,4% (448/360), muito menos que na 5070 Ti. O principal ganho dos 16 GB pode ser eliminar offload para a CPU.
Memória mapeada (mmap) pode aparecer como cache recuperável do sistema. Um painel mostrando “32 GB usados” não significa que um arquivo de 94 GB passou a precisar de apenas 32 GB físicos para rodar bem. Observe memória disponível, paginação e leitura de disco durante inferência. [9,10]
Power limit: não encontrei uma curva controlada de watts × prefill × decode para esta dupla. O relato de uma 3060 a 145 W no Flash-Next não tem comparação A/B que prove perda zero. O exemplo “180 W versus 250 W” do placar CUDA refere-se a outra GPU, não comprova esse resultado na 5060 Ti. Relato de 145 W.
06 · Pontos de partida
Configurações para comparar, sem promessa de ótimo
Use um build CUDA recente com suporte à arquitetura do GGUF e às duas GPUs. No Linux Mint, o caminho nativo facilita comparar com os relatos. No Windows, use o executável correspondente e driver compatível; em LM Studio/Unsloth, confira a versão do backend e o log de carregamento. Um menu de GPU não comprova que todos os tensores foram para VRAM.
Primeiro execute llama-server --list-devices e llama-server --help. Abaixo, CUDA0 deve ser a 5060 Ti e CUDA1 a 3060; ajuste a ordem pelo resultado real. Troque modelo.gguf pelo caminho do arquivo (primeiro shard, se dividido). Opções não reconhecidas exigem revisar o build, não ignorar erros.
A · Só a 5060 Ti: mínimo de comunicação
llama-server -m modelo.gguf --device CUDA0 -ngl 999 -sm none -c 8192 -b 2048 -ub 512 -fa on -ctk q8_0 -ctv q8_0 -t 18 -tb 18 --parallel 1 --host 127.0.0.1 --port 8080
Não aplicar --cpu-moe neste perfil. Se o cache Q8 não for suportado pela arquitetura/build, voltar a F16 e reavaliar a memória. Começar com contexto pequeno facilita distinguir limite de pesos de limite de cache.
B · Duas GPUs: modelo inteiro em VRAM
llama-server -m modelo.gguf --device CUDA0,CUDA1 -ngl 999 -sm layer -ts 60,40 -c 8192 -b 2048 -ub 512 -fa on -ctk q8_0 -ctv q8_0 -t 18 -tb 18 --parallel 1 --host 127.0.0.1 --port 8080
60,40 é hipótese inicial de distribuição. Testar também 55,45 e 65,35 conforme VRAM livre. Mais trabalho na 5060 Ti pode ajudar, mas não adianta provocar falta de memória. A divisão é por camadas discretas, não percentual exato de watts, banda ou utilização. Verifique no log se ainda restaram camadas na CPU.
C · Flash-Next: partes compartilhadas na GPU, experts na RAM
llama-server -m modelo.gguf --device CUDA0,CUDA1 -ngl 999 -sm layer -ts 60,40 --cpu-moe -c 8192 -b 4096 -ub 512 -fa on -ctk q8_0 -ctv q8_0 -t 18 -tb 18 --parallel 1 --host 127.0.0.1 --port 8080
Primeiro confirme que carrega e gera corretamente. Depois teste microbatch 1024 e 2048. Compare todos os experts na RAM com --n-cpu-moe N, removendo --cpu-moe. Comece N no total de camadas do arquivo e reduza em passos de 2, registrando VRAM e ambas as velocidades. Não inventar N com base no número de experts ativados.
Semântica das opções: documentação do llama-server. Estas linhas são propostas para seu hardware, não comandos executados nele.
O que fazer com o ik_llama.cpp?
Vale um teste separado para o Flash-Next: existe implementação específica na PR #2365. Registre o commit e leia o help do próprio fork. Não copiar indiscriminadamente flags entre projetos. Compare qualidade, RAM residente, prefill e decode; o fork que vence em um contexto pode perder em outro.
FP4 e especulação: um GGUF Q4 não usa automaticamente os Tensor Cores FP4 da Blackwell. A 3060 também não tem o mesmo suporte nativo. Comece com CUDA/GGUF comum; investigue NVFP4 apenas com modelo e backend compatíveis. Teste MTP/draft/ngram somente depois da base estável: medindo aceitação, memória adicional e tempo final da resposta. Mais tokens propostos não significam mais tokens aceitos por segundo.
07 · Encontrar o melhor ponto no seu PC
Otimizar por medição
Ordem de experimentos
- Fixar GGUF, versão, prompt, contexto, cache e amostragem. Comparar 3060, 5060 Ti e dupla.
- No Flash-Next, incluir referência só CPU (
-ngl 0 --device none) e híbrida só 5060 Ti. Todos os experts na CPU é diferente de modelo inteiro na CPU. - Testar
-tem 8, 12 e 18 no v4; depois 36 como controle. Mais threads podem aumentar contenção. No v3, incluir 14 núcleos físicos. Variar-tbseparadamente. - Varrer microbatch 512, 1024 e 2048, mantendo batch ≥ microbatch. Depois ajustar experts na VRAM. Reservar espaço para os buffers necessários.
- Somente com alimentação aprovada, testar 5060 Ti a 180/160/150/130 W e 3060 a 170/145/120 W, respeitando limites aceitos pelo VBIOS. Alterar uma variável de cada vez.
- Repetir três vezes após aquecimento. Medir prompt curto e 8k, gerar pelo menos 256 tokens e também testar a profundidade de contexto realmente usada.
O que registrar
Prefill, decode, tempo até primeiro token, duração total, pico de VRAM, RAM disponível, paginação, potência média de cada GPU, consumo na tomada e qualidade da resposta.
Eficiência: tokens/s ÷ watts na tomada = tokens por joule. Exemplo hipotético: 10 t/s a 400 W dá 0,025 token/J; 9,5 t/s a 300 W dá 0,0317 token/J, ganho de 27% em eficiência com perda de 5% em velocidade.
Use mediana das repetições; empate de poucos por cento não justifica complexidade. Avalie programação com o mesmo conjunto de tarefas e testes de resultado, especialmente ao comparar Q1 com Q4.
Monitorar e limitar potência
nvidia-smi --query-gpu=index,uuid,name,power.draw,power.limit,memory.used,temperature.gpu --format=csv nvidia-smi -q -d POWER nvidia-smi topo -m # Administrador/root; substituir pelos UUIDs reais. # Exemplos de ensaio, apenas com alimentação validada: nvidia-smi -i GPU-UUID-DA-5060TI -pl 150 nvidia-smi -i GPU-UUID-DA-3060 -pl 120
O nvidia-smi exige suporte do dispositivo e limites entre mínimo e máximo reportados. UUID evita trocar as placas quando a enumeração muda. No Linux, executar alterações com sudo; no Windows, terminal como administrador. Para restaurar, use o Default Power Limit lido antes do teste, não um valor nominal presumido. Documentação NVIDIA.
Persistência: revalide após reinício e reset/atualização de driver. Depois de estabilizar, o Agendador de Tarefas do Windows ou um serviço systemd pode reaplicar o limite com privilégio adequado e registrar falhas. A fonte e os cabos devem suportar a instalação mesmo se essa automação não executar. MSI Afterburner não exige que a placa seja MSI; compatibilidade e controles dependem do modelo.
A leitura de potência da GPU não mede a fonte inteira nem sua estabilidade. Para consumo AC, use wattímetro adequado à tomada. Leituras de +12 V de software não validam ripple ou transientes; isso exige instrumentação apropriada. Não abrir a fonte para medir.
Expectativa de velocidade sem falsa precisão
Para modelos que cabem na 5060 Ti, as medições publicadas demonstram ganho moderado de geração sobre a 3060 no microbenchmark, mas variam muito por modelo. Para o Flash-Next, não há base para prometer que os seus ~5–8 t/s virarão 20–30 t/s. Os 16 GB novos podem melhorar prefill, permitir quantização melhor e reduzir trabalho na CPU; o ganho de decode depende de quanto do caminho crítico realmente migrou.
Se 70% do tempo continuar na CPU/RAM e os 30% restantes ficarem 2,5× mais rápidos, a aceleração total ideal é 1/(0,7 + 0,3/2,5) = 1,22×. É um exemplo matemático, não uma estimativa medida do seu PC. A prioridade é descobrir essa parcela com os testes.
08 · Rastreabilidade
Fontes e pendências
Consulta em 05/09/2026. Especificações de fabricante, dados submetidos pelos autores e hipóteses de dimensionamento têm pesos diferentes. Nenhum benchmark desta página foi executado no computador do proprietário.
- MSI — MAG A650BN original: capacidade e conectores. Variante PCIE5 III: produto diferente.
- NVIDIA — família RTX 5060: 180 W de referência. MSI Ventus 2X OC Plus: PCIe x8, 8-pin, memória de 28 Gbps × 128 bits ÷ 8 = 448 GB/s. MSI Gaming OC: exemplo com 16-pin.
- NVIDIA — família RTX 3060: potência e memória de referência.
- Corsair — diferenças entre cabos e adaptadores 12V-2x6.
- Intel E5-2695 v4 e v3: memória, núcleos e PCIe.
- AMD 7800X3D: suporta AVX-512, ao contrário do Xeon E5 v4; os hosts não são equivalentes.
- llama.cpp — medições CUDA.
- Unsloth — arquivos Flash-Next: tamanhos e quantizações. Guia de execução.
- llama-server — opções atuais.
- ik_llama.cpp — implementação Flash-Next e teste do autor com duas 3060.
- NVIDIA-SMI: monitoramento e limites de potência.