AMD Ryzen AI Halo: especificações, preço e o impacto na IA local
25 August 2026 · Atualizado 25 August 2026

Gabriel Caetano
ARTIFICIAL INTELIGENCE
AMD Ryzen AI Halo: especificações, preço e o impacto na IA local
O AMD Ryzen AI Halo traz até 128 GB de memória unificada para IA local. Veja especificações, preço e desempenho do Ryzen AI Max+ 395 e se ele pode substituir assinaturas de IA na nuvem.

Tudo sobre o novo AMD Ryzen AI Halo: especificações, preço e por que ele muda o jogo da IA local
A plataforma AMD Ryzen AI Halo é construída em torno do chip Ryzen AI Max+ 395 "Strix Halo", e seu grande diferencial é oferecer até 128 GB de memória unificada, o que permite rodar modelos de 70B de parâmetros direto na sua mesa, sem precisar de assinatura em nuvem. O Ryzen AI MAX+ 395 vem com opções de memória de sistema que vão de 32GB até 128GB de memória unificada, dos quais até 96GB podem ser convertidos em VRAM. É esse teto de memória que torna a inferência local viável para modelos grandes. Dito isso, se você usa IA só algumas vezes por semana, um plano em nuvem de US$ 20/mês ainda sai mais barato do que qualquer workstation.
Este guia cobre o preço, as especificações completas, o desempenho no mundo real e quem realmente deveria comprar um, além da forma mais inteligente de pagar por assinaturas de IA como Claude, ChatGPT e Gemini sem perder dinheiro com taxas de câmbio enquanto você decide.
Ainda pagando por ChatGPT, Claude ou Gemini enquanto avalia montar uma máquina local? A Bleap cobra 0% de taxa de câmbio nas suas assinaturas de IA em dólar e ainda dá 20% de cashback fixo em Claude, ChatGPT e Gemini, com cartão Mastercard self-custodial e nenhuma assinatura própria. (O cashback de 20% vale apenas para Claude, ChatGPT e Gemini.) Peça o cartão Bleap →
1. O que é o AMD Ryzen AI Halo? (Visão Geral do Anúncio)
"Halo" é o codinome da AMD para sua linha topo de gama de silício voltado para IA, e o Ryzen AI Max+ 395 está no topo dessa linha. Anunciado em março de 2025, o AMD Ryzen AI MAX+ 395 (codinome "Strix Halo") é descrito como o APU x86 mais poderoso do mercado, equipado com 16 núcleos de CPU Zen 5, uma NPU XDNA 2 com pico de mais de 50 AI TOPS e uma GPU integrada robusta, com 40 unidades de computação RDNA 3.5.
Em vez de vir em uma única caixa com marca AMD, a plataforma Halo é distribuída em dezenas de mini workstations de parceiros. A AMD está posicionando seu processador Ryzen AI Max+ 395 como a joia da coroa da série Ryzen AI Max 300, com quase 30 modelos de mini workstations de IA Strix Halo lançados em apenas oito meses. A proposta é simples: IA privada, de baixa latência e sem assinatura, rodando direto na sua mesa.
2. Preço e Disponibilidade do AMD Ryzen AI Halo
O preço depende totalmente do integrador do sistema e da configuração de memória, então não existe um preço sugerido único. Os sistemas Strix Halo de entrada ficam bem abaixo das workstations de IA premium, com o sistema Strix Halo da AMD custando cerca de US$ 2.348, alcançando desempenho de inferência comparável ao DGX Spark de US$ 4.699 em precisão FP8 ou FP16. Os modelos totalmente configurados com 128 GB custam mais, e os SKUs voltados para empresas ficam ainda mais caros.
A disponibilidade é ampla. Asus, Beelink, HP e outras marcas já vendem mini-PCs e handhelds Halo tanto no varejo quanto em canais diretos, com memória LPDDR5X quad-channel soldada na placa, ou seja, você escolhe o nível de memória no momento da compra, já que não é possível fazer upgrade depois.
3. Especificações completas do AMD Ryzen AI Halo
Processador e NPU
O Ryzen AI Max+ 395 é um componente sério, digno de workstation. Ele roda 16 núcleos e 32 threads a 3,00 até 5,10 GHz na arquitetura Strix Halo / Zen 5, construído em processo de 4 nm, com uma NPU capaz de até 50 TOPS e desempenho total de IA de até 126 TOPS. A NPU dedicada cuida da inferência leve e contínua, liberando a CPU e a GPU para tarefas mais pesadas com modelos e mantendo o consumo de energia baixo.
Capacidade da GPU e memória unificada
Os gráficos integrados são o verdadeiro diferencial para IA local. O chip combina a placa de vídeo AMD Radeon 8060S (RDNA 3.5, 40 unidades de computação) com até 128GB de memória unificada LPDDR5X-8000 e até 96GB de VRAM alocada dinamicamente, permitindo rodar localmente LLMs com mais de 70 bilhões de parâmetros, como o Llama 3. Como os modelos de linguagem grandes costumam ser limitados pela memória, e não pelo poder de processamento, esse grande volume de memória unificada de alta largura de banda importa muito mais do que a VRAM bruta de uma placa dedicada, que geralmente não passa de 24 GB.
Outras especificações importantes
Os sistemas Halo geralmente contam com Thunderbolt 4 / USB4, dois slots de SSD PCIe 4.0 e múltiplas saídas de vídeo. O design com dois SSDs, um M.2 2280 para o sistema e um slot Mini SSD externo para os modelos de IA, facilita a troca de modelos. Os chassis vão desde torres compactas até dispositivos portáteis de 13 polegadas, todos com folga térmica suficiente para sustentar cargas de trabalho de inferência.
4. Desempenho Real em Benchmarks de Inferência de IA
Os números variam de acordo com a quantização, o comprimento de contexto e o resfriamento, então trate esses valores como estimativas da comunidade, não como especificações fixas.
Benchmark / Modelo | AMD Ryzen AI Halo | Apple M4 Pro | NVIDIA DGX Spark |
|---|---|---|---|
LLaMA 3 70B (tokens/seg) | ~4-6 (Q4) | Não executável (limite de 64 GB) | ~4-5 |
Mistral 7B (tokens/seg) | ~40-50 | ~35-45 | ~35-45 |
DeepSeek-R1 14B (tokens/seg) | ~20-25 | ~18-22 | ~18-22 |
Modelo grande (120B, tokens/seg) | Depende da memória disponível | Não executável | ~38.6 |
Os 128 GB de memória unificada do DGX Spark permitem rodar modelos grandes como o GPT-OSS 120B localmente, mas sua largura de banda de ~273 GB/s em LPDDR5x limita a geração de tokens a cerca de 38,6 tokens/seg. Os testes geralmente são feitos no LM Studio, llama.cpp, Ollama ou ROCm. É nos modelos que simplesmente não rodam em outras plataformas que o Halo se destaca. Nos próprios testes da AMD no LM Studio, ele apresentou pelo menos o dobro de tokens efetivos por segundo com DeepSeek R1, Phi 4 Mini Instruct e Llama 3.2, em comparação com seu rival da Intel. Na prática, algo em torno de 5 tokens/seg em um modelo de 70B se compara ao ritmo de um digitador humano constante, ótimo para chat, mas mais lento para geração em massa.
5. Modelos de IA Locais que Você Pode Rodar no AMD Ryzen AI Halo
A compatibilidade com modelos é o grande motivo para comprar tanta memória assim. A plataforma Halo roda tranquilamente o cenário atual de modelos open-weight:
- LLaMA 3 (8B, 70B, 405B quantizado), o modelo aberto principal da Meta
- Mistral e Mixtral, rápidos, eficientes e multilíngues
- DeepSeek local (DeepSeek-R1, DeepSeek-V2), focado em raciocínio e programação
- Phi-3 / Phi-4, modelos compactos e capazes da Microsoft
- Gemma 2, Qwen 2.5, outras opções open-weight
- Stable Diffusion XL / Flux, geração de imagens local
O pool unificado de 128 GB é o que viabiliza rodar variantes em precisão total ou quantizadas grandes, algo que máquinas com 16-32 GB simplesmente não conseguem carregar. O Ryzen AI Max+ 395 se destaca em cargas de trabalho de IA para consumidor, como o LM Studio, aplicativo baseado no llama.cpp. Os modelos são baixados direto do Hugging Face ou da Biblioteca Ollama, então é só um download de distância.
Comparando setups locais enquanto três assinaturas de IA renovam todo mês? Com o Bleap você paga essas faturas em dólar na cotação real, 0% de IOF/spread, além de 20% de cashback fixo em Claude, ChatGPT e Gemini. Sem mensalidade no cartão. Peça o cartão Bleap →
6. AMD Ryzen AI Halo vs. Concorrentes
AMD Ryzen AI Halo vs. Apple M4 Pro
A diferença está na margem de memória. O M4 Pro suporta até 64 GB de memória unificada rápida e 273 GB/s de largura de banda de memória. O Halo dobra esse limite para 128 GB, o que é a diferença entre conseguir rodar um modelo de 70B ou não. Na NPU, o Neural Engine de 16 núcleos do M4 Pro entrega até 38 TOPS, abaixo do pico de 50 TOPS do Halo. A Apple contra-ataca com um toolchain macOS/MLX bem polido, enquanto a AMD aposta no ROCm para Windows/Linux. Veredito: o Halo ganha em margem para modelos grandes, o M4 Pro ganha no refinamento do ecossistema.
AMD Ryzen AI Halo vs. NVIDIA DGX Spark
O DGX Spark é a opção mais voltada para empresas, e agora custa mais caro. A NVIDIA aumentou o preço da Founders Edition do DGX Spark em 18%, de US$ 3.999 para US$ 4.699, em fevereiro de 2026, devido a restrições no fornecimento de memória. Seu diferencial é a maturidade do CUDA, que ainda leva vantagem sobre o ROCm em pipelines específicos. Mas, para muitos compradores, a conta do custo-benefício favorece a AMD, já que o sistema Strix Halo, que custa cerca de US$ 2.348, alcança desempenho de inferência comparável ao DGX Spark de US$ 4.699 em FP8 ou FP16. Escolha o DGX Spark para desenvolvimento nativo em CUDA; escolha o Halo para inferência local acessível e com alta capacidade de memória.
7. Custo Total de Propriedade: Comprar Uma Vez vs. Assinaturas de IA na Nuvem
O preço intermediário é consistente entre os provedores. ChatGPT, Claude e Gemini custam todos $20/mês no plano pago padrão, enquanto o Grok custa $30/mês. Veja como isso se compara a uma compra única do Halo (usando como base um sistema de entrada de ~$2.300):
Serviço | Mensal | Anual | 3 Anos |
|---|---|---|---|
ChatGPT Plus | $20 | $240 | $720 |
Claude Pro | $20 | $240 | $720 |
Google AI Pro (Gemini) | $19,99 | $240 | $720 |
Os três combinados | ~$60 | ~$720 | ~$2.160 |
AMD Ryzen AI Halo (entrada) | ~$2.300 à vista | $0/mês | ~$2.300 no total |
Comparado a uma única assinatura, o ponto de equilíbrio fica em torno de 8 a 9 anos. Comparado às três combinadas, esse número cai para cerca de 3 anos, antes mesmo de considerar a ausência de limites de tokens, ausência de limites de taxa e privacidade total dos dados. A conta fecha melhor para usuários avançados que já gastam entre €55 e €90 por mês em várias ferramentas de IA. Até você atingir esse ponto de equilíbrio, pagar essas renovações com o Bleap garante que 20% volte pra você no Claude, ChatGPT e Gemini.
8. Stack de Software e Experiência do Desenvolvedor
AMD Ryzen AI Development Center
A AMD disponibiliza SDKs, ferramentas de otimização de modelos e documentação através do seu Ryzen AI Development Center, com suporte ROCm dando base ao PyTorch e ao TensorFlow. Ollama, llama.cpp e LM Studio funcionam direto da caixa, e é por isso que tantos reviewers fazem benchmark primeiro no LM Studio.
Suporte a Linux e ao Ecossistema Open-Source
O suporte nativo a Linux (Ubuntu, Fedora) já está disponível, algo essencial para desenvolvedores de IA, além de um caminho via Windows AI Studio e WSL2. A implantação em containers com Docker ou Podman permite replicar o ambiente de produção localmente. A AMD é amplamente compatível com os frameworks de IA já existentes e, para ferramentas populares como Stable Diffusion ou modelos de linguagem locais, a solução geralmente funciona bem direto da caixa.
Ferramentas de Implantação e APIs
É possível configurar um endpoint de API local compatível com o OpenAI para desenvolvimento de aplicações e integrá-lo ao LangChain, LlamaIndex e frameworks de agentes, fazendo com que seu protótipo se comporte como na nuvem, mas sem a conta da nuvem.
9. Proposta de Valor: Por Que a Inferência de IA Local Importa
- Privacidade: dados sensíveis nunca saem da máquina, algo essencial para trabalhos jurídicos, médicos e financeiros.
- Latência: sem ida e volta pela rede, então muitas tarefas parecem mais rápidas do que na nuvem.
- Confiabilidade: sem quedas, sem limites de requisição, sem indisponibilidade de API.
- Personalização: ajuste fino (fine-tuning) e execução de modelos proprietários que você não poderia rodar publicamente.
- Previsibilidade de custos: uma compra única de CapEx em vez de um OpEx mensal que só cresce.
Como aponta uma avaliação honesta, se sua carga de trabalho envolve treinamento de modelos em vez de inferência, ou se você precisa de compatibilidade garantida com CUDA, uma GPU Nvidia dedicada ou o aluguel na nuvem ainda são as escolhas mais maduras.
10. Quem deveria comprar o AMD Ryzen AI Halo?
- Desenvolvedores de IA e engenheiros de ML que precisam de folga para rodar modelos grandes e um ambiente de desenvolvimento local que espelhe a produção.
- Pesquisadores independentes que rodam experimentos sem gastar com computação em nuvem.
- Usuários avançados que priorizam privacidade, lidando com documentos confidenciais, código ou dados de clientes.
- Pequenos estúdios e agências que querem substituir várias assinaturas em nuvem por um único servidor local compartilhado. Como coloca um dos guias, um mini PC construído com o Ryzen AI Max+ 395 se torna um servidor de inferência local compartilhado para assistentes de código, chatbots internos, busca de documentos e geração aumentada por recuperação (RAG).
- Quem deveria esperar: usuários casuais com necessidades ocasionais. Um plano de US$ 20 continua sendo mais barato para baixo volume de uso.
11. Roadmap futuro do AMD Ryzen AI Halo
Sistemas com mais memória estão a caminho, com configurações de 192 GB prontas para liberar modelos de 70B em precisão mais completa. Os SKUs comerciais Ryzen AI Max PRO trazem recursos de gerenciamento e segurança AMD Pro para frotas corporativas. A grande aposta, porém, está no software: a AMD está empurrando o ROCm em direção à paridade com o CUDA, e a melhoria no uso da NPU somada ao suporte a novos operadores deve extrair mais performance do hardware que você já tem. Comprar agora significa que as atualizações futuras vão continuar valendo a pena. Vale notar que o próprio RTX Spark da NVIDIA, um chip para notebooks Windows anunciado para o outono de 2026, mira nesse mesmo público com um teto semelhante de 128 GB de memória unificada e um preço inicial estimado mais baixo, então a concorrência nessa área está esquentando.
Está pagando Claude, ChatGPT e Gemini todo mês enquanto economiza para um Halo box? A Bleap oferece 0% de taxa de câmbio nessas assinaturas em dólar e 20% de cashback fixo nas três, com um Mastercard self-custodial, sem mensalidade do cartão. Peça o cartão Bleap →
Perguntas Frequentes (FAQ)
O que é o AMD Ryzen AI Max 395 e em que ele difere dos chips Ryzen AI padrão?
É o SKU principal que move a plataforma Halo. O Ryzen AI Max+ 395 é um processador de 16 núcleos (32 threads) com uma NPU XDNA 2 de até 50+ TOPS de IA e gráficos integrados Radeon 8060S com 40 unidades de computação RDNA 3.5. Em comparação com os chips Ryzen AI 300 padrão, ele oferece muito mais unidades de computação de GPU e um suporte de memória unificada bem maior.
Qual a velocidade do AMD Ryzen AI Halo para rodar o LLaMA 3 70B localmente?
Na prática, cerca de 4 a 6 tokens por segundo em um modelo 70B com quantização de 4 bits, algo parecido com o ritmo de alguém digitando de forma constante. A velocidade depende bastante da quantização e do sistema de resfriamento, mas é a memória unificada de 128 GB que torna possível rodar um modelo 70B.
Dá para rodar modelos locais do DeepSeek no AMD Ryzen AI Halo?
Sim. Tanto o DeepSeek-R1 quanto o DeepSeek-V2 rodam bem, e os próprios testes da AMD mostraram pelo menos o dobro de tokens efetivos por segundo com o DeepSeek R1 em comparação com o rival da Intel. As quantizações de Q4 a Q8 oferecem o melhor equilíbrio entre velocidade e qualidade.
Como o AMD Ryzen AI Halo se compara ao Apple M4 Pro para inferência de IA local?
O Halo suporta até 128 GB de memória unificada, contra o limite de 64 GB do M4 Pro, e oferece 50 TOPS contra 38 TOPS na NPU. A Apple leva vantagem no acabamento do ecossistema; o Halo se destaca pela capacidade de rodar modelos maiores e pelo preço.
Vale a pena investir no AMD Ryzen AI Halo em vez de pagar pelo ChatGPT Plus ou Claude Pro?
Se você usa apenas um plano de US$ 20 esporadicamente, não vale a pena. Mas se você paga pelas três ferramentas, o retorno do investimento chega perto de 3 anos, além de você ganhar privacidade e não ter limites de uso. Até lá, pague essas renovações com o Bleap e aproveite 0% de taxa de câmbio e 20% de cashback.
O AMD Ryzen AI Halo tem suporte a Linux para desenvolvimento de IA?
Sim. O suporte nativo a Ubuntu e Fedora vem junto com o ROCm, e o Ollama, o llama.cpp e o LM Studio já funcionam prontos para uso.
Conclusão e Resumo
O AMD Ryzen AI Halo é uma plataforma de IA local desenvolvida especificamente para essa finalidade, alimentada pelo Ryzen AI Max+ 395, com sistemas de entrada por volta de US$ 2.300 e até 128 GB de memória unificada. Sua capacidade de memória incomparável para modelos grandes, um NPU de 50 TOPS e um argumento de custo consistente frente às assinaturas de nuvem acumuladas fazem dele uma alternativa real para desenvolvedores, pesquisadores e pequenas equipes. Usuários casuais devem esperar um pouco mais. Se você está pronto para trazer a inferência para dentro de casa, confira os sistemas Halo disponíveis ou o AMD Ryzen AI Development Center.
Seja qual for a ferramenta de IA que você usa, pague com inteligência. Com o Bleap, você não paga taxas de câmbio em assinaturas em dólar, e no Claude, ChatGPT e Gemini você ganha 20% de cashback fixo em cada renovação, com um Mastercard self-custodial, sem nenhuma assinatura própria.
Um jeito mais inteligente de gastar, enviar, ganhar e negociar

- Artificial Inteligence








