Pular para o conteúdo principal

Execute o DeepSeek-V4-Flash-0731 com Unsloth Studio e OpenCode

Rode o mais recente DeepSeek V4 Flash em um setup multi-GPU com o Unsloth Studio, conecte-o ao OpenCode e use um agente local de IA para construir um site interativo de análise de ações.
Atualizado 6 de ago. de 2026  · 8 min lido

Explorar com IA

ChatGPTClaudePerplexity

Menor e mais rápido não significa, automaticamente, menos capaz. Segundo as avaliações publicadas pela DeepSeek, DeepSeek-V4-Flash-0731 usa uma fração muito menor de parâmetros ativados do que o DeepSeek-V4-Pro e ainda assim entrega desempenho agentic próximo ao estado da arte: obteve 82,7 no Terminal Bench 2.1, contra 81,0 do GLM-5.2 e 85,0 do Opus 4.8. Já no Agents’ Last Exam, marcou 25,2, muito próximo dos 25,7 do Opus 4.8. 

Como os pesos estão disponíveis abertamente, teoricamente você pode executar o modelo no seu próprio hardware, desde que tenha RAM ou VRAM combinada suficiente, mantendo a inferência e os dados do projeto sob seu controle. 

Neste guia, vamos configurar um ambiente RunPod com três GPUs, instalar e iniciar o Unsloth Studio, baixar e carregar a versão Q8 do DeepSeek-V4-Flash-0731 distribuída entre as GPUs, testar o modelo pelo Studio, conectar o servidor local de inferência ao OpenCode e usar o agente de código para criar e publicar um site interativo de análise de ações.

O que torna o DeepSeek-V4-Flash-0731 diferente?

DeepSeek-V4-Flash-0731 é a versão oficial que substitui o preview anterior, com avanços significativos em programação, uso de ferramentas e tarefas autônomas de agentes. Sua arquitetura Mixture-of-Experts ativa apenas parte do modelo a cada token. Assim, ele se mantém mais eficiente sem abrir mão do desempenho.

Tabela de comparação de benchmarks do DeepSeek-V4-Flash-0731

Fonte: deepseek-ai/DeepSeek-V4-Flash-0731 · Hugging Face 

A DeepSeek relata que o modelo evoluiu de 61,8 para 82,7 no Terminal Bench 2.1 e de 7,3 para 54,4 no DeepSWE. Ele também superou o maior DeepSeek-V4-Pro Preview em vários benchmarks de agentes.

O modelo suporta janelas de contexto de até um milhão de tokens. Isso o torna ideal para grandes bases de código, documentos extensos e fluxos de trabalho complexos que exigem muito contexto. Você também pode escolher entre esforço de raciocínio baixo, alto e máximo, dependendo do tempo que o modelo deve dedicar para resolver uma tarefa.

O DeepSeek-V4-Flash-0731 inclui ainda o DSpark para decodificação especulativa. O DSpark rascunha vários tokens antes de o modelo principal verificá-los, o que, segundo a DeepSeek, pode acelerar a geração em 60% a 85% quando usado com um mecanismo de inferência compatível.

1. Configure o Pod no RunPod

Vamos começar criando um ambiente no RunPod com memória de GPU e armazenamento suficientes para rodar a versão Q8 do DeepSeek-V4-Flash-0731 e hospedar o Unsloth Studio e o site gerado pelo OpenCode.

Configure o Pod com:

  • 3× GPUs NVIDIA A100 SXM 80GB
  • Template mais recente do RunPod para PyTorch
  • Pelo menos 250 GB de armazenamento em volume persistente
  • Pelo menos 50 GB de armazenamento do contêiner
  • /workspace como caminho de montagem do volume persistente
  • Um token de acesso do Hugging Face adicionado como HF_TOKEN
  • Portas HTTP 8910 e 9101 expostas

Editando o template Pytorch no Runpod

A porta 8910 será usada pelo Unsloth Studio e sua API local de inferência. A porta 9101 hospedará o site interativo criado pelo OpenCode.

O RunPod expõe esses serviços por meio de seu proxy HTTP, então ambos os aplicativos devem escutar em 0.0.0.0 em vez de apenas 127.0.0.1

Fazendo deploy do pod com 3 GPUs A100 no runpod

Depois de fazer o deploy do Pod, abra a aba Connect, inicie o JupyterLab e crie três sessões de terminal:

Terminal 1: Unsloth Studio
Terminal 2: GPU monitoring
Terminal 3: OpenCode

Manter as tarefas em terminais separados facilita monitorar as GPUs, depurar o modelo e rodar o agente de código ao mesmo tempo.

2. Instale e inicie o Unsloth Studio

Em seguida, vamos instalar o Unsloth Studio, configurar um cache persistente do Hugging Face e iniciar a interface na porta 8910.

No Terminal 1, confirme que as três GPUs estão disponíveis:

nvidia-smi

Você deve ver as três GPUs A100 listadas no servidor Linux.

Resumo das 3 GPUs A100

Crie um cache persistente do Hugging Face em /workspace para que os modelos baixados permaneçam disponíveis no volume do RunPod:

mkdir -p /workspace/huggingface
export HF_HOME=/workspace/huggingface

echo 'export HF_HOME=/workspace/huggingface' >> ~/.bashrc

Agora, instale os pacotes de sistema necessários e o Unsloth Studio:

cd /workspace

apt-get update
apt-get install -y curl git cmake build-essential libcurl4-openssl-dev

curl -fsSL https://unsloth.ai/install.sh | sh

Instalador do Unsloth Studio

O instalador configura a interface do Studio, o ambiente Python, as dependências e os componentes de inferência local. 

A primeira instalação pode levar alguns minutos.

Instalador do Unsloth Studio

Quando o instalador perguntar se você deseja iniciar o Unsloth Studio agora, digite “n”.

Vamos iniciá-lo manualmente para usar a porta 8910 e escutar no endereço de rede correto.

Reinicie o shell para que os novos comandos fiquem disponíveis:

exec bash
cd /workspace

Antes de iniciar o Studio, redefina a senha padrão:

unsloth studio reset-password

Copie a senha temporária exibida durante a configuração, pois você pode precisar dela para concluir a redefinição.

Agora inicie o Unsloth Studio:

unsloth studio \
  -H 0.0.0.0 \
  -p 8910

Iniciando o Unsloth Studio

O Studio deve indicar que está rodando na porta 8910. Mantenha o Terminal 1 aberto enquanto usar o Unsloth Studio e o OpenCode.

Volte à página Connect do RunPod e abra o HTTP Service da porta 8910

Acessando o túnel do Unsloth Studio no Runpod

Use a senha temporária gerada anteriormente para concluir a redefinição e, em seguida, entre com a nova senha criada. 

Conclua ou pule o onboarding e abra a página de Chat.

Menu de Chat do Unsloth Studio

3. Baixe e execute o DeepSeek-V4-Flash-0731

Com o Unsloth Studio em execução, podemos baixar o modelo Q8, distribuí-lo entre as três GPUs e testar suas capacidades de chat e de uso de ferramentas.

Abra o seletor de modelos no canto superior esquerdo, pesquise por unsloth/DeepSeek-V4-Flash-0731-GGUF e selecione a quantização Q8 UD-Q8_K_XL.

Baixando a versão Q8 do modelo Deepseek v4 flash no Unsloth Studio

Usamos Q8 porque as três GPUs A100 oferecem VRAM combinada suficiente. Ela preserva qualidade mais próxima do modelo original, enquanto quantizações menores são mais úteis quando a memória disponível é limitada.

Após o download, o Unsloth Studio começará automaticamente a carregar o modelo na memória da GPU. Isso pode levar alguns minutos, pois o modelo Q8 é bem grande.

Carregando o modelo Deepseek v4 flash no Unsloth Studio

Depois de carregar, use a página Chat para testar o modelo com alguns prompts simples. 

Nos nossos testes, a geração chegou a aproximadamente 33 tokens por segundo sem decodificação especulativa, um resultado bem razoável para um modelo desse porte.

Testando o modelo Deepseek v4 flash no Unsloth Studio

Você também pode ativar a ferramenta de busca na web do Studio e pedir para o modelo consultar informações atuais, como os preços mais recentes de ouro e prata. É uma forma prática de confirmar que o modelo consegue chamar ferramentas externas e não depende apenas do conhecimento interno.

Testando o modelo Deepseek v4 flash no Unsloth Studio com ferramenta web

No Terminal 2, verifique como o modelo está distribuído entre as GPUs:

nvidia-smi

Resumo de GPU com o modelo Q8 do Deepseek v4 flash carregado na memória da GPU

Você deverá ver um uso significativo de memória nas três GPUs. 

No nosso teste, cada GPU ficou com cerca de 70% de ocupação. Porém, isso não significa necessariamente que o modelo Q8 completo caiba confortavelmente em apenas duas GPUs de 80 GB, pois ainda é preciso VRAM adicional para a janela de contexto, o cache KV e buffers de inferência.

Por fim, teste o modelo com o prompt de planejamento do aplicativo que vamos construir:

Create a concise architecture plan for an interactive stock analytics website 
using Next.js, financial charts, technical indicators, portfolio tracking, 
and responsive animations.

O modelo retorna um plano de desenvolvimento estruturado cobrindo arquitetura da aplicação, componentes, fluxo de dados, bibliotecas de gráficos, cálculos financeiros e design da interface.

Testando o modelo Deepseek v4 flash no Unsloth Studio com prompt complexo

4. Conecte o DeepSeek-V4-Flash-0731 ao OpenCode e construa o site

Com o modelo rodando no Unsloth Studio, podemos conectá-lo ao OpenCode e usá-lo como um agente local de programação.

No Terminal 3, defina a URL do Studio:

echo 'export UNSLOTH_STUDIO_URL="http://127.0.0.1:8910"' >> ~/.bashrc
source ~/.bashrc

Crie um novo diretório de projeto:

mkdir -p /workspace/market-pulse
cd /workspace/market-pulse

Inicie o OpenCode pelo Unsloth Studio:

unsloth start opencode

Na primeira execução, o comando vai pedir permissão para instalar o OpenCode. Digite “y”.

Instalando e iniciando o Opencode

Assim que a instalação terminar, o OpenCode será iniciado já configurado com o modelo DeepSeek-V4-Flash-0731 rodando localmente.

OpenCode integrado ao modelo DeepSeek v4 Flash em execução local

Cole o prompt de duas linhas abaixo no OpenCode:

Build a polished, highly interactive stock analytics website using Bun, Next.js App Router, 
TypeScript, shadcn/ui, Motion, TradingView Lightweight Charts, and a free financial-data API, 
with live stock search, charts, technical indicators, gains, losses, watchlists, portfolio tracking, 
comparisons, responsive design, animations, loading states, and error handling.

Work autonomously: install everything, create every file, test and fix the complete application, 
and run the finished website on 0.0.0.0:9101.

Em poucos segundos, o agente de código deve criar uma lista detalhada de tarefas e começar a conduzir o projeto passo a passo.

Construindo site interativo de análise de ações no Opencode com o servidor de inferência do Unsloth

No nosso teste, a construção completa levou cerca de 20 minutos. Enquanto roda, você pode voltar ao Unsloth Studio e abrir a página de monitoramento da API em Settings para acompanhar o uso do modelo e a velocidade de geração.

Observamos uma média de aproximadamente 22,6 tokens por segundo durante o fluxo de programação. A velocidade pode cair conforme a conversa e o contexto do projeto crescem.

Dashboard de monitoramento do servidor de inferência do Unsloth

Ao finalizar as tarefas, o OpenCode deve trazer um resumo dos arquivos, recursos e comandos criados. Ele também deve iniciar o site finalizado na porta 9101.

Resumo do site interativo de análise de ações no Opencode

Volte à página Connect do RunPod e abra o HTTP Service da porta 9101.

O resultado ficou surpreendentemente caprichado. O site ficou limpo, com animações e bem próximo de um dashboard profissional de trading. O modelo concluiu a aplicação web com um único prompt, incluindo interface, visões de dados, gráficos e navegação.

Testando o site interativo de análise de ações criado com DeepSeek-V4-Flash-0731

Você pode selecionar tickers individuais para ver gráficos de candles, desempenho histórico, indicadores e mais informações da empresa.

Testando o site interativo de análise de ações criado com DeepSeek-V4-Flash-0731

A aba Compare também permite comparar várias ações e ver qual teve melhor desempenho no período selecionado.

Testando o site interativo de análise de ações criado com DeepSeek-V4-Flash-0731

Fiquei genuinamente surpreso que um modelo local menor conseguiu construir o site inteiro a partir de um único prompt. 

Após testar a aplicação, todos os recursos principais funcionaram como esperado, incluindo preços em tempo real, dados históricos de mercado, gráficos, indicadores e ferramentas de comparação.

Impressiona a velocidade com que os modelos locais estão evoluindo e como já são capazes de concluir tarefas complexas de desenvolvimento ponta a ponta. 

Considerações finais

Para mim, o DeepSeek-V4-Flash-0731 é o melhor modelo local que testei até agora. 

Ele foi melhor do que o Inkling, a quantização 2-bit do GLM-5.2 e o Qwen3.6-27B, que antes era o meu favorito. Isso se baseia na minha experiência prática, não em um benchmark formal, mas agora é o meu modelo local preferido.

Para a maioria das cargas de trabalho do dia a dia, eu ainda começaria pela API oficial da DeepSeek, que é extremamente acessível. 

Atualmente, a V4 Flash custa US$ 0,14 por milhão de tokens de entrada não armazenados em cache, US$ 0,0028 por milhão de tokens de entrada em cache e US$ 0,28 por milhão de tokens de saída. Nessa taxa, um bilhão de tokens de entrada em cache sairia por cerca de US$ 2,80, sem contar a saída.

Antes de optar pelo Unsloth Studio, tentei rodar o modelo via llama.cpp. O instalador pré-compilado não oferecia um binário CUDA recente adequado para meu ambiente e, embora eu tenha compilado a versão mais nova a partir do código-fonte, enfrentei novos problemas ao ativar o DSpark para decodificação especulativa.

No fim, o Unsloth Studio ofereceu a configuração mais simples e eliminou boa parte dos ajustes manuais. Funcionou muito bem com o OpenCode, embora a construção completa da aplicação tenha levado cerca de 20 minutos.


Abid Ali Awan's photo
Author
Abid Ali Awan
LinkedIn
Twitter

Sou um cientista de dados certificado que gosta de criar aplicativos de aprendizado de máquina e escrever blogs sobre ciência de dados. No momento, estou me concentrando na criação e edição de conteúdo e no trabalho com modelos de linguagem de grande porte.

Tópicos
Inteligência Artificial
Modelos de idiomas grandes

Principais cursos da DataCamp

Curso

Codificação com IA para Desenvolvedores

1 h 30 min
9.9K
Melhore sua programação com IA — guie seu assistente de programação para escrever, testar e documentar códigos de forma eficaz.
Ver detalhesRight Arrow
Iniciar Curso
Ver maisRight Arrow
Relacionado
An avian AI exits its cage

blog

12 Alternativas de código aberto ao GPT-4

GPT-4 alternativas de código aberto que podem oferecer desempenho semelhante e exigem menos recursos computacionais para serem executadas. Esses projetos vêm com instruções, fontes de código, pesos de modelos, conjuntos de dados e interface de usuário do chatbot.
Abid Ali Awan's photo

Abid Ali Awan

9 min

blog

A OpenAI anuncia o GPT-4 Turbo com visão: O que sabemos até o momento

Descubra a atualização mais recente da OpenAI, GPT-4 Turbo com visão, e seus principais recursos, incluindo o corte de conhecimento aprimorado, uma janela de contexto expandida, preço acessível e muito mais.
Richie Cotton's photo

Richie Cotton

7 min

blog

Os 7 melhores geradores de vídeo com IA para 2026, com vídeos de exemplo

Conheça os melhores geradores de vídeo com IA disponíveis hoje, incluindo RunwayML, Synthesia, Colossyan, Pictory, DeepBrain AI, Invideo e os super esperados Sora e Veo da DeepMind.
Dr Ana Rojo-Echeburúa's photo

Dr Ana Rojo-Echeburúa

9 min

Tutorial

DeepSeek-Coder-V2 Tutorial: Exemplos, instalação, padrões de referência

O DeepSeek-Coder-V2 é um modelo de linguagem de código de código aberto que rivaliza com o desempenho do GPT-4, Gemini 1.5 Pro, Claude 3 Opus, Llama 3 70B ou Codestral.
Dimitri Didmanidze's photo

Dimitri Didmanidze

8 min

Tutorial

Tutorial do DeepChecks: Automatizando os testes de machine learning

Saiba como realizar a validação de dados e modelos para garantir um desempenho robusto de machine learning usando nosso guia passo a passo para automatizar testes com o DeepChecks.
Abid Ali Awan's photo

Abid Ali Awan

12 min

Tutorial

Como fazer o ajuste fino do GPT 3.5: Liberando todo o potencial da IA

Explore o GPT-3.5 Turbo e descubra o potencial transformador do ajuste fino. Saiba como personalizar esse modelo de linguagem avançado para aplicativos de nicho, aprimorar seu desempenho e entender os custos associados, a segurança e as considerações de privacidade.
Moez Ali's photo

Moez Ali

11 min

Ver MaisVer Mais