Ana içeriğe atla

DeepSeek-V4-Flash-0731’i Unsloth Studio ve OpenCode ile Çalıştırın

En yeni DeepSeek V4 Flash modelini Unsloth Studio ile çoklu GPU kurulumunda çalıştırın, OpenCode’a bağlayın ve yerel bir yapay zekâ kodlama aracısıyla etkileşimli bir hisse senedi analizi web sitesi oluşturun.
Güncel 6 Ağu 2026  · 8 dk. oku

Yapay Zekâyla Keşfet

ChatGPTClaudePerplexity

Artık daha küçük ve daha hızlı olmak otomatik olarak daha az yetenekli olmak anlamına gelmiyor. DeepSeek’in yayımladığı değerlendirmelere göre, DeepSeek-V4-Flash-0731, her token için etkinleştirilen parametre ayak izi DeepSeek-V4-Pro’dan çok daha küçük olmasına rağmen öncü seviyeye yakın aracısal performans sunuyor: Terminal Bench 2.1’de 82.7 puan alıyor; bu değer GLM-5.2 için 81.0 ve Opus 4.8 için 85.0 ile karşılaştırılıyor; ayrıca Agents’ Last Exam’de 25.2 puanı, Opus 4.8’in 25.7’sine oldukça yakın. 

Ağırlıklar açıkça sunulduğu için, yeterli birleşik RAM veya VRAM’e sahip olduğunuzda modeli teorik olarak kendi donanımınızda çalıştırabilir ve çıkarım ile proje verilerini kendi kontrolünüz altında tutabilirsiniz. 

Bu kılavuzda üç GPU’lu bir RunPod ortamı yapılandıracak, Unsloth Studio’yu kurup başlatacak, DeepSeek-V4-Flash-0731’in Q8 sürümünü GPU’lara indirip yükleyecek, modeli Studio üzerinden test edecek, yerel çıkarım sunucusunu OpenCode’a bağlayacak ve kodlama aracısını kullanarak etkileşimli bir hisse senedi analizi web sitesi oluşturup başlatacağız.

DeepSeek-V4-Flash-0731’i Farklı Kılan Nedir?

DeepSeek-V4-Flash-0731, önceki ön izlemeyi resmi olarak değiştiren sürümdür ve kodlama, araç kullanımı ve otonom ajan görevlerinde büyük iyileştirmeler içerir. Mixture-of-Experts mimarisi her token için modelin yalnızca bir bölümünü etkinleştirir. Bu sayede verimliliğini korurken güçlü performans sunar.

DeepSeek-V4-Flash-0731 kıyaslama karşılaştırma tablosu

Kaynak: deepseek-ai/DeepSeek-V4-Flash-0731 · Hugging Face 

DeepSeek, modelin Terminal Bench 2.1’de 61.8’den 82.7’ye ve DeepSWE’de 7.3’ten 54.4’e yükseldiğini bildiriyor. Ayrıca, bazı ajan kıyaslamalarında daha büyük DeepSeek-V4-Pro Preview’u geride bıraktı.

Model, bir milyona kadar token’lık bağlam pencerelerini destekler. Bu da büyük kod tabanları, uzun belgeler ve kapsamlı bağlam gerektiren karmaşık iş akışları için uygun hale getirir. Kullanıcılar, modelin bir görevi çözmek için ne kadar zaman harcaması gerektiğine bağlı olarak düşük, yüksek ve maksimum akıl yürütme çabası arasında seçim yapabilir.

DeepSeek-V4-Flash-0731 ayrıca DSpark spekülatif çözümlemeyi içerir. DSpark, ana model doğrulamadan önce birkaç token taslağı çıkarır; DeepSeek, uyumlu bir çıkarım motoruyla kullanıldığında bunun üretim hızını %60 ila %85 artırabileceğini belirtiyor.

1. RunPod Pod’unu Yapılandırın

Q8 sürümü DeepSeek-V4-Flash-0731’i çalıştırmak ve hem Unsloth Studio’yu hem de OpenCode’un oluşturacağı web sitesini barındırmak için yeterli GPU belleği ve depolama alanına sahip bir RunPod ortamı oluşturacağız.

Pod’u şu şekilde yapılandırın:

  • 3× NVIDIA A100 SXM 80GB GPU
  • En güncel RunPod PyTorch şablonu
  • En az 250 GB kalıcı birim depolama
  • En az 50 GB konteyner depolama
  • /workspace kalıcı birim bağlama yolu olarak
  • Bir Hugging Face erişim jetonu, HF_TOKEN olarak eklenmiş
  • HTTP portları 8910 ve 9101 açılmış

Pytorch Runpod şablonunu düzenleme

Port 8910 Unsloth Studio ve yerel çıkarım API’si için kullanılacaktır. Port 9101 OpenCode tarafından oluşturulan etkileşimli web sitesini barındıracaktır.

RunPod bu hizmetleri HTTP proxy’si üzerinden sunar; bu nedenle her iki uygulama da yalnızca 127.0.0.1 yerine 0.0.0.0 üzerinde dinlemelidir. 

runpod üzerinde 3x A100 GPU pod’u dağıtma

Pod’u dağıttıktan sonra Connect sekmesini açın, JupyterLab’i başlatın ve üç terminal oturumu oluşturun:

Terminal 1: Unsloth Studio
Terminal 2: GPU monitoring
Terminal 3: OpenCode

Görevleri ayrı terminallerde tutmak GPU’ları izlemeyi, modeli sorun gidermeyi ve kodlama aracısını aynı anda çalıştırmayı kolaylaştırır.

2. Unsloth Studio’yu Kurun ve Başlatın

Sırada Unsloth Studio’yu kurmak, kalıcı bir Hugging Face önbelleği yapılandırmak ve arayüzü 8910 portunda başlatmak var.

 Terminal 1’de üç GPU’nun da kullanılabilir olduğunu doğrulayın:

nvidia-smi

Linux sunucusunda üç A100 GPU’nun tamamını listelenmiş görmelisiniz.

3x A100 GPU özeti

İndirilen modellerin RunPod biriminde kalıcı olarak kullanılabilir olması için /workspace içinde kalıcı bir Hugging Face önbelleği oluşturun:

mkdir -p /workspace/huggingface
export HF_HOME=/workspace/huggingface

echo 'export HF_HOME=/workspace/huggingface' >> ~/.bashrc

Ardından gerekli sistem paketlerini ve Unsloth Studio’yu kurun:

cd /workspace

apt-get update
apt-get install -y curl git cmake build-essential libcurl4-openssl-dev

curl -fsSL https://unsloth.ai/install.sh | sh

Unsloth Studio Yükleyicisi

Yükleyici Studio arayüzünü, Python ortamını, bağımlılıkları ve yerel çıkarım bileşenlerini yapılandırır. 

İlk kurulum birkaç dakika sürebilir.

Unsloth Studio Yükleyicisi

Yükleyici size Unsloth Studio’yu hemen başlatmak isteyip istemediğinizi sorduğunda “n” girin.

Doğru ağ adresinde dinlemesi ve 8910 portunu kullanması için manuel olarak başlatacağız.

Yeni komutların kullanılabilir olması için kabuğu yeniden başlatın:

exec bash
cd /workspace

Studio’yu başlatmadan önce varsayılan parolayı sıfırlayın:

unsloth studio reset-password

Sıfırlamayı tamamlamak için gerekebileceğinden, kurulum sırasında gösterilen geçici parolayı kopyalayın.

Şimdi Unsloth Studio’yu başlatın:

unsloth studio \
  -H 0.0.0.0 \
  -p 8910

Unsloth Studio'yu başlatma

Studio’nun artık 8910 portunda çalıştığını bildirmesi gerekir. Unsloth Studio ve OpenCode’u kullanırken Terminal 1’i açık tutun.

RunPod Connect sayfasına dönün ve 8910 portu için HTTP Servisini açın. 

Unsloth Studio Runpod tüneline erişim

Sıfırlamayı tamamlamak için önce oluşturulan geçici parolayı kullanın ve ardından oluşturduğunuz yeni parola ile oturum açın. 

Karşılama adımlarını tamamlayın veya atlayın ve Sohbet sayfasını açın.

Unsloth Studio Sohbet menüsü

3. DeepSeek-V4-Flash-0731’i İndirin ve Çalıştırın

Unsloth Studio artık çalıştığına göre Q8 modeli indirebilir, üç GPU’ya yükleyebilir ve sohbet ile araç kullanımı yeteneklerini test edebiliriz.

Sol üst köşedeki model seçiciyi açın, unsloth/DeepSeek-V4-Flash-0731-GGUF ifadesini arayın ve ardından Q8 kantizasyonu UD-Q8_K_XL seçin.

Unsloth Studio'da Deepseek v4 flash modelinin Q8 sürümünü indirme

Üç A100 GPU birleşik VRAM açısından yeterli olduğundan Q8 kullanıyoruz. Bu, kaliteyi orijinal modele daha yakın korur; daha düşük kantizasyonlar ise donanım belleğinin sınırlı olduğu durumlarda daha kullanışlıdır.

İndirme tamamlandığında Unsloth Studio modeli otomatik olarak GPU belleğine yüklemeye başlayacaktır. Q8 model çok büyük olduğundan bu işlem birkaç dakika sürebilir.

Unsloth Studio'da Deepseek v4 flash modelini yükleme

Yüklemenin ardından modeli birkaç basit istemle test etmek için Sohbet sayfasını kullanın. 

Testlerimizde, spekülatif çözümleme olmadan üretim hızı yaklaşık saniyede 33 token seviyesine ulaştı; bu, bu boyuttaki bir model için makul bir sonuçtur.

Unsloth Studio'da Deepseek v4 flash modelini test etme

Ayrıca Studio’nun web arama aracını etkinleştirip modelden güncel bilgileri, örneğin en son altın ve gümüş fiyatlarını aramasını isteyebilirsiniz. Bu, modelin yalnızca dahili bilgisine güvenmek yerine harici araçları çağırabildiğini doğrulamanın kullanışlı bir yoludur.

Unsloth Studio'da web aracıyla Deepseek v4 flash modelini test etme

 Terminal 2’de modelin GPU’lar arasında nasıl dağıtıldığını kontrol edin:

nvidia-smi

GPU belleğine yüklenen Q8 Deepseek v4 flash modelinin GPU özeti

Üç GPU’nun tamamında önemli bellek kullanımı görmelisiniz. 

Bizim testimizde her GPU yaklaşık %70 doluydu. Ancak bu, bağlam penceresi, KV önbelleği ve çıkarım arabellekleri için ek VRAM gerektiğinden, tüm Q8 modelinin yalnızca iki adet 80 GB GPU’ya rahatça sığacağı anlamına gelmez.

Son olarak, oluşturacağımız uygulama için planlama istemiyle modeli test edin:

Create a concise architecture plan for an interactive stock analytics website 
using Next.js, financial charts, technical indicators, portfolio tracking, 
and responsive animations.

Model; uygulama mimarisi, bileşenler, veri akışı, grafik kütüphaneleri, finansal hesaplamalar ve arayüz tasarımını kapsayan yapılandırılmış bir geliştirme planı döndürüyor.

Karmaşık istemle Unsloth Studio'da Deepseek v4 flash modelini test etme

4. DeepSeek-V4-Flash-0731’i OpenCode’a Bağlayın ve Web Sitesini Oluşturun

Model artık Unsloth Studio’da çalıştığına göre, onu OpenCode’a bağlayıp yerel bir kodlama aracısı olarak kullanabiliriz.

 Terminal 3’te Studio URL’sini ayarlayın:

echo 'export UNSLOTH_STUDIO_URL="http://127.0.0.1:8910"' >> ~/.bashrc
source ~/.bashrc

Yeni bir proje dizini oluşturun:

mkdir -p /workspace/market-pulse
cd /workspace/market-pulse

OpenCode’u Unsloth Studio üzerinden başlatın:

unsloth start opencode

Bu komutu ilk kez çalıştırdığınızda OpenCode’un kurulumu için izin ister. “y” girin.

Opencode'u kurma ve başlatma

Kurulum tamamlandığında OpenCode, yerelde çalışan DeepSeek-V4-Flash-0731 modeli önceden yapılandırılmış şekilde başlatılacaktır.

Yerelde çalışan DeepSeek v4 Flash modeliyle entegre OpenCode

Aşağıdaki iki satırlık istemi OpenCode’a yapıştırın:

Build a polished, highly interactive stock analytics website using Bun, Next.js App Router, 
TypeScript, shadcn/ui, Motion, TradingView Lightweight Charts, and a free financial-data API, 
with live stock search, charts, technical indicators, gains, losses, watchlists, portfolio tracking, 
comparisons, responsive design, animations, loading states, and error handling.

Work autonomously: install everything, create every file, test and fix the complete application, 
and run the finished website on 0.0.0.0:9101.

Birkaç saniye içinde kodlama aracısı ayrıntılı bir görev listesi oluşturmalı ve projeyi adım adım ilerletmeye başlamalıdır.

Unsloth çıkarım sunucusuyla Opencode'da etkileşimli hisse senedi analizi web sitesi oluşturma

Tam derleme testimizde yaklaşık 20 dakika sürdü. Çalışırken, model kullanımını ve üretim hızını takip etmek için Unsloth Studio’ya dönüp Ayarlar bölümündeki API izleme sayfasını açabilirsiniz.

Kodlama iş akışı boyunca ortalama yaklaşık saniyede 22.6 token gözlemledik. Konuşma ve proje bağlamı büyüdükçe hız düşebilir.

Unsloth çıkarım sunucusu izleme panosu

Görevler tamamlandıktan sonra OpenCode, oluşturduğu dosyaların, özelliklerin ve komutların bir özetini sağlar. Ayrıca tamamlanmış web sitesini 9101 portunda başlatmalıdır.

Opencode'da etkileşimli hisse senedi analizi web sitesinin özeti

RunPod Connect sayfasına geri dönün ve 9101 portu için HTTP Servisini açın.

Ortaya çıkan sonuç şaşırtıcı derecede cilalıydı. Web sitesi temiz, animasyonlu ve profesyonel bir işlem platformuna benzer görünüyordu. Model, arayüz, veri görünümleri, grafikler ve gezinme dahil olmak üzere web uygulamasını tek bir istemle tamamladı.

DeepSeek-V4-Flash-0731 ile oluşturulan etkileşimli hisse senedi analizi web sitesini test etme

Mum grafikleri, tarihsel performans, göstergeler ve ek şirket bilgilerini görüntülemek için tek tek hisse senedi sembollerini seçebilirsiniz.

DeepSeek-V4-Flash-0731 ile oluşturulan etkileşimli hisse senedi analizi web sitesini test etme

 Karşılaştır sekmesi ayrıca birkaç hisseyi karşılaştırmanıza ve seçilen dönemde hangisinin daha iyi performans gösterdiğini görmenize olanak tanır.

DeepSeek-V4-Flash-0731 ile oluşturulan etkileşimli hisse senedi analizi web sitesini test etme

Daha küçük bir yerel modelin tüm web sitesini tek bir istemle oluşturabilmesine gerçekten şaşırdım. 

Uygulamayı test ettikten sonra canlı hisse fiyatları, tarihsel piyasa verileri, grafikler, göstergeler ve karşılaştırma araçları dahil tüm temel özelliklerin beklendiği gibi çalıştığını gördüm.

Yerel modellerin ne kadar hızlı geliştiği ve karmaşık, uçtan uca geliştirme görevlerini tamamlama konusunda ne kadar yetkin hale geldikleri dikkat çekici. 

Son Düşünceler

Benim için DeepSeek-V4-Flash-0731 şimdiye kadar test ettiğim en iyi yerel model. 

Inkling, 2-bit GLM-5.2 kantizasyonu ve daha önce favorim olan Qwen3.6-27B’den daha iyi performans gösterdi. Bu, resmi bir kıyaslamadan ziyade kendi deneyimlerime dayanıyor; ancak artık tercih ettiğim yerel model bu.

Çoğu pratik iş yükü için yine de resmi DeepSeek API’siyle başlamayı tercih ederim; çünkü son derece uygun fiyatlı. 

V4 Flash şu anda önbelleksiz milyon başına giriş token’ı için 0,14 ABD doları, önbellekli milyon başına giriş token’ı için 0,0028 ABD doları ve milyon başına çıkış token’ı için 0,28 ABD dolarıdır. Bu oranda, çıkış ücretleri hariç, bir milyar önbellekli giriş token’ı yaklaşık 2,80 ABD dolarına mal olur.

Unsloth Studio’ya karar vermeden önce modeli llama.cpp üzerinden çalıştırmayı denedim. Hazır yükleyici, ortamıma uygun güncel bir CUDA ikili dosyası sağlamadı ve en son sürümü kaynaktan derlememe rağmen DSpark spekülatif çözümlemeyi etkinleştirirken başka sorunlarla karşılaştım.

Sonuç olarak Unsloth Studio en basit kurulumu sundu ve çoğu manuel yapılandırmayı ortadan kaldırdı. OpenCode ile iyi çalıştı; ancak tamamlanmış uygulamanın derlenmesi yaklaşık 20 dakika sürdü.


Abid Ali Awan's photo
Author
Abid Ali Awan
LinkedIn
Twitter

Sertifikalı bir veri bilimcisi olarak, yenilikçi makine öğrenimi uygulamaları oluşturmak için en son teknolojileri kullanmaya büyük ilgi duyuyorum. Konuşma tanıma, veri analizi ve raporlama, MLOps, konuşma yapay zekası ve NLP alanlarında güçlü bir geçmişe sahip olarak, gerçek bir etki yaratabilecek akıllı sistemler geliştirme becerilerimi geliştirdim. Teknik uzmanlığımın yanı sıra, karmaşık kavramları açık ve özlü bir dille ifade etme yeteneğine sahip, becerikli bir iletişimciyim. Sonuç olarak, veri bilimi konusunda aranan bir blog yazarı oldum ve giderek büyüyen veri profesyonelleri topluluğuyla görüşlerimi ve deneyimlerimi paylaşıyorum. Şu anda, içerik oluşturma ve düzenlemeye odaklanıyorum. Büyük dil modelleriyle çalışarak, hem işletmelerin hem de bireylerin verilerinden en iyi şekilde yararlanmalarına yardımcı olabilecek güçlü ve ilgi çekici içerikler geliştiriyorum.

Konular
Yapay Zeka
Büyük Dil Modelleri

Öne Çıkan DataCamp Kursları

Kurs

Geliştiriciler için Yapay Zeka Destekli Kodlama

1 sa 30 dk
9.9K
AI ile kodlamanızı geliştirin — kodlama asistanınızı kod yazma, test etme ve belgeleme konusunda etkili bir şekilde yönlendirin.
Ayrıntıları GörRight Arrow
Kursa Başla
Devamını GörRight Arrow