Kursus
Dalam dua hari, Anthropic dan OpenAI merilis model andalan terbaru mereka. Keduanya tercantum pada harga yang persis sama: $10 per satu juta token input dan $50 per satu juta token output, yang secara kontra-intuitif membuat pertanyaan biasa "mana yang lebih murah" menjadi lebih sulit, karena tarif identik tidak menghasilkan tagihan yang identik.
Dalam artikel ini, saya akan membandingkan GPT-6 Astra dan Claude Fable 5.1 pada aspek pengodean dan pekerjaan agen, penalaran, penggunaan komputer, keamanan, serta berapa sebenarnya biaya untuk menjalankannya. Untuk ulasan lebih mendalam masing-masing model, lihat panduan GPT-6 Astra kami dan panduan Claude Fable 5.1 kami.
Ringkasnya
- Tabel tolok ukur milik OpenAI menempatkan Astra di depan Fable 5.1 hampir di seluruh metrik yang dipublikasikan, sementara Artificial Analysis, penilai independen, menempatkan Fable 5.1 di depan pada kedua indeks andalannya.
- Harga daftar identik, dan satu-satunya celah pada kartu tarif adalah pembacaan cache, di mana Fable 5.1 empat kali lebih murah, serta biaya tambahan konteks panjang milik Astra.
- Pada biaya terukur per tugas, hasilnya berbalik. Artificial Analysis menempatkan Fable 5.1 di $3,76 per tugas Intelligence Index dibanding Astra $1,67, karena Astra menghabiskan jauh lebih sedikit token untuk mendapatkan skornya.
- Pilih GPT-6 Astra untuk penggunaan komputer, artefak profesional, penalaran matematika dan sains, pertahanan keamanan siber, dan biaya per tugas yang lebih rendah.
- Pilih Claude Fable 5.1 untuk kedalaman penalaran, untuk permintaan di atas 272K token ketika Astra menambahkan biaya tambahan sedangkan Anthropic tidak, dan untuk loop agen yang tagihannya didominasi oleh pembacaan cache alih-alih output.
Apa Itu GPT-6 Astra?
GPT-6 Astra adalah model frontier andalan OpenAI, penerus GPT-5.6 Sol, dan dibangun berpusat pada eksekusi agen alih-alih chat. OpenAI memposisikannya untuk penggunaan komputer, pekerjaan profesional, dan rekayasa perangkat lunak, dan ini adalah model OpenAI pertama yang melampaui ambang keamanan siber "Kritis" dalam Preparedness Framework perusahaan. Model ini berjalan pada jendela konteks 1.050.000 token dengan output maksimum 128K dan pengetahuan terakhir hingga 30 April 2026.
Dua hal menonjol dalam pengumumannya. Di Codex, Astra menyimpan catatan lintas jendela konteks alih-alih memadatkannya menjadi ringkasan, sehingga jendela sebelumnya tetap dapat dicari, dan model memutuskan kapan harus mengajukan pertanyaan klarifikasi alih-alih selalu menebak atau selalu bertanya.
Untuk daftar fitur lengkap, tabel tolok ukur, dan detail akses, lihat panduan GPT-6 Astra kami. Layak juga dibaca berdampingan dengan ulasan pendahulunya dalam GPT-5.6 Sol, Terra, dan Luna.
Apa Itu Claude Fable 5.1?
Claude Fable 5.1 adalah model frontier Anthropic yang tersedia secara umum untuk penalaran yang menuntut dan pekerjaan agen dengan horizon panjang. Model ini menjalankan jendela konteks 1M token dengan output maksimum 128K, pemikiran adaptif yang selalu aktif, dan pengetahuan terakhir hingga Juni 2026. Dokumentasi Anthropic menilai latensinya lebih lambat daripada Claude Opus 5 dan Claude Sonnet 5, keduanya berada di bawahnya dalam hal harga.
Claude Mythos 5.1 adalah model yang sama dengan pengamanan berbeda, tersedia melalui undangan lewat Project Glasswing. Perubahan utama bagi pengguna lain adalah harga pembacaan cache, dipotong 75% menjadi $0,25 per satu juta token, sementara tarif daftar tetap.
Panduan Claude Fable 5.1 kami memuat rincian tolok ukur lengkap, dan tutorial API Claude Fable 5.1 kami membangun agen pengembang yang peka repositori, termasuk rincian biaya nyata di berbagai tingkat upaya.
GPT-6 Astra vs Claude Fable 5.1: Perbandingan Langsung

Versi singkatnya: Tabel perbandingan OpenAI menunjukkan Astra di depan Fable 5.1 pada hampir setiap baris yang dipublikasikan, dan Artificial Analysis menunjukkan sebaliknya pada kedua indeksnya. Mana yang Anda percayai bergantung pada seberapa besar bobot yang Anda berikan pada penilaian vendor terhadap pesaingnya sendiri.
| Fitur | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|
| Tanggal rilis | 3 September 2026 | 1 September 2026 |
| ID model API | gpt-6-astra |
claude-fable-5-1 |
| Jendela konteks | 1,05M token | 1M token |
| Maks output | 128K token | 128K token |
| Pengetahuan terakhir | 30 April 2026 | Juni 2026 |
| Harga daftar per 1M token | $10 masuk / $50 keluar | $10 masuk / $50 keluar |
| Pembacaan input yang di-cache per 1M | $1,00 ($2,00 di atas 272K) | $0,25 |
| Tarif di atas 272K token input | 2x input dan cache, 1,5x output | Tidak ada biaya tambahan |
| FrontierMath Tier 4 (v2) | 97,6% | 87,8% |
| Humanity's Last Exam, dengan alat | 57,2% | 65,0% |
| ScreenSpot-Pro (tanpa alat) | 92,7% | 87,3% (Fable 5, dari Mythos) |
| AutomationBench | 41,4% | 31,4% |
| ExploitBench | 100% | 70% |
| AA Intelligence Index (upaya maksimum) | 61 | 66 |
| Biaya AA per tugas Intelligence Index (maks) | $1,67 | $3,76 |
| Area terkuat | Penggunaan komputer, matematika, keamanan siber, biaya per tugas | Kedalaman penalaran, loop agen yang didominasi cache |
Alur kerja pengodean dan agen
Astra memimpin pada tolok ukur pengodean yang dipilih OpenAI untuk dipublikasikan, tetapi marginnya tipis dan indeks independen tidak sejalan. Pada Terminal-Bench 4.0, yang menguji rekayasa perangkat lunak, konfigurasi sistem, dan analisis data di terminal, OpenAI melaporkan 57,7% untuk Astra dibanding 55,8% untuk Fable 5.1. Anthropic memublikasikan angka 55,8% yang sama, jadi setidaknya baris itu tidak diperdebatkan.
Selisihnya melebar pada DeepSWE v1.1, di mana Astra mencapai 74,1% dibanding 67,4%, dan hampir menutup pada FrontierCode 1.1 Main, di mana 53,3% dibanding 50,9% berada dalam rentang yang sudah ditempati Claude Fable 5 (53,5%) dan Claude Opus 5 (53,4%).
| Tolok ukur | GPT-6 Astra | Claude Fable 5.1 | Catatan |
|---|---|---|---|
| Terminal-Bench 4.0 | 57,7% | 55,8% | Tabel OpenAI menyebut 57,7% sementara keterangan grafiknya menyebut 57,9% |
| DeepSWE v1.1 | 74,1% | 67,4% | Dilaporkan OpenAI |
| FrontierCode 1.1 Main | 53,3% | 50,9% | Secara efektif seri dengan Fable 5 di 53,5% dan Opus 5 di 53,4% |
| Migrasi basis data internal | 63,9% | 57,8% | Evaluasi internal OpenAI, tidak ada replikasi eksternal |
| CursorBench 3.2.0 | Tidak dipublikasikan | 73,4% | Dilaporkan Anthropic; SpaceXAI mengonfirmasi 73,4% pada upaya maksimum |
| AA Coding Agent Index | 67 di Codex | 70 di Claude Code | Independen, tetapi harness berbeda |
Baris terakhir itulah yang terus saya rujuk. Artificial Analysis menempatkan Fable 5.1 di Claude Code pada 70, skor tertinggi di Coding Agent Index miliknya, dan Astra di Codex pada 67, kira-kira setara dengan Claude Opus 5 dan Claude Fable 5. Dua catatan kehati-hatian patut dicermati:
- Kedua model dijalankan dalam harness berbeda, Codex vs Claude Code, jadi sebagian dari selisih 3 poin itu milik perbedaan scaffolding, bukan modelnya. Perbandingan Codex vs Claude Code kami membahas bagaimana perilaku keduanya berbeda.
- Astra mencapainya dengan biaya jauh lebih rendah. Artificial Analysis mengukurnya menggunakan sepertiga token GPT-5.6 Sol pada upaya maksimum di Codex, dan seperlima token Claude Opus 5 pada xhigh.
Astra memenangkan baris pengodean yang dipublikasikan tipis-tipis dan menang telak pada efisiensi, sementara Fable 5.1 memegang satu-satunya skor agen pengodean independen yang melampaui keduanya.
Penalaran dan pekerjaan ilmiah
Ini adalah perbedaan paling jelas di seluruh perbandingan, dan arahnya dua sisi. Astra mengambil baris matematika dan sains: 97,6% dibanding 87,8% pada FrontierMath Tier 4 v2, 96,0% dibanding 93,7% pada GPQA Diamond, dan 64,6% dibanding 52,6% pada Terminal-Bench Science 0,1, tolok ukur riset agen yang menjadi sorotan peluncuran Anthropic sendiri.
Fable 5.1 mengambil Humanity's Last Exam dengan alat, 65,0% dibanding 57,2%, dan selisihnya jelas. Artificial Analysis menguatkan arahnya secara independen, menilai Fable 5.1 di 66 pada Intelligence Index dibanding 61 untuk Astra, skor tertinggi yang pernah diukurnya.
Satu catatan kehati-hatian pada angka 66 itu. Artificial Analysis menjalankan Fable 5.1 dengan fallback sisi server default Anthropic, yang merutekan permintaan berpenanda keamanan ke Claude Opus 4.8 atau Claude Opus 5, dan fallback menyumbang sekitar 4% token output di seluruh indeks. Skor tersebut adalah Fable 5.1 sebagaimana kebanyakan orang akan memanggilnya, bukan model mentah secara terisolasi.
Jika pekerjaan Anda adalah matematika atau sains tingkat pascasarjana, pilih Astra. Jika berupa penalaran luas dan sulit seperti yang diuji Humanity's Last Exam, pilih Fable 5.1.
Penggunaan komputer dan artefak profesional
Astra unggul pada dimensi ini, terutama karena Anthropic belum memublikasikan angka yang sebanding. OpenAI melaporkan 72,6% untuk Astra pada set offline OSWorld 2.0 dibanding 70,2% untuk Claude Opus 5, dan 92,7% pada ScreenSpot-Pro dibanding 87,3% untuk Claude Fable 5. Angka Fable 5.1 dari Anthropic sendiri, 77,9% parsial dan 41,7% ketat, berasal dari rilis tugas dan penyetelan penilaian yang berbeda.
Angka artefaknya lebih tidak ambigu: 95,9% pada BenchCAD dibanding 84,3%, dan 41,4% dibanding 31,4% pada AutomationBench.
Untuk agen yang mengklik perangkat lunak nyata dan menghasilkan slide atau output CAD, Astra adalah pilihan yang lebih kuat.
Keamanan, keamanan siber, dan alignment
Angka alignment Astra adalah bagian yang paling kurang dibahas dari peluncurannya. Pada tolok ukur keselamatan penggunaan komputer internal OpenAI, di mana lebih rendah lebih baik, ia mencetak 2,4% dibanding 9,5% untuk Fable 5.1.
Pada keamanan siber, kelasnya berbeda: 100% pada ExploitBench, dan 86 dari 226 tantangan FrontierCyber terselesaikan dibanding 34 untuk GPT-5.6 Sol dalam pengujian independen Irregular. Anthropic melonggarkan Fable 5.1 cukup untuk menemukan kerentanan tetapi tidak untuk mengeksploitasinya.
Dua catatan, keduanya pantas dicermati:
- OpenAI melaporkan penalaran tertulis Astra lebih sulit dipantau dibanding Sol, karena menyelesaikan masalah dalam lebih sedikit langkah tertulis.
- UK AISI menemukan Astra menjalankan serangan rantai pasok simulasi pada 2 dari 500 sampel, bahkan ketika cakupannya melarang akses internet, turun dari 60 dari 499 ketika cakupannya dibiarkan ambigu.
Astra sekaligus menjadi agen yang lebih aman dan penyerang yang lebih cakap, karenanya diberi pengecualian akses.
Harga: apa yang sebenarnya Anda bayar
Tarif daftar identik, jadi pada kartu tarif, satu-satunya perbedaan antara kedua model ini berasal dari caching dan konteks panjang. Kerangka itu hanya berlaku jika kedua model menghabiskan jumlah token yang sama untuk tugas yang sama, dan faktanya tidak, itulah sebabnya angka terukur per tugas di bawah lebih penting daripada kartu tarif.

Tarif token berdampingan
| Tarif | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|
| Input, per 1M token | $10,00 | $10,00 |
| Output, per 1M token | $50,00 | $50,00 |
| Pembacaan input yang di-cache, per 1M token | $1,00 | $0,25 |
| Penulisan cache (5 menit), per 1M token | $12,50 | $12,50 |
| Diskon batch | 50% | 50% |
| Tarif di atas 272K token input | $20,00 masuk / $2,00 cache / $75,00 keluar | Tidak ada biaya tambahan |
Input, output, penulisan cache, dan diskon batch semuanya sama persis. Baris pembacaan cache adalah pengecualian, dan selisihnya 4x: Anthropic memangkas pembacaan cache Fable 5.1 menjadi $0,25, sementara OpenAI memasang harga $1,00 untuk Astra, diskon 90% dari tarif inputnya.
Di atas 272K token input, selisihnya melebar menjadi 8x, karena biaya tambahan OpenAI menggandakan pembacaan cache menjadi $2,00 bersama dengan input, sementara dokumen harga Anthropic menempatkan jendela konteks 1M token penuh pada tarif standar. Perhatikan betapa rendah ambang itu relatif terhadap apa yang diiklankan Astra: 272K kira-kira seperempat dari jendela 1,05M miliknya, jadi permintaan yang menggunakan lebih dari seperempat konteks yang dibawanya akan ditagih pada tingkat yang lebih tinggi.
Pembacaan cache adalah tarif yang terakumulasi sepanjang loop panjang, karena agen mengirim ulang system prompt, definisi alat, dan konteks repositori yang sama pada setiap giliran. Panduan kami tentang prompt caching membahas mekanisme perbedaan penulisan cache–pembacaan cache, jika perbedaan itu baru bagi Anda.
Biaya beban kerja nyata di kartu tarif
Semua di tabel ini adalah aritmetika tarif daftar pada bentuk token tetap, bukan hasil terukur. Ini menjawab pertanyaan "jika kedua model menghabiskan token yang identik, berapa biaya kartu tarifnya?" Bagian berikut menjawab pertanyaan tentang apa yang sebenarnya mereka habiskan.
| Beban kerja | GPT-6 Astra | Claude Fable 5.1 | Perbedaan |
|---|---|---|---|
| Asisten seimbang: 1M masuk / 250K keluar | $22,50 | $22,50 | $0, 0% |
| Pengambilan, di bawah ambang: 10M masuk / 1M keluar | $150 | $150 | $0, 0% |
| Pengambilan, di atas ambang: 10M masuk / 1M keluar | $275 | $150 | $125, 83% lebih mahal untuk Astra |
| Loop berat cache: prefiks 100K, 1.000 pembacaan | $201 | $126 | $75, 59% lebih mahal untuk Astra |
Formulanya sama untuk setiap baris: (volume ÷ 1M) × tarif, dijumlahkan atas input baru, pembacaan cache, penulisan cache, dan output. Baris berat cache mengasumsikan prefiks 100K ditulis sekali dan dibaca kembali 1.000 kali, plus 5K input baru dan 1K output per permintaan.
Baris pengambilan di atas ambang adalah sorotannya. Jaga setiap permintaan di bawah 272K token input, dan kedua model biayanya persis sama $150. Dorong 10M token yang sama melalui permintaan yang masing-masing melampaui 272K, dan Astra melonjak ke $275 sementara Fable 5.1 tetap $150, karena Anthropic memberi harga jendela konteks 1M token penuh pada tarif standar.
Loop berat cache adalah yang paling sering ditemui pembaca. Pada 1.000 pembacaan cache atas prefiks 100K, selisih $0,75 per juta token cache berubah menjadi perbedaan $75 pada beban kerja lain yang identik. Perhatikan bentuk beban kerja itu: sengaja ringan output, 1K token output per permintaan dibanding 100K pembacaan cache. Itulah satu bentuk di mana keunggulan cache Fable 5.1 menentukan tagihan.
Biaya sebenarnya per tugas
Begitu Anda mengukur konsumsi token nyata alih-alih mengasumsikannya, gambarnya berbalik. Artificial Analysis menghitung harga setiap model per tugas Intelligence Index, dan metodenya sudah mencakup token input, hit cache, penulisan cache, penalaran, dan jawaban, jadi cache yang lebih murah milik Fable 5.1 sudah tercakup dalam angkanya.
| Tingkat upaya | GPT-6 Astra: skor/biaya per tugas | Claude Fable 5.1: skor/biaya per tugas |
|---|---|---|
| maks | 61 / $1,67 | 66 / $3,76 |
| xhigh | 61 / $1,20 | 65 / $2,72 |
Pada upaya maksimum, Fable 5.1 berbiaya 2,25 kali lipat Astra untuk set tugas yang sama pada harga daftar yang sama. Artificial Analysis mencapai kesimpulan yang sama pada indeks pengodeannya, di mana Astra menyamai Fable 5 "dengan kurang dari setengah biaya, didorong oleh peningkatan efisiensi token yang signifikan". Rentang Astra turun hingga $0,46 per tugas pada upaya rendah.
Fable 5.1 tidak dirugikan oleh kartu tarifnya di sini, melainkan oleh volume outputnya. Artificial Analysis mengukurnya menggunakan sekitar 1,7x token output Fable 5 pada upaya maksimum, itulah sebabnya biayanya 20% lebih banyak per tugas dibanding pendahulunya meskipun ada pemotongan cache. Tanpa pemotongan itu, angkanya kira-kira $5,16, jadi diskonnya memang berpengaruh, hanya saja belum cukup.
Anda membayar premi itu untuk sesuatu. Fable 5.1 mencetak 5 poin lebih tinggi pada indeks yang sama, dan 4 poin lebih tinggi pada xhigh. Apakah 5 poin layak 2,25x, itu keputusan Anda, bukan saya, tetapi versi perbandingan di mana harga daftar identik berarti tagihan identik tidak bertahan saat diukur.
Keterangan OpenAI sendiri menunjuk ke arah yang sama, sejauh mana laporan mandiri vendor dapat dipercaya. Mereka menempatkan perkiraan biaya API per tugas Astra kira-kira 31% di bawah Fable 5.1 pada Terminal-Bench Science 0,1, sekitar 63% di bawah pada Terminal-Bench 4,0, dan sekitar 86% di bawah pada BenchCAD, diukur pada setelan upaya yang dipilih OpenAI untuk masing-masing model.
Kinerja GPT-6 Astra dan Claude Fable 5.1
Astra sedikit menang pada pengujian kami secara keseluruhan, meskipun keduanya mengirimkan simulasi yang berfungsi pada percobaan pertama.
Pengujian
Saya menjalankan satu tugas sulit terhadap kedua model dalam kondisi identik alih-alih beberapa tugas dangkal. Tes yang dipilih untuk perbandingan ini adalah simulasi fisika dari nol yang dibangun sebagai satu berkas HTML tunggal, dipilih karena menguji tepat hal yang diklaim kedua vendor telah ditingkatkan: ketepatan yang berkelanjutan sepanjang pembuatan panjang, tanpa pustaka untuk diandalkan.
Versi ini adalah penyegaran dari tes tersebut. Varian yang dipublikasikan menggunakan wadah persegi berputar, jadi kali ini diganti dengan heksagon berputar dengan hambatan pusat yang berputar berlawanan arah dan massa sebanding ukuran, yang meningkatkan tingkat kesulitan sambil mempertahankan penahanan sebagai lulus atau gagal yang jelas. Berikut prompnya, ditempel persis ke chat baru untuk masing-masing model:
Build a single-file HTML page (inline CSS and JS, canvas, no build step, no external libraries, no network) that simulates a few dozen balls of varying sizes bouncing under gravity inside a **slowly rotating hexagonal container**, with a **smaller counter-rotating obstacle at the centre** that the balls also collide with.
Ball mass should scale with size, so larger balls shove smaller ones around.
The balls should collide with each other, with the hexagon's walls, and with the central obstacle, and lose a little energy on each collision so the system settles rather than gaining energy over time.
Both the hexagon and the inner obstacle keep rotating throughout, so the balls should slosh and re-pile as they turn.
Ship it as one working file named `index.html` that starts animating on load.
Do not install packages.
Do not open, screenshot, or headless-render the page (no Playwright, Puppeteer, or Chrome).
Do not ask me clarifying questions — make reasonable assumptions and note them briefly in a comment at the top of the file.
Kedua model dijalankan pada upaya penalaran tinggi, satu percobaan tanpa ulang, di dalam agen pengodean yang sama dengan peralatan yang sama. Penilaian adalah pemeriksaan lulus/gagal dapat-dijalankan terlebih dahulu, kemudian rubrik 1 sampai 5 pada ketepatan fisika, stabilitas selama 30 detik, dan kualitas visual.
Apa yang dihasilkan GPT-6 Astra
Astra lolos pemeriksaan dapat-dijalankan dan mencetak 5/5 pada ketiga sumbu rubrik. Ia mencapainya dalam 6 giliran dan 9 panggilan alat, dan komposisi alatnya menarik: ia menulis berkas, membacanya kembali 5 kali, melakukan grep dua kali, dan menambal dua kali sebelum menyatakan selesai.
Simulasinya tepat. 44 bola, massa diskalakan dengan luas, penahanan terjaga selama 30 detik penuh saat heksagon berputar. Astra membuat hambatan dalam berukuran besar relatif terhadap ruangnya, sehingga bola terus bertabrakan dengannya alih-alih menetap di tempat yang tidak terjangkau.
Model ini juga membangun seluruh halaman editorial di sekitar simulasi, dengan judul serif, label monospace berjarak huruf, dan panel telemetri yang melaporkan laju rotasi langsung. Tidak ada yang meminta itu, tetapi menurut saya tampilannya cukup bagus. Ia juga menyertakan kontrol jeda dan mulai ulang, yang tidak diminta prompt, tetapi membuat artefak lebih mudah diperiksa.
Astra memutar ruang pada 0,09 rad/s dan hambatan pada -0,16 rad/s, sekitar 3 kali lebih lambat daripada Fable pada dinding luar dan 5 kali lebih lambat pada hambatan. Lebih mudah ditonton, dan pengujian batas bergerak yang lebih lembut daripada putaran lebih cepat. Karena prompt meminta wadah yang berputar perlahan, ini baik-baik saja.
Apa yang dihasilkan Claude Fable 5.1
Fable juga lolos dapat-dijalankan, mencetak 4 pada ketepatan fisika, 5 pada stabilitas, dan 4 pada kualitas visual. Ia hanya membutuhkan 2 giliran dan satu panggilan alat: satu kali menulis, tanpa baca ulang, tanpa tambalan.
Fisikanya baik meski tidak sempurna. Bola sedikit menempel pada dinding, yang mengurangi satu poin pada ketepatan, dan dalam beberapa detik pertama, mereka menetap di sudut bawah di mana hambatan yang berputar berlawanan tidak lagi menjangkaunya. Hambatan itu lebih banyak diam sepanjang jalannya.
Fable menaruh upayanya pada instrumentasi alih-alih presentasi. HUD langsung melaporkan jumlah bola, frame rate, energi kinetik, dan kedua laju rotasi, dan mengeklik di mana saja di dalam heksagon akan menjatuhkan bola baru di titik itu. Saya menyukai sentuhan terakhir itu lebih dari yang saya duga, karena itu cara tercepat untuk menguji kode tabrakan secara manual.
Hasil
| Ukuran | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|
| Giliran | 6 | 2 |
| Panggilan alat | 9 | 1 |
| Dapat dijalankan | Lulus | Lulus |
| Ketepatan fisika | 5 | 4 |
| Stabilitas seiring waktu | 5 | 5 |
| Kualitas visual | 5 | 4 |
| Skor rubrik | 5,0 | 4,3 |
Astra memenangkannya pada kualitas, dan selisihnya lebih lebar pada presentasi daripada pada fisika. Perbedaan mereka terletak pada bagaimana masing-masing model memaknai tugasnya. Astra membaca prompt sebagai brief untuk diinterpretasikan, menambahkan kontrol, tata letak editorial lengkap, dan putaran yang lebih lambat yang enak ditonton. Fable membacanya sebagai spesifikasi untuk dipenuhi, memenuhinya dalam satu kali tulis, dan menghabiskan sisa upaya pada HUD diagnostik.
Ini adalah satu kali jalan per model, jadi perlakukan sebagai satu titik data, bukan tolok ukur. Ia melaporkan jumlah giliran alih-alih token atau biaya, dan hanya menguji kode simulasi dari nol, bukan dimensi penggunaan komputer atau penalaran yang dibahas di atas.
Kapan Memilih GPT-6 Astra vs Claude Fable 5.1
Karena tarif daftar cocok, keputusan bergantung pada bentuk beban kerja, konsumsi token terukur, dan agen pengodean yang sudah Anda jalankan. Tiga angka yang seharusnya memengaruhi Anda adalah selisih pembacaan cache 4x, ambang biaya tambahan 272K, dan biaya terukur per tugas 2,25x.

Pilih GPT-6 Astra jika...
- Agen Anda mengoperasikan perangkat lunak nyata. Pada 72,6% di set offline OSWorld 2.0 dan 92,7% di ScreenSpot-Pro, Astra adalah satu-satunya dari keduanya dengan catatan terpublikasi tentang grounding dan mengklik aplikasi desktop.
- Anda membutuhkan artefak profesional yang rapi. Slide, spreadsheet, dan output CAD adalah target pelatihan yang dinyatakan, dan skor BenchCAD 95,9% dibanding 84,3% adalah selisih artefak terlebar yang dipublikasikan salah satu vendor.
- Pekerjaannya adalah matematika atau sains fisik. FrontierMath Tier 4 v2 di 97,6% dibanding 87,8%, dan GPQA Diamond di 96,0% dibanding 93,7%.
- Anda melakukan pekerjaan keamanan defensif. 100% pada ExploitBench dan 86 dari 226 tantangan FrontierCyber terselesaikan menempatkannya jelas unggul, asalkan Anda bisa menerima kapabilitas yang dibatasi akses melalui program Daybreak OpenAI.
- Anda sudah menjalankan Codex. Catatan konteks Astra lintas jendela adalah fitur Codex, dan mengganti harness demi mengejar selisih indeks 3 poin jarang sepadan.
- Biaya per tugas lebih penting daripada skor puncak. $1,67 dibanding $3,76 pada Intelligence Index milik Artificial Analysis di upaya maksimum, dan $0,46 di upaya rendah jika Anda bisa menerima 57 alih-alih 61.
Pilih Claude Fable 5.1 jika...
- Anda menjalankan loop agen panjang yang tagihannya adalah pembacaan cache, bukan output. Pada $0,25 per satu juta pembacaan cache dibanding $1,00, beban kerja berat cache di atas berbiaya $126 alih-alih $201. Keunggulan itu menyempit begitu token output mulai mendominasi, persis seperti yang ditunjukkan pengukuran per tugas.
- Permintaan Anda besar. Anthropic tidak menambahkan biaya konteks panjang, jadi beban kerja pengambilan 10M token tetap $150, sementara Astra naik ke $275, dan pembacaan cache Astra juga mengganda di atas ambang tersebut.
- Anda menginginkan skor penalaran independen terbaik dan bersedia membayarnya. Artificial Analysis menilainya 66 pada Intelligence Index dibanding 61, dan model ini menang pada Humanity's Last Exam dengan alat 65,0% vs 57,2%.
- Anda bekerja di Claude Code. Fable 5.1 di Claude Code adalah skor tertinggi yang pernah dicatat Artificial Analysis pada Coding Agent Index di 70, dan default-nya adalah upaya tinggi di permukaan itu.
Cara Memulai dengan GPT-6 Astra dan Claude Fable 5.1
| Permukaan | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|
| Aplikasi konsumen | ChatGPT Plus, Pro, Business, Enterprise | Claude web, seluler, desktop (Pro, Max, Team, Enterprise) |
| API pihak pertama | OpenAI API | Claude API |
| Platform cloud | Amazon Bedrock, Microsoft Azure/Foundry | Amazon Bedrock, Google Cloud, Microsoft Azure/Foundry |
| Agen pengodean | Codex | Claude Code, Cursor |
| Router pihak ketiga | OpenRouter, Vercel AI Gateway | OpenRouter, Vercel AI Gateway |
| ID model API | gpt-6-astra |
claude-fable-5-1 |
Dua detail akses yang akan menghentikan Anda sebelum panggilan pertama. Astra nonaktif secara default untuk ruang kerja enterprise hingga administrator menyalakannya, dan Fable 5.1 memerlukan retensi data 30 hari serta tidak didukung pada Priority Tier. Jangkauan cloud hampir seimbang di antara keduanya, dengan Google Cloud saat ini menjadi satu-satunya platform yang dimiliki Fable 5.1 dan tidak dimiliki GPT-6 Astra.
Menggunakan GPT-6 Astra dan Claude Fable 5.1 dalam agen pengodean
Masing-masing model asli pada harness-nya sendiri, Astra di Codex dan Fable 5.1 di Claude Code, di mana Anda beralih dengan /model claude-fable-5-1 atau flag --model. Lewat API, penukarannya cukup satu string, meskipun SDK-nya berbeda.
from anthropic import Anthropic
client = Anthropic()
response = client.messages.create(
model="claude-fable-5-1", # OpenAI SDK equivalent: model="gpt-6-astra"
max_tokens=16000, # thinking plus response share this budget
output_config={"effort": "high"},
messages=[{"role": "user", "content": "Refactor this module..."}],
)
print(response.content[0].text)
Tiga perubahan Fable 5.1 akan merusak kode yang ditulis untuk Fable 5: pemilihan alat paksa kini mengembalikan 400, model sebelumnya tidak dapat membaca blok thinking miliknya, dan blok thinking terikat pada riwayat persis sebelumnya. Tutorial API Claude Fable 5.1 kami membahas ketiganya, dan panduan pemula OpenAI API kami membahas setelan ekivalennya di sisi lain.
Pemikiran Akhir
Pilih berdasarkan bentuk beban kerja dan biaya terukur, bukan pada tabel tolok ukur. GPT-6 Astra lebih kuat untuk agen yang mengklik perangkat lunak, mengerjakan matematika, atau menghasilkan artefak siap klien, dan tampak lebih murah per tugas meski kartu tarifnya identik. Claude Fable 5.1 memberi Anda skor penalaran independen tertinggi yang tersedia dan lebih murah pada permintaan yang sangat besar serta pada loop yang didominasi cache.
Kartu tarif adalah jebakan dalam perbandingan ini. Dua model di $10 dan $50 terlihat dapat dipertukarkan dari sisi harga, dan satu-satunya celah yang terlihat, pembacaan cache, menguntungkan Anthropic 4x. Lalu Anda mengukur apa yang sebenarnya dihabiskan masing-masing untuk menyelesaikan tugas, dan Astra muncul di 44% biaya Fable 5.1. Saya tidak akan memprediksi itu dari halaman harga, dan itulah satu hal yang akan saya uji terhadap trafik Anda sendiri sebelum memutuskan.
Jika Anda ingin bekerja dengan salah satu model alih-alih membacanya, saya merekomendasikan kursus Introduction to Claude Models untuk sisi Anthropic dan Working with the OpenAI API untuk OpenAI.
FAQ
Apakah GPT-6 Astra lebih baik daripada Claude Fable 5.1?
Tergantung pada tolok ukur yang Anda baca. Pada tabel perbandingan milik OpenAI, GPT-6 Astra memimpin Claude Fable 5.1 pada hampir setiap baris yang dipublikasikan, termasuk 97,6% dibanding 87,8% pada FrontierMath Tier 4 v2 dan 64,6% dibanding 52,6% pada Terminal-Bench Science 0,1. Artificial Analysis, penilai independen, membalikkan hal itu, menilai Fable 5.1 di 66 pada Intelligence Index dibanding 61 untuk Astra. Pilih Astra untuk penggunaan komputer, matematika, dan keamanan siber, serta Fable 5.1 untuk kedalaman penalaran dan loop agen yang banyak cache.
Berapa biaya GPT-6 Astra dan Claude Fable 5.1?
Keduanya mencantumkan $10 per satu juta token input dan $50 per satu juta token output, dengan diskon batch 50% yang sama dan penulisan cache $12,50. Pada kartu tarif, satu-satunya celah adalah pembacaan cache: Claude Fable 5.1 mengenakan $0,25 per satu juta dibanding $1,00 untuk GPT-6 Astra, naik menjadi $2,00 di atas 272K token input, di mana Astra juga mengenakan $20 untuk input dan $75 untuk output. Anthropic tidak menambahkan biaya tambahan pada panjang berapa pun. Namun, terukur per tugas, perbedaan ini berbalik: Artificial Analysis menempatkan Fable 5.1 di $3,76 per tugas dibanding $1,67 untuk Astra.
Mana yang lebih baik untuk pengodean, GPT-6 Astra atau Claude Fable 5.1?
GPT-6 Astra memimpin tolok ukur pengodean yang dipublikasikan masing-masing vendor, mencetak 57,7% dibanding 55,8% pada Terminal-Bench 4.0 dan 74,1% dibanding 67,4% pada DeepSWE v1.1. Artificial Analysis tidak sependapat pada tingkat harness, menempatkan Claude Fable 5.1 di Claude Code pada 70 di Coding Agent Index dibanding 67 untuk GPT-6 Astra di Codex. Karena pengujian tersebut menggunakan harness berbeda, sebagian dari selisih itu milik scaffolding, bukan modelnya.
Di mana saya dapat mengakses GPT-6 Astra dan Claude Fable 5.1?
GPT-6 Astra tersedia di ChatGPT pada paket Plus, Pro, Business, dan Enterprise, melalui OpenAI API dan di Codex. Administrator Enterprise harus menyalakannya karena akses dinonaktifkan secara default saat peluncuran. Claude Fable 5.1 tersedia di aplikasi web, seluler, dan desktop Claude, Claude API, dan Claude Code, dan memerlukan retensi data 30 hari. Keduanya tersedia di Amazon Bedrock, Google Cloud, Microsoft Foundry, dan router pihak ketiga seperti OpenRouter.
Apa ID model API untuk GPT-6 Astra dan Claude Fable 5.1?
ID modelnya adalah gpt-6-astra untuk OpenAI dan claude-fable-5-1 untuk Anthropic. Di Amazon Bedrock, Claude Fable 5.1 adalah anthropic.claude-fable-5-1. Perhatikan bahwa tiga perilaku API Fable 5.1 berubah dari Fable 5: pemilihan alat paksa mengembalikan 400, blok thinking terikat pada riwayat yang persis mendahuluinya, dan penolakan tiba sebagai HTTP 200 dengan stop_reason: "refusal".
Tom adalah seorang ilmuwan data dan pendidik teknis. Ia menulis dan mengelola tutorial serta artikel blog ilmu data DataCamp. Sebelumnya, Tom bekerja di bidang ilmu data di Deutsche Telekom.
