Anthropic belum menerbitkan tolok ukur langsung Opus 5 vs. Sonnet 5. Setiap pos peluncuran membandingkan modelnya dengan pendahulunya sendiri dan dengan Opus 4.8. Jadi angka-angka di bawah ini hanya menceritakan sebagian. Sisanya adalah penilaian yang sama seperti pada pasangan Opus vs. Sonnet mana pun: seberapa tinggi “langit-langit” yang benar-benar Anda butuhkan, dan berapa yang bersedia Anda bayar untuk itu.
Apa Itu Claude Opus 5?
Opus 5 adalah model kelas atas Anthropic, dirilis 24 Juli 2026, dihargai $5 per sejuta token input dan $25 per sejuta token output. Anthropic menyebutnya mutakhir pada Frontier-Bench dan GDPval-AA, serta mendekati model Fable 5 yang lebih besar dengan setengah harga. Ini adalah model bawaan di Claude Max dan model terkuat di Claude Pro.
Ciri menonjolnya adalah verifikasi mandiri: memeriksa pekerjaannya sendiri, membangun test harness saat tidak ada data feed, dan menolak instruksi buruk alih-alih sekadar menurut.
Apa Itu Claude Sonnet 5?
Sonnet 5 adalah model kelas menengah Anthropic, dirilis 30 Juni 2026. Anthropic menggambarkannya sebagai Sonnet paling agentic sejauh ini, dengan performa mendekati Opus 4.8 dengan harga lebih rendah. Ini adalah model bawaan pada paket Free dan Pro, serta tersedia di Max, Team, Enterprise, dan API.
Harga: $2 per sejuta token input dan $10 per sejuta token output hingga 31 Agustus 2026, lalu standar $3/$15.
Perbedaan Tier, dalam Praktik
Bagian ini tidak diuraikan dalam pos rilis, karena memang begitu cara lini model Anthropic bekerja pada umumnya, bukan khusus untuk pasangan ini.
Opus adalah model “langit-langit”
Anda memilihnya ketika kesalahan berbiaya mahal, ketika tugas berjalan lama dan otonom tanpa ada yang memeriksa di tengah jalan, atau ketika masalahnya benar-benar baru alih-alih variasi dari sesuatu yang sudah sering dilihat model. Refactor mendalam lintas banyak file, pertanyaan riset yang ambigu, rangkaian agentic panjang di mana kesalahan menumpuk — itu wilayah Opus. Anda membayar agar model menangkap kesalahannya sendiri sebelum menjadi masalah Anda.
Sonnet adalah kuda beban
Model ini dibuat agar cukup cepat dan murah untuk berjalan terus-menerus: asisten chat, klasifikasi volume tinggi, pengodean iteratif di mana Anda ikut meninjau setiap beberapa langkah, aplikasi sensitif terhadap latensi. Batas penilaiannya lebih rendah, tetapi untuk porsi besar pekerjaan nyata, Anda tidak akan menyentuh batas itu. Penggunaan harian sebagian besar tim seharusnya condong ke Sonnet, dengan Opus dipanggil secara selektif untuk tugas yang benar-benar membutuhkannya.
Khusus Sonnet 5, ini adalah upaya Anthropic untuk mendorong langit-langit itu lebih tinggi dari biasanya bagi model kelas menengah — karena itu “Sonnet paling agentic sejauh ini” dan klaim bahwa ia mendekati Opus 4.8 pada beberapa tugas. Itulah konteks membaca angka tolok ukur di bawah: Sonnet 5 bukan sekadar murah, melainkan murah dan lebih dekat ke level Opus dibanding Sonnet sebelumnya.
Apa yang Sebenarnya Ditunjukkan Angka Rilis
Harga
Perbedaan yang paling jelas dan tidak ambigu. Sonnet 5 berjalan di $2/$10 (hingga 31 Agustus) atau $3/$15 (standar) dibanding tarif tetap Opus 5 sebesar $5/$25 — biaya Sonnet 5 adalah 40–60% dari Opus 5, tergantung jendela harga.
Alignment
Satu-satunya bagian di mana kedua pos rilis saling menyebut secara langsung. Audit otomatis Anthropic menemukan Opus 5 “lebih patuh pada Konstitusi Claude dibanding Opus 4.8, Sonnet 5, atau Fable 5” — hasil nyata yang dinyatakan, bukan inferensi. Opus 5 meraih skor 2,3 pada audit tersebut, skor keamanan tertingginya sejauh ini. Sonnet 5 meningkat atas pendahulunya sendiri (halusinasi lebih rendah, sikap gampang menyetujui lebih rendah, ketahanan lebih baik terhadap pembajakan prompt-injection) namun Anthropic mencatat tingkat perilaku tidak selarasnya masih lebih tinggi daripada Opus 4.8.
Keamanan siber
Kedua model tidak dilatih secara sengaja pada materi siber, tetapi hasilnya berbeda.
Opus 5 mendekati Mythos 5 dalam menemukan kerentanan, meskipun tertinggal dalam mengubahnya menjadi eksploit. Sonnet 5 berada lebih belakang: Anthropic secara eksplisit menyatakan bahwa Sonnet 5 memiliki “kapabilitas siber yang jauh lebih buruk dibanding Opus 4.8 dan Mythos 5,” dan pada evaluasi pengembangan eksploit Firefox, model ini tidak pernah menghasilkan eksploit yang berfungsi penuh (0,0% sukses, hanya sedikit lebih baik dari Sonnet 4.6 pada upaya parsial).
Jika kasus penggunaan Anda menyentuh apa pun yang berdekatan dengan siber, kesenjangan ini nyata dan jelas menguntungkan Opus 5.
Pengodean dan kerja pengetahuan
Di sini kedua pos menggunakan set tolok ukur berbeda, jadi tidak ada garis skor yang bersih.
Opus 5 lebih dari dua kali lipat Opus 4.8 pada Frontier-Bench v0.1 dan hanya terpaut 0,5% dari Fable 5 pada CursorBench 3.2 dengan setengah biaya. Sonnet 5 digambarkan mendekati Opus 4.8 pada BrowseComp dan OSWorld-Verified pada upaya tinggi.
Dibaca bersama dengan logika tier di atas: Sonnet 5 mendekat pada tugas spesifik yang dipilih Anthropic untuk disorot, tetapi kemenangan Opus 5 tampak lebih besar dan lebih luas. Perlakukan bagian ini sebagai indikatif, bukan terukur.
Kapan Memilih yang Mana
Pilih Opus 5 jika
tugasnya berisiko tinggi, berdurasi lama, atau benar-benar baru; Anda mengerjakan ilmu hayati, kimia, atau kerja agentic multi-langkah yang kompleks; Anda memerlukan model dengan alignment terbaik yang tersedia; apa pun yang berdekatan dengan keamanan siber termasuk dalam cakupan.
Pilih Sonnet 5 jika
Anda menjalankan volume tinggi, latensi penting, atau tugas cukup terukur sehingga Anda tidak memerlukan langit-langit penilaian Opus; Anda menggunakan Free atau Pro di mana ini sudah menjadi bawaan; biaya per token adalah batasan utama.
Bukan keduanya, jika
Anda memerlukan pekerjaan keamanan siber dengan pagar pembatas yang dikurangi. Opus 5 otomatis mundur ke Opus 4.8, dan Sonnet 5 berada di belakang Opus 4.8 secara langsung.
Penutup
Sebagian besar faktor penentu di sini sama dengan yang menentukan pertanyaan Opus vs. Sonnet mana pun: apakah tugas ini memerlukan langit-langit, atau cukup perlu dieksekusi andal dalam skala besar? Sonnet 5 mendorong langit-langit itu lebih tinggi daripada Sonnet sebelumnya, yang merupakan kabar utama dalam peluncurannya. Namun pada bagian di mana Anthropic memberi angka untuk kedua model secara berdampingan — audit alignment — Opus 5 unggul, dan cerita keamanan siber mengarah ke arah yang sama. Gunakan Sonnet 5 sebagai standar untuk volume, pilih Opus 5 ketika tugasnya tidak boleh salah.
