Tracks
ผู้อ่านส่วนใหญ่ยังรู้จักห้องแล็บเบื้องหลังกrok ในชื่อ xAI โดย SpaceXAI เปิดตัว Grok 4.6 เมื่อวันที่ 12 สิงหาคม 2026 เพียงเล็กน้อยหลังจาก Grok 4.5 โดยมุ่งที่งานโค้ดดิ้ง งานเว็บเชิงภาพ และงานเอเจนต์ที่รันยาวขึ้น
ข้อมูลวันเปิดตัวไม่สนับสนุนการจัดอันดับแบบเส้นตรงง่ายๆ Grok นำในบางการทดสอบที่ SpaceXAI เลือก ขณะที่ GPT-5.6 Sol และ Claude Fable 5 นำในอีกส่วนหนึ่ง Artificial Analysis จัดวาง Grok เคียงข้าง Sol ที่ราคาผสมต่ำกว่า แต่การอัปเกรดนี้เริ่มตอบช้าลงและมีค่าใช้จ่ายต่อภารกิจที่วัดได้สูงกว่า Grok 4.5
บทความนี้ตามรอยสมดุลนั้นผ่านสเปกของโมเดล ราคา การเข้าถึง และการเปรียบเทียบโดยตรงกับ Sol และ Claude บทความ ความครอบคลุมของ Grok 4.5 ของเราเน้นการใช้โทเค็นต่ำ สำหรับที่นี่ คำถามคือ คะแนนที่สูงขึ้นจะเปลี่ยนบิลจริงหรือไม่เมื่อรวมอินพุตที่แคช โทเค็นการให้เหตุผล และเอาต์พุตเพิ่ม
สรุปสั้น: Grok 4.6
โดยสรุปของฉันคือ คะแนนที่เพิ่มขึ้นห้าจุดสำคัญน้อยกว่าที่หน้าเปิดตัวชี้ให้เห็น พฤติกรรมราคาและประเภทงานเป็นตัวตัดสินว่าจะเปลี่ยนตัวเลือกโมเดลหรือไม่
-
ที่ความพยายามระดับ
highGrok 4.6 ได้ 61 บน Artificial Analysis Intelligence Index เท่ากับ Sol ที่maxและตามหลัง Opus 5 ที่maxอยู่สองจุด -
อัตราพื้นฐานของอินพุตและเอาต์พุตยังคงอยู่ที่ $2 และ $6 ต่อหนึ่งล้านโทเค็น แต่ อินพุตที่แคช ความหน่วงโทเค็นแรก และต้นทุนภารกิจที่วัดได้ล้วนเพิ่มขึ้นจาก Grok 4.5
-
บน AA-Briefcase, Grok ใช้จำนวนรอบและโทเค็นอินพุตน้อยกว่า Opus 5; Sol นำในการทดสอบเทอร์มินัล ขณะที่ Sonnet 5 ให้บริบทใหญ่กว่าเท่าตัวโดยไม่มีค่าธรรมเนียมพรอมต์ยาว
การเปรียบเทียบด้านล่างจะแยกคำอ้างของผู้ให้บริการออกจากผลของ Artificial Analysis ซึ่งสำคัญเพราะโมเดลอาจเปลี่ยนตำแหน่งได้เมื่อระดับความพยายามหรือการตั้งค่าการทดสอบเปลี่ยน
Grok 4.6 คืออะไร?
Grok 4.6 เป็นโมเดลให้เหตุผลเชิงลิขสิทธิ์ของ SpaceXAI ค่า context ที่ API และ Cursor เปิดเผยไม่เท่ากัน และอัตราสำหรับบริบทยาวที่สูงกว่าจะเริ่มก่อนถึงขีดจำกัดของ API ตารางต่อไปนี้วางข้อจำกัดเหล่านั้นเคียงข้างประเภทอินพุต เครื่องมือ และวันตัดความรู้
|
สเปก |
Grok 4.6 |
|
500,000 โทเค็น (API); 256,000 โทเค็นใน Cursor |
|
|
อินพุต / เอาต์พุต |
ข้อความและรูปภาพเข้า; ข้อความออก |
|
ระดับความพยายามในการให้เหตุผล |
ต่ำ กลาง สูง (ค่าเริ่มต้น) สูงมาก |
|
วันตัดความรู้ |
1 กุมภาพันธ์ 2026 |
|
เครื่องมือ |
การเรียกใช้งานฟังก์ชัน, ค้นเว็บ, ค้นหาใน X, รันโค้ด, ค้นคอลเลกชัน (RAG), MCP ระยะไกล |
|
ราคาแบบมาตรฐาน |
$2 / ล้านโทเค็นอินพุต, $0.50 สำหรับแคช, $6 / ล้านโทเค็นเอาต์พุต |
|
ราคาแบบบริบทยาว |
$4 / $1 / $12 เมื่อพรอมต์ถึง 200,000 โทเค็น คิดกับทั้งคำขอ |
SpaceXAI ยังไม่เผยแพร่จำนวนพารามิเตอร์ของทั้งสองโมเดล ตัวเลข 1.5 ล้านล้านในบางรายงานไม่ได้มาจาก SpaceXAI จึงไม่ใช่สเปกที่ยืนยันแล้ว
อะไรใหม่ใน Grok 4.6?
SpaceXAI ระบุว่านี่ไม่ใช่โมเดลใหม่ที่เทรนจากศูนย์ แต่เป็นการให้การฝึกเพิ่มกับ Grok 4.5 โดยใส่ใจกับงาน เอเจนต์ AI เป็นพิเศษ การเปลี่ยนแปลงที่รายงานแบ่งเป็นการรันเอเจนต์ที่ยาวขึ้น งานสร้างเชิงภาพ และงานหลังการฝึก
งานเอเจนต์ที่ยาวขึ้น
SpaceXAI ระบุว่า Grok 4.6 คงเส้นคงวาในการทำงานยาวหลายขั้น เช่น งานวิจัย ทำงานข้ามโค้ดเบส และสร้างแอปพลิเคชัน โดยรายงานว่าโมเดลตรวจสอบงานของตนบ่อยขึ้นแทนที่จะทำทุกอย่างรอบเดียวจบ
ซึ่งสอดคล้องกับแนวโน้มการทดสอบโมเดลในวงกว้าง คำตอบแรกที่ดีมีความสำคัญน้อยลง หากโมเดลลืมการตัดสินใจก่อนหน้าไปหลังเรียกใช้เครื่องมือหลายครั้ง การทดสอบภายในของ GitHub ก็พบว่า Grok 4.6 ยังคงให้เหตุผลและใช้เครื่องมือได้ต่อเนื่องในงานยาว
API ก็มีฟีเจอร์ที่ผูกกับข้ออ้างนี้ Grok 4.6 สามารถสตรีมสรุปการให้เหตุผล ซึ่ง Grok 4.5 ไม่เปิดให้ใช้ และ xAI แนะนำ การบีบอัดบริบท ร่วมกับ prompt_cache_key แบบคงที่สำหรับลูปเอเจนต์ยาว การบีบอัดจะย่อประวัติก่อนหน้าเป็นรายการเดียว แต่ยังคงใช้โทเค็น และคำขอจะต้องพอดีกับหน้าต่างบริบทก่อนจะบีบอัดได้
การพัฒนาเว็บเชิงภาพและเชิงโต้ตอบ
SpaceXAI และ Cursor ต่างก็รายงานว่าความพยายามครั้งแรกในโปรเจกต์เชิงภาพดีขึ้น ในการทดสอบภายนอกครั้งหนึ่ง Grok 4.6 สร้างหน้าโปรดักต์ iPod Mini แบบเก่าเป็นเว็บ 3D ที่มีวงล้อเลือกสีและแอนิเมชันสกอลล์ที่ใช้งานได้ เดโมใช้งานได้จริง แต่การทดสอบเดียวพิสูจน์ข้ออ้างกว้างๆ ไม่ได้
Grok 4.6 ผ่านการฝึกหลังการเทรนอย่างไร
หากสนใจเฉพาะผลทดสอบและราคา ข้ามหัวข้อนี้ย่อยได้ เนื้อหานี้อธิบายมุมมองของ SpaceXAI ว่าคะแนนเพิ่มมาจากไหน
SpaceXAI ทำการฝึกมากกว่าที่ทำกับ Grok 4.5 โดยใช้ตัวอย่างการให้เหตุผลและตัวอย่างเชิงวิศวกรรมที่สร้างโดย AI คัดตัวอย่างที่แย่ออกด้วยการตรวจสอบโดยโมเดล แล้วใช้ การเรียนรู้เสริมกำลัง (reinforcement learning) สำหรับการเขียนโค้ด งานออฟฟิศ การพัฒนาเว็บ การจูนเคอร์เนล และการออกแบบคอมพิวเตอร์ SpaceXAI ยังระบุว่า Grok 4.5 สร้างตัวอย่างการฝึกใหม่ๆ ในการตั้งค่าการให้เหตุผลและหัวข้อที่แตกต่างกัน บริษัทให้เครดิตการเพิ่มขึ้นนี้กับการฝึกมากขึ้นและการคัดเลือกข้อมูลที่เข้มงวดขึ้น ไม่ใช่สถาปัตยกรรมใหม่
ทีมภายนอกไม่สามารถตรวจสอบรายละเอียดเหล่านั้นได้ และ SpaceXAI ยังไม่แชร์ข้อมูลเพียงพอให้ทำซ้ำการฝึก นี่คือคำอธิบายจากบริษัทเอง ไม่ใช่ผลที่มีผู้อื่นตรวจทาน
ผลทดสอบ Grok 4.6: ทางการและอิสระ
ตารางเปิดตัวของ SpaceXAI แสดงว่าคะแนนเพิ่มตรงไหน แต่คะแนนของคู่แข่งคือ "ดีที่สุดจากที่ตนรายงานเองหรือที่มีเผยแพร่สาธารณะ" ซึ่งหมายถึงไม่มีทีมเดียวที่รันทุกโมเดลด้วยการตั้งค่าเดียวกัน ด้านล่างจึงรวมระดับความพยายามเข้าไปด้วยเพราะมีผลต่อคะแนน
|
ชุดทดสอบ |
Grok 4.6 (high) |
Grok 4.5 (high) |
GPT-5.6 Sol (max) |
Claude Fable 5 (max) |
|---|---|---|---|---|
|
AA Intelligence Index |
61 |
56 |
61 |
62 |
|
GDPVal-AA v2 (Elo) |
1,753 |
1,526 |
1,728 |
1,741 |
|
DeepSWE 1.1 |
65.9% |
54.0% |
73.0% |
70.0% |
|
Terminal-Bench 3.0 |
26.0% |
15.7% |
34.6% |
34.1% |
|
APEX-Agents |
57.5% |
47.1% |
56.7% |
59.2% |
|
CursorBench v3.2 |
69.9% |
66.7% |
67.2% |
70.5% |
Grok 4.6 ดีขึ้นจาก Grok 4.5 ตลอดทั้งตาราง ช่องว่างใหญ่สุดของ Sol ปรากฏใน DeepSWE และ Terminal-Bench ขณะที่ Fable นำอยู่ 3 แถว แม้แต่ตารางของ SpaceXAI เองก็ไม่ชี้ผู้ชนะคนเดียว
ผลทดสอบอิสระ
Artificial Analysis รัน Intelligence Index ของตัวเอง ครอบคลุมหกโมเดลในการเปรียบเทียบนี้ ผลลัพธ์ใกล้เคียงกับตัวเลขของ SpaceXAI แต่ไม่เหมือนกันทุกจุด

Grok 4.6 เทียบกับคู่แข่งแนวหน้าห้าราย ภาพโดยผู้เขียน
กราฟวาง Grok เทียบเท่า Sol ด้านระดับปัญญา แต่ต่ำกว่ามากด้านราคาผสม Artificial Analysis คำนวณราคาด้วยสัดส่วน 7:2:1 สำหรับอินพุตที่แคช อินพุตที่ไม่แคช และเอาต์พุต ต้นทุนต่อภารกิจสำเร็จในดัชนีก็สะท้อนช่องว่างเดียวกัน: $0.84 สำหรับ Grok, $1.23 สำหรับ Sol และ $2.34 สำหรับ Opus 5
เวลาไปยังโทเค็นคำตอบแรกเพิ่มจาก 14.62 วินาทีบน Grok 4.5 เป็น 40.44 วินาที ขณะที่ต้นทุนต่อภารกิจเพิ่มจาก $0.36 เป็น $0.84 Grok 4.6 ใช้เอาต์พุตโทเค็นมากขึ้นราว 20% ในการทดสอบเดียวกัน ดังนั้นราคาป้ายที่ไม่เปลี่ยนไม่ได้แปลว่าต้นทุนภารกิจไม่เปลี่ยน การดูต้นทุนต่อภารกิจสำเร็จให้ภาพที่ดีกว่าบัตรราคา API เพราะรวมโทเค็นการให้เหตุผลเพิ่มที่ใช้เพื่อปิดงานด้วย
เมื่อเทียบกับ GPT-5.6 Sol และ Claude Sonnet 5, Grok 4.6 ส่งโทเค็นคำตอบแรกเร็วกว่า Sol ที่ความพยายามสูงสุดใช้เวลา 213.52 วินาที และ Sonnet 5 ใช้ 184.48 เทียบกับ 40.44 ของ Grok Grok ดูช้าเฉพาะเมื่อเทียบกับโมเดลความหน่วงต่ำกว่าอย่าง Gemini 3.7 Flash
ความน่าเชื่อถือของการเปรียบเทียบผลทดสอบเหล่านี้เป็นอย่างไร?
มีประโยชน์ในการหาจุดแข็งสัมพัทธ์ แต่ไม่ใช่การจัดอันดับข้ามโมเดลที่เชื่อถือได้ ระดับความพยายามเปลี่ยนคะแนนและเวลาโต้ตอบ: GPT-5.6 Sol ได้ 57 ที่ระดับสูง และ 61 ที่ระดับสูงสุด ชื่อชุดทดสอบ ยังอาจอ้างถึงคนละเวอร์ชัน จึงทำให้ Terminal-Bench 3.0 ของ xAI และ Terminal-Bench 2.1 ของ Artificial Analysis ไม่สามารถเทียบตรงกันได้
มีอะไรเปลี่ยนจาก Grok 4.5?
สำหรับผู้ใช้ Grok 4.5 คำตัดสินไม่ใช่ว่า 4.6 "ดีกว่า" แบบนามธรรม แต่คือคะแนนที่สูงกว่าจะชดเชยความหน่วงและโปรไฟล์การใช้โทเค็นที่ต่างไปหรือไม่ ตารางนี้วางการเปลี่ยนแปลงบนฐานเดียวกัน
|
ตัวชี้วัด |
Grok 4.5 (high) |
Grok 4.6 (high) |
|
AA Intelligence Index |
56 |
61 |
|
ต้นทุนต่อภารกิจในดัชนี |
$0.36 |
$0.84 |
|
เวลาไปยังโทเค็นคำตอบแรก |
14.62s |
40.44s |
|
ราคาอินพุตที่แคช |
$0.30 / M |
$0.50 / M |
|
โทเค็นเอาต์พุตที่ใช้รันดัชนี |
60M |
72M |
|
ราคาอินพุต / เอาต์พุตพื้นฐาน |
$2 / $6 |
$2 / $6 (ไม่เปลี่ยน) |
อย่างไรก็ตาม "ราคาเดิม" อธิบายได้แค่เรตราคาในป้าย อีกการเปลี่ยนแปลงที่สำคัญสำหรับผู้ใช้ Grok 4.5 เดิมคือ อินพุตที่แคชเพิ่ม 67% จาก $0.30 เป็น $0.50 ต่อหนึ่งล้านโทเค็น อัตราแคชที่สูงขึ้นนี้เพิ่มช่องว่างระหว่างบัตรราคาและต้นทุนภารกิจที่เสร็จสิ้นจริง
Grok 4.6 เทียบคู่แข่ง
เมื่อเคลียร์การเปรียบเทียบกับรุ่นก่อนของมันแล้ว มาดูว่า Grok 4.6 เทียบกับโมเดลชั้นนำอื่นๆ จาก OpenAI และ Anthropic อย่างไร
Grok 4.6 เทียบ GPT-5.6 Sol
คะแนนดัชนีที่เท่ากันซ่อนความต่างที่ชัดเจน Sol นำหน้า Grok 7.1 คะแนนบน DeepSWE และ 8.6 คะแนนบน Terminal-Bench ทำให้งานโค้ดดิ้งที่พึ่งพาเทอร์มินัลเป็นกรณีแข็งแกร่งที่สุดของมัน Grok ได้คะแนนสูงกว่าในอีกสามแถวของงาน
การทดสอบของ OpenAI เองก็ขยายผลเทอร์มินัลนั้นไปยังการท่องเว็บและการใช้งานคอมพิวเตอร์ แม้จะยังเป็นหลักฐานที่ผู้ขายเลือกมา ไม่ใช่การเปรียบเทียบแบบควบคุม แต่ก็ชี้ไปทิศทางเดียวกัน: กรณีแข็งแกร่งที่สุดของ Sol คือ งานที่พึ่งพาเทอร์มินัล เบราว์เซอร์ หรือการเรียกใช้เครื่องมือซ้ำๆ
OpenAI ยังได้ พรีวิวโหมด Ultrafast สำหรับ Sol ซึ่งระบุว่าเร็วขึ้นได้ถึง 14 เท่า แต่ยังไม่มีราคาที่เผยแพร่ จึงยังไม่นับในตารางต้นทุน
Grok 4.6 เริ่มต้นที่ $2 อินพุต และ $6 เอาต์พุตต่อหนึ่งล้านโทเค็น เรตมาตรฐานของ Sol คือ $5 อินพุต และ $30 เอาต์พุต ซึ่งมากกว่า Grok ห้าเท่าที่เอาต์พุต เหนือ 272,000 โทเค็น Sol จะเพิ่มราคาอินพุตเป็นสองเท่าและเอาต์พุตเป็น $45
แต่นั่นไม่ได้ทำให้ทุกงานบน Grok ถูกกว่า Sol ห้าเท่า การใช้โทเค็นให้เหตุผล การโดนแคช และจำนวนรอบยังคงเปลี่ยนบิลสุดท้ายได้ ข้อได้เปรียบด้านราคาของ Grok ชัดที่สุดเมื่อการใช้โทเค็นคาดเดาได้ สำหรับงานที่พึ่งพาเทอร์มินัล คะแนนทดสอบที่สูงกว่าของ Sol อาจสำคัญกว่าช่องว่างราคาป้าย
Grok 4.6 เทียบ Claude Sonnet 5
Sonnet 5 และ Grok 4.6 ต่างก็เริ่มที่ $2 ต่อหนึ่งล้านโทเค็นอินพุต จึงเปรียบเทียบราคาได้ง่าย Sonnet 5 มีหน้าต่างบริบท 1 ล้านโทเค็นเป็นค่าเริ่มต้น ซึ่งมากกว่า Grok 500,000 เท่าตัว โดยไม่มีเรตที่สูงขึ้นสำหรับพรอมต์ยาว ส่วนเอาต์พุตคิด $10 ต่อล้าน เทียบกับ $6 ของ Grok
สองวันก่อน Grok 4.6 เปิดตัว Anthropic ทำราคา $2/$10 ให้ถาวร และยกเลิกแผนที่จะขึ้นเป็น $3/$15 ซึ่งสำคัญเมื่อเทียบกับตารางราคาที่เก่ากว่า รวมถึงของเราที่เก่ากว่า
บนดัชนีของ Artificial Analysis, Sonnet 5 ได้ 55 ที่ความพยายามสูงสุด ต่ำกว่า Grok 4.6 หกคะแนน โดยใช้เอาต์พุตโทเค็น 300 ล้านสำหรับการทดสอบ เทียบกับ 72 ล้านของ Grok ทำให้ต้นทุนต่อภารกิจอยู่ที่ $1.72 ตัวตัวแปลงโทเค็นของมันผลิตโทเค็นมากกว่า Sonnet 4.6 ราว 30% สำหรับข้อความเดียวกัน จึงทำให้การเทียบราคาของสองรุ่น Sonnet นี้ยากขึ้น อีกทั้ง Sonnet 5 ก็ไม่ใช่โมเดลสูงสุดของ Anthropic ด้วย
Grok 4.6 เทียบ Claude Opus 5 และ Fable 5
Opus 5 ที่ $5 อินพุต และ $25 เอาต์พุต นำดัชนีที่ 63 ส่วน Fable 5 ที่ $10 อินพุต และ $50 เอาต์พุต ได้ 62 คะแนน คะแนนของ Fable ยังมีเชิงอรรถ Artificial Analysis บันทึกการ fallback ด้านความปลอดภัยบนพรอมต์ที่ยากบางส่วน จึงสะท้อนโมเดลในแบบที่ผู้ใช้เข้าถึงได้ ไม่ใช่เวอร์ชันที่ไม่จำกัดซึ่ง Anthropic ไม่ได้เสนอ
บนชุดทดสอบ AA-Briefcase ของ Artificial Analysis สำหรับงานเอเจนต์ยาว Grok 4.6 จบงานในราว 53 รอบ และใช้โทเค็นอินพุต 0.5 พันล้าน ขณะที่ Opus 5 ใช้ราว 103 รอบ และ 2 พันล้านโทเค็น นี่ไม่ได้แสดงว่า Grok แข็งแกร่งกว่าโดยรวม แต่แสดงว่า Grok ใช้ขั้นตอนและโทเค็นอินพุตน้อยกว่าบนชุดทดสอบนี้ ขณะที่ Claude นำในชุดอื่นตามที่กล่าวไว้ด้านบน
ราคา Grok 4.6
เกณฑ์พรอมต์ 200,000 โทเค็นคือจุดที่ฉันจับตา: เมื่อถึงแล้วจะย้ายโทเค็นทุกตัวในคำขอไปเรตที่สูงกว่า ตารางยังรวมค่าบริการเร่งด่วนและค่าบริการเครื่องมือ
|
รายการ |
อัตรา |
|
โทเค็นอินพุต ภายใต้พรอมต์ 200K |
$2.00 / ล้าน |
|
อินพุตที่แคช ภายใต้พรอมต์ 200K |
$0.50 / ล้าน |
|
โทเค็นเอาต์พุต ภายใต้พรอมต์ 200K |
$6.00 / ล้าน |
|
อินพุต / แคช / เอาต์พุต (เกินพรอมต์ 200K) |
$4.00 / $1.00 / $12.00 |
|
การประมวลผลแบบเร็วหรือแบบเร่งด่วน |
2x จากเรตมาตรฐาน |
|
ค้นเว็บ ค้นหาใน X รันโค้ด |
$5 ต่อ 1,000 ครั้งเรียก |
ค่าเครื่องมือคิดแยกจากค่าโทเค็น คำขอที่ค้นเว็บแล้วรันโค้ดจะมีค่าธรรมเนียมเครื่องมือทั้งคู่ก่อนคิดค่าข้อความสุดท้าย ไม่มีชื่อโมเดล grok-4.6-fast แยก API ตรงมีตัวเลือกเร่งด่วนที่คิด 2x เมื่อการตอบกลับยืนยันการใช้เร่งด่วน Cursor แสดงตัวเลือก "Grok 4.6 (Fast)" แยกที่เรต 2x เดียวกัน

เลือก Grok 4.6 Fast ภายใน Cursor ภาพโดยผู้เขียน
เข้าถึง Grok 4.6 ได้อย่างไร?
Grok 4.6 ใช้งานแบบ first-party ได้ผ่าน:
- SpaceXAI API
- Cursor
- Grok Build
- เกตเวย์บุคคลที่สาม (OpenRouter, Vercel, Cloudflare, Google Cloud Vertex AI)
- เครื่องมือโค้ดดิ้งอื่นๆ (GitHub Copilot, VS Code, JetBrains, Xcode และ Eclipse)
การทยอยปล่อยครอบคลุมแผน Pro, Pro+, Max, Business และ Enterprise ผู้ดูแล Business และ Enterprise ต้องเปิดใช้งานโมเดลเพราะปิดอยู่เป็นค่าเริ่มต้น Grok 4.6 ไม่รองรับบน SpaceXAI's Batch API จึงไม่มีตัวเลือกแบตช์แบบส่วนลด
รายละเอียด Enterprise อย่างหนึ่งอยู่นอกความพร้อมใช้งานของโมเดล การตอบกลับเป็นแบบ stateful ตามค่าเริ่มต้น และ SpaceXAI ระบุว่าประวัติถูกเก็บไว้ 30 วัน ภายใต้ Zero Data Retention ทีมจะไม่สามารถใช้สายโซ่การตอบกลับที่เก็บไว้หรือส่วนที่เสร็จล่าช้าได้; xAI ชี้ไปที่การเล่นซ้ำการให้เหตุผลแบบเข้ารหัสและ WebSocket Responses แทน ทุกการตอบกลับจะมีเฮดเดอร์แสดงว่า ZDR ทำงานหรือไม่
สัปดาห์เปิดตัวของ Grok 4.6: โมเดล Copilot และ Cursor
สิ่งที่สะดุดตาสำหรับฉันในสัปดาห์นั้นคือความเร็วที่การเปิดตัวโมเดลและข้อตกลงด้านการกระจายรวมตัวรอบ Grok 4.6

สัปดาห์เปิดตัวของ Grok 4.6 นอกเหนือจากผลทดสอบ ภาพโดยผู้เขียน
Grok Bot วางโทนก่อนเปิดตัวโมเดล เอเจนต์คลาวด์ในช่วงเบต้าต้นถูกบันเดิลมากับ SuperGrok Heavy ที่ $300 ต่อเดือน หรือ Cursor Ultra ที่ $200 ต่อเดือนแทนการขายแยก ทำให้การเข้าถึงเชื่อมกับแผนพรีเมียม จากนั้น Grok 4.6 ก็พกโฟกัสเอเจนต์เดียวกันเข้าสู่ API, Cursor และ Grok Build
การเปิดตัว Gemini 3.7 Flash ของ Google และการพรีวิว GPT-5.6 Sol Ultrafast ของ OpenAI ทำให้สัปดาห์นั้นคึกคักขึ้น ในเวลาเดียวกัน การปล่อย Copilot และ การที่ Cursor เข้าร่วมกับ SpaceX ช่วยขยายการกระจายของ Grok Cursor ย้อนที่มาของกระบวนการไปยังการเป็นพาร์ตเนอร์กับ SpaceXAI ก่อนหน้านั้นในปีเดียวกัน และวางกรอบการเคลื่อนย้ายรอบการเข้าถึง GPU ของ SpaceX มากกว่าคะแนนโมเดล โพสต์ของมันระบุว่าการเข้าถึงดังกล่าวจะช่วยสร้างโมเดลได้ในต้นทุนที่ต่ำลง
มุมมองของฉันต่อสัปดาห์นั้นคือ SpaceXAI ต้องการให้ Grok อยู่ในเครื่องมือที่ผู้ใช้ใช้อยู่แล้ว Grok 4.5 ถูก เทรนร่วมกับ Cursor และ Grok 4.6 ก็เข้าไปใน Copilot แทบจะทันที ทำให้การกระจายผ่านพาร์ตเนอร์เป็นส่วนหนึ่งของการปล่อย ไม่ใช่เรื่องตามหลัง
ควรใช้ Grok 4.6 เมื่อใด?
Grok 4.6 เหมาะกับงานที่ราคา API และงานเอเจนต์ยาวสำคัญกว่าความหน่วงของโทเค็นแรก และไม่เหมาะนักเมื่อคะแนนเทอร์มินัลที่สูงกว่าของ Sol หรือหน้าต่างบริบทที่ใหญ่กว่าของ Sonnet 5 ตรงงานมากกว่า
Grok 4.6 เหมาะเมื่อ:
- ราคา API เป็นข้อจำกัดหลัก ราคาป้ายและต้นทุนต่อภารกิจต่ำกว่า Sol, Opus 5 และ Fable 5
- งานรันเป็นเอเจนต์แบบหลายขั้นตอนยาว ที่ประสิทธิภาพเชิงรอบ (รอบและโทเค็นอินพุตน้อยกว่า Opus 5 บน AA-Briefcase) คุ้มค่า
- งานเป็นงานความรู้หรือการให้เหตุผลทางกฎหมาย ที่มันนำบนตารางชุดทดสอบ
- ความหน่วงโทเค็นแรกไม่สำคัญ จุดเริ่มช้าเป็นสัญญาณรบกวนในการรันยาว แต่รู้สึกทั้งประสบการณ์ในการแชทเชิงโต้ตอบ
อาจมีทางเลือกที่ดีกว่าเมื่อ:
- งานเป็นโค้ดดิ้งที่พึ่งพาเทอร์มินัลมาก → GPT-5.6 Sol (คะแนน DeepSWE และ Terminal-Bench สูงกว่า)
- งานต้องการหน้าต่างบริบทขนาดใหญ่ → Claude Sonnet 5 (บริบท 1M ไม่มีค่าธรรมเนียมพรอมต์ยาว)
- ต้องการความหน่วงต่ำสุดสำหรับการใช้งานเชิงโต้ตอบ → Gemini 3.7 Flash
- ซื้อโดยดูแต่ระดับปัญญาสูงสุด → Opus 5 (63) หรือ Fable 5 (62) นำดัชนี
ข้อสรุปเกี่ยวกับ Grok 4.6
Grok 4.6 ลงจอดในจุดก้ำกึ่ง มันขยับขึ้นห้าคะแนนในดัชนีและยังต่ำกว่า Sol และ Opus 5 บนราคาป้าย แต่เริ่มช้าลงและมีต้นทุนต่อภารกิจที่วัดได้สูงกว่า Grok 4.5 “ราคาเดิม โมเดลดีกว่า” จึงพลาดครึ่งหนึ่งของการปล่อยนี้
ส่วนที่ฉันยังอยากเห็นคือการรันหลายชั่วโมงที่โค้ดเบส เครื่องมือ และคำสั่งเปลี่ยนไปเรื่อยๆ ตอนนี้ Cursor และ GitHub Copilot ให้บริบทแบบนั้นได้ หากอัตราการแก้ไขและความล้มเหลวต่ำอยู่ ก็เป็นหลักฐานรองรับข้ออ้างเรื่องการฝึกเอเจนต์เกินกว่าการทดสอบแบบตรึง; หากไม่ ก็เหลือเป็นคะแนนเพิ่มห้าจุดเท่านั้น
สำหรับผู้อ่านที่พัฒนาบน xAI API บทความ สอนใช้ Grok 4 API ของเราครอบคลุมไคลเอนต์ Python และโฟลว์คำขอ
Grok 4.6 FAQs
Grok 4.6 แทนที่ Grok 4.5 หรือไม่?
ยังไม่เป็นทางการ SpaceXAI ยังไม่ประกาศวันเลิกใช้งาน Grok 4.5 และยังแสดงอยู่ทั้งใน API และ Cursor ขณะนี้ยังไม่มีการบังคับย้ายไป 4.6
สามารถโฮสต์ Grok 4.6 เองได้หรือไม่?
ไม่ ตามที่กล่าวไว้ข้างต้น ไม่มีน้ำหนักเปิดเผยและไม่มีจำนวนพารามิเตอร์ที่เผยแพร่ จึงไม่มีสิ่งใดให้ดาวน์โหลดไปใช้งานบนฮาร์ดแวร์ของตน การเข้าถึงทุกช่องทางรวมถึง API ตรงวิ่งผ่านโครงสร้างพื้นฐานของ SpaceXAI หรือพาร์ตเนอร์ที่รีเซลล์
GitHub Copilot คิดค่าบริการ Grok 4.6 อย่างไร?
Copilot แปลงการใช้งาน Grok 4.6 เป็น GitHub AI Credits ตามราคาป้ายของผู้ให้บริการ โดยหนึ่งเซ็นต์เท่ากับหนึ่งเครดิต การเติมโค้ดปกติและคำแนะนำการแก้ไขครั้งถัดไปไม่ถูกคิดเป็น AI Credits การใช้โมเดลในการแชทหรืองานเอเจนต์เป็นไปตามกฎการใช้งานของ Copilot
Grok 4.6 ใช้ได้ในสหภาพยุโรปหรือไม่?
ใช่ แต่ประมวลผลในสหรัฐฯ ผู้ใช้สหภาพยุโรปเข้าถึง Grok 4.6 ได้ (ฐานร่วมของ Grok 4.5 ผ่านกฎหมาย EU AI Act และเปิดให้ผู้ใช้ EU ในเดือนกรกฎาคม และ 4.6 ก็มีใน Cursor ทั่วยุโรป) แต่ไม่มีการพักข้อมูลใน EU หน้ารายการโมเดลของ xAI แสดงเพียง us-east-1 และ us-west-2 ดังนั้นคำขอจะรันในสหรัฐฯ กรุณายืนยันตามแต่ละพื้นผิว (คอนโซล API, Cursor, เกตเวย์) ก่อนพึ่งพา
Grok 4.6 ใช้งานร่วมกับการพักข้อมูลในสหรัฐฯ ของ Cursor ได้หรือไม่?
ขณะนี้ Grok 4.6 ใช้ได้ใน Cursor (มีหน้ารายการโมเดลของตัวเอง) แต่การพักข้อมูลในสหรัฐฯ เป็นฟีเจอร์ Enterprise ที่ครอบคลุมเฉพาะโมเดลที่รองรับพร้อมข้อยกเว้นบางประการ ดังนั้นโปรดยืนยันว่า 4.6 อยู่ในรายชื่อโมเดลที่รองรับปัจจุบันของ Cursor ก่อนพึ่งพา