Anthropic ปล่อย Claude Opus 5.5 เร็วขึ้น 30% ค่าใช้จ่ายรวมถูกลง 40%
Claude Opus 5.5 โมเดลตัวแรกของตระกูล Claude 5.5 ราคาต่อ token ลด 20% cache read ลด 60% สร้างผลลัพธ์เร็วขึ้นกว่า 30% และใช้ token น้อยลง รวมแล้วค่าใช้จ่ายจริงถูกลงถึง 40% เทียบ Opus 5
โดย ณัฐพล ยงค์ไพบูลย์ผู้ร่วมก่อตั้งกลุ่ม Claude Thailand Community
Anthropic ปล่อย Claude Opus 5.5 มาแล้วครับ เร็วขึ้น และถูกลง
Opus 5.5 เป็นโมเดลตัวแรกของตระกูล Claude 5.5 Anthropic ระบุว่าทำงานส่วนใหญ่ได้ในระดับเดียวกับ Claude Fable 5.1 แต่ค่าใช้จ่ายในการรันถูกกว่า Opus 5 เดิมถึง 40%
ราคาต่อ token จริง ๆ ลดแค่ 20% (input จาก 5 ดอลลาร์เหลือ 4 ดอลลาร์ output จาก 25 ดอลลาร์เหลือ 20 ดอลลาร์ต่อล้าน token) ส่วนที่ทำให้ประหยัดรวมไปถึง 40% ในการใช้งานจริง มาจากการที่ Opus 5.5 ใช้ token น้อยลงในการทำงานเดียวกัน บวกกับสร้างผลลัพธ์เร็วขึ้นกว่า 30% พอสองอย่างนี้รวมกัน ต้นทุนจริงจึงลดลงเกือบครึ่ง
สรุปสิ่งที่เปลี่ยน
- cache read ถูกลง จาก 0.50 เหลือ 0.20 ดอลลาร์ต่อล้าน token ลด 60% ซึ่งเป็นค่าใช้จ่ายก้อนใหญ่สำหรับ agent ที่รันงานยาว ๆ ส่วน cache write ลดจาก 6.25 เหลือ 5 ดอลลาร์
- ความสามารถโดยรวมใกล้เคียง Fable 5.1 ในงานส่วนใหญ่ แต่คะแนน benchmark agentic coding สูงกว่า Opus 5 เดิมชัดเจน เช่น Terminal-Bench 4.0 ได้ 66.4% เทียบ Opus 5 เดิมที่ 52.3%
- มีเคสทดสอบจริงที่น่าสนใจ เช่น มีคนลองย้ายโค้ด 680,000 บรรทัดเสร็จในไม่ถึงวันเดียว จากที่ปกติต้องใช้เวลาเป็นสัปดาห์
- เพิ่ม 5-hour usage limit ให้แพลน Pro, Max, Team และ Enterprise แบบ seat-based พร้อมฟีเจอร์เซฟ rate limit reset ไว้ใช้ตอนที่ต้องการเองได้
ตัวเลขจากการทดสอบของ Anthropic
นอกจากเคส 680,000 บรรทัด Anthropic ยังยกตัวอย่างอื่นไว้ในประกาศ
- มีผู้ทดสอบใช้ Opus 5.5 ตรวจและแก้โค้ดเบส 200,000 บรรทัดจบในไม่ถึง 3 ชั่วโมง ขณะที่ Opus 5 ใช้เวลากว่า 20 ชั่วโมง และใช้ token มากกว่า 2.5 เท่า
- งานแปลงซอฟต์แวร์ HAProxy จากภาษา C เป็น Rust ภายในบริษัท Opus 5.5 ทำเสร็จใน 9.5 ชั่วโมง เทียบกับ Fable 5.1 ที่ใช้ 12 ชั่วโมง และมีต้นทุนถูกกว่า 51%
- ตอนสั่งให้ลดเวลาโหลดของเว็บแอปทุกหน้า Opus 5.5 ทำสำเร็จ 39 จาก 40 ครั้ง
- งานวิเคราะห์ดีลควบรวมกิจการ Opus 5.5 ทำเสร็จใน 63 นาที เทียบกับ Opus 5 ที่ใช้ 93 นาที และต้นทุนถูกลงครึ่งหนึ่ง
ด้านงานความรู้ทั่วไป Opus 5.5 ได้ 1846 Elo บน GDPval-AA v2.1 ซึ่งวัดงานอาชีพจริง 44 สาขา นำหน้า Fable 5.1 ที่ 1735 และ Opus 5 ที่ 1708
Anthropic ย้ำเองว่าที่ระดับความสามารถขนาดนี้ ส่วนต่างของคะแนน benchmark เริ่มบอกความต่างในการใช้งานจริงได้ไม่ค่อยแม่นแล้ว และในการใช้งานภายในของ Anthropic เอง ช่องว่างระหว่าง Opus 5.5 กับ Fable 5.1 แคบกว่าที่คะแนนบอก
เขียนและสื่อสารดีขึ้น
จุดที่ Anthropic บอกว่าปรับปรุงเยอะ คือเรื่องการสื่อสาร ซึ่งเป็นเสียงสะท้อนที่ได้รับบ่อยที่สุดเรื่องหนึ่งของ Opus 5 เวอร์ชันใหม่จะเอาข้อมูลสำคัญขึ้นก่อน ใช้ศัพท์เฉพาะน้อยลง และทำตามกฎการเขียนที่เราตั้งให้ได้ดีขึ้น ผู้ทดสอบกลุ่มแรกบอกว่าอ่านง่ายและตามได้ง่ายกว่าเดิม โดยเฉพาะตอนทำงานยาว ๆ ต่อเนื่อง
ความปลอดภัย
Anthropic ระบุว่า Opus 5.5 ทำคะแนนได้ดีที่สุดเท่าที่เคยทดสอบมา บนชุดทดสอบพฤติกรรมอัตโนมัติที่ครอบคลุมเกือบ 2,000 สถานการณ์ และมีโอกาสน้อยลงมากที่จะทำสิ่งที่ย้อนกลับได้ยาก หรือทำงานนอกขอบเขตที่กำหนดไว้ ในการทดสอบตัวใหม่ที่วัดว่าโมเดลพยายามข้ามขอบเขตที่กันไว้บ่อยแค่ไหน Opus 5.5 พยายามน้อยกว่า Opus 5 ราว 85% และยังต้านการโจมตีแบบ prompt injection ได้ดีกว่าเดิม
ก่อนปล่อยมีการทดสอบโดยหน่วยงานภายนอกอย่าง METR และ Frontier Design ด้วย และเนื่องจาก Opus 5.5 เก่งด้านชีววิทยาและความปลอดภัยไซเบอร์มาก Anthropic จึงใส่มาตรการกำกับระดับเดียวกับ Fable 5.1 ไว้ งานด้านไซเบอร์ส่วนใหญ่จะถูกส่งต่อไปให้ Opus 4.8 ทำแทน ส่วนองค์กรที่ต้องใช้งานด้านชีววิทยาจริงจังสมัครเข้าโครงการ Life Sciences Verification Program ได้
ใช้ได้ที่ไหนบ้าง
Opus 5.5 เปิดให้ใช้แล้วบนทุกแพลตฟอร์ม รวมถึง Amazon Web Services, Google Cloud และ Microsoft Azure ส่วนนักพัฒนาที่ใช้ Claude Platform เรียกใช้ด้วยชื่อโมเดล claude-opus-5-5 และยังมี Fast mode ที่เร็วขึ้นถึง 2.5 เท่าใน Claude Code และ Claude Platform ในราคา 8 ดอลลาร์ต่อล้าน input token และ 40 ดอลลาร์ต่อล้าน output token
Anthropic บอกว่า Claude Sonnet 5.5 และ Claude Haiku 5.5 จะตามมาในอีกไม่กี่สัปดาห์ข้างหน้า พร้อมการปรับปรุงหลายอย่างแบบเดียวกัน
มุมมองจากผู้เขียน
ผมว่าจุดที่น่าสนใจที่สุดของรอบนี้ไม่ใช่คะแนน benchmark แต่เป็นเรื่องต้นทุน การที่ cache read ถูกลง 60% มีผลกับคนที่รัน agent ยาว ๆ มากกว่าที่คิด เพราะค่าใช้จ่ายก้อนใหญ่ของงานแบบนั้นอยู่ที่การอ่าน context เดิมซ้ำ ๆ ไม่ใช่การสร้างข้อความใหม่ ส่วนเรื่องที่ตอบโจทย์คนใช้งานทั่วไปคือการเขียนที่อ่านง่ายขึ้นและเพดาน usage limit ที่ขยับขึ้น
ใครลองใช้ Opus 5.5 แล้วบ้างครับ รู้สึกว่าเร็วขึ้นจริงไหมครับ
ข้อมูลในบทความนี้อ้างอิงจากประกาศอย่างเป็นทางการของ Anthropic ที่ anthropic.com อ่านต้นทางได้ที่ลิงก์ด้านล่าง
รับข่าวสารทางอีเมล
บทความใหม่ ข่าวอัปเดตเกี่ยวกับ Claude และประกาศกิจกรรมของชุมชน ส่งให้เป็นครั้งคราว ไม่ถี่จนรำคาญ
