Anthropic เปิดตัว Claude Opus 5.5: ต้นทุนลดลง 40% ความเร็วสูงขึ้น ยกระดับความปลอดภัย และเพิ่มขีดความสามารถในการจัดการงานระยะยาว
เมื่อวันที่ 22 กันยายน ตามเวลาฝั่งตะวันออกของสหรัฐฯ Anthropic เปิดตัว Claude Opus 5.5 ซึ่งโดดเด่นด้านต้นทุนการดำเนินงานที่ลดลง 40% และความเร็วที่เพิ่มขึ้นกว่า 30% โมเดลนี้ยกระดับประสิทธิภาพการจัดการงานซับซ้อน การเขียนโปรแกรมขนาดใหญ่ การวิจัย และงานด้านความรู้ พร้อมทั้งเพิ่มความปลอดภัยขั้นสูงและการตรวจจับข้อผิดพลาดเชิงรุก อย่างไรก็ตาม ยังคงต้องอาศัยการตรวจสอบโดยมนุษย์เพื่อความแม่นยำสูงสุดในภาคธุรกิจและการลงทุน

TradingKey - เมื่อวันที่ 22 กันยายน ตามเวลาฝั่งตะวันออกของสหรัฐฯ Anthropic ได้ประกาศเปิดตัว Claude Opus 5.5 ซึ่งมุ่งเน้นใน 3 ด้านหลัก ได้แก่ ความสามารถที่แข็งแกร่งยิ่งขึ้นในการจัดการงานซับซ้อน ต้นทุนการดำเนินงานที่ต่ำลง และการใช้งานที่ปลอดภัยยิ่งขึ้น เมื่อเปรียบเทียบกับ Opus 5 ต้นทุนในการทำงานลดลง 40% และความเร็วในการแสดงผลเพิ่มขึ้นมากกว่า 30% ขณะเดียวกัน ราคาสำหรับข้อมูลขาเข้า (input) ข้อมูลขาออก (output) และการอ่านแคช (cache reads) ก็ได้รับการปรับลดลงพร้อมกัน
สิ่งที่น่าจับตามองมากที่สุดของการอัปเกรดครั้งนี้อาจไม่ใช่การคว้าอันดับหนึ่งในแบบทดสอบมาตรฐาน (benchmark) เดี่ยวๆ แต่เป็นการเริ่มทำหน้าที่เสมือนพันธมิตรความร่วมมือในระยะยาว โดยสามารถจัดการการย้ายโค้ดขนาดใหญ่ จัดระเบียบเอกสารทางธุรกิจ และสร้างรายงานการวิเคราะห์ พร้อมทั้งนำเสนอคำตอบได้อย่างตรงไปตรงมาและตรวจสอบได้ง่ายยิ่งขึ้น
การเขียนโปรแกรมที่ซับซ้อนช่วยประหยัดเวลาได้มากขึ้น
ความสามารถที่โดดเด่นที่สุดของ Opus 5.5 มุ่งเน้นไปที่งานเขียนโปรแกรมขนาดใหญ่และหลายขั้นตอนซึ่งต้องได้รับการตรวจสอบอย่างต่อเนื่อง ในการทดสอบครั้งหนึ่ง Opus 5.5 ได้ตรวจสอบและแก้ไขฐานโค้ดขนาด 200,000 บรรทัดภายในเวลาไม่ถึง 3 ชั่วโมง ขณะเดียวกัน Opus 5 ใช้เวลานานกว่า 20 ชั่วโมงและใช้โทเคนมากกว่าประมาณ 2.5 เท่า สำหรับองค์กรธุรกิจ สิ่งนี้หมายความว่าคุณค่าของ AI ไม่ได้อยู่เพียงแค่ "จะสามารถเขียนโค้ดได้หรือไม่" เท่านั้น แต่ยังอยู่ที่ว่าสามารถหลีกเลี่ยงขั้นตอนที่ไม่จำเป็นและช่วยประหยัดเวลาได้หรือไม่

[ที่มา: Anthropic]
ข้อมูลการทดสอบยังแสดงให้เห็นว่า Opus 5.5 ทำคะแนนได้ 66.4% บน Terminal-Bench 4.0, 54.4% บน FrontierCode v1.1 และ 57.8% บน CursorBench 4.0 แม้ว่าตัวเลขเหล่านี้จะไม่สามารถเป็นตัวแทนของการทำงานในโลกจริงได้ทั้งหมด แต่ก็แสดงให้เห็นถึงความสามารถที่สูงขึ้นในการรับมือกับงานที่ใช้เวลานานและงานหลายขั้นตอน
ศักยภาพด้านสำนักงานและการวิจัยปรับตัวดีขึ้นเช่นกัน
กรณีการใช้งาน Opus 5.5 ขยายวงกว้างเกินกว่าแค่โปรแกรมเมอร์ โดยการทดสอบของ Anthropic ครอบคลุมถึงกระบวนการทางธุรกิจ งานด้านความรู้ การวิจัยทางวิทยาศาสตร์ การปฏิบัติการคอมพิวเตอร์ และการจดจำแผนภูมิ
ในการทดสอบงานด้านความรู้ GDPval-AA v2.1 Opus 5.5 ทำคะแนนได้ 1,846 คะแนน ซึ่งสูงกว่า Fable 5.1 ที่ทำได้ 1,735 คะแนน และ Opus 5 ที่ทำได้ 1,708 คะแนน ขณะที่ในการทดสอบการปฏิบัติการคอมพิวเตอร์ Opus 5.5 ทำคะแนนได้ 81.8% และทำได้ถึง 89% ในการทดสอบการจดจำแผนภูมิ
รายละเอียดประการหนึ่งในภารกิจการวิจัยมีความน่าสนใจเป็นพิเศษ ผู้ทดสอบได้ขอให้โมเดลหลายรุ่นเขียนรายงานตามข้อมูลในรายงานทางการเงินที่หาได้ยาก พร้อมทั้งตรวจสอบตัวเลขและข้อความอ้างอิงแบบบรรทัดต่อบรรทัด โดย Opus 5.5 ผ่านมาตรฐานคุณภาพได้ถึง 16 ครั้งภายใต้การตั้งค่าที่แตกต่างกัน ขณะที่อีกสองโมเดลไม่สามารถผ่านได้เลยแม้แต่ครั้งเดียว สิ่งนี้แสดงให้เห็นว่าโมเดลให้ความสำคัญกับหลักฐานมากขึ้นเมื่อจัดระเบียบข้อมูล ถึงกระนั้นก็ยังไม่สามารถทดแทนการตรวจสอบโดยมนุษย์ได้
ตัวอย่างเช่น บริษัทการลงทุน Walleye Capital ได้มอบหมายให้โมเดลวิเคราะห์การควบรวมกิจการสมมติ ซึ่งนอกจากจะสร้างโมเดลทางการเงินได้เสร็จสมบูรณ์แล้ว ยังตรวจพบข้อผิดพลาดในคำสั่งการทดสอบและแก้ไขให้อย่างเชิงรุก สำหรับผู้ใช้งานทั่วไป ความสามารถนี้แปลงมาเป็นบทวิเคราะห์ตลาด การจัดทำงบประมาณ และเอกสารนำเสนอที่มีความชัดเจนยิ่งขึ้น
การปรับตัวลดลงของราคาคือการเปลี่ยนแปลงที่สำคัญ
Opus 5.5 มีราคาต่ำกว่า Opus 5 โดยราคา Input ต่อ 1 ล้านโทเคนลดลงจาก 5 ดอลลาร์เหลือ 4 ดอลลาร์ ราคา Output ลดลงจาก 25 ดอลลาร์เหลือ 20 ดอลลาร์ และการอ่านแคชลดลงจาก 0.50 ดอลลาร์เหลือ 0.20 ดอลลาร์

[ที่มา: Anthropic]
การอ่านแคชมีความสำคัญเป็นพิเศษสำหรับงานเขียนโค้ดและงานระบบอัตโนมัติที่ยาวนาน เนื่องจากกระบวนการทำงานจำนวนมากมีการนำเนื้อหาที่ผ่านการประมวลผลแล้วกลับมาใช้ซ้ำอยู่เสมอ หลังจากการปรับลดราคา ทีมงานสามารถมั่นใจได้มากขึ้นในการปล่อยให้โมเดลรันการตรวจสอบรอบเพิ่มเติม แทนที่จะต้องหยุดทำงานก่อนเวลาอันควรเพื่อประหยัดค่าใช้จ่าย
นอกจากนี้ Claude Code และ Claude Platform ยังมีโหมดเร็ว (fast mode) ที่มีความเร็วสูงกว่าโหมดมาตรฐานถึง 2.5 เท่า โดยราคา Input ของโหมดเร็วอยู่ที่ 8 ดอลลาร์ต่อ 1 ล้านโทเคน และราคา Output อยู่ที่ 40 ดอลลาร์ ซึ่งเหมาะสำหรับสถานการณ์ที่มีความต้องการความเร็วในการตอบสนองสูงกว่า
ศักยภาพด้านความปลอดภัยได้รับความสนใจเพิ่มขึ้น
แอนทรอพิกเปิดเผยว่า Opus 5.5 ได้รับคะแนนสูงสุดในบรรดาโมเดล Claude ปัจจุบันจากการตรวจสอบพฤติกรรมแบบอัตโนมัติ โดยการทดสอบครอบคลุมสถานการณ์จำลองเกือบ 2,000 สถานการณ์ ซึ่งเน้นประเมินว่าโมเดลจะก้าวล้ำขอบเขต ดำเนินการที่ยากจะแก้ไขคืนกลับ หรือถูกแทรกแซงด้วยการฉีดพรอมต์ (prompt injection) หรือไม่
ในการทดสอบครั้งหนึ่ง Opus 5.5 พยายามฝ่าฝืนขอบเขตรอบข้างน้อยกว่า Opus 5 ราว 85% โดยพฤติกรรมที่เกี่ยวข้องทั้งหมดจัดอยู่ในประเภทความรุนแรงระดับต่ำและมีการรายงานปัญหาเชิงรุก อย่างไรก็ตาม แอนทรอพิกยังยอมรับว่าการทดสอบความปลอดภัยไม่สามารถค้นพบความเสี่ยงทั้งหมดในโลกแห่งความเป็นจริงได้ล่วงหน้า
ดังนั้น Opus 5.5 จึงได้ใช้มาตรการคุ้มครองที่เข้มงวดยิ่งขึ้นในด้านความปลอดภัยทางไซเบอร์และชีววิทยา โดยการตรวจหาและแก้ไขข้อผิดพลาดในการพัฒนาซอฟต์แวร์ตามปกติยังคงใช้งานได้ แต่งานด้านความปลอดภัยทางไซเบอร์จำนวนมากจะถูกโอนย้ายไปยังโมเดลอื่น ส่วนสถาบันที่จำเป็นต้องดำเนินการวิจัยทางชีววิทยาจะต้องยื่นขอสิทธิ์ที่เกี่ยวข้องผ่านการพิจารณาโครงการ
เนื้อหานี้ได้รับการแปลโดยปัญญาประดิษฐ์ (AI) และผ่านตรวจสอบโดยมนุษย์ มีไว้เพื่อการอ้างอิงและข้อมูลทั่วไปเท่านั้น ไม่ใช่การแนะนำการลงทุนแต่อย่างใด
บทความแนะนำ













ความคิดเห็น (0)
คลิกปุ่ม $ ป้อนสัญลักษณ์ และเลือกเพื่อเชื่อมโยงหุ้น, กองทุน ETF หรือสัญลักษณ์หลักทรัพย์อื่น ๆ