Anthropic ra mắt Claude Opus 5: mạnh hơn cho coding và agent, giá từ 5 USD/M token
Anthropic công bố Claude Opus 5 ngày 24/07/2026, định vị đây là model Opus mới cho coding, AI agent và knowledge work. Benchmark trong bài là số liệu Anthropic công bố; phản hồi doanh nghiệp được tách riêng khỏi đánh giá độc lập.

Cập nhật ngày 25/07/2026: Anthropic chính thức công bố Claude Opus 5 vào ngày 24/07/2026 và cho biết model có thể dùng ngay. Bài này ưu tiên nguồn sơ cấp của Anthropic; các con số benchmark bên dưới là Anthropic-reported, không phải kết quả kiểm định độc lập.
Một bước nâng cấp cho công việc dài và khó
Anthropic mô tả Opus 5 là model “thoughtful and proactive”, tiến gần Claude Fable 5 ở mức intelligence nhưng có giá bằng một nửa. Hướng định vị khá rõ: đây là model cho coding production, AI agent nhiều bước và công việc chuyên môn dài hơi.
Opus 5 có effort settings để người dùng chọn mức suy luận phù hợp với độ khó và chi phí. Anthropic nói model kiểm tra kết quả tốt hơn, biết lặp lại để sửa sai và duy trì mạch làm việc lâu hơn các phiên bản trước.
Benchmark: mạnh, nhưng phải đọc đúng provenance
Theo thông báo của Anthropic:
- Trên ARC-AGI 3, Opus 5 đạt điểm khoảng gấp ba model đứng kế tiếp.
- Trên Zapier AutomationBench, tỷ lệ pass khoảng 1,5 lần model kế tiếp ở cùng chi phí mỗi task.
- Trên OSWorld 2.0, Anthropic cho biết Opus 5 vượt các model khác ở cùng mức chi phí và vượt kết quả tốt nhất của Fable 5 với chi phí chỉ hơn một phần ba.
- Trong các đánh giá life sciences nội bộ, Opus 5 cao hơn Opus 4.8 ở mọi eval; riêng một benchmark hóa hữu cơ tăng 10,2 điểm phần trăm và một task về protein tăng 7,7 điểm phần trăm.
Các claim trên hữu ích để hiểu cách nhà phát triển định vị model, nhưng không nên biến thành bảng xếp hạng khách quan cho mọi workload. Điều kiện, harness, effort, fallback và cách tính chi phí có thể khác nhau giữa từng evaluation. Footnote của Anthropic nói Frontier-Bench v0.1 dùng mini-SWE-agent, GKE backend và trung bình 5 lần thử mỗi task; Opus 4.8 được dùng fallback khi safety classifier từ chối.
Coding và agentic work là trọng tâm
Anthropic đưa ra các ví dụ trong evaluation và early-access testing: Opus 5 tự dựng pipeline computer vision để tái tạo một chi tiết máy thành mô hình FreeCAD; tìm root cause của bug trong package manager; và giúp một kỹ sư xây market-data feed cùng test harness trong một session.
Đây là case study do Anthropic lựa chọn, không phải thử nghiệm đối chứng độc lập. Giá trị của chúng nằm ở việc minh họa loại workflow mà model nhắm tới: yêu cầu dài, mơ hồ, nhiều tool và cần tự kiểm tra đầu ra.
Phản hồi khách hàng: tín hiệu sớm, không phải khảo sát người dùng
Trang công bố liệt kê nhận xét từ các early-access customer như Cursor, Zapier, Lovable, Box, Kiro và nhiều công ty khác. Một số claim đáng chú ý gồm Zapier báo cáo Opus 5 đạt 100% trên một workflow account-health; Lovable nói agentic coding task khó tăng 22% so với Opus 4.7; Box báo cáo tổng thể cao hơn Opus 4.8 là 8%, data analysis cao hơn 11% và due diligence cao hơn 17%.
Những con số này nên được gắn nhãn customer statements / early-access, vì không có đủ thiết kế, dữ liệu và quy trình kiểm định để xem như benchmark độc lập. Chúng là tín hiệu đáng quan tâm về trải nghiệm thực tế, nhưng chưa thay thế được replication từ bên thứ ba.
Safety và cybersecurity
Anthropic cho biết Opus 5 là model aligned nhất của họ trong automated behavioral audit, với điểm misaligned behavior 2,3 — thấp nhất trong nhóm model gần đây của hãng. Đây vẫn là kết quả do Anthropic công bố và cần đọc cùng system card.
Ở cybersecurity, Anthropic nói Opus 5 chưa vượt frontier của Mythos 5: model gần Mythos 5 ở khả năng nhận diện lỗ hổng nhưng kém hơn đáng kể khi phát triển exploit. Cyber classifier của Opus 5 cho phép tìm lỗ hổng trong source code, nhưng chặn binary-based scanning, penetration testing và exploit generation. Các yêu cầu bị flag trong Claude.ai, Claude Code và Claude Cowork sẽ mặc định fallback về Opus 4.8.
Giá và khả năng cung cấp
Claude Opus 5 có giá 5 USD / một triệu token input và 25 USD / một triệu token output, bằng mức giá Opus 4.8. Fast mode chạy khoảng 2,5 lần tốc độ mặc định và có giá gấp đôi mức cơ bản trên Claude Platform. Anthropic cũng nêu prompt caching có thể tiết kiệm tới 90% và batch processing tiết kiệm 50% trong các điều kiện áp dụng.
Model có mặt trên Claude API với tên claude-opus-5, đồng thời được cung cấp trên Claude cho người dùng Pro, Max, Team và Enterprise. Anthropic cũng liệt kê Claude Platform, Amazon Web Services, Google Cloud và Microsoft Foundry cho developer/enterprise.
Kết luận
Claude Opus 5 là một launch đáng chú ý vì Anthropic đang đẩy Opus thành model “daily driver” cho coding và agent dài hạn. Bằng chứng hiện có cho thấy các cải thiện lớn trong benchmark nội bộ và nhiều báo cáo tích cực từ early-access customer.
Kết luận công bằng nhất ở thời điểm ra mắt là: Opus 5 có promise mạnh, đặc biệt ở coding, automation và knowledge work; còn vị trí trên toàn thị trường cần chờ benchmark độc lập và trải nghiệm rộng hơn.
Nguồn
- Anthropic — Introducing Claude Opus 5, 24/07/2026: https://www.anthropic.com/news/claude-opus-5
- Anthropic — Claude Opus, trang sản phẩm và availability/pricing: https://www.anthropic.com/claude/opus
- System card được Anthropic dẫn chiếu: https://www.anthropic.com/claude-opus-5-system-card
Lane hình ảnh: 9router primary (cx/gpt-5.5-image).