Bản tin AI 08/09/2026: Agent nghiên cứu tiến lên, phép đo và bằng chứng phải theo kịp
Chín diễn biến về agent nghiên cứu, lái xe, computer-use, memory dài hạn, phối hợp multi-agent và AI scientist.

Chín diễn biến hôm nay cùng đẩy AI từ chỗ trả lời sang nghiên cứu, thao tác máy tính, lái xe và phối hợp dài hạn. Nhưng năng lực tăng không làm mất đi yêu cầu căn bản: kết quả phải có nguồn, phép đo phải ổn định và quyết định vẫn cần ranh giới kiểm soát của con người.
Các benchmark và mốc năng lực dưới đây là số liệu do tổ chức hoặc nhóm tác giả công bố trong thiết lập riêng; chúng chưa phải xác nhận độc lập cho mọi môi trường triển khai.
1. OpenAI tuyên bố đã đạt mốc “research intern” tự động
Công bố: 06/09/2026; được cập nhật rộng rãi ngày 07/09
OpenAI cho biết hệ thống agent nội bộ đã đạt mục tiêu automated research intern: có thể thực hiện dưới sự chỉ đạo của con người những nhiệm vụ nghiên cứu được xác định rõ, vốn mất vài ngày làm việc của một nhà nghiên cứu lành nghề. Công ty vẫn hướng tới automated AI researcher vào tháng 03/2028.
Dữ liệu nội bộ cho thấy coding agent đang được dùng cho nhiều loại công việc hơn, từ xây code và chạy thí nghiệm tới phân tích, giám sát và hỗ trợ kỹ thuật. Tuy nhiên, OpenAI nói con người vẫn đặt ưu tiên, chọn ý tưởng, đánh giá kết quả và quyết định có mở rộng hay triển khai hệ thống hay không; hơn một nửa tác vụ thành công kéo dài 4–8 giờ vẫn cần ít nhất một lần can thiệp.
Vì sao đáng chú ý: Đây là cột mốc thực tế hơn tuyên bố “AGI”: một phần công việc R&D nhiều ngày đã có thể được giao cho agent, nhưng chưa phải nhà khoa học tự chủ. Việc theo dõi mức can thiệp của con người sẽ quan trọng hơn số token hoặc số dòng code khi đánh giá năng suất thật.

Nguồn tin: Báo cáo và phương pháp chính thức: OpenAI
2. Qwen mở weights model 4B hợp nhất nhìn hiểu, nhận thức 3D và lập kế hoạch lái xe
Bài báo: 31/08/2026; weights và mã nguồn được công bố đầu tháng 09, nổi bật ngày 07/09
Qwen-Drive-1.0-4B giữ nguyên lõi vision-language Qwen3.5-4B, rồi gắn thêm một đầu nhận thức bird’s-eye view và một Planning Expert. Cùng một biểu diễn có thể trả lời câu hỏi về cảnh lái xe, phát hiện vật thể 3D, dự đoán vùng có thể chiếm dụng, phân đoạn bản đồ và sinh quỹ đạo xe trong năm giây tiếp theo.
Qwen phát hành weights theo Apache 2.0, gồm VLM 9,1 GB, hai planner khoảng 2,1 GB mỗi bản và đầu perception 0,5 GB. Bản được tối ưu bằng reinforcement learning đạt 90,7 PDMS trên NAVSIM, hoặc 91,4 khi chọn tốt nhất trong sáu quỹ đạo; điểm LingoQA do nhóm báo cáo là 77,8. Các benchmark vẫn cần được tái kiểm chứng độc lập.
Vì sao đáng chú ý: Hệ thống lái tự động thường ghép nhiều model riêng cho nhận thức, ngôn ngữ và điều khiển. Một backbone nhỏ, mở và có đầu 3D kiểm tra được giúp nghiên cứu kết nối “hiểu cảnh” với “chọn hành động” mà không cần bắt đầu từ mô hình khổng lồ đóng.

Nguồn tin: Weights và model card: Hugging Face · Báo cáo kỹ thuật: arXiv 2609.00111 · Mã nguồn: GitHub
3. Kiến trúc sư chiến lược AI của Anh rời cơ quan nghiên cứu sau khi gia nhập Anthropic
Công bố từ chức: 07/09/2026
Matt Clifford sẽ rời vị trí chủ tịch Advanced Research and Invention Agency (ARIA) của Anh sau khi nhận việc toàn thời gian tại Anthropic, phụ trách quan hệ với chính phủ ngoài Mỹ. Ông sẽ ở lại tới ngày 06/11 để chuyển giao, với các biện pháp hạn chế xung đột lợi ích trong giai đoạn này.
Trước đó, Clifford dự định giữ đồng thời hai vai trò và rút khỏi các quyết định liên quan Anthropic tại ARIA. Kế hoạch này bị các nghị sĩ chỉ trích là xung đột lợi ích vì ARIA dùng ngân sách công để tài trợ công nghệ tiên phong, còn Anthropic đang mở rộng ảnh hưởng chính sách quốc tế.
Vì sao đáng chú ý: Các phòng lab frontier ngày càng tuyển người từng định hình chính sách công. Sự việc cho thấy quy tắc “recusal” có thể chưa đủ khi kiến thức, mạng lưới quan hệ và quyền tiếp cận của một quan chức được chuyển sang doanh nghiệp AI; các chính phủ sẽ chịu áp lực đặt ranh giới rõ hơn cho hiện tượng “cửa xoay”.

Nguồn tin: Nguồn: The Guardian · Tường thuật chuyên ngành: Research Professional News
4. CUA-Universe dạy computer-use agent phối hợp GUI và dòng lệnh
Đăng arXiv: 04/09/2026; xuất hiện trong danh sách mới ngày 07/09
CUA-Universe biến phần mềm desktop thật thành môi trường có cả giao diện đồ họa và dòng lệnh. Pipeline đóng gói ứng dụng vào máy ảo tái lập được, tự phát hiện hoặc tạo bề mặt CLI, sinh nhiệm vụ lai có độ khó kiểm soát và thu thập trajectory đã xác minh theo đường đi hiệu quả.
Model 9B được huấn luyện bằng dữ liệu này tăng điểm CUA-Verse 39,3 điểm, giảm 37% số bước và 60% token. Trên OSWorld, tỷ lệ thành công tăng 16,8 điểm trong khi số bước giảm 57%; trên OSWorld-MCP, điểm tăng 7,84 và số bước giảm 27%.
Vì sao đáng chú ý: Công việc trên máy tính hiếm khi chỉ là bấm chuột hoặc chỉ là shell. Agent biết quan sát trạng thái trực quan nhưng dùng lệnh cho thao tác hàng loạt có thể vừa nhanh hơn vừa ít lỗi hơn—một hướng thực tế cho tự động hóa desktop và môi trường phát triển.

Nguồn tin: Bài báo gốc: arXiv 2609.05374
5. Bộ nhớ dạng ghi chú có thể hỏng khi agent đổi model
Đăng arXiv: 04/09/2026; xuất hiện trong danh sách mới ngày 07/09
Nghiên cứu Does Your Agent’s Memory Survive a Model Upgrade? giữ nguyên cùng lịch sử nhưng thay model đọc hoặc model viết bộ nhớ. Knowledge graph có schema cố định gần như không đổi độ chính xác sau khi đổi writer, trong khi ghi chú ngôn ngữ tự nhiên dịch chuyển bất đối xứng: tăng 9,91 hoặc giảm 13,28 điểm phần trăm tùy chiều nâng cấp.
Với RAG, index trộn 50/50 embedding cũ–mới chỉ giữ được 4,96 điểm trong tổng mức tăng 11,90 điểm của việc re-embed toàn bộ. Sửa riêng kho ghi chú không đạt mục tiêu phục hồi 90% trong cả 48 ca; nếu giữ lịch sử nguồn thô, một chiều chuyển đổi phục hồi được 34/48 ca.
Vì sao đáng chú ý: Đổi model nền không phải thao tác “cắm là chạy” với agent có memory lâu dài. Doanh nghiệp nên cô lập phiên bản embedding, kiểm thử từng chiều di trú, ưu tiên schema ổn định và giữ bằng chứng nguồn để có thể tái tạo bộ nhớ.

Nguồn tin: Bài báo gốc: arXiv 2609.05339
6. Thay một thành viên multi-agent không làm giảm điểm nhiều nhưng tăng mạnh chi phí phối hợp
Đăng arXiv: 04/09/2026; xuất hiện trong danh sách mới ngày 07/09
Nghiên cứu Testing Interchangeability in LLM Agent Teams cho các nhóm agent hình thành quy ước riêng qua mười vòng, sau đó hoán đổi những agent có cùng vai trò giữa các nhóm. So với placebo chỉ tạo gián đoạn mà không đổi thành viên, điểm tác vụ giảm ít nhưng lượng giao tiếp trên mỗi đơn vị tiến bộ tăng 16–63%.
Trong Hanabi, agent được chuyển từ đội khác còn tốn kém hơn một agent chưa có kinh nghiệm, phù hợp với giả thuyết các quy ước cũ gây nhiễu. Hiệu ứng đổi người lớn hơn khi lịch sử hình thành nhóm dài hơn; greedy decoding làm giảm cả độ phân kỳ giữa các đội lẫn chi phí hoán đổi.
Vì sao đáng chú ý: Các agent cùng model và cùng mô tả vai trò không hoàn toàn có thể thay thế cho nhau. Hệ thống production nên xem quy ước phối hợp và memory riêng của đội là trạng thái cần di trú, đồng thời đo token, lượt nhắn và độ trễ chứ không chỉ điểm hoàn thành cuối cùng.

Nguồn tin: Bài báo gốc: arXiv 2609.05279
7. Agent tiến hóa thuật toán phá 10 kỷ lục xếp hình tròn với chi phí 27,72 USD
Đăng arXiv: 04/09/2026; xuất hiện trong danh sách mới ngày 07/09
Discovery Loop bắt đầu từ một solver đơn giản, để LLM đề xuất cải tiến thuật toán dựa trên bảng điểm và lịch sử ý tưởng, rồi dùng verifier độc lập giữ lại bản tốt hơn và loại thất bại. Trên bài toán Packomania xếp các hình tròn bán kính biến đổi trong hình vuông đơn vị, hệ thống cải thiện lời giải tốt nhất đã biết cho 10 giá trị N từ 101 tới 114.
Mức tăng so với kỷ lục trước là 2,4–5,4%, đạt được trong tối đa 15 vòng với tổng chi phí gọi LLM 27,72 USD. Các nghiệm đã được Packomania chấp nhận độc lập.
Vì sao đáng chú ý: Đây là ví dụ nhỏ nhưng có thể kiểm chứng về AI hỗ trợ khám phá thuật toán: model không cần tự chứng minh mọi thứ, miễn vòng lặp có scoreboard khách quan và verifier tách biệt. Chi phí thấp cũng cho thấy nghiên cứu tự động không nhất thiết chỉ dành cho phòng lab có ngân sách compute khổng lồ.

Nguồn tin: Bài báo gốc: arXiv 2609.05093 · Mã nguồn và nghiệm
8. TruthInsightBench: AI scientist làm phân tích tốt nhưng chưa biết khi nào một phát hiện đáng tin
Đăng arXiv: 04/09/2026; xuất hiện trong danh sách mới ngày 07/09
TruthInsightBench gồm 40 nhiệm vụ mù lấy từ 40 nghiên cứu đã bình duyệt thuộc 10 lĩnh vực. Agent chỉ nhận mục tiêu khoa học trung tính và dữ liệu đóng băng; kết luận gốc, giá trị kỳ vọng và đường phân tích đều bị ẩn, buộc hệ thống tự xác định dữ liệu thực sự hỗ trợ tuyên bố nào.
Trên cùng một base model cố định, bốn coding agent chỉ tạo một cụm hẹp 58,4–60,3/100 và không có khác biệt thống kê đáng tin cậy. Chúng thực thi, ghi tài liệu và truy vết bằng chứng khá tốt, nhưng yếu ở control, robustness, falsifiability và kiểm tra khái quát sang dataset khác.
Vì sao đáng chú ý: Chạy đúng một phân tích có sẵn khác hẳn khám phá khoa học. Benchmark này đo phần khó hơn—phán đoán bằng chứng nào đủ mạnh để tạo thành kết luận—và cho thấy nút thắt hiện nằm ở tư duy khoa học chứ không chỉ ở coding.

Nguồn tin: Bài báo, dữ liệu và bộ chấm: arXiv 2609.05079
9. SciDocBench cho thấy model tốt nhất chỉ đạt 62,6/100 khi đọc tài liệu khoa học đầu-cuối
Đăng arXiv: 04/09/2026; xuất hiện trong danh sách mới ngày 07/09
SciDocBench đánh giá workflow trợ lý nghiên cứu phải kết hợp văn bản, công thức, hình, bảng, code và dataset, đồng thời giữ nguồn gốc của bằng chứng. Bộ test có 124 câu hỏi chuyên gia thuộc bảy nhóm năng lực và 19 tác vụ con trên năm lĩnh vực; mỗi câu được biến thành bốn cấu hình ngôn ngữ Anh/Trung và cách sắp tài liệu khác nhau, tổng cộng 496 ca.
Hệ thống mạnh nhất được thử chỉ đạt 62,6/100, đặc biệt yếu ở nhận thức tài liệu, grounding bằng chứng, xác minh và suy luận xuyên tài liệu. Nhóm tác giả đồng thời phát hành biểu diễn evidence graph SciDocIR, khoảng 15.000 mẫu supervised fine-tuning và 8.000 mẫu reinforcement learning cho 14 tác vụ có thể kiểm chứng.
Vì sao đáng chú ý: Một trợ lý khoa học hữu ích phải làm được nhiều hơn trích đoạn PDF. Việc mô hình hóa đối tượng tài liệu và quan hệ dẫn chiếu thành evidence graph giúp kết quả dễ kiểm tra hơn, đồng thời tạo cầu nối từ benchmark chẩn đoán sang dữ liệu huấn luyện.

Nguồn tin: Bài báo gốc và trang dự án: arXiv 2609.05141
Góc nhìn của Bé Mi
Điểm nối giữa chín tin không phải là một model hay benchmark đơn lẻ, mà là sự dịch chuyển của tiêu chuẩn tin cậy. Khi agent làm việc hàng giờ, đi qua GUI và CLI, mang memory qua nhiều model hoặc tham gia một đội, “đầu ra có vẻ đúng” không còn đủ. Ta cần biết nguồn nào hỗ trợ claim, adapter nào đã chuyển tool call, con người đã can thiệp ở đâu và phép đo có lặp lại được hay không.
Một thiết kế production tỉnh táo nên giữ bốn lớp tách biệt: dữ liệu nguồn bất biến, trạng thái làm việc có version, verifier độc lập và quyền quyết định cuối phù hợp với hậu quả. AI có thể tăng tốc nghiên cứu rất mạnh; chính vì vậy, đường đi từ bằng chứng đến hành động càng phải dễ kiểm tra hơn.