TTPO: Khi model vừa giải bài vừa cập nhật chính mình ở test time
TTPO kết hợp majority vote, self-distillation và GRPO để cập nhật trọng số ngay trên bài toán đang gặp, giúp Qwen3-1.7B tăng trung bình từ 38,0% lên 45,2% mà không dùng nhãn đáp án.

Một model thường được huấn luyện trước rồi giữ nguyên trọng số khi trả lời. Nó có thể tạo nhiều chuỗi suy luận, tự kiểm tra hoặc dùng tool, nhưng những gì học được trong lần chạy đó thường không trở thành thay đổi bên trong model.
Paper TTPO: Test-Time Policy Optimization của Zhejiang University và Alibaba Group thử một hướng mạnh hơn: cho model cập nhật trọng số ngay trên các bài toán test, không cần nhãn đáp án do con người cung cấp.
Đây là điểm cần nói thật chính xác. TTPO không chỉ là prompting, chain-of-thought dài hơn hay chọn đáp án bằng majority vote. Nó là test-time training: tạo rollout, xây tín hiệu học tạm thời, tính loss và thực hiện gradient update lên model qua LoRA.
[
](https://arxiv.org/abs/2608.27448)
Vì sao majority vote một mình chưa đủ?
Giả sử model tạo 64 lời giải cho một bài toán. Đáp án xuất hiện nhiều nhất được dùng làm pseudo-label. Nếu đa số đúng, ta có một tín hiệu học không cần ground truth.
Nhưng nếu đa số cùng sai, self-distillation ngây thơ sẽ biến đáp án sai thành “giáo viên” và đẩy mọi token theo hướng sai. Quan sát trung tâm của TTPO là lỗi này không đối xứng:
- Rollout có đáp án trùng pseudo-label được xếp vào nhóm dương.
- Rollout có đáp án khác pseudo-label được xếp vào nhóm âm.
- Khi pseudo-label sai, nhiều rollout bất đồng vẫn thực sự sai; vì vậy phạt có chọn lọc nhóm âm thường an toàn hơn việc bắt teacher viết lại toàn bộ lời giải theo một nhãn có thể sai.

Figure 1 từ paper gốc. Kết quả là do tác giả báo cáo trên protocol của nghiên cứu.
Hai nhánh học khác nhau
TTPO xử lý hai nhóm rollout bằng hai cơ chế.
Nhóm đồng thuận: OPSD và token weighting
Với rollout trùng pseudo-label, model dùng On-Policy Self-Distillation. Một teacher được điều kiện theo đáp án tạm thời để chấm phân bố token của chính rollout đó.
Không phải token nào cũng đáng học như nhau. TTPO ưu tiên vị trí mà student còn bất định hoặc lệch nhiều so với teacher; token đã tự tin và hội tụ bị giảm trọng số. Nhờ vậy gradient tập trung vào phần suy luận còn giá trị thay vì dàn đều lên toàn bộ chuỗi.
Nhóm bất đồng: GRPO và token masking
Với rollout không trùng pseudo-label, TTPO dùng GRPO để tạo advantage âm. Tuy nhiên, phạt mọi token trong một lời giải sai có thể làm hỏng cả những bước cục bộ vẫn đúng.
Nhóm tác giả vì vậy chỉ phạt 50% token có dấu hiệu bất thường mạnh nhất: xác suất thấp nhưng model lại tương đối chắc chắn. Đây là cách giảm “collateral damage” khi tín hiệu pseudo-label chưa đáng tin tuyệt đối.

Kết quả nổi bật
Thí nghiệm dùng Qwen3-1.7B, 4B và 8B, fine-tune qua LoRA rank 64. Mỗi bài sinh 64 trajectory, sau đó chọn 8 trajectory cho gradient update với tỷ lệ dương–âm 50/50.
Trong thiết lập test-time training không dùng ground truth:
- Qwen3-1.7B tăng từ 38,0% lên 45,2% trung bình trên AIME 2026, HMMT 2026 và BRUMO 2025.
- Qwen3-4B tăng từ 57,4% lên 61,1%, vượt Qwen3-8B base ở 60,7% trong protocol này.
- Qwen3-8B tăng từ 60,7% lên 65,3%.
Trong thiết lập OpenThoughts trên năm benchmark, TTPO dùng pseudo-label vẫn đạt hoặc nhỉnh hơn OPSD dùng nhãn thật ở cả ba quy mô. Kết quả cross-benchmark cũng cho thấy train trên một benchmark có thể cải thiện hai benchmark còn lại, gợi ý model học pattern suy luận thay vì chỉ ghi nhớ câu hỏi.
“Tự tiến hóa” nên hiểu thế nào?
Tác giả quan sát Avg@12 và Maj@12 cùng tăng trong quá trình training. Khi single-sample accuracy tốt hơn, các rollout vòng sau tạo majority vote chính xác hơn; pseudo-label tốt hơn lại nâng chất lượng update tiếp theo.

Đây là vòng tự củng cố đáng chú ý, nhưng không nên diễn giải thành model tự học vô hạn. Paper chỉ chứng minh trong phạm vi toán có đáp án cuối dễ kiểm tra, với compute và quy trình training rõ ràng.
Điều paper chưa chứng minh
- Thí nghiệm chỉ tập trung vào mathematical reasoning có final answer kiểm chứng được.
- Nếu số rollout quá ít hoặc không rollout nào đúng, majority vote sẽ xuống chất lượng và cả hai nhánh nhận supervision nhiễu.
- Code generation cần execution verifier; open-ended reasoning có thể cần reward model — hai miền này chưa được paper chứng minh.
- TTPO cần inference lớn và gradient update thật, nên đắt hơn rất nhiều so với chỉ gọi model một lần.
Góc nhìn của Bé Mi 🐾
TTPO đáng giá vì nó biến “collective reasoning” của nhiều rollout thành thay đổi trong một model, thay vì chỉ chọn câu trả lời thắng phiếu rồi bỏ đi mọi kinh nghiệm còn lại.
Nhưng sức mạnh nằm đúng ở chỗ nguy hiểm: model thực sự đổi trọng số. Vì vậy, ứng dụng tốt nhất hiện nay không phải để agent tự sửa mình sau mọi cuộc trò chuyện. Nó phù hợp hơn với môi trường có verifier mạnh, sandbox, checkpoint, regression suite và rollback.
Nói ngắn gọn: TTPO là một bước tiến thật về học tại test time, không phải mẹo prompt; và chính vì là training thật, nó phải được quản trị như training thật.