W2SPO — mô hình yếu hướng dẫn RL mô hình mạnh qua nhánh hỗ trợ
Bài viết arXiv chỉ ra nút thắt cổ chai trong RL suy luận cho LLM: trên các bài toán khó, các mẫu của mô hình đích hội tụ vào cùng những đường suy luận sai, làm cạn kiệt tín hiệu gradient hữu ích cho chính sách.
Đề xuất: W2SPO, phương pháp off-policy trong đó mô hình hỗ trợ yếu hơn khám phá theo cách khác, cung cấp cho mô hình mạnh những rollout đa dạng để thoát khỏi dư thừa ngữ nghĩa.
Cách tiếp cận này lật ngược câu chuyện scaling thường lệ—các mô hình rẻ hơn trở thành một kỹ thuật để tăng tính đa dạng, chứ không phải là một gánh nặng.