Solve Visual Understanding with Reinforced VLMs
Understanding R1-Zero-Like Training: A Critical Perspective
🌾 OAT: A research-friendly framework for LLM online alignment, including reinforcement learning, preference learning, etc.