October 30, 2025

Offline RL by Reward-Weighted Fine-Tuning for Conversation Optimization

14 minutes

This paper recasts the complex offline RL problem as standard supervised fine-tuning (SFT) techniques that directly optimizes for rewards. Authors show that their method empirically outperforms state-of-the-art baselines such as SFT and Direct Preference Optimization (DPO) across various QA benchmarks. The experiments focus on fixed-horizon conversational policies where the agent either reasons about answers or asks clarifying questions, demonstrating that directly optimizing the reward signal leads to superior accuracy and language quality metrics.

...more

View all episodes

By Enoch H. Kang

October 30, 2025

Offline RL by Reward-Weighted Fine-Tuning for Conversation Optimization

14 minutes

...more

Share Offline RL by Reward-Weighted Fine-Tuning for Conversation Optimization

Sign up to save your podcasts

Offline RL by Reward-Weighted Fine-Tuning for Conversation Optimization

Offline RL by Reward-Weighted Fine-Tuning for Conversation Optimization