February 01, 2025

【周末特辑】1月第4周最火AI论文 | 强化学习优于监督微调，HLE挑战LLMs能力。

Listen Later

12 minutes

本期的 5 篇论文如下：

[00:35] TOP1(🔥53) | 🧠 SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training（监督微调记忆，强化学习泛化：基础模型后训练的比较研究）

[03:02] TOP2(🔥48) | 🧠 Humanity's Last Exam（人类最后的考试）

[05:21] TOP3(🔥47) | 🛡 GuardReasoner: Towards Reasoning-based LLM Safeguards（GuardReasoner：面向基于推理的LLM安全防护）

[07:44] TOP4(🔥45) | 🎙 Baichuan-Omni-1.5 Technical Report（百川全能1.5技术报告）

[10:07] TOP5(🔥42) | 📚 Qwen2.5-1M Technical Report（Qwen2.5-1M 技术报告）

【关注我们】

您还可以在以下平台找到我们，获得播客内容以外更多信息

小红书: AI速递

...more

View all episodes

View all episodes

Download on the App Store

Download on the App Store

Get it on Google Play

HuggingFace 每日AI论文速递

By duan

5

22 ratings

February 01, 2025

【周末特辑】1月第4周最火AI论文 | 强化学习优于监督微调，HLE挑战LLMs能力。

Listen Later

12 minutes

本期的 5 篇论文如下：

[00:35] TOP1(🔥53) | 🧠 SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training（监督微调记忆，强化学习泛化：基础模型后训练的比较研究）

[03:02] TOP2(🔥48) | 🧠 Humanity's Last Exam（人类最后的考试）

[05:21] TOP3(🔥47) | 🛡 GuardReasoner: Towards Reasoning-based LLM Safeguards（GuardReasoner：面向基于推理的LLM安全防护）

[07:44] TOP4(🔥45) | 🎙 Baichuan-Omni-1.5 Technical Report（百川全能1.5技术报告）

[10:07] TOP5(🔥42) | 📚 Qwen2.5-1M Technical Report（Qwen2.5-1M 技术报告）

【关注我们】

您还可以在以下平台找到我们，获得播客内容以外更多信息

小红书: AI速递

...more

More shows like HuggingFace 每日AI论文速递

硅谷101|中国版 by 泓君Jane

硅谷101|中国版

56 Listeners

商业就是这样 by 商业就是这样

商业就是这样

292 Listeners

声动早咖啡 by 声动活泼

声动早咖啡

293 Listeners

思文，败类 by 思文败类

思文，败类

157 Listeners

不开玩笑 Jokes Aside by 不开玩笑JokesAside

不开玩笑 Jokes Aside

136 Listeners

人民公园说AI by JustSayAI

人民公园说AI

7 Listeners

數創實驗室 - AI時代的學習指南 by Vincent在數創

數創實驗室 - AI時代的學習指南

1 Listeners

AI可可AI生活 by fly51fly

AI可可AI生活

0 Listeners