
Sign up to save your podcasts
Or
活动预告🥳:5 月 24 日,我们会请到丁丁和 Fellou 创始人谢扬办一场线上活动,大家记得翻到 shownotes 末尾查看报名信息!
像 RL 这个概念一样,Benchmark 和 Evaluation 也是做 AI 的人经常挂在嘴边的词,但到底该怎么理解这个概念,该如何正确的设定这些问题和数值呢?
正巧前不久 OpenAI 研究员姚顺雨的那篇《AI 即将进入下半场》特别火,他核心讲的就是「我们当下已经进入了 AI 的第二阶段——从解决问题转向定义问题,评估的意义会超过训练本身。而这其中,评估最关键的不是设置更难的基准测试,而是要在实际落地的场景中重新设计一套实用的评估标准」。
所以这期我们请到了前 Kimi 产品经理丁丁,从她在大模型公司一年多的实践经验出发,请她分享些对于 Benchmark 和 Evaluation 的思考,相信大多数人听完这期都会对这些概念有更深的理解,也可以开始自己设定一些评估问题和标准了。
P.S. 丁丁之前曾在微信做过 5 年的搜索产品,也在美团做过策略产品,所以在节目最后她也分享了一些从古典产品转型 AI 产品经理的心得。
【人类博物馆】
导游:曲凯,42章经创始人
34 号珍藏:丁丁,前微信、美团、Moonshot 产品(负责 Kimi App)
【时光机】
【Reference】
【活动预告🥳】
5 月 24 日,我们会办一场线上活动。感兴趣的朋友欢迎点击链接或扫描下面的二维码,一起来认识&交流!
【The gang that made this happen】
4.4
99 ratings
活动预告🥳:5 月 24 日,我们会请到丁丁和 Fellou 创始人谢扬办一场线上活动,大家记得翻到 shownotes 末尾查看报名信息!
像 RL 这个概念一样,Benchmark 和 Evaluation 也是做 AI 的人经常挂在嘴边的词,但到底该怎么理解这个概念,该如何正确的设定这些问题和数值呢?
正巧前不久 OpenAI 研究员姚顺雨的那篇《AI 即将进入下半场》特别火,他核心讲的就是「我们当下已经进入了 AI 的第二阶段——从解决问题转向定义问题,评估的意义会超过训练本身。而这其中,评估最关键的不是设置更难的基准测试,而是要在实际落地的场景中重新设计一套实用的评估标准」。
所以这期我们请到了前 Kimi 产品经理丁丁,从她在大模型公司一年多的实践经验出发,请她分享些对于 Benchmark 和 Evaluation 的思考,相信大多数人听完这期都会对这些概念有更深的理解,也可以开始自己设定一些评估问题和标准了。
P.S. 丁丁之前曾在微信做过 5 年的搜索产品,也在美团做过策略产品,所以在节目最后她也分享了一些从古典产品转型 AI 产品经理的心得。
【人类博物馆】
导游:曲凯,42章经创始人
34 号珍藏:丁丁,前微信、美团、Moonshot 产品(负责 Kimi App)
【时光机】
【Reference】
【活动预告🥳】
5 月 24 日,我们会办一场线上活动。感兴趣的朋友欢迎点击链接或扫描下面的二维码,一起来认识&交流!
【The gang that made this happen】
109 Listeners
316 Listeners
42 Listeners
176 Listeners
164 Listeners
52 Listeners
272 Listeners
23 Listeners
25 Listeners
4 Listeners
45 Listeners
289 Listeners
27 Listeners
4 Listeners
8 Listeners