AI Podcast

HumanOmni:以人为中心的视频理解大型视觉语音语言模型


Listen Later

深入探讨HumanOmni,一个为理解以人为中心的场景而设计的多模态大型语言模型。我们讨论了其数据集构建、模型架构以及在情感识别、面部表情理解和动作理解等任务上的表现。
...more
View all episodesView all episodes
Download on the App Store

AI PodcastBy weedge