本期嘉宾:Ben (Simiao) Ren,Scam AI 联合创始人/CEO
本期主播:Jasmine Zhong
当 AI 开始替我们读邮件、接电话、核验身份并执行操作,诈骗的目标也正在从“欺骗人”转向“欺骗 AI”。Ben(Simiao)Ren,Scam AI 联合创始人,杜克大学电子与计算机工程博士,前 Meta 高级研究科学家。Scam AI 专注于识别 deepfake、换脸视频、克隆声音、伪造文件及其他由 AI 驱动的骗局,入选 UC Berkeley SkyDeck 创业加速器,并完成首轮 260 万美元融资。
随着生成式 AI 的研究重点从文字和图像逐渐走向视频,当越来越多创业者追逐更真实、更流畅的 AI 视频生成时,离开 Meta 后的 Simiao 却选择站到生成式 AI 的另一面,研究如何判断屏幕对面的人、声音和视频究竟是不是真的。这是一个正在迅速进入当代每个人现实生活中的问题。许多在实验环境中表现良好的检测模型,一旦面对真实网络中的视频压缩、剪辑和后期处理,准确率便可能大幅下降。AI 鉴真也不再只是实验室里的技术竞赛,而是一个同时涉及数据、速度、准确率、隐私和商业落地的现实挑战。
所以这一期,我们想讨论的是一个更加根本的问题:社会的信任基石究竟从何而来?
我们从 Simiao 的博士研究和 Meta 经历聊起,聊到他为什么不推荐大家读 PhD,长期的学术训练如何给他的思维带来了限制;也聊到他为什么选择 AI 鉴真,企业和个人正在面对哪些新型 AI 骗局,以及一项论文中表现优秀的技术,为什么进入现实世界后仍然远远不够。除此之外,我们还聊到 Scam AI 如何完成首轮 260 万美元融资,以及一位技术创业者如何寻找投资人、辨别真正有价值的反馈,并穿过融资过程中接连不断的 “No”。
本期你会听到:
- 为什么离开 Meta,选择创业做 AI 鉴真?
- 2026 年的 AI 诈骗,已经发展到了什么程度?
- 当“眼见为实”失效,社会还能够依靠什么建立信任?
- 为什么实验室中接近 100% 的 AI 辨伪准确率,到了真实网络里可能迅速下降?
- 为什么 Simiao 说,他“有一点后悔读 PhD”?
- 技术创业的第一年是种什么样的体验?
- 首轮 260 万美元融资背后,经历了多少个“No”?如何平衡心理状态?
- 从第一位客户到与大公司合作,To B 创业最难的是什么?
- 普通人现在可以怎样保护自己?
时间线:
00:00:00 开场00:01:33 Scam AI 到底是做什么的?
00:02:55 为什么离开Meta,主动跳出舒适区
00:05:08 当所有人都在做生成,他为什么选择AI鉴真
00:10:09 让AI每天接100通诈骗电话
00:13:52 骗子如何把来电显示伪装成Kaiser等官方机构
00:17:08 诈骗正在将AI Agent变成新的攻击入口
00:23:20 普通人应该如何保护自己
00:25:29 当“眼见为实”失效,新的信任基石从哪里来
00:27:47 AI 鉴真如何成为一门 To B 生意
00:35:49 生成与检测,一场猫鼠游戏
00:38:02 Simiao预测社会对AI的信任拐点何时出现
00:39:49 AI鉴真的三条技术路径
00:46:00 为什么Simiao说,他“后悔读 PhD”
00:57:15 Simiao锐评大厂大多是“草台班子”
00:58:22 创业第一年:人生最有意思的一年
00:59:52 创业最难的,是忘掉原来的人生框架
01:02:12 融资像参加一场《非诚勿扰》
01:06:36 “你怎么样和大厂竞争?”应该怎样回答
01:08:02 如何拿下第一位大客户
01:09:35 To B 销售的真实难点在哪里
01:12:09 “眼见为实”的时代已经过去了
本期提到的关键词:
Deepfake:利用 AI 合成或替换一个人的脸、声音和表情,让虚假内容看起来像真实发生。如今 deepfake 已经可以用于实时视频通话和线上会议。
声音克隆:通过少量语音样本模仿一个人的声音、语气和停顿。诈骗者可以借此冒充家人、同事或公司高管,制造紧急情况并要求转账。
Caller ID Spoofing:来电号码伪造。诈骗者通过技术手段修改电话传输的号码或元数据,让来电显示看起来来自 Kaiser、政府机构或其他可信组织。
AI Agent:能够读取信息、调用工具并代替用户执行任务的 AI 系统,例如查看邮件、回复消息、安排日程。它获得的权限越多,可能被攻击和利用的入口也越多。
Attack Surface:攻击面,指一个系统中所有可能被攻击者利用的入口。当 AI Agent 获得邮箱、文件、账户等权限后,用户面临的攻击面也会随之扩大。
Prompt Injection:提示词注入。攻击者将恶意指令隐藏在邮件、网页或图片中,诱导 AI Agent 泄露 API Key、转发银行邮件,或执行其他未经授权的操作。
TTS:Text to Speech,文字转语音。高质量的 TTS 可以生成接近真人的声音、停顿和情绪。Scam AI 也利用 TTS 驱动的 AI 接听诈骗电话,消耗诈骗者的时间并研究最新话术。
On-device AI:端侧 AI,指模型直接运行在用户自己的电脑或手机上,而不是把数据上传到云端。它可以降低延迟,也能减少视频、会议和身份信息离开本地设备带来的隐私风险。
ID Verification / IDV:身份验证,通过证件、人脸、自拍或视频确认用户身份。Simiao 提到,传统的“上传证件、转头或眨眼”验证方式,已经可能被实时换脸技术绕过。
KYC:Know Your Customer,了解你的客户。银行和金融机构通过 KYC 核实用户身份、年龄和风险信息,AI 鉴真公司则帮助这些系统识别换脸、冒用身份和伪造材料。
Detection:内容检测,通过模型分析图片或视频中的视觉痕迹,判断内容是真实拍摄、AI 生成还是经过换脸处理。它通常只能给出概率判断,遇到新的生成模型时也可能需要重新训练。
数字水印:生成平台嵌入 AI 内容中的可识别标记,可以是肉眼可见的,也可以隐藏在图片数据里。水印能够帮助识别内容来源,但开源模型可能没有水印,攻击者也可能尝试删除它。
Provenance:内容溯源,记录一张图片或视频由谁、在什么时间、通过什么设备或模型产生,以及之后是否被修改。它关注的不是内容“看起来像不像真的”,而是它是否拥有一条可验证的来源链。
Cryptographic Signature:加密签名,利用密码学为文件生成独一无二的数字证明。内容一旦被修改,签名也可能发生变化,因此可以帮助验证文件的来源和完整性。
C2PA:Coalition for Content Provenance and Authenticity,内容来源与真实性联盟。它试图为图片、音频和视频建立统一的来源标准,让用户知道内容由谁生成、经过了哪些处理。
Benchmark:基准测试,使用统一数据集比较不同模型的性能。Simiao 提到,一些 deepfake 检测数据集已经落后于最新生成技术,因此模型在旧数据集上获得很高准确率,并不代表它能识别现实中的最新骗局。
信任基石:社会用来确认身份、信息和交易真实性的基础机制。Simiao 认为,每个时代的信任都建立在“当时难以伪造的东西”之上;当照片、视频和声音都可以被 AI 低成本复制,新的信任机制也必须被重新建立。关于 NexValley:NexValley 是一个关注 AI、创业与技术判断的深度访谈频道。我们和 AI founder、投资人、研究者、工程师对话,记录他们如何在不确定性中判断方向、选择路径、理解技术变化。
「在这里找到我们」
公众号:NexValley
收听渠道:Apple Podcast|小宇宙|Spotify 搜索「NexValley Podcast」
视频平台:小红书|Bilibili|YouTube 搜索「NexValley」
联系我们:[email protected]|[email protected]