世界最顶尖的数字取证专家如何鉴别视频/声音/图片造假
哈尼·法里德是全球最顶尖的数字取证专家之一,研究照片、视频、声音造假二十多年。
一天早上,法里德收到一段疯传视频。画面显示,一枚美国制造的导弹击中伊朗一所小学,造成大量儿童死亡。媒体和各种组织都在问他:这是真的,还是 AI 做的?法里德的第一反应是怀疑,因为他最近已经看过太多“看起来很真”的 AI 视频:假的轰炸、假的坠机、假的大火、假的处决。它们已经不是过去那种一眼假的东西,
但法里德不说“我觉得像真的”或者“我觉得像假的”,而是把这段视频拆成一堆小问题,一个个去审。
** 第一步是查地点**。 视频说发生在伊朗,那画面里的街道、电线、树、建筑轮廓,能不能和真实地点对上?他用全球图片数据库做地理定位,发现画面确实指向伊朗米纳布市的一条街,而且离一所小学不远。这一步很关键,因为 AI 可以造出一个“像中东”的地方,但要造出一个能和真实街景精确对上的地方,难度就高得多。
** 第二步是看镜头** 。 视频晃动得很自然,像普通人拿手机拍摄,不像那种刻意模拟出来的假晃动。然后他把视频稳定下来,去掉抖动,开始逐帧追踪导弹轨迹。导弹的飞行路线是直的,速度也稳定。他继续放大画面,测量像素,估算导弹长度,算出来大约18英尺,和真实导弹尺寸吻合。
这也是普通人最该学的一点:** 不要只看整体感觉,要把视频拆开看。地点、尺寸、速度、轨迹,每一项都要问一句:它符合真实世界吗?**
** 第三步是看光影和透视。** 很多假图假视频,最容易败在这里。因为真实世界里的光源、物体和影子有固定关系。太阳从一个方向照过来,影子就不能乱跑;房子、道路、桌子这些平行线,在画面里也应该按照透视规律汇向合理的消失点。AI 很会画“像真的画面”,但它经常不是真的理解三维空间,所以阴影、反射、光源、透视线之间会互相打架。
法里德看这类视频时,不是看“画质清不清楚”,而是看** 物理关系对不对** 。影子该长的时候有没有短,反光该出现的地方有没有出现,建筑线条延伸后能不能汇到同一个空间点。如果这些地方乱了,画面再高清也可疑。
** 第四步是听声音** 。 那段导弹视频里,导弹击中建筑后,爆炸声和尖叫声不是立刻出现,而是有一个短暂延迟。这个细节反而更像真的,因为声音传播本来就比画面慢。如果一个远处爆炸,画面和声音完全同时到达,反而要警惕。很多人看视频只盯着画面,专业鉴定会同时看声画关系:爆炸、枪声、回声、尖叫、环境噪音,是否和距离、空间、场景匹配。
所以,普通人刷到突发事件视频,至少可以先问几个问题:地点有没有其他来源能对上?光影有没有明显不合理?远处爆炸的声音是不是来得太快?人物反应和声音是否同步?这些不能保证你一定判断对,但能让你从情绪里退出来。
更麻烦的是,AI 不只会伪造战争视频。它可以伪造总统电话,可以伪造 CEO 视频会议让员工转账,可以伪造孩子的求救电话,可以伪造名人广告,也可以伪造一个普通人的脸、声音和动作。法里德自己也中过招:有人冒用他的手机号,又用 AI 克隆他的声音,去联系他的同事,试图套取机密信息。后来他和妻子约定,敏感电话开始前,必须先说一个安全暗号,确认对方是真人。
这听起来像电影,其实已经是现实。尤其是视频会议诈骗,未来很可能越来越多。这里有一个特别值得普通人借鉴的方法:
主动打光。
思路很简单。视频通话时,对方通常坐在电脑屏幕前。屏幕本身就是一个可控光源。你可以让屏幕突然变亮、变暗,或者显示一块变化的颜色,让这道光照到对方脸上。如果对方是真人坐在摄像头前,他的脸、脖子、衣服,甚至背后环境,都会随着屏幕光发生同步变化。如果是 AI 换脸、录播、虚拟摄像头,画面可能反应不对,或者有细微延迟。
这招的本质不是“看他像不像真人”,而是主动给现实世界出一道题:我改变光,你的脸能不能立刻、自然、符合物理地跟着变?
放到生活里也很实用。以后遇到远程转账、合同确认、敏感电话,不要只相信视频里那张脸。可以让对方做实时动作,换角度,走到窗边,打开灯,靠近屏幕,或者说一个只有你们知道的暗号。** 越是涉及钱和隐私,越不能只靠“我看见他了”。**
还有一种方法,** 是看嘴型和声音。**
现在 AI 很会克隆声音,也很会改嘴型,但嘴型和声音要在语言层面完全对上并不容易。真正说话时,嘴唇、下巴、舌位、声音节奏是连在一起的。如果只是换了音频,或者只改了嘴巴,就可能出现细小错位。普通人未必能看出算法级别的差异,但可以留意:嘴巴闭合和爆破音是否对得上,说话停顿是否自然,情绪和表情是否匹配。
更深一层,是看人的行为和生理细节。
人不是一张脸,而是一整套动态习惯。每个人说话时的头部摆动、眼神、表情节奏、声音起伏,都有自己的模式。真人说话时,面部还有细微血流变化,心脏泵血会让脸部颜色产生极小波动。AI 可以模拟五官,却未必能稳定模拟这些真实人体细节。
当然,这类方法普通人很难直接操作,但它提醒我们:不要只问“长得像不像”,还要问“这个人动起来、说起来、反应起来,像不像一个真实的人”。
法里德最后至少看了那段导弹视频100遍。可怕的是,所有证据都指向:它很可能是真的。但他仍然不敢直接写“这是真的”。他只写了一句非常谨慎的话:没有发现有说服力的证据,表明这段视频是假的,或者经过篡改。
制造深伪视频越来越便宜、快速、可靠,检测它却越来越慢、越来越贵、越来越难。一个普通社交媒体帖子的热度,可能90秒就衰减一半。20分钟之内,舆论场基本已经跑完一轮。等专家终于完成分析,伤害往往早就发生了:假的已经凝固成事实,真的也已经被拖进怀疑。
这才是 AI 造假最可怕的地方。它不只是制造假内容,还会污染真内容。假的可以像真的,真的也会被怀疑成假的。以后每个人都可以说“这是 AI 做的”,每个人也都可以用 AI 制造一份“证据”。
所以,AI 时代真正稀缺的东西,不是内容,而是可信度。以后再看到爆炸视频、名人发言、孩子求救、老板下指令, ** 第一反应最好不是转发,也不是愤怒,而是先慢下来。**
看来源,看地点,看光影,看声音,看有没有其他渠道印证。视频通话涉及钱,就打光、换角度、说暗号。截图涉及重大指控,就找原始出处。越是让你立刻愤怒、立刻害怕、立刻转发的东西,越要停几秒。
AI 造假的时代,最容易被骗的不是笨人,而是反应太快的人。因为假内容最怕你慢下来。
相关文章
甲骨文埃里森:AI泡沫的压力表
80岁再登世界首富,随后财富蒸发2000亿美元。 他把1300亿美元债务、OpenAI和自己的晚年全押在了AI上。 如果AI真有泡沫,甲骨文可能是最先显示压力的那只仪表。 80岁首富的另一面:一座岛,一个中国女人,至少四个孩子 在夏威夷,埃里森几乎拥有整座拉奈岛。140平方英里的岛上,从47英里的海岸线,到加油站、电影院、两家四季酒店,再到新建的员工住宅,大量资产都属于他。当地约3000名居...
《New Scientist》陶哲轩专访:AI最可怕的,不是抢走工作,而是重新定义你的工作
《New Scientist》陶哲轩专访:AI最可怕的,不是抢走工作,而是重新定义你的工作 -AI正以每周几个的速度攻克数学难题 -数学家已暂时失去了对叙事的控制 -如果一个行业说不清自己的价值,别人就会替它定义 AI已经闯进数学界 数学家大概是世界上最习惯“慢”的一群人。一个问题悬而未决几十年甚至几百年,一个人花几年时间只研究一道题,在这个行业里都很正常。 但2026年,节奏突然变了。 一...
AI要真正理解世界,光靠大语言模型够吗?
Science 25 June 2026: AI要真正理解世界,光靠大语言模型够吗? 在纽约市一家初创公司的办公室里,一个人工智能程序正在即时“梦出”一个世界。 我在一款视频游戏里移动:穿过房间,遇到其他角色。每一帧画面,都是新泽西一个数据中心实时生成的。 但这个挑战并不是为人类设计的。 我停下来,一个自主AI智能体接管了我的操作。 General Intuition 的联合创始人 Adam...