套餐
知识

一部没提 AI 的法律,凭什么管住 AI?

解读一部从未提及 AI 的 GDPR 如何通过同意、数据最小化、自动化决策与解释权等抓手约束 AI,并介绍欧洲议会研究的核心结论与合规要点。

ai-marketingevidence
2026-09-13SupaMarketers7 分钟阅读

前几天,一个做跨境电商的朋友约我喝茶。聊到欧洲市场,他愁眉苦脸。

他说,欧洲用户对个人数据这事,较真到令人发指。他的系统想给用户做推荐,法务先把他拦下:过 GDPR 这一关再说。

他问我:GDPR 是 2016 年通过的,那会儿连 ChatGPT 都没影儿。一部"老"法律,管得住今天的 AI 吗?

我说,巧了。2020 年,欧洲议会的研究部门组织过一批学者,专门研究这个问题:一部从头到尾没出现"人工智能"四个字的法律,到底管不管得住 AI?

研究结论挺反直觉:管得住。但前提是,法律不用改,作业必须补。

今天,我把这份研究的思路,用你能听懂的话,讲给你。

一、AI 为什么突然这么能吃?

很多人对 AI 的印象,还停留在科幻片里。其实今天真正在改变世界的,是一种看起来很"笨"的方法:机器学习。

什么叫机器学习?

先说老一辈的做法。想让机器认猫?找专家来,把知识一条条写成规则:有胡须,是猫。有尖耳朵,是猫。眼睛会发光,是猫。写了几千条,机器还是认不出一只歪着头的猫。

这条路,叫专家系统。上世纪八九十年代,无数聪明人栽在这上面。常识这东西,写得越多,漏得越多。学术界管这叫"知识表示瓶颈"。

机器学习,把逻辑彻底反了过来。

规则写不出来?那就不写了。我给你一万张标注好的照片:这张是猫,这张不是。机器自己从里面"悟"出猫长什么样。

这叫监督学习。人不当老师了,人只管出题。题目加标准答案,叫训练集。机器对着训练集反复做题、对答案、修正自己,最后长出一个模型。

你想想看,这套方法里,最值钱的是什么?

不是算法,是数据。

没有训练集,再聪明的算法也是巧妇难为无米之炊。所以 AI 对数据有一种刻在骨子里的饥饿。而今天的世界,恰好管饱:差不多 300 亿台设备挂在网络上,你的手机、汽车、门铃、手环,每一台都在默默记账。

于是,一个螺旋转起来了:AI 越强,越想吃数据;吃得越多,长得越强。

而你的个人数据,就是这个螺旋上最肥美的一段。

二、这口饭,吃出了什么?

先说好的一面,真的好。

算法做判断,经常比人靠谱。人有一堆改不掉的毛病:过度自信、损失厌恶、先入为主、看谁顺眼就给谁加分。算法没有情绪,不会累,不怕得罪人,还能被反复审计。在不少招聘、信贷、医疗诊断的对比里,算法的表现超过了人类专家。

再说不好的一面。

同样的能力,换个方向用,就是另一番景象。

模型从你的数据里"悟"出来的,不只是你喜欢什么,还有你是谁:你健康不健康,还得起还得不起钱,你倾向哪边的观点,你看到什么话术会动摇。

这个过程,有个专门的名字:画像。

什么叫画像?就是把你留下的数据点喂给模型,让它推断出连你自己都没意识到的东西。点赞是数据,浏览是数据,住哪个小区是数据。模型把线索一拼,给你补全一张你本人都没画过的自画像。

画完这张像,能干什么?能预测你,进而能影响你。

觉得抽象?我给你讲个真事。

2016 年美国大选前后,一家叫 Cambridge Analytica 的公司,上线了一款性格测试小程序。做题有奖励,2 到 5 美元。条件只有一个:用 Facebook 账号登录。

大约 32 万人做了题。

他们不知道的是,程序顺着他们的账号,把他们好友的数据也一并卷走了。32 万人的授权,变成了 3000 万到 5000 万人的数据。

然后,公司拿这 32 万人的"测试答案+社交数据"当训练集,训练出一个模型:什么样的点赞模式,对应什么样的人格;什么样的人格,吃什么样的话术。

最后一步,用这个模型给剩下几千万没做过题的人画像,从中挑出那些"稍微推一把就会改变主意"的摇摆选民,锁定几个关键州,一人一策,精准投放政治广告。

你看懂这个结构了吗?

32 万人自愿交出的东西,变成了几千万人不自愿被推断的东西。每个环节单看都人畜无害:做个测试,拿点奖励。合起来,是一次对几千万人心理的规模化操作。

这就是画像最可怕的地方:它伤害你的方式,可以非常温柔。

更妙的是,就算公司规规矩矩,算法公平、准确、不歧视,事情也没完。一个人持续被记录、被评估、被"贴心地"投喂,这本身就是一种压力。你以为你在挑选信息,其实是信息在挑选你。

三、"匿名",可能只是个错觉

说到这,肯定有人会说:那我把数据匿名化,不就行了?

天真了。

讲三个案例,都是这份研究里反复引用的经典。

第一个。美国马萨诸塞州曾把州政府雇员的医疗记录抹掉姓名、匿名化之后公开,供研究使用。有研究者把这份"匿名"数据,和公开的选民登记表一交叉:生日、邮编、性别,三个字段一对上,锁定了州长本人的完整医疗记录。

第二个。Netflix 办过一场算法大赛,公布了一份"匿名"的用户影评数据。有人拿另一个影评网站上的公开影评一比对,只要知道某个用户在那儿写过的随便两条影评,就能在这份"匿名"数据里把他认出来。

第三个。有研究发现,一款应用只要知道你手机上装了哪 4 个应用,再拿到全量的应用安装列表做比对,就能把你从"匿名"用户里挑出来。

3 个字段,2 条影评,4 个应用。

看完是不是有点发凉?你以为你穿上了隐身衣,其实你只是摘掉了胸牌。 走路姿势、身高、口音,全都在。

AI 时代,判断一份数据是不是个人数据,已经不能只看它本身了,得看它跟谁放在一起。单独看毫无意义的数据,拼上另外一块,就是你这个人。

研究里还有个更狠的主张:模型从你的数据里"推断"出来的新信息,比如从浏览记录推出的性取向、政治倾向,也应该算新的个人数据,甚至算敏感数据,一样要接受监管。

不然,企业只需要一个动作就能绕过法律:不去"收集"你的敏感信息,去"猜"。

四、一部没提 AI 的法律,怎么管?

回到开头的问题。GDPR 里连"人工智能"这个词都没有,凭什么管 AI?

答案是:AI 做的所有事,落点都是个人数据。而这部法律,管的恰恰就是个人数据。

四个抓手,我一个一个说。

第一,同意。

很多人以为,数据保护的套路是"通知+同意":企业贴一份隐私政策,你点了同意,就两清了。

研究对这套模型毫不客气。今天的处理过程复杂到没人看得懂,隐私条款长到没人读完,而且很多服务你不点同意就别用。这种同意,叫自由自愿吗?

GDPR 的解法,是允许一种更灵活的读法:你的数据被拿去干别的,不一定要重新走一遍同意,只要新用途和原始用途"兼容"。统计、科研类用途,法律直接推定兼容。

这就像你把钥匙交给物业,是让他来修水管的。他顺手把楼道的灯也修了,可以;他打开你的保险柜,不行。

第二,最小化。

字面意思是:数据少收,够用就行。这跟 AI 正面相撞,AI 就是要吃海量数据。

研究给了一个聪明的转译:最小化,盯住的不该只是数据的"量",更该是数据的"认人度"。

什么意思?数据可以多,但要给它打码(假名化),让它不容易连回具体的人。你拦不住别人存数据,但你可以让数据"认不出"人。而一旦有人把打了码的数据重新连回你身上,这件事本身就等于"重新收集了一次你的个人数据",要按完整的规矩重新来一遍。

第三,自动化决策。

这是最硬的一条。GDPR 白纸黑字:完全由机器做出、对你产生法律后果或重大影响的决策,原则上禁止。

注意,是"原则上"。后面跟着三个宽例外:合同必要、法律授权、你明确同意。所以招聘筛选、贷款审批这类自动化决策,现实中照跑不误。

但跑了,你就得给保障:你有权要求真人介入,有权表达意见,有权申诉。

说白了:机器可以拦你,但你有权喊一个真人过来。

第四,解释权。

这条最有意思,因为它是整部法律里最暧昧的地方。

GDPR 的序言里写着,被机器决策的人有权"获得对决策的解释"。可翻到正文条款,这句话没了,只剩真人介入、表达意见、申诉三项。

序言里有,正文里没有。这是什么?像是谈判时口头答应了你,落到白纸黑字的条款里,没写。

所以学术界吵到今天:企业到底有没有法律义务,解释"为什么拒了我的贷款"?有人说那是好意提醒,不是义务;有人说"至少"两个字说明,还可能有更高的要求。

研究的态度很实在:解释可以粗糙一点、笼统一点,但必须有,而且要够你去申诉。不然你申诉什么?连为什么被拒都不知道。

顺便看看现实水平。研究里举了 Airbnb 的隐私政策,关于画像的说明,翻译过来就一句话:我们会分析你的特征和偏好,给你推你可能感兴趣的东西。

就这。你看了,等于没看。

五、真正的难题,不在法律,在作业

讲到这,你可能觉得挺好,原则都有,都能落地。

研究者的结论也是:GDPR 和 AI 不冲突,不需要大动干戈改法律。

但是,先别乐观。

这部法律有个特点:大量条款是模糊的、开放式的。"兼容""合理""适当""有意义",全是这种词。放在平常场景,模糊一点无所谓,大家凭常识办事。

可 AI 场景下,技术是新的,影响是大的,后果是不确定的。模糊的规则,加上巨额的罚单,等于什么?

等于一边给你一本满是"酌情处理"的交规,一边装满高清摄像头。

大公司不怕,法务团队排队研究。怕的是小公司。研究点得很透:重罚加不确定,最可能的结果是,小团队干脆不敢碰 AI 了。合规成本,会把最想创新的人挡在门外。

所以这份研究真正的主张是八个字:法律不动,作业必补。

监管机构要出手,把模糊处一条条写具体,用指南、守则、认证,给企业尤其是小企业指路。哪些 AI 应用绝对禁止,哪些有条件下放行,要靠全社会的公开辩论来定。个人单打独斗太弱,集体维权的通道也得打通——研究成稿那会儿,欧洲法院刚明确:个人打官司,只能主张自己的损失,不能替别人打包起诉。

研究里还有一句,我特别想划给你看:统计用途的数据再利用,推定兼容。

什么意思?只要数据处理的产出是汇总结果,不落到任何具体个人头上,法律就开一条绿色通道,配上假名化等安全措施即可。

这基本是给企业递的梯子:既能吃到大数据的红利,又不踩个人的红线。

六、比"准不准"更要紧的问题

最后,说点研究之外的感慨。

这份研究里有个细节,让我停了很久。

已经有团队做出了能从人脸推断性取向、推断所谓"犯罪倾向"的模型。怎么对待它?研究说,我们不该只问"它准不准",更该问"它该不该被造出来"。

这两个问题的区别,是天和地。

准不准,是技术问题,工程师就能回答。该不该,是价值问题,必须由全社会回答。

再比如健康数据的预测。用在医疗上,是提前救命;用在保险上,是给一部分人涨保费;用在招聘上,是让身体弱的人连工作都拿不到。

同一份数据,同一个模型,放在不同的位置,就是完全不同的善恶。

技术决定能做什么。决定"允许做什么"的,应该是我们。

AI 吃数据这件事,停不下来,也不必停。真正的分水岭在于:数据养出来的智能,是回头服务人,还是回头算计人。

所以,后来我跟朋友说,别把 GDPR 当墙,把它当作业。能把作业写明白的公司,在欧洲市场反而走得更远。

一部没有"AI"字样的老法律,至少证明了一件事:技术往前跑的时候,法律是跟得上的。只是每一代人都得重新回答一遍:哪些东西,永远不许被计算。

祝你,永远不需要向一台机器证明,你是你。

继续阅读