Hugging Face深伪治理危机:开放模型平台需要承担哪一层责任

摘要:AI Forensics 调查发现,Hugging Face 部分热门图像编辑 Spaces 可以在缺少有效安全措施的情况下生成非自愿私密图像。研究团队监测到的请求中,73% 带有性化意图。

Hugging Face 常被称为 AI 时代的代码仓库。

开发者可以在平台上传模型、数据集和演示程序。用户通过 Spaces 功能打开网页,就能直接体验图像生成、语音处理和文本模型,无需自行安装环境。

开放模式推动了模型传播,也让部分高风险工具获得了非常低的使用门槛。

欧洲非营利组织 AI Forensics 在 7 月发布调查报告,称 Hugging Face 上的部分图像编辑 Spaces 能够被用于生成非自愿私密图像。

研究人员测试了九个热门图像编辑应用,其中七个会响应简单的违规编辑请求。

只有少量应用设置审核机制

AI Forensics 检查了相关 Spaces 的代码和运行方式。

报告称,在更大范围的样本中,只有约 3% 的应用包含输入或输出审核代码。多数应用把安全控制交给模型开发者自行决定。

很多工具对外展示为通用图像编辑器,没有明确宣传违规用途。

用户只需上传照片并输入简短要求,模型就可能生成带有伤害性的修改结果。

这种情况使平台治理变得困难。

一个应用页面可能没有明显违规文字,模型能力却能够被用于侵犯个人权益。只审核标题、说明和标签,很难识别实际风险。

诱饵实验显示需求已经存在

研究团队还搭建了一个不会输出图像的诱饵 Space,用于观察用户会提交什么请求。

一周内,系统记录到 1081 条去重请求,其中 73% 带有性化意图。相关请求主要针对女性,部分涉及疑似未成年人。

研究人员没有生成相应图像,并在报告发布前向平台通报结果。

这些数据说明,风险已经进入实际使用环节。

模型具备某种能力,与用户是否会主动滥用,是两个不同问题。诱饵实验显示,平台上确实存在寻找此类服务的人群。

模型仓库和应用平台承担不同责任

Hugging Face 同时扮演多个角色。

它是模型文件仓库,也是数据集平台、开发者社区和在线应用运行环境。

如果用户只下载一组权重并在个人设备运行,平台对后续行为的控制能力有限。

Spaces 则直接在 Hugging Face 基础设施中提供在线服务。平台掌握页面、计算资源、访问日志和运行入口,也具备实施输入过滤、输出扫描和账户处置的条件。

因此,Spaces 更接近云应用商店或托管平台。

平台是否需要对在线运行的高风险功能进行审核,已经成为这场争议的重点。

只依靠开发者自律很难覆盖风险

开源社区中的开发者背景差异很大。

有些团队会设置严格过滤,有些项目只关注模型效果,还有一些开发者缺少内容安全经验。

要求每个开发者独立建设分类器、敏感内容识别和未成年人保护系统,成本很高,执行效果也不稳定。

平台可以提供统一安全组件。

例如,公开的输入检测接口、图像输出扫描、人物身份保护、风险标签和访问频率限制。高风险图像编辑应用上线前,还可以接受额外审核。

这些机制会增加运营成本,也可能产生误判。平台需要建立申诉和人工复核渠道。

开放生态需要分层治理

模型权重、开发代码、在线应用和用户生成内容,可以采用不同治理方式。

基础模型层重点披露训练数据、能力范围和已知风险。

应用层需要检查具体用途、用户界面和安全措施。

在线平台层负责访问控制、日志留存、投诉处理和违规下架。

用户内容层则涉及传播、举报和受害者救济。

把所有责任压给模型开发者,会留下平台运行环节的空白。要求模型仓库审查每一种本地用途,也很难执行。

分层治理能够让责任落到拥有实际控制能力的一方。

平台需要建立受害者响应机制

深伪治理不能停留在模型下架。

受害者需要能够快速提交投诉,平台需要保存必要证据、阻止内容继续生成,并处理相关账户和应用。

涉及未成年人和非自愿私密内容时,响应速度尤其重要。

Hugging Face 已有禁止相关内容的政策,但调查显示,政策条款与技术执行之间仍有差距。部分被媒体指出的页面随后被移除,平台整体审核机制仍需要进一步说明。

开放模型生态的价值来自共享、研究和低门槛创新。

这套生态要长期发展,也需要处理明确可见的伤害。平台提供了模型运行入口、计算资源和流量分发,就需要建设与这些能力相匹配的安全机制。

分享到