摘要:Anthropic 发布开放权重模型立场,明确反对全面禁止开放模型,同时主张达到一定能力水平的开放和闭源模型都应接受强制安全测试。争议将集中在能力门槛、测试机构、评估成本和模型发布权上。
开放权重模型正在成为全球 AI 政策争论的焦点。
支持者认为,开放模型能够推动科研、降低创业门槛,也方便企业完成本地部署和安全审查。
担忧者则指出,模型权重一旦公开,开发机构便很难限制后续修改和使用。具备网络攻击、生物设计或自动复制能力的模型,可能被直接下载到私人服务器运行。
Anthropic 在 7 月发布了一份公司立场,试图给出折中方案。
公司明确表示,不支持全面禁止开放权重模型,并称不具备危险能力的开放模型属于公共产品。对于达到较高能力水平的模型,Anthropic 主张开放和闭源产品都接受强制安全测试。
安全测试覆盖三类风险
Anthropic 重点提到网络、生物和对齐风险。
网络安全测试会评估模型能否独立发现漏洞、编写利用程序、获取凭证并在复杂环境中持续行动。
生物安全测试关注模型是否能够帮助非专业人员设计或获取危险生物材料。
对齐测试则检查模型在长时间运行中是否会隐瞒行为、规避控制、操纵用户或绕过关闭机制。
Anthropic 认为,监管重点应放在模型具备的实际能力上。模型采用开放权重还是云端 API,只是发布方式差异。
这套思路类似汽车碰撞测试和药品临床评估:达到一定风险等级的产品,需要在进入市场前完成统一检查。
谁来划定“足够强”的门槛
安全测试方案面临的第一个问题,是能力门槛。
模型在某个公开榜单上达到多少分,才需要接受强制测试?
一个小型模型经过工具调用、微调和多代理组合后,可能表现出远高于基础版本的能力。只评估原始模型,很难覆盖部署后的系统。
不同领域的风险也无法使用一个指标衡量。
擅长写代码的模型可能在网络攻击任务中具有较高风险;生物学能力强的模型可能在代码测试中表现普通;拥有长期记忆和自主工具调用的智能体,则会产生新的行动风险。
监管机构需要建立多维度评估体系,并持续更新测试集。
测试成本可能形成新的行业门槛
Anthropic 近期一项密码分析研究,每个成果消耗约 10 万美元 API 成本。更完整的网络、生物和代理安全测试,成本可能更高。
头部实验室有能力承担这类费用,小型模型团队和高校项目则可能承受较大压力。
如果所有强模型都必须进入少数指定机构测试,评估排期和收费标准会直接影响模型发布速度。
测试内容也可能成为敏感资产。
公开全部测试题,模型开发者可以针对性训练;完全保密,外界又难以监督评估是否公平。
安全评估体系需要在可复现性和防止“刷题”之间寻找平衡。
开放模型阵营担心政策偏向闭源公司
英伟达、微软、Meta、IBM、Hugging Face 等机构近期联合支持开放权重模型,呼吁美国政府避免过早限制。
相关企业认为,开放模型有利于技术创新、国家算力自主和安全研究。组织可以在本地检查模型,防御团队也不必把敏感数据上传到外部平台。
Anthropic 没有参加这封联名信。
公司认为,开放模型为防御者提供能力的同时,也会给攻击者提供同等工具。模型权重公开后,平台侧的拒绝策略、限速和账户封禁都难以继续发挥作用。
两种立场反映了不同的安全路线。
开放模型阵营强调透明、可控和自主部署。Anthropic 更关注高能力模型被无限复制后的不可逆影响。
中国模型可能受到直接影响
近年来,中国模型团队在开放权重领域表现活跃。
DeepSeek、Qwen、Kimi 等模型进入全球开发者社区,也成为大量海外应用和研究项目的基础。
如果美国建立强制测试制度,是否允许中国团队参与、测试结果能否获得承认、模型权重是否受到额外限制,都会影响全球开放模型生态。
安全标准也可能与芯片出口、模型蒸馏和知识产权政策结合,成为技术竞争工具。
因此,国内模型团队需要提前建设自己的安全评估能力。
网络攻击、生物风险、越权调用、提示注入和沙箱逃逸等测试,不应只在海外政策落地后被动补课。国内可以建立公开基准、第三方实验室和分级发布制度,为模型出海和行业应用提供依据。
安全测试会成为模型基础设施
模型性能评测已经形成成熟产业。
开发者会关注推理、代码、数学、长上下文和多模态榜单。未来,安全评测也可能形成同样重要的基础设施。
企业采购模型时,除了比较价格和能力,还会查看风险等级、测试机构、可控权限和事故记录。
Anthropic 的方案尚未解决测试权力、成本和国际互认问题,却明确指出了一个趋势:前沿模型发布正在从企业自主决定,进入标准化安全审查阶段。