配图为主题示意,不代表现场实拍或产品界面截图。
10月7日,Reuters报道,Biohub与美国政府及Meta、Google DeepMind、Isomorphic Labs等机构推进一项AI生物学数据计划,总体资金规模约18亿美元。商业参与者新增投入约3亿美元,美国能源部计划投入逾5亿美元;总额还包括Biohub承诺的资金和部分既有公共科研支持。因此,把标题里的18亿美元理解为“这次新融到的钱”,账就已经算错了。计划要做的是通过高通量实验产生标准化生物数据,用来训练预测细胞状态及其响应的AI模型。首批数据预计约一年内形成,远期细胞预测目标仍属研发规划。
这条新闻值得注意的不是又有人宣布一个更大的模型,而是多方愿意为模型前面的实验环节出钱。我的判断是,AI生物学最缺的未必是会读更多论文的系统,而是能把一次实验的条件、过程与结果可靠地交给下一位研究者的数据生产方式。花钱买算力比较容易看见,花钱把实验做成可重复的资料,进展慢得多,却可能决定模型在新实验面前有没有用。
细胞不会因为数据表整齐就按表行动
一个模型要预测细胞受到干预后的变化,首先得知道“变化”是相对于什么条件说的。同一类细胞,培养方式不同、测量时点不同,读出的状态可能就不能直接并排比较。不同实验室使用的操作、仪器和记录方式也可能不一致。把这些数据简单堆成更大的训练集,样本数看着可观,模型学到的却可能是实验来源的差异,而不是所研究的生物过程。这是理解此类计划的技术背景,不是报道已证实该项目具体遇到了哪些问题。
批次效应尤其容易被误读。设想两个实验批次中恰好使用不同的处理方式,模型可以很快学会区分批次,却未必真正识别处理产生的变化。若再拿同一来源的数据随机分成训练集和测试集,评测分数可能很漂亮;换一家实验室,表现就未必保持。这只是说明评测设计需要警惕的例子,不是对Biohub模型结果的判断。要检验预测能力,至少应记录足够完整的实验条件,并在未参与训练的新条件或新来源上试一试。
标准化也不等于把各种实验强行压进一张没有差别的表。记录样本如何获得、采用什么干预、何时测量、用了什么质量控制,这些上下文与数值本身一样重要。能够比较的数据,要说明它们为何可比;不能比较的数据,留出差异的说明。否则标准可能只让文件格式统一,却没让科学问题更容易回答。对研究团队来说,公开一个漂亮的数据下载页面之前,把元数据和质量控制做扎实,往往更费人力。
Biohub计划使用高通量实验,意义就在于可以有组织地生成大量相对一致的观察结果。高通量并非质量的代名词:实验步骤若存在系统偏差,放大规模也会放大偏差。比较稳妥的路径是从问题和测量标准出发,决定哪些条件需要覆盖,再不断检查重复实验是否给出接近的结果。报道给出的时间表是首批数据约一年内形成,不能据此推断一年后就能可靠预测任意细胞状态,更不能把更远期目标说成已经交付的产品。
谁付钱,决定先做哪类公共能力
资金构成提供了另一个观察角度。约18亿美元的总体规模里,商业参与者新增约3亿美元,能源部计划投入逾5亿美元,其余还包含Biohub承诺和部分既有公共科研支持。新增、计划投入、已存在的支持,不属于同一种口径。报道讲的是一个联合推进的数据建设计划,不是一家初创公司拿到一笔18亿美元融资。讨论成败时也不能只问钱有没有到位,还要看资金究竟变成了哪些实验能力、数据规范与可用成果。
政府、科研机构和企业一起做这件事,各自的期待不会完全相同。政府投入公共科研资源,需要关心设施与成果能否被更广泛的研究者使用;企业参与,可能关心数据能否改善自身研究工具;执行实验的平台则要让数据按一致的方法持续产出。这里说的是合作中应审视的利益问题,不是对参与方协议条款的描述。开放到什么程度、由谁制定访问条件、谁可以复核负面结果,都应成为后续观察点,而不能凭“联合”二字假定已经谈妥。
尤其要珍惜那些没有得出预期效果的实验。如果数据体系只留下“有显著变化”的结果,模型会对哪些干预无效缺少认识。对新实验的规划而言,知道哪条路走不通并不比找到一次明显响应廉价。是否记录未达到预期的结果、如何标识失败原因,属于设计数据资产时该问的问题;本次日报并未披露该项目对此的具体制度。读新闻时把“应该怎样做”和“他们已经怎样做”分开,才能避免把自己的理想方案当成既成事实。
还有数据的边界。生物数据可能涉及样本来源、共享许可与使用限制,研究价值高不意味着所有资料都能毫无限制地流转。一个可持续的数据平台要同时说明什么可公开,什么只能受控访问,什么需要额外审查。模型训练也得继承这些约束,不能因为结果只呈现为参数,就忽略输入资料的使用条件。这些原则适用于科研数据治理,并非该计划已公布的具体访问政策。
配图为主题示意,不代表项目现场实拍或产品截图。
国内平台能借鉴什么
国内科研平台如果看到18亿美元就想列一个同等体量的模型项目,很可能抓错重点。日报第三节给出的启示更朴素:共同建设公共实验设施、数据标准和开放评测。先找一个问题边界相对清楚的研究方向,让参与实验室对干预、测量、元数据和质量控制有可执行的约定,再决定用什么模型。模型可以迭代,混乱的实验记录要事后补齐却很难。
具体落到合作,首先需要把“同一条记录”说清。它应能追到实验条件、样本处理、测量环节和必要的版本信息;若另一家实验室无法判断自己是否在重复同一过程,所谓可重复只是标签。然后再约定什么样的数据能够进入共享集合,哪些异常应保留并解释,哪些必须退回核查。光发布格式模板不够,还要给研究人员留下按模板记录的时间与工具,否则标准只会在项目总结时出现。
开放评测同样应从真实问题倒推。不要让模型只在自家数据上答题,再用一个分数宣布“理解细胞”。可以把不同来源、不同时间或不同实验条件的数据留作检验,明确模型预测的对象和误差该如何解释。遇到失败,记录是哪些条件失效,而不是悄悄换一个平均分更高的集合。上述做法是本文提出的工作建议,不是对Biohub计划评测设计的陈述。
如果企业希望参与,投入也不必只押在模型训练上。实验自动化、数据记录工具、标注与质量控制的流程,都可能是合作的一部分。采购时应问:换一家实验室是否还能使用这套规范?原始数据与处理步骤能否回溯?测量结果不符合预期时,系统是留下证据还是只生成一份好看的汇总?这些问题乍看不如参数规模吸引眼球,却更接近研究者每天要解决的麻烦。
也要给目标设一道刹车。项目的长期愿望是预测细胞状态及响应,但生物系统对条件敏感,新实验不是对旧数据的机械复述。模型若能在指定条件下提供有用的预测,已经值得认真评价;把它写成普遍可靠的“虚拟细胞”则跨过了证据。第一批数据形成时,最该看的不是宣传片里细胞动得多漂亮,而是数据是否有清楚的来历、可复现的基线,以及独立使用者能否指出它何时不适用。
数据真的能复用,要过几道关
数据产出以后,第一位使用者通常最熟悉仪器和实验背景,第二位就未必。若记录只写“处理组A”,没有说明处理方式、剂量与测量窗口,别人只能猜。数据管理员要能告诉外部团队一个字段的确切含义,哪些值经过清洗,哪些仍是原始读数;研究者要能根据记录发现自己误用了不适合比较的样本。一个可下载文件并不自动等于可复用数据集,旁边的说明与校验同样是成果的一部分。
质量控制也需要留下痕迹。重复实验之间差异大,是生物过程本身变动,还是操作、仪器或记录出了问题?不能仅用“剔除离群值”四个字处理。哪些样本被排除,为什么排除,是否会改变对干预效果的判断,最好能让后来使用数据的人查到依据。若实验平台要服务多个研究方向,一套适用于所有问题的简单质量分数往往不够;至少要让不同研究者能够按自己的问题重新筛选。这些是通用的科研数据建议,日报没有给出Biohub的具体处理规则。
模型评测还有一个经常被忽略的选择:究竟预测数值,还是帮助挑选下一次实验?两者的合格标准不一样。数值预测可比较误差与校准,实验选择则要看按照建议开展实验后,是否更快得到可解释的结果。模型可能在平均意义上准确,却总在罕见但重要的条件下犯错;也可能预测不够精细,却能排除大量明显不合适的候选。没有事先明确使用任务,一个总分很难告诉实验人员该不该相信它。
可重复性不是要求每个实验室得到完全相同的数字。更合理的提问是:按照可取得的记录重做一遍,差异能不能被解释;不同条件下的差异是研究对象的变化,还是技术上的噪声。把这些差别标出来,模型才有机会学习什么是可迁移的规律。过早把异质数据混合成单一标签,看似方便训练,却会剥夺后来纠错的线索。共享平台若能保留原始记录与处理版本,后续方法改进时也不必从零重做实验。
这些工作琐碎,往往没有模型发布会那样响亮。它们还有人员和组织成本:实验员需要统一记录习惯,数据工程师要懂测量背景,领域研究者得参与定义评测题。让每个角色都只管自己的那一段,最后很容易得到大量彼此接不上的文件。联合项目真正值得借鉴的地方,可能就是把实验生产、数据整理和模型使用放在同一个可追问的流程里;这是一种借题发挥的组织判断,并不是报道对项目内部运作的披露。
研究平台还需要决定如何交付“尚无答案”。很多真实问题超出了已有实验条件,如果模型仍给一个精确预测,使用者难以判断该不该投入下一轮实验。比起只展示一个结果,界面可以同时列出它与现有数据相距多远,哪些条件没有测过,是否应先做小规模验证。这不是降低研究野心,而是让预测在实验前承担应有的检验。资金投入越大,越要能解释模型在哪些边界内可靠,哪些问题依旧需要人动手测量。
18亿美元是一个容易传播的数字,也容易把讨论带歪。把商业新增投入、政府计划投入和已有支持分清,再去看高通量实验怎样产生可靠的数据,才能看见这项计划真正昂贵的部分。AI for Science需要模型,也需要有人耐心记录实验里那些不整齐、不惊艳、却决定模型能否被信任的细节。
资料来源
- 《AI技术每日分析》,2026年10月8日,“三、Biohub联合政府与科技企业建设生物学数据:实验数据是AI for Science的底座”(本文的参与方、资金构成、实验目标和时间表均据此;数据治理和平台建议为本文分析)。
- Reuters,《US government, Google join Zuckerberg-backed Biohub in $1.8 billion push for AI biology data》,2026年10月7日,日报参考资料[4]:https://www.reuters.com/business/healthcare-pharmaceuticals/us-government-google-join-zuckerberg-backed-biohub-18-billion-push-ai-biology-2026-10-07/