摘要:LLM 降低 loss、贴近既有分布,这确实会压低怪异性;但这不等于它只能复读。更准确的说法是:LLM 能生成新组合和候选假说,但不能单独证明这些东西有价值。
有人说:LLM 的训练目标是降低 loss,SFT 和 RLHF 又让模型贴近规则、偏好和 ground truth,所以它不可能产生真正的新想法。
这个说法抓住了一个真实矛盾,但结论太快。
LLM 的确不是凭空创造真理的机器。它的训练目标会把模型拉向既有语料、既有规则和既有偏好。默认产品形态下,它也经常给出稳妥、平滑、没有棱角的答案。
但降低 loss 不等于只能复读。模型学到的不是句子库,而是语言、概念、代码模式、论证结构和问题求解路径的压缩表示。推理时,它可以在这些结构之间组合、迁移和搜索。
真正的问题不是“LLM 能不能说出新东西”,而是:它说出的新东西,谁来证明有价值?
先定义创新
如果创新指“从宇宙之外拿来一个绝对原创的观念”,那人类也很少做到。
大多数创新是已有要素的新组合、新迁移、新解释。蒸汽机、智能手机、Transformer,都不是凭空出现,而是把已有材料放进新的结构。
创新至少有三层:
第一,组合。把分散概念、工具和场景放到一起。
第二,重构。不是简单拼接,而是改变问题表达,让旧材料产生新作用。
第三,验证。新组合必须在现实中成立,能解释更多现象,解决具体问题,降低成本,或产生新的审美和组织方式。
LLM 在前两层有能力。第三层是它的短板。
loss 学到的是结构,不是服从
“预测下一个 token”只是训练接口,不代表模型只会词频统计。
要在海量文本上持续降低 loss,模型必须学到更深的结构:语法、事实、风格、代码语义、数学符号关系、任务格式和隐含意图。否则它无法在复杂上下文里稳定生成答案。
所以,“loss 越低越不能创新”这个说法过于简单。
更准确的说法是:loss 越低,模型越掌握既有结构;能不能在结构上产生有价值的新组合,取决于上下文、采样策略、工具反馈和外部评估。
对齐确实会压低怪异性
反方也不是完全错。
SFT、RLHF 和偏好对齐会让模型更像一个可用助手:礼貌、稳妥、结构化、少冒犯、少走极端。这对产品可用性有价值,但会压低“标新立异”的表达。
用户想要一个反直觉、有突破性的想法,模型却经常给出中庸的行业分析。这不是因为底座没有组合能力,而是默认系统把它训练成了安全回答机器。
同一个模型,在不同提示、不同温度、不同工具链、不同评估目标下,创造性差别很大。
让它写合规公告,它会收敛。
让它提出 50 个反常识假设,再用评估器筛选,它会发散。
让它进入代码、仿真、实验或市场反馈循环,它就不只是“预测文本”,而是在环境里搜索解。
ground truth 不是创新的敌人
创新不等于随机偏离正确答案。
把 2+2 答成 5,不叫创新。编造药物副作用,不叫创新。把不存在的法律条文说得很像真的,也不叫创新。
真正的创新,是在约束内找到新的有效路径:
- 算法结果正确,同时更快;
- 材料符合物理化学约束,同时性能更好;
- 商业模式满足成本、渠道和信任条件,同时效率更高;
- 设计有审美,同时能制造、能使用、能维护。
Ground truth 不是创新的敌人。它是地基。
没有地基的标新立异,只是噪声。
LLM 的“新”更像候选假说
LLM 可以提出新解释、新类比、新产品角度、新技术路线、新系统架构。
但这些输出应该被看成候选假说,而不是最终结论。
一篇文章的新观点,要看它是否解释了旧观点解释不了的现象;一个产品想法,要看用户是否真的需要;一个工程方案,要看性能、成本和风险;一个科学假说,要看实验是否支持。
所以衡量 LLM 创新能力,不应问“它能不能说出从未出现过的话”。这太容易,随机字符串也能做到。
真正要问的是:它能不能提出更高质量的候选,并帮助人类和工具更快筛出少数有价值的方向。
这就把问题从“模型有没有原创性”变成“系统有没有验证栈”。
有效偏离才是创新
创新需要偏离主流分布,但偏离本身不等于创新。
偏离有三种:
第一种是错误偏离。它只是错了。
第二种是随机偏离。它不一定错,但没有结构,也没有可复现价值。
第三种是有效偏离。它违背常识的一部分,但保留底层约束,并在新场景中表现更好。
人类追求的是第三种。
LLM 的问题在于,它能生成三种偏离,却不能稳定区分三者。它会把错误偏离解释得像洞见,也会把随机偏离包装成理论。
所以越强调 LLM 创新,越不能离开 evaluator。
结论
LLM 的原理与标新立异之间确实有矛盾:
训练要降低 loss,创新需要差异;对齐要减少风险,突破经常来自非共识路径;模型要贴近偏好,而新东西一开始常常不符合旧偏好。
但这个矛盾不推出“LLM 数学上不可能产生新想法”。
更准确的结论是:
LLM 可以生成新组合、新类比和新假说,但不能单独完成新价值证明。
它不是自动创新机器,也不是概率复读机。它更像高通量候选生成器,负责扩大探索半径。
哪些方向真有价值,仍然要交给工具、实验、市场、专家、用户和时间。
参考资料
[1] Vaswani et al., “Attention Is All You Need”, 2017, https://arxiv.org/abs/1706.03762
[2] Brown et al., “Language Models are Few-Shot Learners”, 2020, https://arxiv.org/abs/2005.14165
[3] Ouyang et al., “Training language models to follow instructions with human feedback”, 2022, https://arxiv.org/abs/2203.02155
[4] Sutton, “The Bitter Lesson”, 2019, http://www.incompleteideas.net/IncIdeas/BitterLesson.html
[5] OpenAI, “Evaluation best practices”, https://developers.openai.com/api/docs/guides/evaluation-best-practices