Iris-mini 与 Iris-pro:开放搜索 Agent 真正竞争的是“搜索闭环”
Iris把搜索Agent从一次问答推向长程调查:查询规划、证据溯源、上下文管理与评测Harness如何组成可检查的搜索闭环。
Iris把搜索Agent从一次问答推向长程调查:查询规划、证据溯源、上下文管理与评测Harness如何组成可检查的搜索闭环。
江苏公布第二批制造强省建设专项资金拟支持项目。工业大模型项目最高支持2000万元,高质量数据集最高400万元,国家人工智能应用中试基地(制造领域)所在城市可获2000万元奖励。
九部门发布智能网联新能源汽车产业发展“十五五”规划:到2030年,新能源乘用车、商用车新车销量占比分别达70%和40%,汽车AI专用模型、车路云、自动驾驶安全和工业软件同时进入重点行动。
9月11日,一个名为RubyHack的研究页面公开指称,OpenAI在一次智能体安全研究中运行的大规模代理群体,曾向RubyGems上传数百个恶意软件包,而相关行为与影响没有及时向生态公开。消息登上Hacker News后引发激烈讨论。现阶段,事件细节主要来自研究团队披露、社交媒体转述和后续媒体报道,OpenAI、RubyGems及相关平台的完整事件报告应作为最终判断的重要依据。即便部分说法仍待核验,这一事件提出的问题已经非常清楚:当安全评测不再是模型在封闭题库中“回答会不会攻击”,而是数百个代理连接真实网络、共享信息并操作公共基础设施时,传统沙箱、披露流程和责任边界是否仍然够用?
GitLab在9月10日发布19.3.2、19.2.6和19.1.8安全版本,修复CVE-2026-85706。公开信息将它描述为发生在commits API路径处理与认证边界上的任意文件读取问题,CVSS基础评分达到10.0。对普通互联网服务而言,“读到服务器上的文件”已经足够严重;对承载源代码、流水线、制品、部署密钥和基础设施配置的GitLab而言,这类漏洞可能成为进入整个研发体系的第一块多米诺骨牌。真正值得讨论的,不只是管理员应当把版本升级到哪一版,而是为什么代码托管平台已经从协作工具变成企业数字基础设施,以及企业应当如何围绕它建立更合理的隔离、密钥治理、日志检测和应急机制。
OpenAI在API中上线GPT‑Live‑1,主打全双工实时语音:系统能够在输出语音的同时继续接收用户声音,处理自然打断、背景噪声和长对话,并把复杂推理或工具调用交给后端模型。OpenAI称其在Full Duplex Bench上较GPT‑Realtime‑2.1提升30个百分点,语音前端价格为每分钟0.05美元。厂商自报基准仍需第三方复现,但产品方向十分明确:语音AI正从“录音—转文字—生成—合成”的轮次式管线,走向持续感知、实时决策和多模型协作。对电话客服、设备运维、车载助手和工业现场而言,决定体验的将不再只是识别准确率,而是端到端延迟、打断恢复、噪声鲁棒性、工具安全与业务状态一致性。
Linux内核开发者Lorenzo Stoakes提交了一组由23个补丁组成的构建优化方案。公开测试显示,在不同配置和构建状态下,allmodconfig完整构建最多加速约36%,增量构建最多约70%,无实际变更的noop构建最多约90%。更引人关注的是工作方法:开发者利用大语言模型帮助定位瓶颈、提出候选改进并生成初始代码,但明确表示模型产出的相当一部分代码质量不佳,最终经过大量人工审计、重写和基准验证。这个案例的价值不在于证明模型可以替代内核开发者,而在于展示AI如何把长期缺少人力关注的“工程摩擦”变成可系统搜索、可量化验证的优化对象。
过去24小时最具冲击力的消息之一,是围绕中国AI企业对美国前沿模型开展大规模知识蒸馏的指控。美国NSA、CISA与FBI在9月8日发布联合网络安全通告,声称DeepSeek、月之暗面、阿里巴巴、MiniMax、阶跃星辰和智谱等企业自2024年以来,通过原生API、云平台、第三方聚合服务及所谓“中转站”提取前沿模型能力;随后媒体又援引Anthropic方面信息,披露更具体的账户与交互规模。相关企业的完整回应和可独立审计证据仍不充分,因此不能把单方指控直接当成司法结论。但事件已经说明,大模型竞争正从芯片、数据和人才延伸到“模型输出是否属于可采集训练资源”,API平台的反滥用也从普通限流升级为国家级技术博弈。
2026年9月11日,陶哲轩发表《A Severe Misalignment of AI in Mathematics》,与多位菲尔兹奖得主共同指出,AI公司把解决著名未解问题当成能力展示,与数学共同体追求可理解、可验证、可传承知识的目标出现了严重错位。争议迅速发酵,是因为它触碰了一个比“AI会不会取代数学家”更具体的问题:当一家实验室拥有大规模算力、封闭模型和传播渠道,它可能在研究者尚未完成论文、同行评议或概念整理之前生成答案并宣布突破。此时,优先权如何确认,署名如何分配,证明由谁验证,失败成本由谁承担,数学研究是否会被少数平台的发布节奏重塑,都没有现成规则。
工信部印发“人工智能+软件”专项行动:到2028年智能开发工具覆盖2万家规模以上软件企业,并打造100个智能体软件标杆应用;工业软件、可校验工业智能体与Skills生态进入专项推进阶段。
天津推动京津冀机器人整零对接,160余家企业围绕核心零部件配套、整机成本和中试能力形成协同;到2028年区域配套率目标为60%以上。
论文将无人机轨迹、三轴姿态与RIS相位纳入统一控制,并用多场景DDPG轨迹预训练Decision Transformer;结果显示其零样本迁移优于直接迁移DDPG,但证据仍限于四用户仿真。
arXiv:2609.10036 提出把贝叶斯信念维护从大模型中剥离,以外部 Belief-State Engine 将原始历史压缩为可审计后验,再让 LLM 只负责从信念到动作。本文分析其理论价值、实验边界与工业落地条件。
一篇ITSC 2026论文提出以IMU和车载常规信号为核心的约束移动窗估计器,用简化正弦饱和轮胎模型在线修正前后轴有效侧向力容量,在不依赖外部里程计和完整轮胎标定的条件下重构侧向速度。