
本文将梳理OpenAI、蚂蚁、谷歌、英伟达等国内外企业最新进展,覆盖智能体、具身智能、世界模型、芯片设计等方向,一文速览产业前沿。
OpenAI 发布 Agents API,为开发者提供快速构建智能体的框架,用户仍可自主掌控环境与体验。该接口将任务编排、工具调用和运行管理封装成可组合的原语,大幅降低多步骤 Agent 的开发难度。
对 AI Coding 从业者来说,这延续了 OpenAI 将 Agent 能力标准化的思路,团队可基于统一接口接入自有数据与系统,无需从零搭建调度层。
蚂蚁集团在外滩大会推出“灵影”平台,由GPASS技术框架升级而来,专为AI眼镜等终端打造Agent原生系统与开放生态。
该平台聚焦自然交互、智能体运行、多端协同及安全可信等核心能力,并向芯片商、硬件厂和开发者全面开放。此举为AI眼镜提供了统一的Agent运行底座,助力开发者跨设备构建智能应用。
在外滩大会上,科大讯飞与蚂蚁集团宣布讯飞AI眼镜接入灵影AOS生态。依托原有语音交互、翻译等能力,叠加阿里本地生活服务,用户可通过眼镜完成停车缴费、点咖啡、扫码支付等高频动作,实现开口即办。
眼镜从商务工具升级为城市生活入口,以硬件做深底座、生态拓宽边界模式,打通感知—服务闭环,推动人机交互从人找服务向服务找人转变。
蚂蚁集团在外滩大会推出“灵影”平台,由GPASS技术框架升级而来,专为AI眼镜等终端打造Agent原生系统与开放生态。
该平台聚焦自然交互、智能体运行、多端协同及安全可信等核心能力,并向芯片商、硬件厂和开发者全面开放。此举为AI眼镜提供了统一的Agent运行底座,助力开发者跨设备构建智能应用。
高德推出ABot-Earth 0.7,号称全球首个3D原生城市世界模型。它支持从星球到街景的全尺度AI生成,覆盖196个国家和地区,定位为AI认知真实世界的入口。
该模型将地图由静态栅格升级为可生成、可推演的三维空间,方便智能体在虚拟城市中进行路径、场景与决策的预演。对自动驾驶、机器人和数字孪生来说,这类世界模型有望成为感知与规划共用的底层基座。
大模型正渗透半导体设计领域。月之暗面发布Kimi K3时,其自主Agent在无人工干预下,仅凭开源EDA工具与Nangate 45nm工艺库,连续运行48小时完成推理芯片原型的设计、优化与验证,该消息曾引发新思科技、Cadence股价下跌。
随后OpenAI也披露利用自研模型加速自研推理芯片的设计与优化,印证AI正向下游芯片底层环节延伸。
Claude Opus 由丁磊磊、张彦勇团队推出,旨在评估大模型自主完成基础设施工程任务的能力,覆盖9大类85项任务。最新测试中,Claude Opus 5以36.53%的成绩位列第一,领先Kimi K3与GPT 5.6 Sol;但在硬件边缘类任务上,最佳模型得分仅5.4%。
这表明大模型在代码与基础设施自动化方面虽有进展,但在真实仓库级端到端优化上仍处早期,距离自己写底层系统还有差距。
Hugging Face发布旗舰机器人项目SO-101机械臂的组装指南。该指南提供了从零件到校准的完整物理装配说明:跟随臂采用6个STS3215电机,引导臂组合了三种不同减速比,相关零件与3D打印文件均已上传至GitHub仓库。
SO-101延续了LeRobot系列的开放理念,将机械臂从成品转变为可自制的教学平台,便于个人和实验室以低成本进入机器人操作研究领域。
ADI计划收购Alif Semiconductor,以补强边缘AI算力。Alif主打AI原生计算平台,擅长在微控制器级芯片上运行神经网络推理;ADI则拥有广泛的模拟与混合信号产品线及规模优势。
双方整合旨在将智能推向边缘,让传感、采集与推理在同一低功耗器件上完成,缩短工业与物联网设备的端侧智能链路。
远景天机气象大模型首次参评便斩获国内外双料冠军,支持未来45天、分钟级全球天气预报。该模型已应用于电网负荷预测、台风应对等场景,助力新能源提升收益。
相比传统数值模式,AI气象模型将预报窗口从数天延伸至月级,且推理成本更低,正成为新能源并网与防灾减灾的实用工具。
1996年,王继军创办衡泰信,从高尔夫打击垫起步,2008年国内市占率达70%。2011年转型室内模拟器,自研高速相机与机器视觉方案,2026年上线AI高尔夫助手,国内市占率超50%,用户超50万。
AI不替代教练,而是量化挥杆数据,以阶梯式进步对比用户历史最佳,实现个性化训练。室内高尔夫正从训练、娱乐向城市商业综合体演进,衡泰信以硬件+AI+数据闭环,降低门槛,推动高尔夫从精英运动走向大众。
雄安新区创业者毛亮成立一人公司,开发AI跑步应用跑栈。该软件接入华为、佳明等多品牌设备数据,打破数据孤岛,并以AI教练为核心,依据用户历史数据动态生成个性化训练方案。
作为入驻雄安中关村科技园的36家人工智能OPC之一,毛亮借助AI搭档完成全链条开发。园区通过场景对接会与机会清单助力OPC成长,让创业者立足真实需求创新。
谷歌为 Gemini 系列加入 agentic video understanding 能力,模型不再按固定帧率死板采样,而是像智能体一样动态浏览视频时间轴。在长视频场景下,token 消耗最多降 88%、成本降 66%,准确率还有提升。
对企业来说,会议录像、监控片段、课程视频的自动摘要与检索变得更划算。这也说明大模型竞争正从“会聊天”转向“会看、会挑、会执行”。
英伟达把 Cosmos 3 世界模型平台推向开源,支持文本、图像、视频、音频和动作序列的统一建模。它既能生成带同步音效的视频,也能根据图片加动作指令预测机器人下一步运动,提供 16B Nano 与 64B Super 两个规格。
对自动驾驶、机器人仿真团队而言,真实数据采集贵、合成数据糙的痛点被缓解,物理 AI 的训练闭环进一步打通。
阿里把 QoderWork、MuleRun、悟空整合为“千问办公”并公测,又推出 QoderWake 1.0 数字员工,一句话就能生成带职责和权限的岗位角色,已接入钉钉、飞书、企业微信。字节“豆包工作”、腾讯 WorkBuddy、百度“库库 AI”也在加码。
大厂争夺的不只是聊天框,而是企业流程入口:谁先让 Agent 跑通审批、写代码、做运营,谁就拿下下一代办公操作系统
9月10日,DeepSeek正式发布V4.1 Flash模型,采用552B参数MoE架构与全新的Causal-Encoder-Decoder非对称结构,具备原生多模态视觉理解能力。API定价同步大幅下调,空闲时段缓存命中输入价格降至0.02元/百万Token,降幅最高达60%。性能方面,V4.1 Flash在费用、速度、任务总用时等指标上已全面超越V4 Pro。
结合此前美国三大部门联合点名中国AI企业的背景,DeepSeek以技术迭代与降价双线出击,持续在全球市场保持竞争力。
从巨头标准化输出到创业公司敏pg电子官方网站捷创新,AI正沿算力—框架—终端—场景全链路加速落地。竞争焦点已从模型参数转向产品化与场景渗透。谁先让技术变成入口、把入口变成习惯,谁就握住下一代人机交互的钥匙。
