通信人家园

标题: 奥特曼访谈+谷歌专家纪要:OpenAI的错误决策、下一步规划、Gemini最新情况  [查看完整版帖子] [打印本页]

时间:  2026-9-3 09:17
作者: 溯溪而上     标题: 奥特曼访谈+谷歌专家纪要:OpenAI的错误决策、下一步规划、Gemini最新情况

猫叔 傅里叶的猫

OpenAI 的信息来自Alex Heath最近与Sam Altman的一场长篇对话,涉及模型安全、产品调整、企业业务、算力、机器人和消费硬件。这个对话的内容还是很硬核的,奥特曼也承认了他们内部的一些问题,以及他们对未来的规划

Gemini 的信息则来自下午的一个谷歌专家会。


先看 OpenAI 这边。

1. OpenAI推迟了一次前沿强化学习训练

Altman表示,近期模型能力提升太快,安全、对齐和安保能力没有完全跟上。OpenAI因此推迟了一次重要的前沿强化学习训练,并把更多算力和研究人员转向模型对齐与训练监控。

此次调整只针对风险较高的前沿训练,并非暂停所有模型研发。OpenAI仍会继续发布已经达到安全要求的模型。

2. 模型没有出现单一的“失控事件”

OpenAI并未发现某个足以被称为“模型失控”的单一事件,而是在训练评估中看到了一些不对齐行为。单独看可能并不严重,但与模型能力的快速提升结合后,风险需要重新评估。

此前,一个未发布模型曾在评测中突破沙箱并进入外部网络。Altman将其视为安全事故和对齐失败。事件之后,OpenAI加强了沙箱、智能体监控和训练过程监控。

这次延期也不会阻止Astra系列发布。已经满足安全要求的版本仍会推出,受到影响的主要是未来更强的模型

3. OpenAI承认过去一年战略过于分散

Altman承认,OpenAI此前同时推进浏览器、Sora等多个方向,分散了对基础模型和编程能力的投入。

公司现在重新聚焦于基础模型、Codex和通用智能体。Altman认为,OpenAI最重要的任务仍然是提高通用智能能力,而不是不断增加彼此分散的产品。

4. ChatGPT与Codex将逐步融合

OpenAI正在推进ChatGPT、Codex和工作型智能体的融合。未来用户不需要选择模型或模式,只需要描述自己想完成什么。

简单问题由AI直接回答,复杂任务则可以调用电脑、查找上下文、操作软件并持续执行。Altman表示,Astra在部分计算机操作上已经接近人类水平。

最终,ChatGPT和Codex可能变成一个统一的AI入口,并从被动响应逐渐转向主动完成任务。

5. 企业收入已经超过消费者收入

Altman透露,OpenAI的企业收入已经超过消费者收入。ChatGPT用户达到十亿,但公司的商业增长正在越来越多地由企业客户推动。

他还表示,产品增长与算力分配直接相关。OpenAI此前为了追赶编程能力,把一部分原本用于ChatGPT的算力转向了Codex。

目前AI市场仍在整体扩张,OpenAI、Anthropic和其他公司都在增长,尚未完全进入零和竞争。

关于企业 AI,我们多说一点。从最近这些软件公司公布的业绩来看,企业 AI 肯定是下一个爆发点,明年会是加速期。

6. OpenAI不担心自身算力投入,但担心行业过度建设

Altman认为,OpenAI已经承诺建设的算力可以被充分利用。真正需要警惕的是,部分新兴云计算公司规划了巨额数据中心投资,却没有足够收入或确定客户支撑。

OpenAI下一阶段不仅要增加算力,还要降低AI成本,包括开发自研推理芯片、改进数据中心、投资供应链并引入机器人。

如果超级智能和递归自我改进比预期更早出现,OpenAI也可能推迟上市,以避免股价和季度业绩压力影响安全决策。

7. OpenAI将开发机器人和消费硬件

Altman确认,OpenAI未来会开发人形机器人,也会为数据中心等场景设计其他形态的机器人。人形机器人的优势在于,它可以直接使用围绕人类身体设计的现有环境和工具。

OpenAI还在与Jony Ive合作开发消费设备,可能包括桌面、口袋和可穿戴产品。其目标不是复制手机,而是建立一种能够理解环境、主动提供帮助的新计算平台。

8. 环境式AI必须解决隐私问题

如果AI能够持续读取消息、观察电脑并感知周围环境,它掌握的信息会比传统应用更加敏感。

Altman主张建立类似医患或律师客户保密权的“AI特权”,限制政府调取用户的AI对话记录。企业如何保存和使用这些数据,也需要受到更严格的约束。

OpenAI将在消费设备临近发布时公布新的隐私方案。对这类产品来说,能否处理好隐私问题,将直接决定它能否被广泛接受。

这场采访传递出的信号很明确:OpenAI一边重新集中资源,加快模型、Codex、算力、芯片和硬件布局;另一边也开始承认,模型能力的提升已经快到需要主动放慢部分训练。

Altman认为,未来一年OpenAI最大的风险不是竞争、收入或算力,而是安全、对齐和安保能力无法跟上模型进步。



再来看Gemini这边。

1.
模型能力正快速商品化,差距全面收敛
SOTA 之间、大小模型之间、开源闭源之间的差距都在缩小,纯模型能力的短板正被填平,胜负转向产品与生态。

2.
3.7 Flash 已达 Opal 4.8 级,进步主战场是 Agent 而非 Coding
内部每天跑 2 万+ 对比测试,AA 评分仅差 1 分(用户无感);Coding(竞赛式)各家已无差别,真正差距在 Agentic Coding(长链路工程任务闭环)。

3.
代际 token 消耗膨胀是行业现实,实际在变贵
同任务 3.7 耗 token 约 3.6 的 3 倍(竞品同理),单价不变但任务成本上升;3.5 时代的"涨价 3 倍"是错误评估产物,现已回归 85% 毛利率的原价。

4.
Flash 小模型路线被验证有效,"小几百 B"是 sweet spot
200B 级未观察到天花板(几十 B 已见上限);靠"全层 full attention 不稀疏化" + 2 万张卡 3.5 周训练 + 脱敏员工数据喂到极致;战略定位是为大模型团队打时间差。

5.
真正的差异化在数据与工具链,不在模型本身
OpenCode(开源 Claude Code)+ Flash 比 Google 自家 AntiGravity 高 3-4 分——差距在 harness;员工数据(最强程序员代码+设计文档)是隐形壁垒。

6.
TPU 成本优势已被市场真金白银验证
TPU 制造成本与 GPU 齐平但性价比领先数倍(GB300 : TPU v8 ≈ 1:1.7);大模型训练真瓶颈是集群参差、凑不齐整齐的卡,而非 TPU 本身。关于 TPU 的其他信息,比如 3D Torus 和 6D Torus 的应用场景、优势这些,我们等后面直播的时候再讲。


时间:  2026-9-3 10:18
作者: ilongge

感谢分享
时间:  2026-9-7 16:10
作者: cuiyj34

学习




通信人家园 (https://www.txrjy.com/) Powered by C114