2026 年 8 月 19 日 星期三
  • 登录
  • 注册
周天财经
  • 首页
  • 24 小时
  • 世界
  • 商业
  • 基金
  • 期货
  • 股票
  • 行业新闻
  • 黄金
没有结果
查看所有结果
  • 首页
  • 24 小时
  • 世界
  • 商业
  • 基金
  • 期货
  • 股票
  • 行业新闻
  • 黄金
没有结果
查看所有结果
周天财经
没有结果
查看所有结果
首页 行业新闻

姚顺雨重整腾讯多模态路线:靠拢梁文锋,远离李飞飞

2026 年 8 月 19 日
在 行业新闻
阅读时间: 2 mins read
阅读:829
A A

Related articles

新能源渗透率首破60%——「上半场」赢了,「下半场」更难

新能源渗透率首破 60%——「上半场」 赢了,「下半场」 更难

2026 年 8 月 19 日
雪山派第一到天下第一,影石的路有多远?

雪山派第一到天下第一,影石的路有多远?

2026 年 8 月 19 日


文 | 字母 AI

腾讯混元多模态团队又发生了一起人事变动。据媒体报道,曾负责 xAI 多模态理解负责人蔺旭东,已经离开 xAI,加入腾讯混元,担任多模态内容生成算法负责人。

这则人事消息之所以值得关注,是因为它发生在混元多模态团队持续调整的背景下。

过去一段时间,混元内部陆续传出负责人离职、研究人员转岗和新成员加入的消息。

原多模态理解负责人胡瀚离职创业,田永龙等人加入腾讯,原有多模态团队的汇报关系也随着大语言模型部门和多模态模型部门的整合而发生变化。

但这是否意味着腾讯多模态团队正在 「改朝换代」,目前还不能直接下结论。

公开信息能够确认的是,混元确实出现了人员流动和组织重组。蔺旭东的加入传闻,更像是这场调整中的一个新信号:腾讯正在重新组合多模态理解和内容生成这两条路线。

那么问题来了,蔺旭东究竟是什么来头,他能为腾讯补上什么能力?以及腾讯的多模态路线是否正在从 「生成内容」 转向了姚顺雨更偏向的 「理解上下文并在世界中行动」?

蔺旭东是什么来头,他加入腾讯后能做什么?

公开资料显示,蔺旭东 2018 年毕业于清华大学,随后赴哥伦比亚大学攻读博士。

在读博期间,他的研究方向包括嵌入学习、视频分析和生成模型,也曾参与哥伦比亚大学与 Facebook AI 合作的 Vx2Text 项目。

V 指的是视频,x 指的是未知数,可以是声音、语音甚至是环境音,2 代表 to,Text 则代表字幕。它的逻辑是,先把视频、声音等不同模态转换成类似 「语言 token」 的向量,再统一送入语言模型进行融合,最后由自回归解码器生成开放式文本。

Transformer 只能理解 token,所以 AI 本质上是不理解视频和音频这两种文件形式的,也就更不可能将其转换成文字。

举个例子,一只狗在游泳池旁边跳进水里,那么 Vx2Text 的视频识别器看 (V) 就会输出关键词:狗、跳跃、游泳池;声音识别器 (x) 就会输出:水声、扑通。

虽然 Vx2Text 的产品功能是 「生成」,但产品的核心难点在于 「理解」。

当然,Vx2Text 并不是简单地把画面 「翻译」 成几句话而已。模型需要从视频里识别人物、物体、动作和事件,还要理解这些东西在时间上的变化,最后再把视觉信息组织成语言。

博士毕业后,蔺旭东进入 DeepMind,参与 Gemini 相关的多模态预训练和后训练工作。2025 年,他又加入 xAI,公开资料称其负责多模态理解方向,并参与多模态内容理解与生成模型的训练。

如今他加入腾讯混元,将负责混元多模态内容生成算法。

蔺旭东的加入与其说是提升混元多模态生成的性能,倒不如说是为了解决一个困扰所有多模态的问题——理解。

以前的生成模型更像一个画面制造器。给它一句提示词,它可以生成一张图片、一段视频。但只要用户提出更复杂的要求,模型就有点跟不上了。比如人物在长视频里变了,物体的形状前后不一致,摄像机运动不符合空间关系等等。

这不是因为模型不会生成,而是因为它没有稳定地记住和理解世界。

所以,把蔺旭东放到多模态内容生成的位置上,可能正是因为他把多模态,「翻译」 成 AI 能理解的东西。

蔺旭东的加入要放在一个更大的背景下才能看得清楚,那就是如今腾讯混元正在重新整理自己的多模态路线。

2025 年 1 月,腾讯杰出科学家 (Tencent Distinguished Scientist) 胡瀚接替此前离职的刘威,全面负责混元多模态大模型的研发,同时担任腾讯混元大模型 Tech Lead。

2025 年下半年腾讯内部组织调整,他从多模态模型部,调入了大语言模型部旗下的 「Frontier」 前沿技术研究组,头衔变成了多模态理解方向负责人,汇报线也改为向姚顺雨汇报。

实际地位从 「一个独立部门的领导」 变成了 「大语言模型部下面一个研究组里某个方向的负责人」,管的范围从整个多模态大模型收缩到只剩多模态理解这一块,多模态生成等方向被划出去了。

2026 年 3 月腾讯已经撤销了成立近十年的 AI Lab,部分人员并入混元大语言模型部转向姚顺雨汇报。在这次调整后,此前混元实际掌舵人、腾讯公司副总裁蒋杰,正式与姚顺雨完成工作交接,不再兼管 AI Lab 和混元。

2026 年 7 月初,前 OpenAI 研究员、姚顺雨清华本科校友田永龙加入腾讯,负责视觉语言模型方向。

紧接着没过几天,腾讯 TEG 正式发文,撤销大语言模型部和多模态模型部,合并成立 「基础模型部」,姚顺雨任负责人,向 TEG 总裁卢山汇报。腾讯称,此举旨在提升模型研发与协同效率,探索全模态模型的智能上限。

随后,胡瀚被曝离职创业。

前亚马逊首席科学家、京东数科首席科学家、阿里通义实验室应用视觉团队负责人、原腾讯多模态模型部负责人 Linus 在这次调整之后,从原本和姚顺雨平行的地位,改为了向姚顺雨汇报。

还没完,腾讯混元多模态基础模型负责人钟钊,负责 HunyuanVideo 和 HunyuanImage 两条生成线,是混元多模态生成方向的实际掌舵人。

他在 8 月 14 日发了一条朋友圈,称 「即将发布的版本或将是我在 HunyuanVideo 与 HunyuanImage 项目中的最终版本」,字里行间充满了告别。

蔺旭东或许只是混元多模态换血中的一员,但是他的加入释放出了一个明显的信号,整个腾讯对于多模态的研发方向,已经发生了改变。

在此之前,腾讯是怎么做多模态的?

此前腾讯的语言模型和多模态是根本的两条线,而混元多模态最核心的两个产品,正是前文提到的 HunyuanVideo 和 HunyuanImage。

HunyuanVideo 是文生视频模型,2024 年 12 月首发即以 130 亿参数成为当时全球最大的开源视频生成模型,支持 5 秒 720p 输出。2025 年密集扩展能力,3 月上线图生视频,5 月推出定制化生成 HunyuanCustom 和数字人驱动 Avatar,11 月发布 1.5 版本,将参数压缩至 83 亿,支持原生生成 5 至 10 秒的 480p 或 720p 视频,并可通过超分辨率得到 1080p 输出。

HunyuanImage 起步更早,这是 2024 年 5 月,混元推出的首个中文原生 DiT 架构图像模型,2025 年迭代出业界首个工业级实时生图的 2.0 版本,同年 9 月发布了 2.1 版本 (170 亿参数、原生 2K 分辨率) 和 3.0 版本 (800 亿参数、首个工业级开源原生多模态生图模型),2026 年 1 月进一步推出带推理能力的 Instruct 版本,支持提示词自改写和图生图编辑。

还有一条线是 Hy 3D,这是一个专门生成单体 3D 模型的模型,2024 年 11 月随 Hunyuan-Large 一同开源 1.0 版本,2025 年 1 月升级到了 2.0,拆分为 DiT 形状生成加 Paint 纹理合成的两阶段流水线,6 月 2.1 完整开源训练代码,9 月发布 3.0 将建模精度提升 3 倍、几何分辨率达 1536³,目前已迭代至 3.1,广泛用于电商建模、产品设计和 3D 打印。

在这三座大山之后,或许是李飞飞的空间智能理论影响了腾讯,亦或者是多年以前,腾讯在数字孪生中掌握的相关知识,在 AI 的加持下得以再次利用。

就如同刘关张之后有赵云一样,混元多模态在 2025 年 7 月下旬也迎来了四弟,Hy World 1.0。

所谓空间智能,根据李飞飞旗下 World Labs 的表述,它是指让 AI 感知、生成、推理并与三维空间中的世界互动。

语言模型学习的是文本的统计结构,而世界模型需要学习空间和时间的结构,例如光线如何落到物体表面、从没有拍摄过的角度看花园会是什么样,以及物体受到外力后会如何运动。

腾讯称,Hy World 1.0 是全球首个开源、支持仿真的沉浸式 3D 世界生成模型,技术路线是先生成一张 360 度全景图作为 「世界代理」,再分解成语义层做分层 3D 重建,最后输出可导入游戏引擎的分层 Mesh。

由于腾讯本身就很擅长开发游戏引擎和游戏内容,Hy World 虽然表现力非常惊人,却也被网友调侃成了 「腾讯不愿离开舒适圈」。

在 Hy World 1.0 发布的一个多月后,腾讯又发布了 Hy World-Voyager,定位是基于相机轨迹控制的超长漫游世界模型。

Hy World-Voyager 解决的是 1.0 留下的一个痛点。虽然 1.0 生成的 3D 世界质量不错,但漫游范围是相当有限的,走不了多远就会出现几何漂移和穿模。

Voyager 的思路是换一条技术路线,不直接生成 3D 资产,而是先做 RGB-D 双模态视频生成,每一帧画面在输出色彩的同时同步输出一张深度图,然后用深度图即时重建 3D 点云。

总而言之,Hy World 几乎可以说是藉由腾讯在引擎和美术上的优势,完美还原了李飞飞空间智能的设想。

要知道,Hy World 2.0 它的技术报告全称就是 《HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds》,其中的 「Reconstructing, Generating, and Simulating 3D Worlds」(重建、生成、模拟 3D 世界),也就是前文所提到的,World Labs 对空间智能的阐述。

然而并不是所有人都认同李飞飞,就包括姚顺雨。在多模态这件事上,姚顺雨似乎更认同梁文锋的观点。

姚顺雨认同梁文锋

李飞飞的观点是,世界模型作为空间智能的一部分,是 AGI 重要的一条线,梁文锋则持反对意见。

曾有投资者在多模态这个问题上向梁文锋提问,梁文锋回答说:「我们只做 AGI 主线——GPT、CoT、Agent。AI 领域很广泛,但 3D、视频生成、世界模型,跟智能的主线没有太大关系。」

DeepSeek 有个产品,叫做 DeepSeek OCR,几乎就是梁文锋多模态观的技术具象化。把视觉模态当成服务于语言模型的工具,而不是独立的智能方向。

DeepSeek OCR 的核心叫做 「上下文光学压缩」(Contexts Optical Compression),核心思路是把长文本渲染成图像,用视觉编码器把文本压缩成紧凑的视觉 token,再交给语言模型解码。

是不是有点眼熟?翻回前面看看蔺旭东的 Vx2Text,姚顺雨或许正是想学梁文锋,把混元现有的多模态基础,转换成为这样一种理解方式,进而更好地融合进 Hy 模型主线。

包括 OpenAI 在内,很多 AI 大厂其实都是类似的做法。姚顺雨曾就职于 OpenAI,很可能就是在那时,确立了这个方向。

姚顺雨加入腾讯后的第一款旗舰产品是 Hy3,他把重点放在推理、智能体、长上下文和生产力任务上。

官方称,Hy3 在软件开发、办公生产、金融建模、前端设计和游戏制作等任务上进行了优化,并且在工具调用稳定性、复杂上下文承接和多轮意图保持方面继续改进。

Hy3 的目标并非 「屠榜」,而是让模型在真实产品里少出错、能理解上下文、能够把任务持续做下去。

这个产品本身就非常的 「姚顺雨」。

2026 年 6 月 5 日,在腾讯云 AI 产业应用大会与汤道生的对谈中,姚顺雨是这么判断的,AI 下半场的竞争壁垒不在模型参数量,而在 Context(上下文)。

「我们现在就像是拥有了一个万能的锤子,它可以去砸任何钉子。方法论已经变得非常成熟,相反,寻找真正有价值的问题,变得越来越困难。」 姚顺雨如此说到。

同样在那场会上,公布了腾讯长期 AGI 建设的三层架构:基础底座 (预训练+后训练+基建)、产品落地、前沿探索。推理能力属于基础底座要解决的问题,上下文能力属于产品落地和前沿探索的交叉点。

此前,为了测试模型脱离原有知识,只从上下文中寻找答案,姚顺雨还特地制作了测试上下文的基准 CL-bench 以及 CL-bench life。

可见,姚顺雨其实也跟梁文锋一样,觉得主线是 Agent 相关的内容,而非多模态生成。

至于 Hy3 到底怎么样,那就要看 WorkBuddy 了。WorkBuddy 是 Hy3 的首发平台之一,这哥俩属于是 「产品+模型」 双螺旋关系,互相成就。

接入 Hy3 后 WorkBuddy 的表现提升非常显著。基于办公场景内部测评,任务解决率从 72% 跃升至 90%,平均耗时缩短 34%,可多处理约五分之一的复杂需求。

Hy3 上线后,WorkBuddy 上主动选择 Hy3 的用户数增长了 6 倍,日均文字处理量较预览版增长 20 倍,7 月 8 日算力消耗一度达到峰值,排队率超过 50%,腾讯为此紧急扩容。

一个猜想,Hy 提升多模态理解后,它的 GUI Agent 场景下的体验会更上一层楼。GUI Agent 的核心链路是 「感知屏幕 — 理解界面 — 决策操作 — 执行验证」,其中多模态理解是连接视觉感知与语言决策的关键瓶颈。

但这并不足以证明李飞飞是错的,只能说姚顺雨认同梁文锋罢了。

广告

相关 文章

新能源渗透率首破60%——「上半场」赢了,「下半场」更难

新能源渗透率首破 60%——「上半场」 赢了,「下半场」 更难

来自 周天财经
2026 年 8 月 19 日
0

文 | 财观二姐 7 月,中国新能源汽车又跨...

雪山派第一到天下第一,影石的路有多远?

雪山派第一到天下第一,影石的路有多远?

来自 周天财经
2026 年 8 月 19 日
0

文  | 一刻商业,作者 | 刘乐 ,编...

浦发银行半年报:双增的业绩,三个待解的问号

浦发银行半年报:双增的业绩,三个待解的问号

来自 周天财经
2026 年 8 月 19 日
0

文 | 节点财经,作者 | 七公 8 月 1...

订单已排到2030年,电子织布机需求爆发,国产织机迎来窗口期

订单已排到 2030 年,电子织布机需求爆发,国产织机迎来窗口期

来自 周天财经
2026 年 8 月 18 日
0

文 | 产联社 CLS2026 年 8 月,电子...

利好连发,股价滞涨:特锐德仍需努力

利好连发,股价滞涨:特锐德仍需努力

来自 周天财经
2026 年 8 月 18 日
0

文|财经思享汇,作者 | 刘雅坤,编辑 ...

加载更多
广告
  • 热门
  • 评论
  • 最新
「我们也深陷残酷价格战」,德资巨头中国区高管警告

「我们也深陷残酷价格战」,德资巨头中国区高管警告

2025 年 8 月 4 日
一周产业基金|上海市人工智能CVC基金发布;湖北百亿人形机器人母基金来了

一周产业基金|上海市人工智能 CVC 基金发布;湖北百亿人形机器人母基金来了

2025 年 8 月 4 日
「硬科技」指数携手上涨,半导体设备ETF易方达(159558)、芯片ETF易方达(516350)等产品助力布局板块龙头

基民懵了!这个火爆的板块年内涨超 37%,主力却借道 ETF 狂抛逾 400 亿元

2025 年 9 月 20 日
pt999铂金回收价格今日多少钱一克(2025年06月27日)

期货在什么情况下会被强行平仓

2025 年 8 月 4 日
Lesson 1: Basics Of Photography With Natural Lighting

The Single Most Important Thing You Need To Know About Success

4
Lesson 1: Basics Of Photography With Natural Lighting

Lesson 1: Basics Of Photography With Natural Lighting

3
Lesson 1: Basics Of Photography With Natural Lighting

5 Ways Animals Will Help You Get More Business

2
Lesson 1: Basics Of Photography With Natural Lighting

New Cryptocurrency That Will Kill Of Bitcoin

2

「818 理财节」 十周年:AI 赋能技术迭代,服务坚守投资者本源

2026 年 8 月 19 日

国证机器人产业指数上涨 2.5%,机器人 ETF 易方达 (159530) 今日获资金加仓

2026 年 8 月 19 日
8月12日现货黄金最新资金流向:累计流出28.06亿美元

8 月 12 日现货黄金最新资金流向:累计流出 28.06 亿美元

2026 年 8 月 19 日

【央行圆桌汇】 美联储加息预期持续降温 (2026 年 8 月 17 日)

2026 年 8 月 19 日
  • 隐私政策
  • 联系我们
  • 关于周天
  • 登录
  • 注册
投诉建议:+86 13326565461

© 2025 广州小舟天传媒有限公司 by 周天财经 - 粤 ICP 备 2025452169 号-1

没有结果
查看所有结果
  • 首页
  • 24 小时
  • 世界
  • 商业
  • 基金
  • 期货
  • 股票
  • 行业新闻
  • 黄金

© 2025 广州小舟天传媒有限公司 by 周天财经 - 粤 ICP 备 2025452169 号-1

欢迎回来!

在下面登录您的帐户

忘记密码? 注册

创建新帐户!

填写以下表格进行注册

所有项目需要填写。 登录

重置您的密码

请输入您的用户名或电子邮件地址以重置密码。

登录

用户登录

还没有账号?立即注册

用户注册

已有账号?立即登录