# RT Eric Xu (e/Mettā): 科普一下“多模态”的具体含义。 首先，我们虽然不认为盲人有“智力”上的缺陷，但不会因此让盲人靠听收音机去驾驶汽车。因为有些模态比...

- 来源：宝玉
- 发布时间：2026-08-02 21:58
- AIWatch 分数：61
- AIWatch 标记：未精选
- AIWatch 链接：https://aiwatch.icu/events/evt_01kz1k82y8qgdyvvnbdkz99bt5
- 原文链接：https://x.com/dotey/status/2083938515805491681

## 精选理由

常规快讯，保留列表

## AI 摘要

Eric Xu 科普了多模态的具体含义，指出视觉模态不可替代且AI需接受人择世界的模态，并评论了DeepSeek和Anthropic在AGI路上的多模态策略。

## 正文

首先，我们虽然不认为盲人有“智力”上的缺陷，但不会因此让盲人靠听收音机去驾驶汽车。因为有些模态比如视觉，不是其他模态（文字或者语音）能够简单取代的。这里面有一个人择原理：即使最终在 AI 内大家都是 token, 但人类选择了用红灯而非多普勒雷达构建了整个交通系统，也选择了用 2D 屏幕而非字节流表达计算机操作，因此 AI 为了在现实世界和数字世界中完成任务，必须接受人类已经接受的模态和输入。

多模态是个被滥用了的词。模型多模态输入有利于内部更好的表示这个人择的世界，特别是视觉信号，可以帮助模型 grounding ，比如“红灯”它到底是一个什么样的信号， 在语义上毫无问题，但在开车场景里要接近人择的感知和推理，才能更加准确的表征人择世界的模型——这个世界上不存在客观的世界模型，都是人择的。

即是是纯粹追求虚幻的 AGI 目标，就以长程任务为标尺， DeepSeek 要做的长程任务，持续学习，最终也都绕不过多模态，特别是人择世界的视觉信号。一个很明显的例子就是盲人不能够仅靠语言，不依赖计算机屏幕，来操作针对视觉无碍者设计的计算机，很好完成长程计算机操作任务。 AI 也会在这种选择压力下，迫使 tokenize 人择的数字视觉信号。

DeepSeek 不愿意在 AGI 的路上做多模态的输出，和 Anthropic 的方向是一样的。因为多模态输出更多是一个工程问题，牵涉到如何构建扩散或者 flow match 模型，如何让输出的分布不塌陷到平均期望上，如何保障多步输出的一致性——在通往 AGI 路上这些都是垂直的任务，可以被通用的 AI 模型一句话调用，因此可以从通用智能里外化掉。

DeepSeek 放出一个只支持 text 输入的模型不代表 DeepSeek 就死死抱住 text-only 不放。实际上 DeepSeek 的非 API , 非开放权重版本是可以处理视觉信号的，而且许多我知道的企业应用里，都有人在试图给 DeepSeek 嫁接一个 ViT.
