今天给大家讲一个现在 AI 圈超火的词:Multimodal(多模态)。
1. 什么是多模态?
先拆词:
- 模态 = 信息的形式文字、图片、声音、视频、3D 都是不同 “模态”。
- 单模态 AI:只会一种。比如只懂文字、只会画画、只能语音识别。
- 多模态 AI:能同时看懂、听懂、读懂,还能混合输出。简单说:以前 AI 是 “瞎子 / 聋子”,只会看字;现在多模态 AI = 眼、耳、脑一起用。
2. 多模态到底有多厉害?举几个你天天用的例子
- 发一张图问 AI:“这张照片里的猫是什么品种?适合新手养吗?”AI 看图 + 读文字 → 直接回答。
- 对着手机说话:“帮我把这段语音转成文字,再配一张适合发朋友圈的图”AI 听语音 → 转文字 → 生成图片。
- 上传一段视频,让 AI 总结内容、提取字幕、写解说。这些都是多模态在干活。
3. 和普通 AI、生成式 AI 的区别
- 传统 AI:只会处理一种信息。
- 生成式 AI:能造内容,但很多只玩文字 / 图片。
- 多模态 AI:能输入混合、理解混合、输出混合,更接近人的感知方式。
4. 一句话总结
Multimodal 多模态 = 让 AI 不再只会 “读字”,而是能像人一样,看图、听声、读文、理解世界,再给你想要的答案。
现在几乎所有主流大模型都在卷多模态,大家平时用 AI 的时候有没有感受到这种 “全能感”?