孔蓝举着手机冲进技术部:"能不能让学生拍张试卷照片上传,AI 自动批改?"黄俪眼睛一亮:"多模态呀!给 UserMessage 塞张图片就行。"
多模态
本章定位
本章解决的核心问题:让 AI 不仅"读文字",还能"看图片"和"生成图片"。通过 Spring AI 的 Media 类,将图片数据附加到 UserMessage 中实现视觉问答。
学习路线图
学习顺序说明:先掌握如何让 AI "看"图片(图像输入)→ 再学习如何让 AI "画"图片(图像生成)。
文件关系说明
| 文件 | 一句话角色 |
|---|---|
图像输入与视觉模型.md | 通过 Media 类让 AI 理解图片内容,实现试卷批改、证件识别等场景。 |
图像生成.md | 通过 ImageModel 接口让 AI 根据文本描述生成课程封面图。 |
与上一章的衔接
Tool Calling 让 AI 调用 Java 方法获取文本数据,多模态则让 AI 直接"看到"图片数据——两者互补,共同扩展 AI 的感知与行动边界。