📰 研报摘要
查看全文 ➔本报告为 AI 系列深度第 05 期,探讨了模型表征学习与多模态对齐的核心技术机制。报告指出,表征落地的基础在于三类机制:一是嵌入(Embedding),即将文本、图像等对象映射为高维向量,实现语义搜索、推荐及 RAG 等工程化应用;二是自监督学习,通过掩码预测、对比学习及 token 预测等方式,利用海量无标注数据形成通用表征;三是 CLIP 对齐技术,通过大规模图文配对的对比学习,将图像与文字映射至统一的语义空间,构成了文生图及多模态大模型的底层基础。
报告最后强调,当前数字底座模型发展路径明确,但难以实现物理世界的建模闭环;物理 AI 作为未来 AI 发展的增量方向,智能驾驶作为最先跑通闭环的场景,具备重要的投资价值。风险提示包括技术迭代不及预期、厂商增速放缓、云厂商资本开支不足及商业化落地不及预期等。