Google推出全新多模态嵌入模型
2026年3月10日,Google正式发布Gemini Embedding 2,这是其首个原生多模态嵌入模型,现已开放公开预览。该模型基于Gemini架构构建,能够将文本、图像、视频、音频和文档映射到单一的统一嵌入空间中。
核心功能
Gemini Embedding 2的主要能力包括:
- 多模态输入支持:可处理文本、每请求最多6张图片、最长120秒的视频、无需转录的原生音频,以及最多6页的PDF文档
- 统一嵌入空间:将不同模态整合到单一空间,简化复杂的AI管道,增强多模态下游任务
- 交错输入:支持在单个请求中组合不同模态,如图片配文字说明
- 百种语言支持:支持超过100种语言的语义理解
- 灵活输出维度:采用Matryoshka表示学习,默认3072维度可缩放至1536或768
性能提升
Google表示,Gemini Embedding 2在文本、图像和视频任务上表现优于领先模型,并引入了强大的语音能力。该模型可通过Gemini API和Vertex AI获取。
相关阅读
这条线上还有几篇站内文章可以接着看:
延伸阅读
- Google Gemini 3.5 Pro 传7月17日发布:全新预训练重塑底座,前端能力叫板Fable 53 月前
- 腾讯整合WorkBuddy与QClaw团队:一场迟到的”内部合流”2 月前
- OpenClaw v2026.8.1 更新发布3 周前
- 小米 MiMo-V2-Pro 发布:1T 总参数 42B 激活、1M 上下文,API 定价约为同级竞品 1/52 天前
AI 自学笔记 每天更新 AI 前沿动态,订阅 RSS,或按 Ctrl/⌘+D 收藏本站,明天见。
