Cohere 于 2026-09-30 发布嵌入家族 Embed 5:Pro(质量优先)与 Fast(延迟/成本优先)共享同一 embedding space,可 Pro 建索引、Fast 查而无需重建。多模态(文本/图像/融合)、128K 上下文、100+ 语言;API 模型名 embed-v5.0-pro / embed-v5.0-fast。官博:ViDoRe V3 上 Pro 均 85.8(相对 Embed 4 +8.8);定价文本 $0.12 / $0.08 per M tokens。已上 Cohere API、Model Vault、Azure Foundry、SageMaker,可 vLLM 私有化。

核心要点速览 (Key Takeaways)

  • ✓发布日 2026-09-30;主文 cohere.com/blog/embed-5;文档入口 Cohere Embed docs
  • ✓双档同空间:Pro 索引 + Fast 查询;官博称跨模型组合相对同模型基线平均损失约 1.6%–2.7%(40 个开发集)
  • ✓检索:ViDoRe V3 Pro 85.8(+8.8 vs Embed 4),领先 Voyage 4 Large 83.7、Gemini Embedding 2 83.2;Fast 84.5
  • ✓规格:128K 上下文;维度 2048…256;float/int8/binary + Matryoshka;文本价 Pro $0.12/M、Fast $0.08/M(图像均 $0.40/M)
  • ✓落地:co.embed(model="embed-v5.0-pro"|"embed-v5.0-fast", …);Foundry/SageMaker/vLLM;集成 LangChain、Weaviate、Qdrant、Pinecone 等
🧭

阅读完核心要点?进一步了解模型实力与实际开销

7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算

🔬

深度技术解析与实战评估

核心背景与行业痛点

Agent / RAG 的钱往往耗在「检不准 → 生成模型硬扛噪声」。企业语料又是扫描 PDF、表格、幻灯与多语言混杂;一套「最强但贵」与一套「快但要重建索引」的双模型,运维成本极高。Cohere 在 2026-09-30 官博 推出 Embed 5 家族,用 Pro / Fast 共享向量空间直接回应:离线用 Pro 建库,在线用 Fast 查,无需 re-index。

架构亮点与底层机制

两档均支持文本、图像、fused text+image;上下文 128K;输出维度 2048/1536/1024/768/512/256;格式 float / int8 / binary,并带 Matryoshka 截断。API 示例模型 id:embed-v5.0-pro、embed-v5.0-fast(见官博代码)。共享空间经 40 个开发集交叉评测:以 Pro+Pro=100 归一化后,Pro 语料 + Fast 查询约 98.4,Fast+Fast 96.6。压缩上,官博举例 2048-d float32≈8KB → 256-d binary≈32B(约 256×);多数部署建议 1024-d int8。分发:Cohere API / Model Vault、Microsoft Foundry、Amazon SageMaker;私有化可用 vLLM;批处理嵌入支持大规模摄入。

权威 Benchmark 与实测跑分对比

以下为 Cohere 官博自报(含其 RCP-nDCG@10 方法),第三方复现以原文脚注/GitHub 标注为准。ViDoRe V3(解析文本):Pro 均 85.8(较 Embed 4 +8.8),对比 Voyage 4 Large 83.7、Gemini Embedding 2 83.2、OpenAI text-embedding-3-large 75.5;Fast 84.5。金融:FinanceBench Pro/Fast 80.1 / 80.0,FinQA 90.0 / 88.8,ViDoRe V3 Finance 85.0 / 83.9。解析 PDF 套件均分 Pro 84.8 vs Voyage 4 Large 83.6、Gemini Embedding 2 80.8。吞吐:Fast 文档吞吐平均约为 Pro 的 2.4×(~200 / ~1K token 语境)。定价(文本):Pro $0.12/M tokens,Fast $0.08/M;图像两档均为 $0.40/M。

开发者实战落地与开箱指南

  1. 读 Embed 5 博文 与 Embed 文档,创建 API key。
  2. 索引路径优先 embed-v5.0-pro + input_type="search_document";在线查询用 embed-v5.0-fast + search_query,维度与量化格式保持一致。
  3. 向量库侧对齐 int8/binary 与 Matryoshka;先在自有语料用 RCP/nDCG 抽样,勿只抄公开榜。
  4. 云上可选 Foundry / SageMaker;内网用 vLLM 拉私有权重服务。
  5. 生态:官博列出 LangChain、Haystack、Weaviate、Qdrant、Pinecone、Elasticsearch、MongoDB、Redis、Milvus、OpenSearch 等集成——以各连接器当前版本为准。