开发者 3 秒速决决策指标
CrewAI 于 2026-09-28 发布 1.15.23:原生接入 Gemini 3.8 Flash;crewai eval 可基于 AMP 评估最近一次 traced run(不再只打印);任务 span 记录声明的输出格式与结果;LLM 对限流提供商自动重试,Bedrock acall 可回退同步调用。面向多 Agent 编排的可观测与评测闭环明显收紧。
核心要点速览 (Key Takeaways)
阅读完核心要点?进一步了解模型实力与实际开销
7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算
相关资源与官方项目出处
免代理直达深度技术解析与实战评估
核心背景与行业痛点
多 Agent 编排框架长期卡在两件事:一是新模型(如 Gemini 3.8 Flash)要等 LiteLLM/适配层才能用,原生 SDK 路径滞后;二是跑完 Crew 往往只有日志,缺少「最近一次轨迹 → 一键评分」的闭环,回归与人工抽检成本高。运维侧限流重试与云厂商异步/同步不一致,也会让长程任务中途脆断,影响生产稳定性。
架构亮点与底层机制
CrewAI 1.15.23 在原生 Google SDK 路径加入 Gemini 3.8 Flash,与 官方 LLM 指南 的 provider 模型一致。评测侧:记录 last traced run,并经 AMP 执行 crewai eval,TUI 暴露 Evaluate、CLI 打印 graded areas。Tracing 增强任务 span,写入声明的 output format 与实际结果,便于对照 schema。LLM 层对 throttled 调用自动重试,Bedrock 上 acall 失败可回退同步;另修复 SQLite 连接、S3 body、Selenium driver 复用等资源问题,平台集成 UX 与热门集成排序也做了收紧。
权威 Benchmark 与实测跑分对比
该补丁版未公布独立公开 benchmark 数字;Gemini 3.8 Flash 能力以 Google 模型卡为准。框架侧价值在可观测与评测工作流,而非模型榜单分数——请在自有任务集上对比启用 AMP eval 前后的回归通过率、graded areas 覆盖与人工抽检一致性。
开发者实战落地与开箱指南
```bash pip install -U "crewai==1.15.23"
或 uv add "crewai[google]==1.15.23"
`` 配置 LLM(model="gemini/gemini-3.8-flash", api_key=...)(以 docs.crewai.com LLMs 当前 ID 为准)。开启 tracing 跑一轮 Crew 后,用 crewai eval` 评估 last traced run;在 TUI 点 Evaluate 查看 graded areas。仓库:crewAIInc/crewAI,站点 crewai.com,追踪文档见 Tracing。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察