Agent-Field/CodeAF 以 Apache-2.0 单二进制把开源权重(DeepSeek/Qwen/GLM/Kimi 等)编成「工厂」:一窗派活、子 harness 分工、Pareto Crewing 按任务选模型。v0.6.0 发布于 2026-10-01T18:59:00Z;本跑 ★259。厂商文档:同模 DeepSeek V4 Flash 上 /senior-dev 在 DeepSWE 113 题解出 62(54.9%),单位成本标为对照 1x(有单种子与采样契约差异等限制)。

核心要点速览 (Key Takeaways)

  • ✓仓库 Agent-Field/CodeAF Apache-2.0;本跑 ★259 / forks 34;安装 curl -fsSL https://agentfield.ai/get/codeaf | bash
  • ✓正式标签 v0.6.0 发布于 2026-10-01T18:59:00Z;README 仍标 early preview
  • ✓厂商 DeepSWE 对照(同模 deepseek-v4-flash-0731,113 题):senior-dev 62/113=54.9%、每题约 22¢;mini-swe-agent 49.6%、codex 45.1%、pi 37.2%、claude-code 14.2%(见仓库 docs/benchmarks/deepswe)
  • ✓后续同套题:DeepSeek V4.1 Flash 上报 88/113=77.9%;Kimi K3 78/113=69.0%(仅 senior-dev,非跨 harness 对比)
  • ✓内置 OpenRouter/DeepSeek/GLM/Kimi/MiniMax/Qwen/Codex/Ollama;crew 默认 worker/planner/checker 三角色自动选模
🧭

阅读完核心要点?进一步了解模型实力与实际开销

7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算

🔬

深度技术解析与实战评估

核心背景与行业痛点

开源模型在「裸 CLI」上往往跑不满潜力:缺工厂式派活、缺按任务选模、缺统一成本账。CodeAF(AgentField)把反向做成 专为开源权重优化的软件工厂:一个 Go 二进制、Apache-2.0,开发者从一扇窗把活派到隔离仓库环境,只在架构判断处介入。v0.6.0 于 2026-10-01 打正式标签,同时仍自我标注 early preview——适合关注开源模型 harness 的团队跟进,而非当作已冻结生产基线。

架构亮点与底层机制

会话层是「你对话的那一个 seat」;每个下发任务再展开 worker / planner / checker crew,默认按目录元数据与本机历史用 Pareto Crewing 加权选模,可 /crew pin 或 --best/--cheap。Headless 入口 codeaf do / codeaf exec 方便 CI 与基准。可选 Model Pool 交换「无代码、无路径」的聚合统计以改进选模,可用环境变量关闭。Provider 覆盖 OpenRouter 与多家开源 API,以及 ChatGPT 计划下的 Codex。

权威 Benchmark 与实测跑分对比

主要公开数字来自仓库 docs/benchmarks/deepswe:十个 harness、同一 DeepSeek V4 Flash、DeepSWE 113 题、官方 verifier 0b9fabb、每题 3h。senior-dev 解出 62(54.9%),每题约 22¢,成本/解题标为 1x;对照含 mini-swe-agent 49.6%、codex 45.1%、pi 37.2%、claude-code 14.2% 等。文档明确限制:单种子;senior-dev 未送 temperature/top-p 与其它臂采样契约不一致;部分 harness 仅有总账。后续同题:V4.1 Flash 88/113(77.9%)、Kimi K3 69.0%——均为 vendor 自跑,需独立复现。

开发者实战落地与开箱指南

curl -fsSL https://agentfield.ai/get/codeaf | bash 后运行 codeaf,按提示接 OpenRouter 或各厂 Key;也可 VERSION=<tag> 钉版本。先在小仓库用 /senior-dev 或默认工厂流跑通一单带测试的修复,再用 codeaf models / /crew 看花费。阅读 early preview 声明与 DeepSWE limits 后再对外引用分数;生产合并仍需人审与回归。