来源:IT之家查看原文 ↗
原文版权归来源方所有,本站仅作收录、翻译或格式整理。
媒体:0 条已核验,3 条仅保留来源
事实脉络
IT之家 8 月 7 日消息,Composio 昨日(8 月 6 日)在 X 平台发布推文, 使用 30 项任务测试 4 个 AI 编程智能体框架,观察哪个框架更能发挥 DeepSeek V4 Flash 正式版性能。 IT之家查询公开资料,Composio 成立于 2023 年,总部位于旧金山,定位开源 AI 智能体工具集成平台,核心是打通大语言模型与各类外部应用的连接,帮助开发者快速搭建可落地的生产级 AI 智能体。 Comp
解读与影响
AI 智能体工具集成平台 Composio 近日发布了一项基准测试,旨在找出与 DeepSeek V4 Flash 大模型搭配最佳的编程智能体框架。测试围绕 Oh My Pi、OpenCode、Claude Code 及另一款未具名工具展开,通过 30 项编程任务综合考察各框架在成功率、执行速度与成本控制上的表现。Composio 本身定位为打通大语言模型与外部应用连接的开源平台,其测试结果对于开发者选择生产级 AI 编程助手具有直接参考价值。
根据新浪科技转引的详细数据,Oh My Pi 以 17/30 的成功率领跑,但平均每个任务耗时 272 秒,是四者中最慢的。与之形成鲜明对比的是 Claude Code,它仅需 122 秒即可完成单个任务,速度最快,然而其单任务成本高达 0.195 美元,同样位居榜首。OpenCode 则展现出极佳的成本效益,每个成功任务仅花费 0.073 美元。值得注意的是,Claude Code 虽然速度与成本均突出,但它生成的输出令牌和工具调用次数却是最少的,这暗示其高效可能源于更精准的指令执行,而非海量计算。
从技术架构角度看,此次测试也折射出当前 AI 智能体发展的一个趋势:通过“技能封装”来提升模型能力。正如 51CTO 的分析,2026 年正成为 Skills(技能)体系的“应用爆发之年”,其核心思路是将专家知识封装为可渐进加载的模块,供 AI 智能体调用。这与 Composio 平台本身“连接大模型与外部工具”的使命一脉相承。测试中各框架的表现差异,很大程度上可能源于它们对技能调用、上下文管理以及工具链整合的优化策略不同。
综合来看,这场测试并没有诞生一个绝对的“六边形战士”。Oh My Pi 适合对任务成功率要求苛刻的场景;Claude Code 是追求极致速度的选择;而 OpenCode 则为成本敏感型项目提供了高性价比方案。对于开发者而言,选择哪款框架作为 DeepSeek V4 Flash 的搭档,将取决于具体项目在精度、时效与预算之间的权衡。
参考来源
来源原文
IT之家 8 月 7 日消息,Composio 昨日(8 月 6 日)在 X 平台发布推文, 使用 30 项任务测试 4 个 AI 编程智能体框架,观察哪个框架更能发挥 DeepSeek V4 Flash 正式版性能。 IT之家查询公开资料,Composio 成立于 2023 年,总部位于旧金山,定位开源 AI 智能体工具集成平台,核心是打通大语言模型与各类外部应用的连接,帮助开发者快速搭建可落地的生产级 AI 智能体。 Composio 使用 Gmail、GitHub、Slack 和 Notion 等真实工具测试 30 个 AI 智能体任务,统一调用 DeepSeek V4 Flash 正式版模型,其任务结果如下: Oh My Pi: 17/30 Claude Code: 16/30 Codex: 16/30 OpenCode: 14/30 测试结果显示 Oh My Pi 的成功率最高(17/30),但速度最慢,每个任务耗时 272 秒。OpenCode 的成本最低,每个成功任务仅需 0.073 美元;而 Claude Code 速度最快,仅需 122 秒,但成本最高,每个任务耗时 0.195 美元,尽管它使用的工具调用次数最少,生成的输出令牌也最少。