实测DeepSeek V4.1 Flash:成本远低于Claude但无法独立编码

咨询公司实测DeepSeek V4.1 Flash替代Claude编码。同等用量下,其API成本约4200美元,远低于按列表价计算的14万美元,但需额外引入Claude检查成果,无法独立高效完成代码变更。

一家名为呼叫中心医生(Call Center Doctor)的咨询公司近期开展了一项实测,旨在验证“DeepSeek 比 Claude 便宜 80 倍”这一网络流行说法。该公司为其他企业建造和运营呼叫楼,此次测试将 DeepSeek V4.1 Flash 模型提供给其编码代理使用,以取代原本使用的 Anthropic Claude Opus 5.5。

DeepSeek仅能运行只读审核代理

价格对比与成本测算

根据 DeepSeek API 的定价策略,非高峰时段每百万新输入 token 的价格为 0.15 美元,缓存输入 token 为 0.003 美元,输出 token 为 0.60 美元;高峰时段成本则是非高峰时段的三倍。相比之下,Anthropic 的 Claude Opus 5.5 列表价为每百万输入 token 4 美元,输出 token 20 美元,缓存读取 0.20 美元。然而,该咨询公司实际通过订阅而非按量付费 API 的方式使用 Claude。

在 9 月 1 日至 27 日的测试期间,系统共进行了 203 万次模型调用,读取了 3885 亿个 token,其中 3742 亿个来自缓存,写入量为 3.93 亿个,并合并了 5610 项代码变更。若按 Claude Opus 5.5 的列表价计算,同等 token 用量的费用约为 140,000 美元,是该公司 9 月份约 5500 美元的 Claude Code 订阅费用的 25 倍以上。这种巨大的价差正是“80 倍便宜”说法的来源。

若使用 DeepSeek API 处理同样的数据量,费用预计在 3500 至 7000 美元之间,具体取决于是否处于高峰时段。假设用量在一周内均匀分布,估算平均成本约为 4200 美元。此外,咨询公司还对每次合并的代码变更进行了定价:在 Claude 上约为 1 美元;若 DeepSeek 使用相同的 token 完成相同工作,在其 API 上则约为 0.63 美元。但需注意,DeepSeek 的 1.15–4.90 美元估算值基于额外假设:即模型可能需要更多 token、成功率更低,且需要引入 Claude 来检查其工作成果。

硬件租赁与运行效率分析

为了模拟独立部署环境,该公司租用了四架 Nvidia H200 服务器进行测试。数据显示,这套硬件组合以每秒约 213 个 token 的速度编写代码,按需成本为每天 440.88 美元,而通过 DeepSeek API 服务的成本仅为每天 184.223 美元。这意味着电话中心(指代使用该硬件的服务方或场景)的价格低于直接租用硬件的需求价格。

测试日志显示,编码代理主要依靠重复发送对话内容来工作,提供给模型的信息中有 96% 是过时文本。每生成一个新 token,大约需要重新读取 1,000 个旧 token。虽然重读成本较低,但庞大的数量导致设备大部分时间忙于重读,几乎没有剩余时间用于生成新 token。一台设备在满负载运行一分钟、处理单一类型任务时表现尚可,但在复杂代理任务中效率受限。

让模型稳定运行需要五次尝试,每次充电耗时 10 到 15 分钟。无论是否有人在使用,收费均照常进行,这被认为是不理想的计费模式。按照咨询公司的算法,一个标准月的按需费用为每小时 18.37 美元,总计约 13,200 美元,这是其 9 月份 Claude 账单的两倍。此外,一个盒子每天仅能通过约 200 亿 token。

功能限制与最终结论

值得注意的是,DeepSeek 在测试中从未真正编写过代码。咨询公司的审核人员一直在寻找代理代码逃离沙箱的方法,例如通过共享临时文件中的设置文件,这迫使编写代码的代理人不得不离线操作。相反,DeepSeek 仅以 48 到 64 只读的审核代理运行,阅读了 2,377 个文件并提交 32 个错误报告。该箱子以每小时 9.19 美元的现货租金出租,在最后一次测试结束后几分钟内,供应商便收回了设备。

基于 V4 代的性能比较,Pro 版本超过了 Flash 版本,DeepSeek V4.1-Pro 的表现更好,但目前尚无明确的发布日期。这可能改变未来的成本算法,但在当前阶段,对于此类高吞吐量需求,似乎仍有更具性价比的方案。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读