8月13日,DeepSeek几乎没有预告地上线了新的旗舰模型 V4 Pro 0813。这已经是它今年的第三次重大迭代,但这一次的分量不同:在多个被广泛引用的基准测试里,它已经把与闭源第一梯队的差距追到个位数百分点,而价格只有对方的几十分之一。Hacker News 上这条消息当天就冲到 556 分、199 条评论,评论区最高赞的一句话总结得相当克制:"性能对标 Opus 4.8,但便宜大约 20 倍。"
▲ 图1
性能:离第一梯队只差三五个百分点
先看最硬的数据。有 HN 网友把几大模型的基准分数做成了几何平均:GPT-5.6 Sol 65.5、Fable 5 64.5、Opus 5 64.0,而 DeepSeek V4 Pro 0813 拿到 62.5,压过 Kimi-K3 的 62.3,远超自家 Flash 0731 的 55.8 和 GLM-5.2 的 47.3。也就是说,它已经稳稳站在了全球第一梯队的门口,距离最强的闭源模型只差三五个百分点。具体到单项:Terminal Bench 2.1 拿到 87.9(Fable 5 是 88.0,Opus 4.8 是 85.0),Cybergym 83.3 对 Fable 5 的 83.1 基本打平;DeepSWE 62.7 对 70.0 是它相对落后的硬核编程项,但评论区普遍认为这项最能反映真实使用体感,差距仍在"同量级"范围。
价格:便宜一个数量级
真正让创业者坐不住的是价格。官方定价页显示,V4 Pro 0813 的输入价格是每百万 token 0.435 美元(缓存命中时只要 0.003625 美元),输出 0.87 美元。作为对比,Qwen3.8-max 的定价是输入 2 美元、输出 6 美元。也就是说,在性能相近的前提下,DeepSeek 只收对方大约五分之一到七分之一的钱。有位网友算了笔更狠的账:在 agentic coding 这类典型工作负载里,考虑到 DeepSeek 对缓存读取的深度折扣,单次请求的成本大约是 0.000875 美元,而等价的 Opus 请求要 0.052 美元——算下来接近 60 倍的差距。评论区里另一个真实案例更有说服力:有人花 10 美元充值了 DeepSeek 官方工具,连续高强度用了一个周末、"烧了数十亿 token",账户里还剩 3 美元。
同一天,三家密集出牌
值得注意的是,这次发布"撞车"了。同一天,Qwen 刚刚开放了 Qwen3.8-max 的权重,Grok 4.6 也同步上线。一天之内三家密集出牌,有人解读为 DeepSeek 在"抢 Qwen 的风头"。但评论区也有更冷静的判断:DeepSeek 一贯的风格就是"觉得准备好了就发",并不怎么在意别人在做什么。这家公司背后有量化基金幻方的持续输血,创始人在采访里把目标直说成 AGI。在 OpenAI、Anthropic 忙着讲商业化故事的时候,这种"闷头推技术"的姿态反而赢得了不少工程师的好感。
▲ 图2
对创业者最重要的三个信号
对 AI 创业者来说,这则新闻里最该读懂的信号有三个。
第一,成本曲线的斜率又变陡了。当"接近前沿"的模型价格被打到每百万 token 不到一美元,你此前为闭源 API 预留的预算,现在可能只需要付零头。做多 Agent 工作流、批量内容生成、内部代码辅助这类高 token 消耗的业务,切换引擎意味着毛利直接翻倍。评论区里已经有人用一句"如果数据反正要被美国或中国看,那不如选更便宜、还没有围墙花园的那个"来概括这种心态的转变。
第二,别只盯着 headline 价格,要算"缓存账"。DeepSeek 的缓存命中价是正常输入价的约一百二十分之一,这种设计对长上下文、反复调用同一代码库的 Agent 场景极其友好。真正精打细算的团队,会刻意设计提示词和上下文结构来最大化缓存命中率,而不是简单地按每百万 token 价格比价。这也是为什么"60 倍"和"20 倍"这两个数字会同时出现在讨论里——前者是算上缓存后的真实差距,后者是纯 token 价的差距。
第三,涨价已经在路上。官方定价页明确写着:"我们计划在近期上调 DeepSeek API 的整体价格,预计涨幅显著。"评论区也确认 Flash 会先涨、随后是全面上调。这意味着"极致便宜"的窗口期可能不会太久,现在立项、把用量跑起来的团队,会比观望者多吃到一段红利期。
迁移成本几乎为零,四步落地
还有一个容易被忽略的技术细节:DeepSeek 这次顺手补齐了 OpenAI 的 Responses API 格式,base_url 直接就是 api.deepseek.com,意味着你可以在 Codex 这类工具里几乎零改动地把模型切过去。加上它同时支持 Anthropic API 格式、1M 上下文、384K 最大输出和 thinking 模式,对已经习惯了两大主流 API 生态的开发者,迁移成本被压到了最低。
如果你现在就想动手,可以按下面四步落地。第一步,先做一次"影子切换":挑一个已经跑通、日志完整的 Agent 任务(比如代码审查或日报生成),把模型换成 deepseek-v4-pro,让它在后台跑三天,和原来的闭源模型逐条对比输出。注意不要只看能不能跑通,要看"重试次数"和"输出体积"——评论区有开发者实测,Flash 版初答经常出错、要靠自我纠正把结果磨出来,输出体积是 Pro 版的五倍;Pro 版虽然单价高,但"一次到位"的比例明显更高,算上重试成本反而更省。第二步,把提示词和上下文结构改造成"缓存友好"型:系统提示、工具定义、项目背景这类固定内容放在最前面且尽量不变动,因为缓存命中价只有正常输入的约一百二十分之一,这是 DeepSeek 性价比里最容易被人忽略、也最肥的一块。第三步,利用它同时兼容 Anthropic API 和 OpenAI Responses API 的特性,在你的现有框架里通过改 base_url 和 key 的方式接入,而不是重写调用层;多数情况下十分钟就能完成一次 A/B。第四步,趁涨价窗口未到,把高频、高 token 消耗的批量任务(内容生成、数据清洗、长文档处理)先切过来跑量,锁定当前的低成本结构。记住一个判断原则:纯 token 价比的是"每百万 token 多少钱",但真正决定月账单的是"每完成一个任务要花多少钱"——后者才该是你做选型时看的那个数。
泼一盆冷水:合规与政治风险
当然,也要泼一盆冷水。企业级客户对"中国模型"的政治风险顾虑是真实存在的——评论区里不止一人提到,美国的联邦承包商、金融机构很可能在半年内被明令禁止使用这类模型,这是创业者在做选型时必须放进决策模型里的一个变量。好在市场上已经出现了一批在欧美本地部署、专供 DeepSeek/Qwen/Kimi 模型、且完全兼容 Anthropic API 的托管服务,需要合规的方案并非没有。
一句话总结:当开源模型把性能和价格的剪刀差同时拉满,最大的受益者不是模型公司,而是那些敢用、会算账的独立开发者和一人公司。你的对手还盯着那几家大厂的 API 价目表,而你已经在用十分之一甚至六十分之一的成本,跑出接近前沿的效果。这一局,账要算在缓存上,机会要抓在涨价前。
本文由AI辅助创作,经人工审核编辑发布
更多一人公司案例与工具,微信搜索「AI创业内参」关注我们