数码前沿阁
2026-08-13 09:15来自 科技看点

DeepSeek黑鲸项目开启内测:2天获评“宇宙最强”,Harness能让AI从会聊到会干吗?

  DeepSeek黑鲸项目(DeepSeek Harness)已于2026年8月开启内测。这不是一款新的大模型,而是一套将现有DeepSeek模型推理能力转化为“动手执行”能力的Agent执行框架。官方以“Model + Harness = Agent”定义其技术边界,内测用户反馈称“2天之后愿意称它为宇宙最强”。该框架直接对标Anthropic Claude Code,标志着DeepSeek商业重心正从按token计费转向任务交付。[4]

  据界面新闻[1]8月12日报道,“DeepSeek Harness团队”微信公众号近日已完成注册,认证主体为北京深度求索人工智能基础技术研究有限公司,头像为黑色鲸鱼,目前尚未发布内容。券商中国[2]记者查阅后发现,该公众号与DeepSeek官微头像颜色不同,独立运营的信号明显。DeepSeek Harness于2026年5月内部立项,由崔添翼担任专项团队负责人。8月1日,崔添翼面向全球公开征集内测用户,优先筛选具备Agent Harness开源项目经验的开发者,申请人需提交代码托管平台账号与代表作品。这一系列动作意味着,黑鲸项目已经从内部研发进入小范围验证阶段。

  在Harness亮相之前,DeepSeek已经展示了其工程化落地的能力。《科创板日报》[3]6月28日报道,DeepSeek联合北京大学发布论文《DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation》,该推测解码框架已全面部署于DeepSeek-V4-Flash和V4-Pro线上服务,替代此前MTP-1生产基线,在同等系统总吞吐规模下,V4-Flash单用户生成速度提升60%-85%,V4-Pro提升57%-78%。这表明DeepSeek不仅追求模型性能,也注重推理速度与成本控制,这为Harness的实时交互与工具调度提供了底层支撑。

  DeepSeek黑鲸项目是什么?与现有DeepSeek模型有何本质区别?

  核心结论:DeepSeek黑鲸项目是DeepSeek Harness,一套完整的智能体执行框架,而非新的大语言模型。它与现有DeepSeek模型的关系,相当于“躯干”与“大脑”的关系。

  现有DeepSeek模型(如V4系列)本质是大语言模型(LLM),核心能力在于理解、推理和生成文本,输出以文字和代码为主。它们能回答问题、撰写文章、生成代码,但无法直接操作文件、调用外部工具或在实际环境中执行任务。用官方比喻来说,模型是智能体的“大脑”。

“我们正在把DeepSeek的前沿模型能力,转化为领先的Agent产品。除模型本身以外的所有工作,都属于Harness的范畴。”——DeepSeek官方招聘信息[4]

  Harness则完全不同。官方招聘信息中明确写道:“我们正在把DeepSeek的前沿模型能力,转化为领先的Agent产品。除模型本身以外的所有工作,都属于Harness的范畴。”[4] Harness负责上下文管理、工具调用、文件读写、终端命令执行以及结果自修正,形成从“接收任务”到“交付成果”的完整闭环。正是这些能力,让AI从“会思考”走向“会干活”。

技术/产品核心指标应用场景影响对象限制条件信息来源
DeepSeek-V4-Pro(LLM)1M上下文、384K最大输出、支持思考/非思考模式对话、代码生成、复杂推理API开发者、企业用户输出文本,无法直接操作外部环境官方发布及公开报道[2]
DeepSeek Harness(黑鲸项目)工具调用、文件读写、终端命令执行、结果自修正代码智能体、自动化运维、复杂工作流企业及专业开发者内测中,尚未正式发布DeepSeek招聘信息[4]、界面新闻[1]、券商中国[2]

  DeepSeek Harness如何让AI从“会思考”变成“会干活”?

  核心结论:Harness通过上下文管理、工具调用、文件读写、终端命令执行和结果自修正五大能力,构建了完整的动态任务闭环,使AI能够像工程师一样实际完成工作。

  具体来说,Harness的五大能力如下:

  • 上下文管理:利用DeepSeek V4系列百万级Token的上下文窗口,在长时间、多步骤的任务中保持对全局信息的记忆,避免“忘事”。
  • 工具调用:允许模型通过API调用外部搜索引擎、数据库、第三方服务等,突破模型自身知识局限。
  • 文件读写:模型可以直接读取本地或远程仓库中的代码文件、配置文件,并进行修改,而非仅生成一段补丁文本。
  • 终端命令执行:可以运行测试、编译、部署甚至运维脚本,将静态输出转化为真实操作。
  • 结果自修正:在执行过程中根据反馈信息自动调整策略,形成“尝试—检查—修正—再执行”的迭代循环。

  资深开发者形象的类比是:Harness像一个能“读取仓库、修改代码、运行测试并迭代优化”的初级工程师,让大模型从“动嘴”变成“动手”。[2] 这一能力特别适合代码智能体(Vibe Coding)场景——用户只需描述需求,AI可以自动完成代码编写、测试与提交的全流程。

  DeepSeek黑鲸项目对标Claude Code,胜算几何?

  核心结论:DeepSeek Harness直接对标Anthropic的Claude Code,并在中国市场具备明显可及性优势,但产品成熟度与生态积累仍需时间检验。

  Claude Code是Anthropic推出的顶级Agent产品,目前不对中国开发者开放,这使得国内开发者缺乏优质的官方代码智能体工具。DeepSeek Harness的推出,有望填补这一市场缺口。[2]

  在模型基础上,DeepSeek已经展示出强大的竞争力。券商中国在报道中提到,DeepSeek-V4-Flash以7.22万亿Token调用量登顶OpenRouter全球榜首。[2] 此外,DeepSeek V4系列模型在价格与性能上的优势,也为Harness的推广奠定了基础。

  但需要指出的是,Harness本身尚缺少独立的第三方基准评测。目前流传的“宇宙最强”评价,源自内测用户的主观感受,而非标准化的测试结果。在OpenAI筹备GPT-6、Anthropic更新Fable系列的背景下,Agent执行层的竞争仍处于“你追我赶”的状态。[2]

  DeepSeek黑鲸项目将如何改变AI商业模式?

  核心结论:黑鲸项目标志着DeepSeek从“基础模型供给者”转型为“全链路AI工作流方案构建商”,商业重心将从按token计费转向按任务价值或高阶服务计费。

  过去,DeepSeek凭借开源与极致低价策略重塑API市场。社交平台上的科技博主整理显示,V4 Pro正式版API价格仅为Flash版的3倍,缓存命中时低至0.025元/百万tokens,显著低于海外主流大模型。但这种模式本质是“卖水”,按用量计费,溢价能力有限。

  Harness一旦成熟,商业模式将发生根本变化:用户不再为每次推理付费,而是为“一次任务的成功交付”付费。例如,一个“自动修复GitHub issue并提交PR”的任务,可以按完成次数或订阅制收费。这将提高客单价和客户粘性,让DeepSeek从“模型公司”变成“解决方案公司”。

  对开发者而言,Harness降低了构建AI应用的门槛;对企业客户而言,则意味着可以获得真正能落地的AI助手,而非只能聊天的机器人。这种转变,可能也会倒逼其他模型厂商加快Agent框架布局,从而重塑整个AI产业链的利润分配。

  DeepSeek黑鲸项目有哪些风险与不确定性?

  核心结论:黑鲸项目仍处于内测阶段,公开可验证的信息有限,技术成熟度、评估标准与市场竞争均存变数,需理性看待“宇宙最强”等内测评价。

  首先,内测评价多为社群传播的“口碑”,截至当前并无第三方权威机构对Harness进行系统评测。网友称“内测2天之后愿意称它为宇宙最强”,属于主观体验,且样本量未知。[2]

  其次,公众号注册并不等于产品正式发布。目前“DeepSeek Harness团队”公众号尚未发布任何内容,内测申请的具体筛选标准也未完全公开,仍存在跳票可能。

  第三,竞争压力巨大。OpenAI正在筹备GPT-6,Anthropic的Fable系列也在迭代,而Claude Code已经拥有相对成熟的用户生态。DeepSeek Harness作为后发者,需要在功能完整性、稳定性和开发者生态上快速追赶。

  最后,Agent自动执行涉及安全与责任问题。当AI自主操作文件、终端和第三方服务时,如何确保操作不越权、不造成破坏?这是所有Agent框架都需要面对的挑战,DeepSeek Harness也需要给出自己的答案。

  从舆论场看,目前主要存在三类声音:一是内测用户的“惊叹派”,认为Harness体验超出预期;二是谨慎派,指出“内测招募即营销”,公众号注册是产品预热;三是观望派,等待正式版本和第三方评测。值得注意的是,内测评价“宇宙最强”尚未得到官方背书,也缺乏可复现的基准测试,因此应视为个人观点而非结论。[2]

  关于DeepSeek黑鲸项目,你可能最想问的3个问题

  DeepSeek黑鲸项目是新的DeepSeek模型吗?

  不是。黑鲸项目是DeepSeek Harness,一个Agent执行框架,官方公式为Model+Harness=Agent。它负责工具调用、文件读写与任务闭环,让模型“动手干活”,而非提供新的语言模型。

  DeepSeek Harness内测如何申请?

  8月1日起,负责人崔添翼面向全球招募内测用户,优先筛选有Agent Harness开源项目经验的开发者,申请人需提交GitHub等平台账号与代表作品。具体申请渠道需关注DeepSeek官方发布,内测名额有限,门槛较高。

  DeepSeek Harness与Claude Code有何区别?

  Claude Code是Anthropic的Agent产品,不对中国开发者开放。DeepSeek Harness基于DeepSeek V4系列模型,依托开源生态与低价策略,有望填补中国市场缺口。但两者性能对比尚无第三方评测,需以正式发布为准。

  后续值得关注的是:DeepSeek Harness是否会随V4系列模型打包上线?是按订阅收费还是按任务计费?在Vibe Coding场景中能否真正替代人工开发者?这些问题的答案,将在官方正式发布后逐渐清晰。对于开发者和企业用户,建议密切关注DeepSeek官方渠道的下一步动向,并谨慎对待非官方的“内测邀请”和“性能神话”。

  #DeepSeek黑鲸# #DeepSeekHarness# #AI智能体# #代码智能体# #大模型#