Published on

HarnessX产品失败复盘

Authors
  • avatar
    Name
    narclee
    Twitter

差不多一周之前,我有一个Insight,看到这些团队、企业自己实现的Agent,效果很差劲,为什么不让他们用Claude Code、Codex等SOTA的Coding Agent呢?

所以我想只需要让用户构建好上层的Harness,就能做到这件事情,可以deploy,就能做好这件事情。

初步的规划,一个yaml文件,就能解决一个场景,比如一个Code Review的工具,在我们的Harness建模下,应该是这样一个结构

id: code-review
version: 0.3.0
description: |
  Multi-Agent demonstration: a primary reviewer agent decides when to
  delegate to a summarizer peer. The peer returns its summary as the
  delegate_to tool result.
harness:
  agents:
    reviewer:
      id: reviewer
      provider: claude-code
      model: sonnet
      adapter:
        kind: claude-code
        timeout_seconds: 300
      system_prompt: reviewer-prompt
    summarizer:
      id: summarizer
      provider: claude-code
      model: sonnet
      adapter:
        kind: claude-code
        timeout_seconds: 30
      system_prompt: summarizer-prompt
  prompts:
    reviewer-prompt:
      type: system
      template: |
        Review the following diff and reply with a JSON array of findings.
        Each finding is { "file": string, "line": number, "severity": "info"|"warn"|"error", "message": string }.
        After you have the findings, call the `delegate_to` tool to hand
        them off to the summarizer agent for the final PR comment.
    summarizer-prompt:
      type: system
      template: |
        Summarize review findings into 3 bullets for a PR comment.
  session:
    mode: multi-turn
    agent: reviewer
  orchestration:
    strategy: multi_agent
    multi_agent:
      allowed_agents:
        - summarizer
      tool_name: delegate_to

我的架构设想是:Go控制面+Python worker进程运行时的,需要搭建Harness体系,load一个Harness Yaml的数据结构,MCP/Skills/Rules等,注入业务领域知识,去run这个agent,搭建了一套harness definiton的sdk/cli,以及自我进化的Harness(所谓的),可以eval score。

事实上并不是这样,我做下来变成了一个agent trace platform。

深夜失眠思考后:

  1. Claude Code需要一层上层Harness吗?Skills能不能解决这个问题?
  2. Harness半年后还Work么?

第一个问题:我想了又想,嗯,不需要,Skills/Rules,也就是Coding Agent本身运行时这套能力就够了,而质量差的Agent,没人会用,提升它们的能力毫无意义。 第二个问题:坦诚讲我不知道,可以简单分析一下现在Agent的几个没有被解决的几个问题:

  1. Transformer本身这套架构的问题,会导致漂移,往往忘记了最早要做的事情,所以harness、loop来了,目的是通过Agent运行时retry的逻辑,re inject cxt prompt,来纠偏。Harness有意义,至少不用重新推理一套样板间业务的代码怎么写。
  2. 长程任务的效果,我看AML-Application有人在做这件事情,当然seed可能也有,or其他公司。我思考后觉得不值得做,因为体感上现在的Agent长程任务本身很不错了,不值得雕花。
  3. Token会不会越来越便宜?不好说,至少短时间内,这个账单大家都很清楚,必须要裁员,比如我:就是一个即将被AI干掉的Frontend Engineer。那么我认为未来如何更高效地用Token、也就是推理成本降低会是一个方向,比如KV Cache的项目/业务在大模型这套业务下,是会work的,依旧work。
  4. Cloud Agent,AAAS Agent as a service,Harness as a service,本质是Paas/Faas -> Aaas,但这份钱只有大厂能赚、目前我的认知里还没找到一个夹缝生长的机会。

嗯,这一年做了太多产品,都是shit,ToC的、ToD的等,当然很大原因是执行成本太低,跑一晚上就能跑出来MVP。 但是反过来说明没有很好的评估,做调研,导致的。

未来Agent方向还能做什么?

我想大概率不是一个Agent,而是一个小方向的问题被解决。 一个又一个方向的小问题被解决,也就是会是一个短周期的业务,这个问题解决了,马上要去解决下一个问题,闪转腾挪,可能是一个方向。

Infra可能更关键,也会有更多机会,比如youyuxu做的VoidZero、Vercel、Cloudflare等公司,更快的publish、开发体验、AI Friendly产品,才能走的更远。