Orca 又一轮 DeepSeek V4 适配复盘:重新理解 Agent Harness
· 20 分钟阅读
本文从 Orca 一次真实 DeepSeek V4 适配出发,解释 DeepSeek-native Coding Agent 为什么需要沿着 provider 行为、tool calling 语义和 agent runtime 一起调整。文章复盘 update_plan 布尔状态归一化、reasoning_content 工具回放、DeepSeek strict mode、update_goal、glob anyOf schema、max_tokens、空响应重试、工具数量上限、系统提示瘦身和 real API 探针。
一次 Orca 卡死反馈背后:真正要修的不是某个超时
· 17 分钟阅读
本文复盘 Orca 一次真实卡死反馈:从 session 日志定位长会话压力,到参考 Codex 和 Claude Code 的上下文处理方式,再到实现 ranged read_file、grep/glob 分页、去除旧 reasoning replay、soft compaction、tool output micro-compaction、TUI 状态提示和回归测试。
Agent 从 Demo 到真实业务,差的不是模型,而是工程秩序
· 15 分钟阅读
这篇文章从真实 Agent 项目落地的常见问题出发,拆解为什么 Demo 能跑但一接业务就乱:RAG 检索不准、工具调用失控、上下文变长、失败无法兜底、成本不可控。文章给出一套从任务契约、工具治理、Verifier、状态管理到评估集的工程化处理方式。
Harness Engineering 的本质:给智能一套能交付的工程外壳
· 11 分钟阅读
这篇文章从 Coding Agent 的真实执行场景出发,解释 Harness Engineering 的本质:它不是 Prompt Engineering 的升级版,而是围绕 Agent 执行生命周期建立的一套权限、环境、状态、观测、验证和恢复系统。
Loop Engineering 的本质:让 Agent 一轮一轮走向交付
· 18 分钟阅读
这篇文章从一个运行超过 1 天 19 小时的 Codex goal 任务出发,解释 Loop Engineering 为什么不是 while true,并结合 boss-skill 与 orca 两个实践,拆解 Agent 长任务闭环里的目标、状态、验证、失败恢复和退出条件。
为什么 Harness Engineering 最近突然变热了?
· 18 分钟阅读
从 AI Coding Agent 的落地现实出发,解释 Harness Engineering 为什么会在最近迅速升温。文章从定义、背景、关键能力、与 Tool Calling 的区别,以及它对 Agent 产品竞争格局的影响几个角度展开,讨论为什么当模型能力逐渐拉平后,真正决定 Agent 可用性的,往往是它背后的执行系统工程。