PenguinHarness
Agent 的构建与改进

工作背景
根据具体任务需求交付 Agent,
日常更多使用 Dify 等平台。
日常更多使用 Dify 等平台。
探索方向
探索 Dify 之外的实现方式,
进一步提高 Agent 交付效率。
进一步提高 Agent 交付效率。
接触和了解 RSI
Agent 如何通过评测与迭代持续改进?
Agent 如何通过评测与迭代持续改进?
调研中看到的 PenguinHarness
Prism-Shadow / penguin-harness★ 2,075
查看 GitHub 仓库 ↗Stars · 截至 2026-09-11
通用 Agent 框架
接入模型、调用工具,
完成编码、数据处理等任务。
面向特定任务,构建并改进 Agent
根据需求创建 Agent,建立评测,
再通过 RSI(递归自我改进)
迭代 Agent 的定义。
接下来,从这个项目入手,
理解 RSI 的具体设计与实现。
理解 RSI 的具体设计与实现。
PenguinHarness 如何定义 Agent?
Agent 的定义保存在 Agent State 中,
主要包括以下文件与资源。
RSI:两个阶段与四种职责
两个阶段都委派评测
启动任务返回产物与 Trace
构建者:把需求变成可评测的 Agent
构建者通过两项 Skills,
先定义 Target,再建立检验方法。
执行与评价如何分工
组织者 → 评测者 → Target
职责不同,接收的信息也不同。
优化者:找出问题,修改后再评测
改进的是 Target 的 State;
Benchmark 在优化期间保持不变。
对 Agent 交付工作的启发

后续关注:EvoTest 等新架构
通过执行者与改进者,在多次尝试之间
调整 Agent 的配置。
继续了解不同的改进架构
目前刚开始接触这一领域,
接下来希望结合 EvoTest 等工作,
拓展对 Agent 设计的认识。
后续想进一步理解
哪些内容可以被优化?
如何判断每轮修改是否有效?
设计预览