PENGUINHARNESS / 01

PenguinHarness

Agent 的构建与改进

手绘概念插画:用可替换的指令卡定义 Agent 的行为
工作背景
根据具体任务需求交付 Agent,
日常更多使用 Dify 等平台。
探索方向
探索 Dify 之外的实现方式,
进一步提高 Agent 交付效率。
接触和了解 RSI
Agent 如何通过评测与迭代持续改进?

调研中看到的 PenguinHarness

Prism-Shadow / penguin-harness★ 2,075
查看 GitHub 仓库 ↗Stars · 截至 2026-09-11

通用 Agent 框架

接入模型、调用工具,
完成编码、数据处理等任务。

面向特定任务,构建并改进 Agent

根据需求创建 Agent,建立评测,
再通过 RSI(递归自我改进)
迭代 Agent 的定义。

接下来,从这个项目入手,
理解 RSI 的具体设计与实现。

PenguinHarness 如何定义 Agent?

Agent 的定义保存在 Agent State 中,
主要包括以下文件与资源。

RSI:两个阶段与四种职责

两个阶段都委派评测 启动任务返回产物与 Trace

构建者:把需求变成可评测的 Agent

构建者通过两项 Skills,
先定义 Target,再建立检验方法。

执行与评价如何分工

组织者 → 评测者 → Target
职责不同,接收的信息也不同。

优化者:找出问题,修改后再评测

改进的是 Target 的 State;
Benchmark 在优化期间保持不变。

对 Agent 交付工作的启发

手绘插画:检视 Agent 的定义,通过评测再次改进

后续关注:EvoTest 等新架构

通过执行者与改进者,在多次尝试之间
调整 Agent 的配置。

阅读论文 ↗

继续了解不同的改进架构

目前刚开始接触这一领域,
接下来希望结合 EvoTest 等工作,
拓展对 Agent 设计的认识。

后续想进一步理解

哪些内容可以被优化?
如何判断每轮修改是否有效?