1. 项目背景与核心思路
作为一名长期奋战在AI应用开发一线的工程师,我深知prompt调优的痛苦。就像在黑暗房间里摸索电灯开关,你永远不知道下一个微调会让效果变好还是更糟。最近看到Andrej Karpathy的autoresearch方法被Ole Lehmann应用到Claude Code的skill优化上,pass rate从50%提升到90%,这让我眼前一亮。
当时我正在调试brain-search这个skill——它能调用Brave Search API返回结构化搜索结果,但输出质量极不稳定。有时完美呈现来源链接和清晰结构,有时却变成杂乱无章的文字堆砌。手动调了四五版prompt后,效果依然像老式收音机的信号,稍微一动就"飘"了。
autoresearch的核心思想很简单:把"假设-实验-评估"的科研流程自动化。在机器学习中,它自动调整训练代码;在prompt工程中,它自动迭代文本内容。这本质上是一种进化算法:生成变异、评估适应度、保留优势变种。我决定把这个方法通用化,做成一个能优化各类AI skill的独立工具。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 系统设计与关键技术实现
2.1 架构选型与核心决策
与Lehmann的方案相比,我做了三个关键改进:
脚本驱动替代对话驱动
传统方法需要工程师与AI持续对话,像教小孩写字一样手把手指导。我的方案将其转化为一个命令行工具:
bash复制python autoresearch.py \
--target skills/brain-search/SKILL.md \
--evals eval.json \
--provider minimax \
--max-experiments 10
这种设计让优化过程可以后台运行,解放工程师的时间。就像把手动挡换成自动驾驶,设定好目的地就能放手。
混合评估策略
评估标准分为两类:
- 规则型评估:用正则表达式检查URL格式、字数统计等确定性指标
- LLM评估:当需要语义理解时,让另一个AI作为裁判
这就像考试设计:选择题保证评分效率,主观题测量深层能力。以下是eval.json的示例:
json复制{
"test_inputs": ["search for latest AI agent
