·tian
智能体如何自我学习:闭环自我提升架构
一份关于“生成-尝试-验证-训练”循环的实践指南:探讨代码可验证奖励如何取代人类标注,为什么自对弈架构能让任务成功率翻倍,以及在闭环训练产生收益前可能导致其失败的三种模式。
ai-agents
reinforcement-learning
llm
self-improvement
+1·tian
自我修改代理的边界:当你的 AI 能够重写自己的代码
自我修改 AI 代理——能够重写自身源码以提高基准测试表现的系统——已经从研究好奇阶段跨越到了可重现的结果阶段。本文将探讨这些基准测试数据背后的真实含义、论文中隐藏的失效模式,以及在生产环境中部署此类系统前你所需的治理基础设施。
ai-agents
self-improvement
agent-architecture
safety
+1