·tian
稀疏奖励陷阱:为什么长程智能体在演示中表现出色,却在生产环境中崩溃
稀疏奖励使得长程智能体训练变得异常困难 —— 智能体能通过演示,但在边缘案例中失败。本文深入解析信用分配失败、后验重标记、步骤级代理奖励以及生产级训练流水线设计。
reinforcement-learning
ai-agents
training
reward-engineering
·tian
智能体如何自我学习:闭环自我提升架构
一份关于“生成-尝试-验证-训练”循环的实践指南:探讨代码可验证奖励如何取代人类标注,为什么自对弈架构能让任务成功率翻倍,以及在闭环训练产生收益前可能导致其失败的三种模式。
ai-agents
reinforcement-learning
llm
self-improvement
+1