·tian
合理补全陷阱:为什么代码智能体会生成看似正确实则错误的代码
代码智能体生成的代码能够编译、通过Lint检查、看起来正确,但却在悄无声息地做着错误的事。这里揭示了训练目标为何从根本上导致这一问题,数据说明了什么,以及如何构建真正能发现问题的验证循环。
ai-engineering
code-agents
software-quality
llm
·tian
代码智能体中的束搜索:为什么贪婪生成是可靠性陷阱
在处理复杂任务时,贪婪单次生成会将代码智能体的可靠性限制在 20–30%。而树搜索探索策略 —— 包括束搜索、MCTS 以及带有执行反馈的结构化树搜索 —— 在不改变底层模型的情况下,能让相同问题的通过率提升 30–130%。
insider
code-agents
llm-inference
ai-engineering
+1