跳转到主要内容

834 含有标签「ai-engineering」

Posts tagged "ai-engineering" on TianPan.co.

查看所有标签

·tian

反思安慰剂:为什么“计划-反思-重新计划”循环最终总是回到第一版

单模型反思循环大多只会在增加 Token 账单的同时,对第一版计划进行修修补补。本文将探讨如何衡量这种“安慰剂效应”,以及什么样的方法才能真正生成具有差异化的计划。

ai-agents
llm
planning
ai-engineering
+1
·tian

右缘准确率下降:为什么上下文窗口的最后 20% 是个陷阱

填满 LLM 宣称的上下文窗口会导致右缘准确率崩溃 —— 这是继“迷失在中间”之后的一种失效模式。本文包含基准测试、按任务划分的安全裕度以及提示词修复方案。

insider
llm
context-window
prompt-engineering
+2
·tian

橡皮图章式崩溃:为什么 AI 编写的 PR 正在掏空代码审查

当代码仓库中大部分的 diff 最初都源自模型输出时,审查者往往会陷入“看起来没问题”的心理锚点,从而漏掉那些没有明显语法异味的语义错误。本文探讨了应对措施、管理层必须回答的披露问题,以及会在六个月后集中爆发的事故曲线。

insider
ai-engineering
code-review
engineering-leadership
+1
·tian

语义缓存是安全隐患,而非性能提升

语义缓存能在不到一毫秒的时间内返回另一个用户的响应,而你的命中率仪表盘还会因此变绿。本文探讨如何通过缓存键设计、溯源封装和审计追踪,从架构层面防止跨用户数据泄漏。

insider
llm
security
caching
+2
·tian

发布并固定版本之陷阱:模型版本的稳定性如何演变为弃用技术债

固定模型版本虽然换取了短期稳定性,却在悄然积累弃用技术债。通过定期的重新验证、针对下一代模型的漂移监控以及双轨提示词组合,你可以将模型迁移从“救火行动”转变为日常运营。

llm-ops
ai-engineering
model-migration
evals
+1
·tian

合成偏好陷阱:AI 排序的 RLHF 如何让你的模型悄然漂移到“老师”的口吻中

合成偏好数据看起来像是一顿免费午餐 —— 直到你的产品开始悄无声息地听起来和你用来训练它的“老师”模型一模一样。这是一份关于如何识别、衡量和限制 RLHF 风格漂移的实战指南。

rlhf
fine-tuning
llm-training
ai-engineering
+1
·tian

你的工具描述是提示词,而非 API 文档

工具规范文本是模型在决定何时调用之前读取的提示词。请像对待提示词一样对待它——提供具体的用例、反面示例、同类工具辨析——而不是像对待 OpenAPI 文档那样。

ai-engineering
tool-use
function-calling
prompt-engineering
+1
·tian

验证器陷阱:事后防御如何从内部腐蚀你的提示词

你给 LLM 增加的每一个输出验证器听起来都像是一个修复方案。随着时间的推移,这些修复会将你的提示词重写为一份防御性合同,从而剥夺模型的推理能力。本文将介绍如何审计并修复这种损害。

insider
llm
prompt-engineering
ai-engineering
+2
·tian

AI 更新日志问题:为什么你的提示词更新正在破坏其他团队的工作

提示词编辑、模型升级和工具架构调整会在不改变代码的情况下改变行为。这里有能让消费团队保持畅通的更新日志格式和版本控制契约。

insider
ai-engineering
prompt-engineering
versioning
+2
·tian

在写第一个 Prompt 之前,先设计好你的 Agent 状态机

先写 Prompt 再拼接逻辑的直觉,会导致 agent 在简单测试中正常运行,却在生产环境中神秘失败。先设计状态机,会改变一切。

insider
ai-engineering
agents
architecture
+1
·tian

归因鸿沟:如何将用户投诉追溯到具体的模型决策

当用户反馈AI给出错误建议时,大多数团队无法重建是哪个模型版本、哪个提示词或哪段检索上下文产生了该输出。本文介绍让AI投诉可追查的日志方案、追踪传播和采样策略。

llm-observability
ai-engineering
distributed-tracing
rag
+1
·tian

AI 代码审查实践:自动化 PR 分析真正能发现什么,又持续遗漏什么

AI代码审查工具在拼写错误和空指针检查方面的准确率为70-85%,但遗漏语义错误的概率高达85-90%。本文提供实证数据分析,并介绍避免自动审批沦为橡皮图章的工作流设计。

insider
code-review
ai-engineering
developer-tools
+1
显示第 493–504 篇,共 834 篇