跳转到主要内容

990 含有标签「insider」

Posts tagged "insider" on TianPan.co.

查看所有标签

·tian

入职缺口:为什么新工程师需要三个月才能上手 AI 技术栈

AI 代码库承载着一种隐藏的领域知识税,使得原本三周的入职期延长到了三个月。解决方法是决策历史,而非架构图。

insider
ai-engineering
team-design
onboarding
+2
·tian

标注员校准差距:当人类评分者悄然失去一致性时

在人类评估项目进行六个月后,评分者间一致性指标实际上是三个不同隐性标准的加权平均值。模型没有发生漂移 —— 而是测量工具发生了漂移。

insider
evals
human-evaluation
llm
+2
·tian

审计追踪的不匹配:当用户、智能体和工具各有各的日志时

智能体技术栈生成的四种日志往往无法对齐。解决方案并非增加更多日志,而是在用户操作边界生成的事务 ID、统一的审计记录,以及根据合规需求(而非子系统)确定的保留周期。

insider
ai-agents
observability
compliance
+1
·tian

合规审查员作为评测编写者:为什么法律团队应该为你编写测试用例

合规审查员能发现工程评测系统性遗漏的 LLM 失败模式。将他们从文档审查环节移至回归测试套件中 —— 法律签署将转变为对每次提交时运行的固定测试用例的确认。

insider
ai-engineering
evals
compliance
+2
·tian

上下文膨胀:你无法用 Grep 搜寻的 AI 内存泄漏

长期运行的智能体对话会悄无声息地泄露 Token —— 二次增长的成本和性能下降隐藏在对话历史中。本文介绍如何监控、修剪和压缩上下文。

insider
ai-agents
context-engineering
observability
+1
·tian

跨渠道记忆:当你的智能体遗忘邮件上下文时

多端 AI 智能体在聊天、邮件、短信和语音之间割裂了记忆,导致用户收到自相矛盾的回答。本文探讨统一身份、写穿式存储以及上下文隐私。

insider
ai-agents
memory
architecture
+1
·tian

昼夜延迟:为什么你的 AI 功能在东部时间上午 9 点最慢

前沿模型的延迟遵循由他人流量决定的每日曲线。通过分时段队列、批量路由和负载感知故障转移,可以将这种“幽灵般的”性能退化转变为一个调度问题。

insider
llm-ops
latency
observability
+1
·tian

你的评估套件就是你拒绝编写的产品需求文档

PRD 中模糊的形容词(如 “有帮助” 和 “简洁”)在模型面前很难生存 —— 评估套件才是这些决策真正落地的场所。请将评估视为产品规格,而非仅仅是测量工具。

insider
ai-engineering
evals
product-management
+2
·tian

强制一致性偏见:当模型将你的意图向分布众数取整时

经过对齐的大模型会悄悄地将不寻常的请求向训练分布的众数取整。本文将探讨为什么标准评估会忽略这一点,以及捕捉这一现象的离模态约束方法。

insider
llm-evaluation
rlhf
instruction-following
+1
·tian

隐藏的 SDK 重试机制:为什么你付了两倍的钱却浑然不知

主流 LLM SDK 默认附带两次自动重试。如果在调用侧再叠加一层重试,当提供商出现短暂故障时,单个请求可能会扇出为九次推理调用 —— 这在你的追踪日志中难以察觉,却会实实在在地体现在账单上。

insider
llm
reliability
cost
+2
·tian

内部工具代理:当你杠杆率最高的 AI 功能却零客户时

面向客户的 AI 功能占据了大部分预算,但你公司中杠杆率最高的 AI 投资却是那个无人运维的内部 Slack 机器人。这里有背后的数学逻辑、失败模式以及捕捉这些价值所需的纪律性。

insider
ai-engineering
internal-tools
productivity
+2
·tian

负面提示词是代码异味:为什么系统提示词中的每个 “不要” 都是技术债

生产环境系统提示词中的每一个 “不要” 子句,都是对行为不匹配的补丁。跟踪负面提示词的密度,将每个否定项重构为正面规范,并将残留的否定项作为一种信号,表明提示工程可能并不是解决该问题的正确工具。

insider
prompt-engineering
llm
ai-engineering
+1
显示第 337–348 篇,共 990 篇