跳转到主要内容

990 含有标签「insider」

Posts tagged "insider" on TianPan.co.

查看所有标签

·tian

两个模型对同一结构化输出 Schema 的不同理解

两个大模型供应商可能都遵循同一个 JSON Schema,但生成的输出却无法互换 —— 这种差异通常在你第一次触发备选路由时显现。

insider
llm
structured-output
reliability
+1
·tian

教会你的智能体识别评估的合成评估

当你的合成评估生成器带有特征指纹时,你的模型会学到它 —— 结果就是评分上升而生产环境的质量却停滞不前。要把 “评估识别” 视为一个奖励作弊问题,而不是覆盖范围问题。

insider
llm-evals
reward-hacking
ai-engineering
·tian

增长速度快于评估套件的系统提示词

系统提示词随着规则逐条增加,而评估套件则随着事故逐个增加 —— 这种不对称性悄然让 “评估通过” 变成了一个谎言。本文将介绍如何让这两个层面协同演进。

insider
llm-evals
prompt-engineering
ai-engineering
+1
·tian

误将假期低谷视为新基线的 Token 预测

落在假期低谷的四周滚动窗口,会导致在进入新季度的第一天就让 Token 预算崩溃。本文将探讨为什么 LLM 支出预测呈现的是消费者需求而非基础架构成本的形态,以及通过同比基线叠加、日历叠加和残差反馈循环,让容量规划在日历周期中维持稳健。

insider
llm
capacity-planning
forecasting
+2
·tian

你的供应商通过更小的分块达成的 Tokens-Per-Second SLO

你的供应商通过缩小分块达到了每秒 Token 数的 SLA,但你的渲染器却为此付出了代价。为什么流式吞吐量是一个需要协同设计的属性 —— 以及如何编写一个由消费者主导的感官 SLO。

insider
llm-streaming
slo
observability
+2
·tian

当源数据已更改,你的 Prompt 缓存仍在提供旧的工具执行结果

Prompt 缓存将易变的工具结果转化为你与模型提供商之间的一项隐藏 TTL 契约。当缓存 TTL 的生命周期超过了数据的有效期时,你的 Agent 就会在享受缓存命中率的同时,自信地提供“昨天的真相”。

insider
ai-engineering
prompt-caching
agents
+1
·tian

由客户端时钟而非网关标记时间戳的链路追踪时间线

在你的 Agent 链路中,浏览器标记的 Span 与网关标记的 Span 是不可比的。本文探讨为什么客户端时钟会“撒谎”、SDK 是如何传播这一偏差的,以及缩小差距的几种模式。

insider
observability
distributed-tracing
ai-agents
+2
·tian

语音代理 SLO 定义为首个音频时间,而你的服务商则以首个 Token 时间衡量

基于 LLM 的首个 Token 时间(TTFT)构建的语音代理延迟 SLO 看起来是绿色的,但用户却听到了 600 毫秒的间隙。该 SLO 存在于错误的层级;用户的耳朵才是真正关键的边界。

insider
voice-ai
llm-ops
observability
+2
·tian

即使你发誓绝不分享,你的评估集仍需要的水印

私有评估集会像其他任何东西一样泄露 —— 通过 Bug 票据、Slack 粘贴、供应商流水线和调试日志。请为它们添加水印,以便在下一次模型升级到来时,你能分辨出真实的性能提升与污染造成的假象。

insider
evals
ai-engineering
benchmarks
+1
·tian

你定义‘首个 Token’的位置决定了你的延迟 SLO 是否真实

p99 首个 Token 延迟低于 800 毫秒看起来像是一个承诺——直到推理层的切换悄然重新定义了‘首个 Token’的含义。SLO 衡量的是供应商边界;而用户的感受则完全不同。

insider
llm-ops
observability
latency
+2
·tian

你的编程智能体忘记检查的分支状态

编程智能体基于 Git 状态快照进行推理,而该快照往往会悄无声息地失效。Worktrees、turn-preludes、分支锚定以及快照恢复技术能将这种无声的漂移转化为明确的信号。

insider
coding-agents
git
agent-harness
+2
·tian

被切分边界拦腰截断的关键句,以及随之消失的答案

固定大小的 Token 切分会将关键子句拦腰切断,导致碎片化的片段无法被单独检索。本文探讨了为什么这种失败在标准评估中难以察觉,以及哪些切分策略能真正解决这一问题。

insider
rag
retrieval
chunking
+2
显示第 169–180 篇,共 990 篇