跳转到主要内容

778 含有标签「llm」

Posts tagged "llm" on TianPan.co.

查看所有标签

·tian

Token 账单漂移:当你的追踪日志与供应商发票不一致时

每个在托管 LLM 上构建产品的团队最终都会发现,其追踪日志中的 Token 计数与月度发票并不匹配。这种差距很少是因为欺诈,而是一个由六个复合原因导致的结构性测量问题。

llm
finops
observability
tokens
+1
·tian

《智能时代》逐章解读:这本 2004 年的著作预言了现代 AI 的半壁江山

逐章深度解读杰夫·霍金斯的经典著作《智能时代》——探讨它在“预测即认知”方面的先见之明,分析它在规模化扩展(Scaling)上的失算,以及为什么在 2026 年,它依然是我理解 Transformer 行为最清晰的思想模型

insider
ai-engineering
neuroscience
llm
+2
·tian

评估天花板:当你的黄金测试用例失去区分度时

一旦每个候选模型在相同的测试用例上都获得了 95+ 的分数,你的评估套件就不再具备任何衡量价值 —— 是尺子不再适用,而不是被测平台的问题。

insider
ai-engineering
evaluation
llm
+2
·tian

评估选择偏差:为什么你的测试集会对那些导致用户流失的失败视而不见

从生产链路中更新的评估集继承了幸存者偏差:遭遇最严重失败的用户已经离开,并停止生成链路。分数在攀升,而留存率在下降。以下是如何打破这一循环的方法。

insider
evals
llm
agents
+2
·tian

LLM 提示词中 “现在” 的五种定义

每个 LLM 提示词中隐藏的五层隐性时间 —— 以及为什么当请求被重放、批处理或针对固定快照进行评估时,这些层级会产生无声的冲突。

llm
prompt-engineering
rag
observability
·tian

流式推理中的海勒姆定律:节奏、停顿和中间 Token 是未成文的契约

当更换模型虽然保留了结构化输出 schema,但改变了 Token 节奏、停顿模式和中间表述时,你实际上发布了一个破坏性变更,违反了一个你从未正式定义的契约。

insider
ai-engineering
llm
streaming
+2
·tian

采样漂移:当 Temperature 和 Top-P 变成团队内部的“口头传说”

生产环境中的采样配置往往堆积了大量未经记录的 Temperature、Top-P 和惩罚项数值。当初设置这些参数的理由早已模糊,但其影响却在不断叠加。本文介绍一种捕捉此类问题的工程规范。

llm
sampling
prompt-engineering
ai-engineering
+1
·tian

语音智能体轮次切换:重塑架构的 250 毫秒门槛

200–300 毫秒的轮次转换窗口迫使语音智能体采用实时架构:流式流水线、语义端点检测、猜测性生成以及插话处理。

ai-engineering
voice-agents
latency
real-time-systems
+1
·tian

标注员校准差距:当人类评分者悄然失去一致性时

在人类评估项目进行六个月后,评分者间一致性指标实际上是三个不同隐性标准的加权平均值。模型没有发生漂移 —— 而是测量工具发生了漂移。

insider
evals
human-evaluation
llm
+2
·tian

你的评估套件就是你拒绝编写的产品需求文档

PRD 中模糊的形容词(如 “有帮助” 和 “简洁”)在模型面前很难生存 —— 评估套件才是这些决策真正落地的场所。请将评估视为产品规格,而非仅仅是测量工具。

insider
ai-engineering
evals
product-management
+2
·tian

冰封提示词:当你的团队不敢修改一个仍然奏效的系统提示词时

一个没人敢动的 4,000 token 系统提示词并非稳定,而是债务。本文探讨提示词如何演变为“冰封”状态、为何迭代会因此陷入僵局,以及如何通过考古与评估规范来解冻它们。

llm
prompt-engineering
technical-debt
ai-engineering
+1
·tian

隐藏的 SDK 重试机制:为什么你付了两倍的钱却浑然不知

主流 LLM SDK 默认附带两次自动重试。如果在调用侧再叠加一层重试,当提供商出现短暂故障时,单个请求可能会扇出为九次推理调用 —— 这在你的追踪日志中难以察觉,却会实实在在地体现在账单上。

insider
llm
reliability
cost
+2
显示第 145–156 篇,共 778 篇