跳转到主要内容

778 含有标签「llm」

Posts tagged "llm" on TianPan.co.

查看所有标签

·tian

被你的模型视为“约束性判例”的 Few-Shot 示例

Few-shot 示例并非中立的演示 —— 它们是“判例法”。模型会通过表面 Token 绑定到最接近的示例,并继承其约束,从而输出评估套件无法察觉的、充满自信的错误答案。

insider
llm
prompt-engineering
evals
+1
·tian

JSON Schema 校验通过了,但下游消费者因语义漂移拒绝了你的输出

JSON Schema 验证的是数据的形状而非含义。当 LLM 升级导致在符合 Schema 的情况下数值分布发生偏移时,下游消费者会遭遇崩溃,而生产者的监控面板却依然显示正常。

insider
llm
structured-outputs
contract-testing
+2
·tian

供应商移除的 Logprobs 字段如何静默地破坏了你的置信度路由

一个不再升级低置信度回答的置信度路由,导致该问题的供应商静默层级变更,以及响应结构契约、群体级告警和针对错误故障模式编写的回退机制是如何共同掩盖问题的。

insider
llm
observability
api-contracts
+2
·tian

供应商上调 max_tokens 默认值,导致你的尾部响应长度翻倍

一家 LLM 供应商悄悄调高了 max_tokens 的默认值,导致你的 p99 输出长度在一夜之间翻了一倍。那些你没有显式传递的参数,往往就是背后发生变化的配置 —— 本文将介绍如何停止继承那些你无法控制的默认设置。

insider
llm
api-design
production
+2
·tian

模型指标卡的基准测试:当你的合同引用该数字时,其方法论已发生偏移

基准测试数字是协议下的测量结果,而协议是由你的供应商控制的。请锁定方法论,或在合同中规定使用你自己的评估套件。

insider
llm
benchmarks
procurement
+2
·tian

供应商将你的模型标识符重定向到特定租户的微调模型,而其他人使用的却是基础模型

如果将 LLM 模型标识符视为权重的名称而非路由决策的标签,那么供应商可能会在评估套件仍保持“绿色”通过状态时,静默地将你的租户从微调模型切换回基础模型,导致客户最先察觉到问题。

insider
llm
evals
observability
+2
·tian

OpenTelemetry 尾部采样器丢弃了复盘最需要的 LLM Span

尾部采样(Tail-based sampling)是针对请求-响应世界而优化的,在那里,200 OK 和“值得保留”几乎是一回事。然而,LLM 系统打破了这一约定——而你最需要的追踪记录,往往正是你的采样器配置为丢弃的那一个。

observability
llm
opentelemetry
tracing
+1
·tian

系统提示词提供的人格,模型每次都会以同样的方式选择

当你的系统提示词要求模型在不同人格之间做出选择时,模型的训练先验决定了结果——在实验平台察觉到之前,你的 A/B 测试分支就已经坍缩了。

insider
llm
ab-testing
experimentation
+2
·tian

那个保护了日志却让模型泄露输出结果的 PII 脱敏器

仅针对输入的 PII 脱敏器只是半个控制措施。一旦模型具备了生成能力,输出路径就变成了你在审查中从未提及的泄露面。

privacy
llm
agents
security
+2
·tian

那些悄然成为你唯一评测集阅读者的提示工程师

你的评测集只是一个文件,而使其具备可读性的判断力却存在于某个工程师的脑海中 —— 本文将探讨这种巴士系数如何在他们离职后才显现出来。

insider
evals
ai-engineering
team
+2
·tian

那些悄悄将你的高级流量路由到 Haiku 的供应商自动路由器

通过供应商的 'auto' 别名减少 34% 的开支看起来像是一场胜利,直到你流量最高的界面的客户满意度连续两个季度下滑 —— 而批准此次上线的评估流程甚至从未见过路由器重定向到 Haiku 的那些提示词。

insider
llm
model-routing
cost-management
+1
·tian

被反向代理剥离的 SSE Keep-Alive,以及你支付了两次费用的 Prompt

LLM 流式响应看起来像是从模型到用户的通畅管道 —— 直到一次 35 秒的工具调用导致反向代理断开连接,你的客户端针对无状态 API 重试整个 Prompt,最终用户的账单为同一个响应支付了两次费用。

insider
ai-engineering
llm
observability
+2
显示第 61–72 篇,共 778 篇