跳转到主要内容

778 含有标签「llm」

Posts tagged "llm" on TianPan.co.

查看所有标签

·tian

你的 Agent 读不懂的生产日志

把 agent 接入日志系统只是给了它访问权,不是理解力。真正的集成工作,是教它你的数据叫什么名字。

ai-agents
observability
logging
tool-design
+1
·tian

当评估指标全看“感觉”时,你的 A/B 测试无法区分两个模型

点击率无法区分用户是真心喜爱一个模型还是仅仅在忍受它。在你信任实验结果并据此选择模型之前,请先证明你的指标能够检测出你故意搞坏的模型。

insider
evaluation
ab-testing
llm
+2
·tian

提示词 Diff 隐藏了自身的爆炸半径

一个三个单词的提示词修改和一段三个段落的重写在文本 Diff 中看起来并无二致,但其行为后果却大相径庭。为什么提示词审查需要评估增量,而不是字符计数。

insider
prompt-engineering
llm
code-review
+2
·tian

用户终将学会忽略的置信度评分

LLM 回答旁边的置信百分比是一份你通常无法兑现的信任契约。在经历了几次失准的 90% 评分后,用户便学会了忽略这个测量计——而摆在面前的只有三种诚实的设计方案。

calibration
llm
ux
uncertainty
+1
·tian

填充式工具调用:当智能体在表演勤奋而不是真正干活

生产环境中的智能体不断发出对答案毫无影响的工具调用——烧掉 token、拖慢延迟、损害准确率。本文讲清楚填充式调用是如何从训练中长出来的、它真正的成本是多少,以及如何用反事实测量和调用预算把它从工作流里剔除出去。

insider
ai-agents
llm
tool-calling
+2
·tian

无人书写的工具调用授权层

你的网关检查‘是谁’。你的端点检查‘是什么’。但在你的智能体栈中,没有任何环节在检查模型最初是否被允许发起该调用。

ai-agents
security
authorization
llm
+1
·tian

你的 Agent 端点是一个伪装成函数调用的分布式系统

一个 `await agent.run()` 看起来像是一个本地函数,但实际上隐藏了一个远程的、可能部分失效的分布式系统。本文将探讨 Agent 代码所需的超时、重试、幂等性和熔断机制。

ai-agents
distributed-systems
reliability
llm
+1
·tian

那些由于模型选择了不同的 Token 而无法复现的 Bug

重现一个 LLM bug 时看到它通过了,并不意味着 bug 消失了 —— 而是意味着你抽取到了不同的样本。当你的工具假设一切都是确定性的,该如何调试一个采样器。

insider
llm
debugging
observability
+1
·tian

对于你的 AI 功能,“自研还是购买” 是个错误的问题

一个 AI 功能是一个包含五个层级的技术栈,而不是一件可以简单制作或购买的单一事物。真正重要的决策是:哪个层级能累积你的差异化优势,而哪个层级又是竞争对手可以轻易买到的。

insider
ai-engineering
architecture
strategy
+1
·tian

Token 预算是产品决策,而非配置值

设置上下文窗口分配(历史记录 vs 检索结果 vs 工具输出)的那行代码,是隐藏在 f-string 中的产品决策。本文将介绍如何将其显性化、衡量它,并为其指定负责人。

context-engineering
llm
rag
product
+1
·tian

你的语音智能体将每一个转录错误都视为事实

语音识别器返回的是猜测,但在移交给语言模型时,它们被重新标记为了事实。本文探讨如何保留 ASR 的不确定性,并设计在执行操作前进行确认的语音智能体。

voice-agents
speech-recognition
ai-engineering
llm
·tian

那个本该计算却随口编造数字的智能体

LLM 智能体往往会随口说出一个看似合理的数字,而不是去进行计算,流畅的文字掩盖了缺失的工具调用。本文探讨如何强制使用工具并为每一个数据附上出处。

insider
ai-agents
llm
hallucination
+2
显示第 97–108 篇,共 778 篇