跳转到主要内容

778 含有标签「llm」

Posts tagged "llm" on TianPan.co.

查看所有标签

·tian

一次回填,让你的整个 AI 账单重新运行

一次重新索引、重放或迁移操作,可能会悄无声息地以全价 token 重新处理你的整个语料库——几天后账单便会送达。本文将介绍如何在大型 AI 重新处理任务让你措手不及之前,对其进行估算、设置上限和分阶段执行。

llm
cost
finops
mlops
+1
·tian

评估了错误的 RAG 管道环节

一个 RAG 系统本质上是由两台机器组成的,但大多数评估框架只给生成器评分。本文将解释为什么检索环节需要独立的评分体系,以及如何构建它。

insider
rag
evaluation
retrieval
+2
·tian

FinOps 鸿沟:为什么没有人批准你那 4 万美元的 AI 账单

模型支出通过你的变更管理流程从未审查的代码路径进入生产环境。本文将探讨为什么 Token 成本在审批中是不可见的,以及弥补这一鸿沟的归因、成本分摊(Showback)和支出闸门(Spend-gate)等原语。

insider
finops
llm
cost-optimization
+2
·tian

语义差异:当行级对比毫无意义时,如何评审 Prompt 变更

仅仅三个词的 Prompt 修改就可能让你的幻觉率翻三倍,而行级对比(Line Diff)看起来却毫无破绽。为什么 Prompt 变更需要语义差异(Semantic Diff)—— 比较行为而非文本 —— 以及如何在 PR 中对此进行门控拦截。

prompt-engineering
llm
code-review
evaluation
+1
·tian

你从未进行过压测的每分钟 Token 上限

供应商的速率限制是你无法控制的每分钟 Token 预算 —— 而产品发布则是发现这一上限的最糟糕时机。本文将介绍如何在 429 错误发生前进行预测、压测并预留缓冲空间。

llm
capacity-planning
rate-limits
reliability
+1
·tian

没人使用的长尾:工具带是如何变得尾大不掉的

你给智能体增加的每一个工具,都在削弱它选择正确工具的能力。那几十个无人问津的工具正在悄悄降低那三个核心工具的被选概率 —— 本文将探讨如何保持工具目录的精简与高效。

insider
ai-agents
tool-use
mcp
+2
·tian

与先验对抗:当模型掌握了错误版本的技术栈时

你的编程模型并不是对你的框架一无所知 —— 它掌握的是一个自信但错误的版本。本文将探讨为什么模型的先验知识会战胜你提供的上下文,以及哪些对策能真正奏效。

ai-engineering
llm
code-generation
context-engineering
+1
·tian

间接提示注入:你以为处于惰性的数据平面

你的智能体将检索到的每个文档都视为惰性数据,但检索到的文本实际上是以系统提示词的权限运行的。本文将探讨间接提示注入的工作原理、为什么 EchoLeak 证明了它的存在,以及真正有效的防御手段。

insider
ai-security
prompt-injection
llm
+2
·tian

试点炼狱:廉价的 90% 正是你的 AI POC 无法转正的原因

一个可运行的 AI 演示只是那看起来像 100% 但其实很廉价的 90%。那些能确保其在生产环境中安全运行的评估、护栏、可观测性、成本上限和权属划分,才是没人预估过的昂贵的 10% —— 这里有一份清单,帮你提前预估这些成本。

insider
ai-engineering
llm
mlops
+1
·tian

Token 预留容量:被人们忽略的、尚未从云时代迁移过来的预留实例决策

预置吞吐量和承诺使用折扣让你能像以前预留 EC2 一样预留 LLM 推理资源 —— 但盈亏平衡点比你想象的要高,而且你的承诺可能会因为模型弃用而陷入困境。这里是移植过来的实战手册,以及其中一个危险的变数。

insider
finops
llm
inference
+2
·tian

AI 路线图:押注于尚不存在的模型

围绕模型在六个月后的预期表现来界定功能,会使你的计划变成对供应商发布时间表的预测。本文将探讨如何区分合理的模型能力博弈与空想,以及如何进行设计,使得更强大的模型是锦上添花,而非维持生存的氧气。

ai-engineering
product-strategy
roadmap
llm
+1
·tian

护栏税:当安全分类器让你的延迟和账单翻倍时

外挂式安全分类器堆叠在关键路径中,使延迟增加三倍并推高了你的推理账单。本文介绍如何根据爆炸半径调整护栏规模,并采用并发而非串行的方式运行它们。

llm
ai-safety
guardrails
latency
+1
显示第 1–12 篇,共 778 篇
1 / 65下一页