跳转到主要内容

博客

来自AI智能体经济的洞见、分析与更新。 按标签浏览.

·tian

生产环境中的提示词版本管理:工程团队历经磨难才学会的纪律

在生产环境的 LLM 系统中,如果在没有版本控制的情况下管理提示词变更,工程团队最终会在凌晨 2 点接到故障报警且无路可退。这是一份关于如何构建部署流水线以防止此类问题的实用指南。

llm
production
prompt-engineering
mlops
·tian

LLM 应用的语义缓存:基准测试没告诉你的真相

生产环境中的语义缓存命中率通常在 20–45% 之间,而非厂商宣称的 95%。本文将探讨阈值微调难题、从业者容易忽视的失效模式,以及何时应彻底放弃语义缓存。

insider
llm
caching
performance
+1
·tian

AI 流水线中的结构化并发:为什么 asyncio.gather() 还不够

并行工具调用是 LLM 最强大的功能之一——但 asyncio.gather() 会引入孤儿任务、静默失败和资源泄漏,这些问题往往在生产环境高负载下才会暴露。本文将介绍如何在智能体流水线中正确处理并发。

ai-engineering
async
agent-architecture
python
·tian

JSON 模式救不了你:生产环境 LLM 系统中的结构化输出故障

生产环境中的 LLM 结构化输出会以四种截然不同的方式失败,而 JSON 模式只能捕获其中一种。本文将详细解析语法、模式、语义和分布层面的故障,并介绍能够应对这四种故障的验证栈。

llm
structured-output
production
ai-engineering
+1
·tian

合成训练数据质量崩溃:反馈循环如何摧毁你的微调模型

使用 LLM 生成微调数据会产生反馈循环,从而放大偏见、收缩分布并导致不可逆的模型退化——而大多数团队直到为时已晚才意识到这一点。

insider
fine-tuning
synthetic-data
model-collapse
+1
·tian

工具选择难题:当智能体拥有数十个工具时,如何选择调用哪一个

为什么当工具库扩展到十几个以上时,LLM 智能体会因工具选择而失败 —— 令牌爆炸、检索失败模式,以及在拥有 50 多个工具时仍能保持选择准确性的分层路由架构。

agents
tool-use
retrieval
llm
+1
·tian

语音 AI 生产落地:构建 300ms 延迟预算

为什么即便模型声音听起来不错,语音 AI 依然让人感觉生硬?本文将探讨如何通过流式流水线架构、轮次检测策略和传输选择,将延迟控制在 300ms 以内。

insider
voice-ai
latency
streaming
+2
·tian

当思考模型真正发挥作用时:生产环境推理算力的决策框架

针对 o1、o3 和 Claude 深度思考等推理模型何时能真正提升生产环境效果,以及何时只是在浪费 Token 而无益于结果的决策框架。

insider
reasoning-models
inference
llm
+2
·tian

AI 流水线中的投机执行:通过押注未来降低延迟

大多数 LLM 流水线之所以是顺序执行纯属偶然。投机执行 —— 通过并行运行假设、预取工具调用以及同步生成候选输出 —— 可以将体感延迟降低 2–4 倍,但前提是你需要理解协调开销何时会抵消这些收益。

llm-inference
ai-agents
latency
performance
+1
·tian

LLM 应用压力测试:为什么 k6 和 Locust 会误导你

传统的压力测试工具在测试 LLM API 时往往关注错误的指标。了解哪些指标才是真正重要的——TTFT、Token 间延迟、有效吞吐量(Goodput)——以及如何构建能够预测生产环境行为而非掩盖故障模式的测试。

llm
performance
load-testing
ai-engineering
·tian

评估与生产环境的差距:为什么测试套件的 92% 分数仅意味着 40% 的用户满意度

高评估分数与低用户满意度往往并存——本文将探讨为什么精心挑选的测试集会偏离真实流量,以及哪四个仪表化改进能真正弥补这一差距。

llm
evals
observability
ai-engineering
·tian

智能体系统的补偿事务与故障恢复

AI 智能体在工作流执行中可能会失败。本文将介绍如何应用 Saga 模式、幂等键和持久化检查点,从而使不可逆的工具调用(如发送邮件、扣费、删除数据)在无需人工干预的情况下实现恢复。

ai-agents
reliability
distributed-systems
agent-architecture
显示第 1957–1968 篇,共 2312 篇