跳转到主要内容

834 含有标签「ai-engineering」

Posts tagged "ai-engineering" on TianPan.co.

查看所有标签

·tian

思维的 p99:当模型决定你的请求耗时多久

推理模型使响应时间成为问题难度的函数,导致 p99 延迟激增至 p50 的 3-5 倍,超时调整也演变为成本问题。通过针对更小模型的对冲请求、按路由设置的推理开销上限以及感知难度的 SLO,可以将尾部延迟控制在合理范围内。

insider
llm
inference
sre
+2
·tian

你的智能体幻觉出的软件包现在已存在 —— 而且它是恶意的

LLM 会反复幻觉出相同的虚假软件包名称 —— 43% 的名称在每次重新运行时都会重复出现 —— 而攻击者正在注册这些名称。本文探讨了为什么拥有安装权限的智能体会将幻觉演变为供应链攻击,为什么 Diff 审查无法捕捉此类问题,以及能够防御此类威胁的 lockfile、白名单和冷却期防御机制。

insider
ai-engineering
security
supply-chain
+2
·tian

脚手架审计:每一次模型发布都让你的部分开发框架变成累赘

重试机制编排、JSON 修复解析器以及强制思维链,都是为你不再运行的模型而构建的。这是一套在每次模型升级时,对过时的 LLM 脚手架进行标记、消融和删除的实用规范。

insider
ai-engineering
agents
llm
+1
·tian

不存在的单一质量指标

你的 AI 功能质量是一个分布,而非一个标量。为什么平均评估分数会将细分领域的崩溃误报为提升,以及你应该在汇报 PPT 中展示什么——细分网格、底线指标、最差案例记录——以及保持噪声指标可信度的报告节奏。

insider
ai-engineering
llm-evals
observability
+1
·tian

万档代码转换:在机械式代码迁移中运行智能体集群

确定性的代码转换工具可以完成迁移中简单的 80%,但在长尾问题上会停滞不前 —— 而这正是单个文件编码智能体大显身手的地方。但在集群规模下,问题不再是提示词工程,而是变成了批量操作:分片、验证网关、隔离以及针对其 Mapper 具有随机性的 MapReduce 作业的合并策略。

ai-engineering
coding-agents
migrations
devops
·tian

429 错误背后的惊群效应:速率限制是一个分布式系统问题

不带抖动的指数退避会组织你的重试集群而不是将其消解 —— 随之而来的是同步的 429 浪潮、重试放大和亚稳态故障。本文将探讨为什么 LLM 速率限制需要抖动、重试预算,以及你原本没打算构建的客户端调度器。

insider
ai-engineering
llm
reliability
+2
·tian

Tokenizer 税:除了英语,你的 AI 功能在所有其他语言中成本更高且表现更差

同一个 AI 功能,在日语或阿拉伯语中的服务成本比英语高出 2-3 倍,且质量明显较差——然而大多数团队在进行全球发布时仅使用单一的英语评估套件。本文探讨 Token 肥沃度如何驱动各地区的成本、上下文和准确性,以及在全球发布前需要衡量哪些指标。

insider
llm
tokenization
internationalization
+2
·tian

在构建下一层 AI 技术栈之前,请先绘制 Wardley 地图

关于 AI 基础设施的‘自研还是外购’的争论,往往假设了一个并不存在的稳定格局。Wardley 地图揭示了你的技术栈中哪些层会在几个月内商品化,以及哪些组件(如领域评估和私有数据)正朝着相反的方向发展。

insider
ai-engineering
strategy
build-vs-buy
+1
·tian

谁在为 Token 买单?内部 LLM 平台的费用分摊与结算设计

免费推理会将你的 LLM 平台变成一场容量拍卖;而幼稚的按 Token 计费则会扼杀实验。采用账单展示优先的阶梯、工作单元定价,并将影子集成视为内部市场失效的信号。

ai-engineering
platform-engineering
finops
llm
·tian

你的智能体内存需要垃圾回收机制

持久化智能体内存默认会单调增长,因此过时的事实会污染之后检索它们的每一次运行。本文将探讨为什么仅靠 TTL 是不够的,以及过时评分、替代链、溯源和写入时门控如何将内存从简单的日志转变为一套生命周期管理系统。

insider
ai-agents
memory
llm
+1
·tian

你的 AI 工作负载也有“夜晚”:批处理折扣是对架构的考验

每一个主要的供应商都通过批处理 API 以半价销售同样的 token,但大多数团队从未获得过这一折扣,因为他们从未对哪些推理调用确实需要即时响应进行过分类。本文介绍了一个延迟分道(latency lanes)框架、批处理所需的架构重构,以及为什么 50% 的折扣是结构性的。

ai-engineering
llm
cost-optimization
infrastructure
·tian

你的上下文流水线需要一份新鲜度 SLA

大多数 “幻觉” 其实是伪装下的新鲜度事故。上下文窗口是基于十个上游数据源的物化视图 —— 它像任何其他数据流水线一样,需要血缘追踪、新鲜度 SLA 和回填计划。

insider
ai-engineering
context-engineering
data-engineering
+2
显示第 25–36 篇,共 834 篇