跳转到主要内容

29 含有标签「streaming」

Posts tagged "streaming" on TianPan.co.

查看所有标签

·tian

流式响应追踪模式鸿沟:为什么你的 APM 在 LLM 延迟上撒了谎

流式 LLM 响应打破了请求/响应的 Span 模型。duration 字段具有误导性;故障发生在边界之间——如 TTFT 回归、中途停顿、内容死循环——而解决方案是采用基于检查点的 Token 时间事件,并建立真正的尾部事件分类体系。

llm-observability
streaming
opentelemetry
tracing
+1
·tian

流式推理中的海勒姆定律:节奏、停顿和中间 Token 是未成文的契约

当更换模型虽然保留了结构化输出 schema,但改变了 Token 节奏、停顿模式和中间表述时,你实际上发布了一个破坏性变更,违反了一个你从未正式定义的契约。

insider
ai-engineering
llm
streaming
+2
·tian

流式工具结果破坏了请求-响应式智能体规划器

“缓冲并移交”式的集成会将流式工具转变为撑爆上下文、吞噬延迟的隐形故障点。一个由四个部分组成的规划器契约 —— 流式标志、运行摘要、consume_until 和预算中止 —— 能让智能体在执行轨迹而非具体数值上进行推理。

insider
ai-agents
tool-use
mcp
+2
·tian

流式结构化输出:为什么你的解析器会在第 47 个 Token 处卡住

Token 流式传输与结构化输出在架构上是相互矛盾的。天真的 try/catch JSON.parse 循环复杂度为 O(n²),is_complete 布尔值是个谎言,而部分枚举则是 Delete 工具在 DeleteIfEmpty 上误触发的原因。

ai-engineering
streaming
structured-output
llm
·tian

Token 间抖动:你的 p95 仪表盘看不见的流式传输 UX 失败

首个 Token 响应时间 (TTFT) 和总生成时间都符合 SLO,但用户却抱怨 AI 在响应过程中『卡住了』。你的仪表盘所隐藏的指标是相邻 Token 之间的间隔 —— 而平滑这一间隔是一个 UX 问题,而非吞吐量问题。

ai-engineering
streaming
latency
observability
+1
·tian

投机采样(Speculative Decoding)是一项流式传输协议决策,而非推理优化

投机采样(Speculative Decoding)承诺在保持模型输出一致的前提下实现 3-6 倍的加速,但这种保证仅限于离开推理引擎的 Token —— 而非已经展示给用户的字节。当你通过流式传输尚未验证的草稿 Token 时,被拒绝的后缀必须撤回。哪些界面能够容忍撤回是一项产品决策,而推理团队往往很少考虑到这一范围。

speculative-decoding
llm-inference
streaming
architecture
+1
·tian

流式 JSON 解析器:Token 与类型化对象之间的鸿沟

JSON.parse 是全量或全无的,但 LLM 的 Token 流并非如此。为什么流式结构化输出是 API 和 SDK 必须共同解决的设计难题,以及一个真正的部分解析器必须具备哪些功能。

insider
llm
streaming
structured-output
+2
·tian

取消税:用户点击停止后的推理账单

点击停止只是停掉了你的 UI,而不是 GPU。大多数供应商会完成生成,并为你那些用户从未读过的 Token 计费。本文将介绍如何衡量并缩小这一差距。

llm-cost
finops
streaming
observability
+1
·tian

输出承诺问题:为什么流式自我纠正比原始错误更损害用户信任

即便最终答案正确,流式输出中途的修改也会被视为无能。解决方案是采用“先规划再承诺”协议、清晰的细化层面分类,以及有意识地选择何时隐藏思考过程。

insider
ai-ux
streaming
llm
+2
·tian

首字延迟 (TTFT) 是你尚未监测的延迟 SLO

p50 和 p99 的总延迟忽略了一个决定你 AI 产品体验的关键指标:首字延迟 (TTFT)。本文将探讨为什么推理模型会让情况变得更糟、需要衡量哪些指标,以及如何通过路由策略来优化它。

llm-ops
observability
latency
streaming
+1
·tian

延迟感知差距:为什么3秒的流式响应比1秒的批量响应感觉更快

3秒的流式响应往往比1秒的批量响应感觉更快。这是背后的心理学原理和利用它的工程模式。

insider
ai-engineering
ux
performance
+2
·tian

LLM 应用中的 SSE vs WebSockets vs gRPC Streaming:那个稍后会让你头疼的协议抉择

探讨 SSE、WebSockets 和 gRPC streaming 在背压下的不同失效方式,分析哪些浏览器限制和边缘代理会在生产环境中引发故障,以及如何根据失效模式概览来选择你的传输协议。

llm
streaming
websockets
sse
+3
显示第 13–24 篇,共 29 篇