跳转到主要内容

10 含有标签「reasoning-models」

Posts tagged "reasoning-models" on TianPan.co.

查看所有标签

·tian

你定义‘首个 Token’的位置决定了你的延迟 SLO 是否真实

p99 首个 Token 延迟低于 800 毫秒看起来像是一个承诺——直到推理层的切换悄然重新定义了‘首个 Token’的含义。SLO 衡量的是供应商边界;而用户的感受则完全不同。

insider
llm-ops
observability
latency
+2
·tian

思维标记(Thinking Tokens)在你的日志中隐身,但在账单上却震耳欲聋

推理标记(Reasoning tokens)按输出计费,但它们存在于一个大多数 LLM 可观测性栈在构建时尚未涉及的字段中。本文将分析为什么财务部门总是先于技术人员发现成本回归,以及你该如何弥合这一差距。

insider
llm-observability
reasoning-models
ai-cost
+2
·tian

推理模型套利:在处理难题时,慢速昂贵模型反而更省钱

按 Token 计价仅反映了中位请求的成本,而非你产品实际服务分布的全额成本。一旦重试、人工介入和信任损失计入损益表,将复杂提示词路由至推理模型便会胜过默认使用通用模型。

insider
llm-routing
ai-cost
model-selection
+2
·tian

“展示过程”的 UX 陷阱:当推理链只是披着产品外壳的调试输出

大多数 AI 功能之所以带有可见的推理过程,仅仅是因为模型输出了它,而将其隐藏似乎很浪费。这是一个团队从未真正做出的产品决策——也是信任流失的一个可衡量的来源。

insider
ai
ux
product-design
+2
·tian

推理力度预算编制:当思维 Token 成为财务账单的独立细目

推理 Token 在账单上看起来像输出 Token,但其规模会膨胀 3-10 倍且没有自然上限。你应该将思维力度视为一种可调资源——通过产出来衡量,由预算来管理,按难度来路由,并在财务部门发问之前,将其作为仪表板上的独立细目进行展示。

llm
finops
reasoning-models
cost-optimization
+1
·tian

工具边界处的推理模型税

推理模型在基准测试中获胜,但在工具选择步骤中却损失了延迟和质量。本文探讨了按步骤进行的混合路由模式、归因以及反模式。

insider
ai-agents
llm
cost-optimization
+2
·tian

首字延迟 (TTFT) 是你尚未监测的延迟 SLO

p50 和 p99 的总延迟忽略了一个决定你 AI 产品体验的关键指标:首字延迟 (TTFT)。本文将探讨为什么推理模型会让情况变得更糟、需要衡量哪些指标,以及如何通过路由策略来优化它。

llm-ops
observability
latency
streaming
+1
·tian

推理模型的提示词用法大不同:为何你现有的模式在 o1、o3 和 Claude 扩展思考上会失效

o1、o3 和带扩展思考的 Claude 等推理模型处理提示词的方式,与指令跟随模型有着本质区别。那些在 GPT-4 上有效的模式,反而会主动损害思考模型的性能——本文提供一套适配框架。

prompt-engineering
reasoning-models
llm
ai-engineering
·tian

智能体循环中的推理模型溢价:何时“思考”值得,何时不值得

推理模型的单次查询成本最高可达标准模型的 86 倍 —— 并且在智能体循环中,该成本会随每次迭代而叠加。本文提供了一个实用的决策框架,帮助你判断何时应路由到推理模型,以及何时选择快速模型更为明智。

insider
reasoning-models
agent-loops
llm-cost
+1
·tian

当思考模型真正发挥作用时:生产环境推理算力的决策框架

针对 o1、o3 和 Claude 深度思考等推理模型何时能真正提升生产环境效果,以及何时只是在浪费 Token 而无益于结果的决策框架。

insider
reasoning-models
inference
llm
+2