·tian
当思考模型真正发挥作用时:生产环境推理算力的决策框架
针对 o1、o3 和 Claude 深度思考等推理模型何时能真正提升生产环境效果,以及何时只是在浪费 Token 而无益于结果的决策框架。
insider
reasoning-models
inference
llm
+2·tian
LLM 延迟分解:为什么 TTFT 和吞吐量是两个不同的问题
TTFT 和吞吐量并不是滑块的两端 —— 它们是由不同的物理原理驱动的,且需要不同的优化手段。本指南旨在解析 LLM 延迟的构成,并针对你的工作负载优化正确的指标。
llm
performance
inference
production
·tian
生产环境中的 LLM 延迟:哪些手段真正能见效
对 LLM 延迟进行的实用解析——涵盖 Prefill 与 Decode 阶段、流式传输、KV 缓存策略、投机采样,以及为了加速交付 AI 应用需要衡量哪些关键指标。
llm
inference
performance
production
显示第 37–39 篇,共 39 篇
上一页4 / 4