·tian
那些在评估集中遗漏、却在模型蒸馏中丢失的能力
蒸馏通过有限的样本优化散度,并根据有限的评估集进行交付。评估集未测量的行为是学生模型可以自由丢弃的熵 —— 而它首先丢弃的,通常是那些罕见但关键的能力。
distillation
evals
llm-ops
model-compression
·tian
云边混合 LLM 架构:将推理路由至其真正所属之处
70-80% 的生产环境 LLM 查询其实并不需要尖端模型。云边混合架构能够将每个请求路由到可以妥善处理该任务的最经济层级——通过使用复杂度分类器、置信度级联和投机采样,在不牺牲质量的前提下,将边缘路径的成本降低 50-100 倍。
edge-ai
llm-inference
model-compression
hybrid-architecture
·tian
混合云-边缘 LLM 推理:决定成本、延迟和隐私状况的路由层
边缘和云端推理之间的路由层可将 LLM 成本降低 60–80%,同时改善延迟和隐私 —— 本文介绍了查询级路由、模型压缩、投机性解码背后的工程实践,以及使混合架构在生产环境中运行的编排技术。
insider
edge-ai
llm-inference
model-routing
+1·tian
混合云边 LLM 推理:决定模型运行位置的延迟-隐私-成本“黄金三角”
一份关于在端侧模型与云端 API 之间分配 LLM 推理任务的生产指南 —— 涵盖延迟-隐私-成本三角模型、保持任务精度的压缩技术、智能查询路由,以及混合架构特有的失效模式。
insider
edge-ai
llm-inference
model-compression
+1·tian
混合云边 LLM 推理:端侧模型何时优于云端
生产团队正将 60–80% 的 LLM 查询路由到端侧模型——将延迟降低到 20 ms 以下,消除了数据驻留的烦恼,并大幅削减了云端推理成本。这是一份关于混合云边推理背后的路由、压缩和架构模式的实用指南。
edge-ai
llm-inference
on-device-ai
model-compression