·tian
你的评估测试集对现任模型存在过拟合
私有评估集往往源自单一模型的生产环境故障,因此它会偏向现任模型,并低估所有挑战者。应将回归测试与能力测试分开,并针对真实的业务流量进行测试。
llm
evaluation
model-migration
ml-engineering
·tian
离职工程师带走的微调产物
微调模型不仅仅是注册表中的一个文件;它是流水线在训练集上的闭包。那些只交付权重的团队,会在需要进行基础模型迁移而原工程师已经离职的那天,发现他们的公交车指数有多低。
mlops
fine-tuning
reproducibility
ml-engineering
·tian
合成种子数据:在首批千名用户到来之前启动微调
AI个性化和任务专项微调在没有行为数据时会遭遇冷启动困境。了解如何生成500–1,000个高质量合成样本,以及可能悄然毒化模型的失败模式。
insider
fine-tuning
synthetic-data
llm
+2·tian
AI 工程团队的人员配置:每个功能都有 AI 组件时,谁负责什么
当 LLM 将建模商品化后,ML 工程师、数据工程师和产品工程师之间的技能分工如何转变——以及当每个功能都有 AI 组件时,如何配置人员、构建架构并分配所有权。
ai-engineering
team-structure
engineering-leadership
ml-engineering
·tian
领域特定 LLM 微调的合成数据流水线
构建领域特定 LLM 微调的合成数据流水线实用指南 —— 涵盖蒸馏与自我提升、质量过滤、防止模型崩溃以及预算驱动的策略选择。
llm
fine-tuning
synthetic-data
ml-engineering