跳转到主要内容

Will Larson 从 Digg v4 灾难性启动中获得的教训

阅读需 1 分钟Tian PanTian Pan

Digg 从 v3.5 到 v4 的灾难性启动实际上是相当雄心勃勃的。Digg 曾受到谷歌 Panda 算法更新的严重打击。而推出 v4 是他们重新回到互联网巨头之中的机会。

因此没有回滚计划,意外的规模问题发生了。

  1. 存在 Cassandra 瓶颈 -> 实现了写透缓存 memcache
  2. 然而,MyNews 页面每四小时仍然会崩溃
  3. 在 Redis 中重写 MyNews,并秘密删除多余的数据以保持网站运行
  4. 花了一个月的时间追踪 Python tornado 后端服务中的错误,并且有某种 API 使用可变默认值作为参数,例如
def get_user_by_names_or_ids(names=[], ids=[])

这会导致内存泄漏 - 如果你改变这些参数,变更会跨调用延续。累积的数据甚至会导致 memcache 集群崩溃。

参考资料

保持联系,关注我获取更多内容

阅读需 10 分钟

没人会为你的智能体承保

你的智能体准确率足以在无人看管的情况下运行,但部署过程却卡在了一个问题上:当它出错时,谁来承担损失。本文探讨了为什么自主性现在成了一个保险问题,以及如何让智能体变得可承保。

insider
ai-agents
阅读需 11 分钟

CTO 已拨款但安全团队拒绝让你上线的 AI 功能

能够按时上线的 AI 功能会将安全威胁模型视为需求阶段的“形态约束”,而不是发布前的核对清单。这是一份面向工程领导者的安全左移指南。

insider
ai-security
阅读需 11 分钟

Demo 到 Dogfood 的鸿沟:为什么你的 AI 功能死在了发布幻灯片与周一早晨之间

大多数企业级 AI 试点只留下了一个精彩的 demo 和一个沉寂的 Slack 频道。Dogfood 阶段是你所能运行的最廉价的生产级评估 —— 本文将介绍真实的准入标准是怎样的,以及为什么 demo 并不代表产品已准备就绪。

insider
ai-engineering
阅读需 9 分钟

Eval 回填税:为什么每一次模型能力发布成本都超出了你的预算

新的模型能力会引入历史评估套件从未设计捕捉的失败模式 —— 而回填这些评估的工作是每一次能力发布中被低估的关键路径。

insider
evals
阅读需 12 分钟

智能体系统就是分布式系统:在遭遇惨痛教训前应用微服务经验

当今困扰多智能体 AI 系统的失败模式,其实是伪装成新问题的 2015 年分布式系统老问题。那些在构建智能体之前就内化了微服务经验的团队,正在交付更可靠的系统。

ai-engineering
agents