跳转到主要内容

22 含有标签「ci-cd」

Posts tagged "ci-cd" on TianPan.co.

查看所有标签

·tian

不稳定的测试毒化 Agent 循环的速度比伤害人类时快得多

人类对不稳定测试耸耸肩;Agent 却将报错视为绝对真理——回退正确的更改并在虚影上浪费 token。为什么测试确定性现在已成为一项 SLO,以及 Agent 集群如何检测并修复它们所遭受的不稳定测试。

ai-agents
testing
ci-cd
reliability
·tian

你在廉价模型上测试,却在昂贵模型上部署

在廉价模型上运行 CI 和评估,而生产环境却使用尖端模型,这在最关键的地方破坏了开发与生产环境的一致性。本文将探讨为什么层级差距会使你的评估门控失效,以及缩小这一差距的预算计算方法。

insider
llm
evals
ci-cd
+1
·tian

合并队列成了新的瓶颈

编程代理让你的 PR 数量翻了一番,但合并过程仍像是在为人类打字速度设计的队列中缓慢爬行。本文将探讨合并队列拥堵背后的容量计算逻辑、为什么不稳定测试会在代理规模下产生连锁反应,以及分层预合并/合并后测试如何恢复吞吐量。

insider
ai-engineering
ci-cd
devops
+1
·tian

CPU 调节器决定了你的 Agent 基准测试结果:那个被忽视的 CI 宿主机因素

一次 22% 的 Agent 延迟回归,最终发现竟是 Runner 镜像中的 cpufreq 调节器变更所致 —— 以及为什么 CI 基准测试数值测量的是宿主机,而非你的代码。

ai-agents
benchmarking
ci-cd
performance
·tian

那些在本地通过但在 CI 中失败的编程智能体

编程智能体会继承你笔记本电脑中已配置好的环境,并提交在本地通过但在 CI 中失败的补丁。解决方案是建立仓库级的环境契约、进行预检一致性检查,并根据本地与 CI 的差异进行评分。

insider
ai-engineering
coding-agents
ci-cd
+1
·tian

凌晨 3 点拥有合并权限的 CI Agent

把一个有合并权限的 AI Agent 接入 CI,就在你的体系里创造了一种 SRE 手册从未命名过的新型操作主体。给它的动作分级、把不能无人值守的动作排进队列、为每次变更留下可追溯的归属,并定期演练它的紧急停机开关。

ai-engineering
ci-cd
sre
agents
+1
·tian

Prompt 的 Pre-Commit Hooks:LLM 团队一直缺失的内环工具链

如今 Prompt 对行为的影响已经超过了代码,但大多数团队仍在使用 2008 年时代的工具进行评审。本文介绍了五种 pre-commit hooks —— 格式化工具、静态检查器、密钥与 PII 扫描器、冒烟评估以及缓存影响评估器 —— 旨在以应有的严谨态度对待 Prompt 的修改。

prompt-engineering
llm-ops
pre-commit
ci-cd
+1
·tian

影子评估:当私有切片取代了你的评估汇总

私有的评估 Notebook 看起来效率很高,但会让组织缺乏统一的评估汇总。解决方案是建立合并门控契约:共享框架、验证过的切片、明确的负责人,以及任何人都能重新运行的排行榜。

evals
ai-engineering
llmops
ci-cd
+1
·tian

Prompt 修改不只是措辞变动:将 Prompt 视为软件的代码审查规范

Prompt 修改看起来像是英语,但行为表现却像代码。通过配对评估与 Prompt 的 PR、行为差异注释以及划分审查角色等规范,在用户发现之前捕捉行为回归。

insider
llm
prompt-engineering
code-review
+2
·tian

Eval-as-Code:当你的发布门禁只是某人笔记本电脑上的一个 Notebook

决定你的模型是否发布的数字竟然存在于某人笔记本电脑上的一个 Notebook 中。你应该像对待生产系统一样对待评测套件 —— 对其进行版本化、设置准入规则并提供 SLO。

evals
llmops
ci-cd
ai-engineering
+1
·tian

将 Eval 作为 Pull Request 评论而非任务:在代码审查中嵌入 LLM 质量门禁

为什么只有当 LLM 评估(evals)存在于 diff 旁边的 PR 评论中时,才能有效捕捉回归。借鉴代码覆盖率如何从夜间任务迁移到内联审查界面的经验 —— 以及将“评估即任务”转变为“评估即合并门禁”的四个工程关键点。

insider
llm
evals
ci-cd
+2
·tian

为什么你的提示词库应该是 Monorepo,而不是 Cookbook

Cookbook 模式的提示词文件夹在规模化时会失效。应用 Monorepo 规范——语义化版本控制、依赖图、原子重构和评估门禁——以防止提示词漂移、幽灵依赖和迁移瘫痪影响生产环境。

insider
prompt-engineering
llm-ops
ai-engineering
+2
显示第 1–12 篇,共 22 篇
1 / 2下一页