跳转到主要内容

990 含有标签「insider」

Posts tagged "insider" on TianPan.co.

查看所有标签

·tian

摘要有效性问题:如何识破 AI 压缩掉的关键信息

看起来忠实原文的 AI 摘要可能会悄无声息地丢失下游任务所需的关键信息。本文将教你如何定义完整性契约、结合覆盖率指标,并构建回归测试,在有损压缩破坏你的流水线之前及时发现问题。

insider
llm
rag
evaluation
+1
·tian

零样本之墙:为什么上下文示例在生产规模下失效

少样本提示能让你以最小的投入达到 80% 的效果。除此之外,每提升一个百分点的准确率,成本都会剧增。本文将告诉你如何识别这些信号,并了解何时微调成为你唯一的杠杆。

insider
llm
fine-tuning
prompt-engineering
+2
·tian

智能体问责栈:当子智能体造成伤害时,谁来承担责任

当子智能体发错邮件、删除记录或错误向客户收费时,责任是分散的。本文介绍如何设计审计追踪和授权检查点,在不扼杀自主性的前提下建立真正的问责机制。

insider
ai-agents
accountability
security
+2
·tian

AI 软件物料清单 (AIBOM):当采购部门问起时,你的依赖树长什么样

大多数 AI 团队在面对“请展示你们的依赖树”时,只能给出一个 Slack 讨论串。AIBOM 将其转变为一个查询系统 —— 一个持续生成的模型、Prompt、工具和数据集清单,在监管机构和采购部门提问之前就满足他们的需求。

insider
aibom
ai-governance
compliance
+2
·tian

你的 AI 功能需要一个无需部署的紧急开关 (Kill Switch)

一次标准的部署回滚需要 30 分钟;而一个表现异常的 LLM 仅需几秒钟就能向客户发送错误的输出。这里是你的 AI 功能在发生首次故障前所需的关闭原语——四种标志系列、触发它们的检测信号,以及确保其有效的测试规范。

insider
ai-engineering
sre
incident-response
+2
·tian

你的 AI 功能没有 DRI:为什么它在没有季度目标负责人的情况下处于漂流状态

AI 功能横跨产品、工程、研究和 FinOps,最终却落得无人负责。这里提供了一种组织模式,可以防止它们在季度评估之间处于漂流状态。

insider
ai-product-management
engineering-leadership
dri
+2
·tian

你的 AI 功能可靠性受限于无人负责的上游 ETL 流水线

大多数 AI 质量退化实际上是伪装成 AI 问题的上游数据问题。数据契约、血缘关系和结对轮值机制能将隐形的 ETL 接缝转化为一等公民工件。

insider
data-engineering
etl
ai-reliability
+2
·tian

你的律师还没学会要求的 AI 采购条款

标准 SaaS 模板缺少 AI 特有的条款——如训练数据排除、模型锁定、输出赔偿和审计权——这些条款决定了你的供应商关系能否在下一次模型更迭中幸存。

insider
ai-procurement
vendor-contracts
engineering-leadership
+1
·tian

自主性开关:为何智能体模式应是用户设置而非模型设置

在你的智能体产品中硬编码单一的自主性级别会疏远一半的用户。相反,你应该交付单项任务自主性阶梯、成比例的撤销机制以及学习型默认设置。

insider
ai-agents
ux
product-design
+1
·tian

AI 功能的 Bug Bash:分布采样,而非猎捕缺陷

为什么传统的 Bug Bash 流程在具有随机性的 AI 功能上会失效,以及如何将其重新设计为一种产生评估(evals)而非轶闻的采样过程。

insider
ai-engineering
qa
evals
+2
·tian

闭环升级漏洞:当你的专精型智能体陷入循环路由

两个专精型智能体之间来回传递同一个对话,可能会在任何人察觉之前悄无声息地烧掉五万美元的推理成本。请将移交(handoffs)视为一种路由协议,而非领域抽象。

insider
ai-engineering
multi-agent
agents
+2
·tian

群体感知微调:当单一模型不够,而针对每个用户的微调又负担过重时

大多数微调都处于两个极端:要么一个模型服务所有人,要么每个客户一个模型。中间地带 —— 三到八个针对特定群体的感知微调 —— 才是杠杆效应所在。

insider
fine-tuning
llm-ops
evaluation
+1
显示第 469–480 篇,共 990 篇