跳转到主要内容

990 含有标签「insider」

Posts tagged "insider" on TianPan.co.

查看所有标签

·tian

你的模型路由是基于评估集训练的,而不是你的真实流量

基于基准测试训练的路由器会带来隐蔽的质量退化:低成本路径在宏观数据上表现尚可,但在你的评估套件从未采样的少数关键用户群体中却会失败。本文探讨了为什么路由器是一个控制系统而非分类器,以及实现闭环处理究竟需要什么。

insider
llm-routing
model-cascades
evaluation
+1
·tian

多模态评估漂移:为什么在文本表现稳定的情况下,图像和音频路径会出现回退

大多数团队将多模态作为其文本产品的薄扩展来发布,并沿用了一套系统性地无法察觉图像或音频回退的评估准则。解决方法是采用单模态评分标准、特定模态的黄金数据集,以及一个拒绝在不同输入类型间聚合质量指标的发布门控。

insider
multimodal
evaluation
vision
+3
·tian

30 天 Prompt 见习计划:当“阅读代码”失效时,如何入职工程师

一段 200 行的系统 Prompt 没有函数签名,没有测试,且 diff 历史完全没有说明为什么每一行代码会出现在那里。这份为期 30 天的课程——涵盖失败案例集、消融实验、PR 重构和受控编辑——旨在教导新工程师通过询问其行为来“阅读”一个 Prompt。

insider
prompt-engineering
onboarding
ai-engineering
+2
·tian

Prompt-Eligibility:数据分类中缺失的那一列

大多数数据分类方案从未将提示层(Prompt Layer)建模为厂商出口通道。增加一个 Prompt-Eligibility 层级——以及填充该层级的模板审计——可以填补你的 DLP 方案所默认忽略的合规漏洞。

insider
privacy
security
llm
+2
·tian

你的系统提示词终会泄露:针对提示词提取进行设计

提示词提取是对 LLM 产品的一种隐蔽攻击。应将系统提示词视为公开内容,将秘密移出上下文,并为其构建评估体系。

insider
llm-security
prompt-engineering
owasp
+1
·tian

当你的 CLI 开始说英语:可提示基础设施的最小权限原则

当你的 CLI 开始接受英语时,最小权限原则就失效了。每一个将意图转化为命令的封装层都变成了一个“混淆代理”。目前行之有效的模式包括:锚定已解析计划的意图绑定令牌、强制性模拟运行(dry-run)以及将提示词与动作图关联起来的审计追踪。

insider
security
ai-agents
authorization
+2
·tian

智能体动作空间的可达性分析:为你从未测试过的分支提供评测覆盖

你的工具目录加上规划器构成了一个可达的执行计划图,而你的评测(Evals)可能从未覆盖过这些路径。借鉴编译器的可达性分析方法,找出那些可能最先由事故频道(Incident Channel)发现的隐藏分支。

insider
ai-engineering
agents
evaluation
+2
·tian

采样参数继承:当 0.7 的温度从规划器泄露到验证器时

将温度沿调用树向下传播的智能体框架,会将规划器的创意旋钮变成验证器的 Bug。本文探讨了基于角色的采样配置文件、默认拒绝继承,以及捕获此类泄露的分歧率评估。

insider
agents
llm
evals
+1
·tian

Session Stitching:为什么你的会话 ID 是个谎言

框架交付的是会话 ID;而用户生活在任务中。两者之间的鸿沟导致了一半的智能体 UX 体验流失,解决方案是使用任务 ID,而不是延长会话时间。

insider
agent-ux
memory
persistence
+2
·tian

影子 MCP:你的安全团队从未听说过的工具服务器已经在工程师的笔记本电脑上运行了

MCP 使得将开发者的笔记本电脑连接到准生产系统变得极其廉价。其产物是一个使用工程师现有凭据的环回套接字(loopback socket)——这对采购、CASB 和 SSO 日志来说是不可见的。在发生第一次数据泄露披露之前,必须建立发现和治理规程。

insider
ai-agents
security
mcp
+2
·tian

共享提示词的“夺旗日”:当一次修改引发三十个团队的性能回归

将安全前导语(safety preamble)集中化管理看起来像是典型的 DRY 原则胜利,直到第一次修改发布,导致三十个下游团队的评估指标暴跌。本文将探讨为什么共享提示词的行为类似于分布式系统,以及如何构建能够经受住“夺旗日”考验的治理框架。

insider
llmops
platform-engineering
prompt-management
+1
·tian

流式 JSON 解析器:Token 与类型化对象之间的鸿沟

JSON.parse 是全量或全无的,但 LLM 的 Token 流并非如此。为什么流式结构化输出是 API 和 SDK 必须共同解决的设计难题,以及一个真正的部分解析器必须具备哪些功能。

insider
llm
streaming
structured-output
+2
显示第 565–576 篇,共 990 篇