跳到主要内容

5 篇博文 含有标签「accessibility」

查看所有标签

无障碍树是你最新的公共 API

· 阅读需 11 分钟
Tian Pan
Software Engineer

十年来,无障碍(Accessibility)一直是那种被忽视的工作。它躺在待办事项(backlog)的最底层,只有在合规性审查期间才会浮出水面,然后被修补上刚好能让 linter 闭嘴的 ARIA 标签。经济层面的论据从未奏效,因为受影响的用户是少数群体,他们的流失从未出现在任何会让工程师收到告警(paged)的仪表盘上。

然后,浏览器代理(browser agents)出现了,经济逻辑在一夜之间发生了反转。像 ChatGPT 的浏览模式、Claude 的 computer use 以及基于 Playwright-MCP 的自动化浪潮,它们并不看你的像素。它们读取的是浏览器的“无障碍树”(accessibility tree)——这正是屏幕阅读器(screen readers)二十年来一直在消费的语义结构。每一个未标记的按钮、每一个伪装成链接的 div、每一个没有暴露状态的自定义下拉菜单,现在不仅对盲人用户不可见,对你的业务合作伙伴正在集成的代理也是不可见的。十年积压的无障碍债务变成了集成债务(integration debt),而集成债务是挂钩付费客户的。

当流式 Token 遇到屏幕阅读器:生成式 UI 的无障碍债

· 阅读需 12 分钟
Tian Pan
Software Engineer

过去两年中最受赞誉的交互模式——文本逐字显现,仿佛机器正在放声思考——对于屏幕阅读器用户来说,这更像是噪音而非语言。你的模型输出的每一个 Token 都是一次 DOM 变更。如果在这个流中插入一个简单的 aria-live 区域,屏幕阅读器会尝试播报每一次到来的变更,从而产生断断续续、相互重叠的洪流,每秒钟会在句中重置几十次。使你的产品显得充满灵性的功能,恰恰是让那些依赖辅助技术的人无法使用它的元凶。

这就是无障碍债,而生成式 UI 积累这种债务的速度比以往任何界面模式都要快。其原因是结构性的:传统的 Web 内容是静态且可预测的,因此你可以推理一次后即发布。生成式界面在每次交互时都会发生变化——一个提示词返回列表,下一个返回表格,再下一个流式输出 600 字的文章,随后是一个工具调用组件。这里没有可供审计的固定 DOM,没有可验证的稳定 Tab 键顺序,也没有代表“页面”的单一快照。无障碍契约必须在无限的生成输出空间中保持有效,而几乎没有人为此进行测试。

没人做的 AI 无障碍审计

· 阅读需 12 分钟
Tian Pan
Software Engineer

打开你的智能体产品,开启 VoiceOver,然后发送任意提示词。如果你使用的是典型的带有内联推理过程的流式 UI,那么你在接下来的 30 秒内听到的内容并非你的产品。那是一股汹涌的局部 token 流、单词中间的重排、无人播报的状态变化,以及一段视力正常的用户选择查看、但盲人用户却无法逃避的推理独白。在舞台上演示效果极佳的界面,对于屏幕阅读器来说,是一场以语音形式发起的拒绝服务攻击。

这是 AI 团队中没有人会运行的审计。设计评审批准了流式动画。评估套件测量了回答质量。延迟仪表盘追踪了首个 token 响应时间。但这些工具都没有注意到,让某一群体感到产品快速且贴心的功能特性,却让另一群体完全无法使用。这种疏忽正开始出现在亲自诉讼申请中——过去十年一直在处理针对电商网站无障碍投诉的联邦法院,现在看到的 AI 界面相关投诉正急剧增加,据一家追踪机构报告,仅在 2025 年,同比增幅就达到了 40%。

生成式 UI 作为一种生产规程:当模型渲染屏幕时

· 阅读需 14 分钟
Tian Pan
Software Engineer

上周二发布给用户的按钮标签从未经过文案人员之手,从未在 Figma 中评审过,从未进行过 QA,甚至在推理阶段(inference time)之前都不存在。它是由一个模型生成的,该模型在对话中途决定,收集送货地址的正确方式是渲染一个包含六个字段的内联表单,而不是再进行三轮文字交流。表单生效了,标签也没问题。团队中没有人能告诉你究竟是哪次模型运行生成了它,因为追踪记录(trace)已经从热存储中移出,而评估套件测试的是文本输出,而非组件图。

这就是生产环境中的生成式 UI(Generative UI):模型不再仅仅是一个偶尔调用工具的文本生成器。它是一个输出为组件树的 UI 编译器,而设计系统现在是模型必须遵守的契约,而不仅仅是人类松散遵循的指南。这种转变打破了一整套假设——针对静态规范的 QA、固定布局的无障碍审计、最终字符串的文案审查、构建时的设计系统一致性检查——而大多数团队在替换掉这些旧流程之前,就已经发布了功能。

AI 界面中无人关注的可访问性鸿沟

· 阅读需 9 分钟
Tian Pan
Software Engineer

大多数 AI 团队都会对其落地页进行无障碍审计。但几乎没有人对聊天界面本身进行审计。这种差距并非源于懒惰 —— 而是因为工具根本不存在。WCAG 2.2 没有针对流式内容的成功标准,没有针对非确定性输出的标准,也没有针对逐个 token 传输的指南。这意味着目前每个将响应流式传输到 <div> 中的 AI 产品都处于合规灰色地带,同时破坏了很大一部分用户的体验。

这并不是一个微不足道的边缘情况。盲人和低视力用户报告称,寻求信息是他们使用 AI 的首要场景。患有诵读障碍、ADHD 和认知障碍的用户正积极尝试使用 AI 工具来减轻阅读负担 —— 而默认的实现模式却实际上让情况变得更糟。