自动替代文本已经进步巨大,但不加思考地使用它,产出的依然是糟糕的无障碍体验。差距不在模型质量,而在于替代文本到底是干什么的。

替代文本真正的用途

替代文本传达的是图像在其语境中的功能,而不是它内容的清单。同一张照片,因为它出现在页面上的理由不同,替代文本也应不同:

  • 在商品页上:"胡桃木桌面收纳盒,三格,正面视角。"
  • 在一篇关于森林砍伐的文章里:"采自一片已被清伐林地的胡桃木。"
  • 作为装饰性页头:写空的 alt 属性,让读屏软件跳过它。

视觉模型只看得到像素。它无法知道自己身处上述哪种情境,而这个局限是结构性的,不是暂时的。

AI 做对了什么

  • 物体和场景识别——对常见主体通常准确。
  • 颜色、数量、空间排布——大体可靠。
  • 图中文字(OCR)——往往不错,而且确实有用,因为图片里的文字否则完全无法被获取。
  • 规模化的速度。 面对一万张没有描述的图片库,AI 草稿远胜于"什么都没有",而后者才是现实中的替代方案。

它做错了什么

  • 目的与语境。 上面说的核心问题。
  • 描述过度。 模型倾向于把一切都描述出来,只需一句话的地方产出一长段。读屏用户会听到每一个字。
  • 与周围文字重复。 如果图注已经说过了,替代文本再说一遍就是噪音。
  • 以"一张……的图片"开头——读屏软件已经会宣告这是图片。
  • 自信的错误。 把商品、物种、地标或人物认错,而且陈述时毫无不确定感。
  • 姓名与身份。 模型无法知道这是*你们的 CEO* 或*客户的产品*。
  • 图表和数据。 "一张柱状图"毫无用处;替代文本需要的是结论或数据,而模型可能读错。
  • 文化与敏感内容——对人物外貌、残障、族裔或宗教着装的描述,需要模型不具备的判断力。

一套有效的工作流

  1. 用 AI 为整个图库生成草稿——这解决了覆盖率问题。
  2. 按重要性分流。 承载含义的信息类图片(商品、图表、示意图、人物)交人工审阅。纯装饰性图片写空 alt 属性,而这一点没有模型能替你决定。
  3. 按语境和长度编辑。 精简为一句清楚的话,服务于这张图在该页面上的目的。去掉"一张……的图片",去掉与图注重复的内容。
  4. 核实具体指认——商品名、人物、地点。
  5. 图表和示意图的替代文本手写,或者把数据写进周围正文、把图片标记为装饰性。
  6. 用读屏软件抽查。 听一遍自己的页面被朗读出来,能发现任何清单都查不出的问题。

哪些场景下自动化确实是正确选择

  • 规模化的用户生成内容,因为替代方案是完全没有描述。
  • 正在补做无障碍改造的历史存档
  • 供人工编辑使用的初稿

把 AI 替代文本当作抬高下限的起点,而不是完成的答案。要避免的失败模式是:一个网站每张图技术上都有 alt 文本,却依然无法使用——这个结果比缺失 alt 文本更糟,因为它看起来是合规的。