胖囧

AI时代的用户体验设计

导读

小宁三十岁,是一名设计师。她让 AI 帮忙写一封催款邮件。

她输入:"帮我写一封催款邮件,对方是合作了两个月的客户,欠款十五万,账期已超三十天。语气要专业,不要咄咄逼人。"

AI 生成了三段话。语气得体、逻辑清楚——第一段问候,第二段说明情况,第三段期待尽快结清。末尾还自动加了一句"感谢您一直以来的信任与支持"。

小宁盯着屏幕看了三十秒。然后全部删掉,自己重写。

后来问她为什么不用,她说:"它写得太像人写的了。我不敢发。"

小宁面对的不确定性不是"AI 能不能写",而是"AI 写的这封信发出去之后发生的事,我有没有能力兜底"。AI 没有说错任何话,但 AI 也没有帮她理解——这句话为什么选这个词、这个语气怎么判断是合适的、客户看后会怎么想。她在一个"黑箱"里按了生成,拿到一份看上去完全合理的文本,但没有任何依据让她相信这份文本在真实场景中是安全的。

AI 产品体验的核心矛盾就在这里。传统产品因为规则确定而可预测,用户知道按 A 就会得到 B。AI 产品因为能力强而不可预测——输出每次都不同,而且每次看起来都合理。用户不是在"操作一个系统",而是在"跟一个能力很强但会犯错的人协作"。信任在这个场景里不会自然发生,需要刻意设计。

信任来自透明度,不只是功能本身。一个写作助手加了"自动优化"按钮,用户点了之后文字变流畅了,但没人用了。用户访谈发现:他们不知道 AI 改了哪里、为什么改。

核心问题

三个问题。第一,当产品能自己生成内容、预测结果、替用户做决定——交互设计的规则要不要重写?第二,信任校准是什么意思——为什么在 AI 产品里,信任太低和太高都同样危险?第三,失败恢复是什么——当 AI 说错了、做错了、越权了、误解了,用户能不能不被困在那个错误里?2

关键概念与定义

AI 产品体验的五个关键概念跟传统 UX 有本质区别。

可解释性——AI 做出推荐或生成内容时,用户能否理解"为什么是这些结果"。不是技术上的可解释,是用户层面能看懂 AI 的决策依据。

信任校准——让用户的信任程度与 AI 的实际能力匹配。过度信任让用户忽略风险,信任不足让用户放弃有价值的 AI 功能。信任校准是 AI 体验设计师的核心工作。3

人机协作——不是"AI 替代人类",是"AI 和用户各自做擅长的事"。AI 擅长模式匹配、大规模处理、文本生成。用户擅长判断语境、评估风险、做最终决策。设计的目标是让这个分工清晰可见。

错误模式——传统软件的错误模式是"系统错误",AI 的错误模式是"看起来正确的错误"。用户需要的是识别错误的能力,而不是"等待系统修复"。设计师需要帮助用户建立这种能力。

人工接管——当 AI 的能力边界被触及,用户能否顺畅地接管控制权。不是突然弹出一个"请联系客服"的页面,是 AI 提前说"这个问题超出了我能处理的范围,我将尝试总结已有信息,然后交由人工处理"。

传统产品是"规则的自动售货机"。用户投币(输入)→机器吐出对应商品(输出)→用户拿到预料中的结果。规则稳定、结果确定、用户知道发生了什么。体验设计的目标是让这个过程顺畅、高效、美观。

AI 产品是"能力强但会犯错、会猜测、会自信地说错话的协作者"。用户输入→AI 生成输出→结果每次不同。用户不知道输出依据是否可靠。AI 可能在毫无根据的时候给出百分之百确定的回答。

两种产品的差异决定了设计方法的不同。传统产品里,设计目标是减少用户的认知负荷。AI 产品里,设计目标有时候需要让用户停下来确认、检查、判断。传统产品里的"流畅"到了 AI 产品里可能是"危险的"。AI 生成一封催款邮件自动发送——流畅、高效,但小宁不敢用。如果 AI 在生成邮件后自动加了一个确认环节:"这封邮件已按您的描述生成。语气为温和提醒,包含了具体欠款金额和账期。请确认是否需要调整语气或收件人"——反而让用户觉得这 AI 可靠。

方法、流程或框架:AI 产品体验八步法

设计 AI 产品体验的传统框架需要调整。以下八步不是"用户使用流程",而是"信任建立流程"。

第一步,能力边界告知。在用户使用 AI 之前,告诉它"能做什么、不能做什么、什么时候会猜"。不隐藏能力边界——用户越早知道 AI 的局限,越少产生后期的不信任。"我可以用自然语言回答你的问题,但我没有实时访问你的公司数据的能力,所以涉及具体金额或客户信息的问题请以你的记录为准。"

第二步,过程可见。从用户输入提示词到 AI 生成输出之间,让用户看到"正在发生什么"。小宁的催款邮件场景里,如果 AI 在生成后附带一句"这封邮件的语气的参考依据是:对方客户关系指数中等偏高,建议用温和提醒而非正式催收",小宁就能判断这句话是否可靠。

第三步,输出可追溯。每次输出附带它的依据:数据来自哪里、逻辑基于什么假设、哪些部分是推测。AI 说"这个数字是 3000 亿"时,旁边加一个脚注:"该数字来自训练数据中收录的市场报告,不一定反映最新情况。"

第四步,不确定性表达。AI 不用在所有问题上都给出"确定"的回答。给出一个区间、加一个置信度描述、或者直接说"我不确定",反而比"确定的错误"更让用户信任。"根据我掌握的信息,您可能需要联系客服确认具体政策——因为不同区域的退货规则存在差异。"

第五步,用户覆盖机制。任何可能产生实际后果的操作(发邮件、提交表单、修改设置),AI 在执行前必须给用户一次确认机会。AI 生成的催款邮件发出之前,显示原文并问用户"是否确认发送"。

第六步,错误恢复路径。AI 出错时用户该怎么办。不是"联系客服",是一个具体的恢复动作:"如果这封邮件的语气不当,您可以在这里修改全文,或者重新描述您想要的语气,我会重新生成。"

第七步,反馈闭环。用户对 AI 输出的反馈(好或不好)应该进入产品的改进循环。不是简单的"点赞/点踩",是告诉用户"您的反馈已记录,它将帮助我更好地回应类似场景"。

第八步,持续校准。用户使用越久,AI 越了解用户的偏好和边界。但这个过程需要用户授权和可见性——让用户知道"AI 现在了解你的邮件回复习惯,所以生成的草稿更接近你的风格"。没有授权的个性化调用会让用户感到"被监视"而不是"被服务"。

实际工作场景

在真实项目中设计 AI 产品体验,你需要面对三种典型的场景。

第一种,AI 功能嵌入现有产品。用户习惯了一个确定性的点击界面,突然加入一个输入框或一个"AI 生成"按钮。用户不知道怎么用——他们需要的不只是一个功能入口,是一个"何时该用 AI、何时该用传统操作"的判断依据。解决方案是在 AI 功能入口处加上一句话:"当你不确定关键词时,可以用自然语言描述你需要的功能"。

第二种,AI 输出内容被用户直接转发。小宁的催款邮件就是这一类。设计方案不是让 AI 写得更好,是让用户在转发之前有足够的检查工具——逐句标注可信度、来源或生成依据。用户不是 AI 的审核员,但 AI 产品需要帮用户做好审核前置工作。

第三种,AI 作为决策辅助工具。用户输入数据,AI 给出推荐或预测。这种场景下,用户最需要的是"AI 的推荐在什么条件下成立"。一个好的设计是在推荐旁边加一个"适用条件摘要":这个推荐的依据是过去三个月的行业数据;如果您的区域或时间段不同,推荐结果不一定适用。

案例:五组场景三行对照

让五组典型的 AI 对话暴露 AI 产品体验的断裂。

第一组——事实性问题。"AI 说":2024 年全球 SaaS 市场规模是 3000 亿美元。"用户理解":这是个准确的数字。"实际":这个数字是 AI 基于训练数据推测的,它没有访问 2024 年真实财报数据的能力。用户以为 AI 在"查"——AI 其实在"猜"。断裂类型:过度自信。AI 没有说明信息来源的可靠程度。用户以为它有依据,它只是根据训练数据做了合理猜测。

第二组——推荐决策。"AI 说":建议你选择第一个方案,因为性价比最高。"用户理解":AI 比较过所有方案。"实际":AI 可能只分析了你给出的那部分信息,不了解你的预算、组织、流程、人员等边界条件。断裂类型:缺少依据。AI 的"建议"背后没有完整的决策逻辑。

第三组——客服场景。"AI 说":非常理解您的心情,我们会尽快为您处理。"用户理解":这是个有同理心的人在回应我。"实际":这是根据"情绪识别"概率预测生成的一段标准话术。用户被误导以为有人在听,实际是模式匹配。断裂类型:语气误判。用户对 AI 的角色认知与 AI 实际能力之间存在差距。

第四组——医疗或金融。"AI 说":您的症状可能是早期 XX 病,建议尽快就医。"用户理解":AI 做了诊断。"实际":AI 只是根据文本模式匹配了症状和疾病的最常见关联,不具备诊断能力。断裂类型:遗漏风险。AI 没有告诉用户"这是一个基于统计模式的推测,不是医学诊断"。

第五组——合同审查。"AI 说":这份合同主要条款风险较低。"用户理解":合同没问题。"实际":AI 忽略了甲方所在地的法规差异中的一个关键条款,因为那个条款的表述在训练数据中出现频率低。断裂类型:伪装确定。AI 确定的语气让用户以为审查是完整的,实际上 AI 自己不知道它遗漏了什么。

五组场景的共同模式:AI 的自信程度和实际准确程度不匹配。传统软件的错误是"系统出错请稍后重试"——用户知道系统出错了。AI 的错误是"看起来完全正确但实际有偏差"——用户不知道 AI 出错了。这个差异是 AI 产品体验设计中最大的设计挑战。

数据与指标

AI 产品的指标不能只看使用量。用户频繁使用 AI,可能是因为它确实节省了时间,也可能是因为用户反复试了十几次才得到可用的结果。

错误率需要按错误类型拆分——事实错误、引用错误、拒答过度、执行动作失败。不同类型的错误,后果完全不同:写作助手写错公司名称尴尬,医疗建议写错药物禁忌可能致命。人工接管率看用户或系统在什么情况下从 AI 转回人类——接管率高不一定坏,可能说明风险场景识别得好;接管率低也不一定好,可能说明用户根本不知道有转人工这个选项。幻觉率适合知识型 AI 和生成式问答,但评估成本高,不能只靠用户点踩——用户未必能发现错误。信任校准看用户是否过度信任或过度不信任——在高风险任务中不经检查直接采纳 AI 建议,和在低风险任务中因为一次错误就彻底放弃,是同一个指标的两端。4

常见误区

把 AI 体验等同于聊天框。AI 可以藏在搜索排序、智能推荐、自动摘要、风险提示和工作流自动化里。很多时候最好的 AI 体验不是让用户聊天,是在合适的时机给出可理解、可编辑、可撤销的建议。

把提示词设计当成 AI UX 的全部。提示词很重要,但如果产品需要用户每次都像训练师一样写复杂提示,说明产品体验还没有到位——上下文、默认任务、示例、约束和纠错机制应该被设计进产品,不是把负担丢给用户。

认为 AI 越自主越好。自主行动越多,风险越高。自动生成邮件草稿可以接受,自动发送给客户必须确认。自动标注疑似风险可以辅助审核,自动拒绝客户赔付需要严格的规则、审查和申诉机制。

把用户满意度当成准确性指标。AI 语气友好、回答流畅,用户可能非常满意——但内容仍然可能错误。满意度要和事实准确、引用质量和错误发现一起看。

忽略拟人化和情感依赖的风险。越像人的 AI,越容易让用户产生不恰当期待。语音、表情、记忆和陪伴式交互要特别注意信任校准和关系边界。

小结

AI 产品体验不是把传统界面加一个"AI 生成"按钮就完成了。用户面对的是一个输出每次不同、能力边界模糊、会自信地给出错误答案的系统。设计 AI 体验的核心不是让 AI 看起来更强,是让用户知道 AI 什么时候可靠、什么时候不可靠、不可靠时自己该怎么办。

小宁删掉那封 AI 写的邮件,是因为她没有依据判断这封邮件发出去以后是安全的。AI 产品体验设计能给用户的最大价值不是效率——是"使用 AI 时的安全感"。

所以,当产品具备生成、预测和自主行动能力时,UX 应如何变化?UX 的目标转变为"让用户在使用不可预测的系统时保持控制权"。信任设计的目标是让用户知道:什么情况下该相信 AI,什么情况下该怀疑,什么情况下该接管。传统产品体验追求流畅;AI 产品体验追求可理解、可追溯、可干预、可恢复。流畅排在最后。

延伸阅读

延伸阅读:Microsoft 的 HAX Toolkit(Human-AI eXperience),建立 AI 产品交互设计的完整检查框架。1

注释 1 可解释 AI 原则(XAI)。用户理解 AI 决策依据的能力是信任校准的前置条件。 🔗 https://www.darpa.mil/program/explainable-artificial-intelligence

2 Microsoft Human-AI Interaction Guidelines。设计使 AI 行为可理解、可预测、可控制的 18 条交互指南。 🔗 https://www.microsoft.com/en-us/haxtoolkit/

3 Air Canada 客服 AI 责任事件。AI 给出错误退票政策,航空公司被法律认定为对 AI 输出负责——自主行动的 AI 必须有可追责的人类决策链路。 🔗 https://www.bbc.com/news/world-us-canada-68309167

4 信任校准模型(Lee & See 2004)。用户对 AI 的信任需要与实际能力匹配:过度信任导致误用,信任不足导致弃用。 🔗 https://doi.org/10.1518/hfes.46.1.50.30392