情绪支持并不只是把话说得流畅。好的支持者还要读懂情绪、调整语气,并处理抗拒、挫败或痛苦。论文认为,过去缺少一个能在相同多轮对话中直接比较人类与大模型的统一方法,因此提出了 HEART。
每段对话都配有人类回复和模型回复,身份被隐藏后交给两类评委:自然判断的人类评委,以及按 HEART 五维标准工作的 LLM 评委。五个维度是人类契合度、共情回应性、情境调谐、共鸣推进和任务遵循。
多个前沿模型在感知共情和一致性上接近或超过平均人类回复;人类则在适应性重构、指出对话张力和细微语气切换上更强,特别是在对方愤怒、怀疑或拒绝帮助时。作者据此主张:情绪支持应被当作独立能力评估,不能只由通用推理或语言流畅度代替。