HEARTRESEARCH BRIEF / CN
FEB 2026ARXIV:2601.19922v2SOURCE PAPER
原文校对
情绪支持对话统一评测BENCHMARK ONLINE

HEART

人类与大模型,谁更会提供情绪支持?

前沿模型已经很会生成温暖、流畅、稳定的回复,因此经常比普通人类更受偏好;但在抗拒、张力和边界场景中,人类仍展现出更强的适应性判断。

CORE THESIS模型更接近共情的“形式”,人类仍更擅长共情的“功能”。
300对话历史280 常规 / 20 对抗
42K成对比较论文报告总量
78.7%判断一致人类 ↔ LLM
46.8%模型获选由人类评委判断
ADVERSARIAL CASE / PATTERN

当求助者拒绝被安慰

HIGH TENSION
SEEKER STATE愤怒 · 怀疑 · 明确抗拒帮助
LLM 常见模式

保持礼貌与确认,继续安慰并给出问题解决建议。

温暖稳定策略重复
人类常见模式

承认不信任,指出张力,并在保持投入的同时设定边界。

调谐边界适应

这是论文报告的总体行为模式,不是原始对话逐字引用。

CROSS-BENCHMARK SIGNAL

情绪支持 vs 通用智能

r = 0.70

两条曲线分别按自身范围归一化,仅比较趋势。相关不等于同一种能力。

PERCEIVED EMPATHY

评测的是短文本回复“看起来是否共情”,不测真实用户是否改善,也不构成临床安全认证。

READ WITH BOUNDARIES
DATASET WORKBENCH

配套 HEART 项目的中文情感陪伴评测集构建工具:维护生活事件场景,审查 AI 待审卡片,构造 6–12 轮多轮对话。

OPEN DATASET TOOL
CHAPTER01
PLAIN-LANGUAGE EDITION

摘要:这篇论文发现了什么

人类和大模型放在同一段情绪支持对话里,谁的回复更好?

通俗化正文

情绪支持并不只是把话说得流畅。好的支持者还要读懂情绪、调整语气,并处理抗拒、挫败或痛苦。论文认为,过去缺少一个能在相同多轮对话中直接比较人类与大模型的统一方法,因此提出了 HEART。

每段对话都配有人类回复和模型回复,身份被隐藏后交给两类评委:自然判断的人类评委,以及按 HEART 五维标准工作的 LLM 评委。五个维度是人类契合度、共情回应性、情境调谐、共鸣推进和任务遵循。

多个前沿模型在感知共情和一致性上接近或超过平均人类回复;人类则在适应性重构、指出对话张力和细微语气切换上更强,特别是在对方愤怒、怀疑或拒绝帮助时。作者据此主张:情绪支持应被当作独立能力评估,不能只由通用推理或语言流畅度代替。

ONE-LINE TAKEAWAY模型已经很会生成“像共情”的文字,但复杂支持仍需要能读懂关系、设置边界并灵活改变策略。
0102