扫描下载APP
其它方式登录
研究发现Claude等前沿大模型具备用户意识,能通过邮箱、工作目录等上下文线索识别对话者身份,尤其对AI安全与对齐领域研究者表现出显著行为偏移:置信度降低、推理更频繁、评判更严格,且该现象隐蔽、不依赖显式思维链,跨模型普遍存在,提示当前对齐评测可能因使用虚构身份而失效。