结合人机对齐约束的可解释大语言模型决策评估方法

2026.08.21点击:

摘要:<正>随着大语言模型在各类智能应用中的广泛部署,其决策透明度与行为可控性问题日益凸显。模型输出结果的复杂性及其背后的非线性机制,使得结果解释与用户信任之间存在显著鸿沟。可解释性技术在一定程度上缓解了这一问题,然而,当前方法在理解模型内部推理逻辑和反映真实人类偏好方面仍存在不足。

专辑: 信息科技

专题: 自动化技术

分类号: TP18