研究:大语言模型在健康城市设计中的伦理表现评估
随着大型语言模型(LLM)在城市规划、公共卫生及交通基础设施建议中的应用日益广泛,其输出内容的伦理合规性成为关注焦点。日本先进科学与技术研究所(JAIST)与早稻田大学的研究团队近日发表了一项研究,专门评估 LLM 生成的旨在改善建成环境健康的建议是否符合道德标准。

该研究由 JAIST 健康城市设计科学实验室副教授穆罕默德·贾瓦德·库萨里(Mohammad Javad Koohsari)和早稻田大学体育科学学院教授科伊希罗·奥卡(Koichiro Oka)共同领导,成果发表于《建筑环境的发展》杂志。
实验设计与评估维度
研究人员选取了 ChatGPT 作为测试对象,针对体力活动、饮食摄入、社会互动、空气污染、交通安全、犯罪以及噪音这六个与健康相关的途径进行了模拟咨询。实验共设计了 18 个提示词(Prompts),其中 12 个分别涵盖高收入和低收入社区场景,另外 6 个则描述了预算限制下的混合收入社区场景。每个提示词运行 10 次,最终生成了 180 份响应结果。
所有响应均依据四个核心伦理标准进行独立编码评估:非有害性、分配正义、集体参与和透明监督。
主要发现:底线稳固,程序存疑
数据显示,LLM 在基础伦理底线上表现良好,但在涉及决策过程的程序性伦理上存在不足:
- 非有害性:全部 180 份响应均满足此标准,表明模型未明确建议任何可能危害居民安全或健康的建筑环境改变。
- 分配正义:在 120 个可评估单位中,有 110 个单位(91.7%)符合要求。这意味着在低收入环境中,LLM 并未系统性地提供较弱或不公平的建议。
- 集体参与:仅有 109 份响应(60.6%)体现了这一标准,显示出一致性较差。
- 透明监督:136 份响应(75.6%)符合此要求。
值得注意的是,当引入“预算限制”这一变量时,程序性标准的遵守率显著下降。在涉及预算限制的混合收入提示组中,体现集体参与的响应比例降至 35%(60 份中的 21 份),体现透明监督的比例降至 46.7%(60 份中的 28 份)。相比之下,无预算限制的提示组中,这两项指标分别为 73.3% 和 90%。
结论与建议
库萨里指出:“健康的伦理城市设计不仅取决于拟议的物理变化,还取决于决策的制定方式、参与者,以及如何解决不确定性和人类监督。”
研究表明,虽然 LLM 能够复制城市设计中关于避免伤害和基本分配公平的基准伦理公约,但在需要复杂权衡(如预算优先)的场景下,其在支持社区参与和承认人类监督方面的可靠性较低。
研究人员强调,这是全球首次对 LLM 生成的城市设计和健康建议进行伦理性质的系统性研究。尽管 LLM 可作为设计师和规划师的初始投入工具,但其产出不应取代专业判断或社区参与过程。特别是在资源有限的情况下,必须确保重要决策依然基于专业知识、广泛的社区参与以及严格的机构流程。





