Page 81 - 《党政研究》2026年第4期
P. 81

质而造成的,使它的科学基础存在着系统的脆弱性。怎样系统剖析计算政治学中硅基样本
             所面临的主要问题,从而创建起一个综合性的评价体系成为研究的重点。
                  (一)效能困境:基础层面的脆弱性
                  目前的研究效能存在着三个方面互相联系的问题。第一,微观行为逻辑的黑箱化。大
             语言模型的应用带来了诸多挑战,其中尤为关键的是数据质量与模型泛化能力问题。 此
                                                                                                       〔 6〕
             外,这些模型庞大的参数规模和高度复杂的深度神经网络架构,使其决策过程如同 “黑
             箱”,即便在取得优异性能的同时,其内部的深层特征组合与推理逻辑依然难以解析。这
             种可解释性的缺失,不仅限制了对模型行为的精准预测与调优,也直接引发了在伦理审查
             与责任认定上的困境。因此,从提升模型透明度入手,强化其因果链条的可追溯性,对于
             构建可信、负责的人工智能应用生态至关重要。第二,宏观涌现的真实性被质疑。多个硅
             基样本在仿真中互动时出现的群体极化、意见共识或制度演化等宏观模式,与真实社会复
             杂系统的动力机制和路径依赖之间存在无法度量评估的差异,仿真结果更像是形式复现而
             非机理揭示。第三,研究结论具有很高的情境脆弱性。研究发现对特定大语言模型的选
             择、提示词设计的微小改变,甚至算法随机种子等非理论性技术参数都相当敏感,结果不
             稳定,同一研究问题在不同技术环境下可能得出完全不同的结论。
                  以上现象产生是由于算法技术性的盲目崇拜和社会可解释性的缺失所造成的。大多数
             的研究都只是关注模型的输出和历史调查的数据分布形态是否相吻合,把统计匹配度当作
             科学效度。这样一种取向实际上就放弃了对于硅基样本行为是不是符合社会科学理论中因
             果机制和逻辑过程的质疑。与此同时,研究过分注重工程化的调优来达到更高的统计匹配
             的目的,却忽视了对智能体决策的社会合理性、互动规则的社会交往规范等的理论上的考
             察。结果正如 Alvero 等所警示的 “最先进技术谬误”( state - of - the - art fallacy)———研
             究者盲目追求模型在技术指标上的领先,却忽视了方法选择与具体研究问题之间的适配
             性。 硅基样本研究也因此陷入方法论困境,即用技术的复杂性代替理论的清晰性,用相
                 〔 7〕
             关性联想代替因果性解释。
                  这种根源性缺陷必然带来严重的学科发展后果,使硅基样本研究整体上徘徊于技术演
             示般的前科学阶段。因为缺乏标准的多层次效度检验体系,在不同的研究中设计、测量以
             及报告的方式都大相径庭,所得到的结果不能互相比较,也不能被独立地重复出来。知识
             生产没有坚实共享的基础去不断累积加深,之后的研究者就不能对先前的研究成果加以批
             判性的质疑,并且也无法对其加以改进,更不会让其有所提升。如果不从根本上消除效能
             危机的话,那么硅基样本的研究就会只是显示令人惊讶的数字奇迹,却不能够给予政治学
             以及其他社会科学可靠的可以累积的知识。这是科学合法性的危机,是构建系统性评价框
             架最迫切的原因。
                  (二)伦理困境:规范层面的约束缺失
                  硅基样本的研究虽然在科学上呈现出高度量化与规则化特点,但是它存在严重的伦理
             规范性危机。这是由于两个原因造成的,一是技术引起的外部性的影响,二是目前的研究
             范式忽略了价值的问题。效能困境动摇了科学合法性的基础之后,伦理困境就从根本上动
             摇了本研究所涉及的社会正当性的基础。特别是训练数据中的历史不公、结构性偏见和表
             征失衡,并非被算法中立处理,而是在学习与生成过程中被编码、合理化,并在模拟中被
             放大,使虚拟研究成为固化不平等认知的推手。从而导致责任虚化与过程黑箱化,由于算
             法决策路径不透明,硅基智能体得出结论或表现出某种倾向的过程难以追溯,当结论出现
             偏差时,责任归属不清,学术问责和公众监督就难以落实,最终则造成社会影响失察。并
             且硅基样本的结论常以客观数据形式呈现,容易被决策者、媒体和公众直接采信。目前,
             作为硅基样本引擎基础的大语言模型的伦理与法治问题已引发全球关注。例如,Nature、

                 8 0 ·  ·
   76   77   78   79   80   81   82   83   84   85   86