Page 78 - 《党政研究》2026年第4期
P. 78

时所包含具体操作规范和可审计流程却是一片空白。对于硅基样本可能固化社会已有的偏
             见,或者由于结论的权威性的外观而造成的误导性社会影响的重大风险还没有形成有效的
             防控机制。
                  维度二:科学效度与伦理规范存在着效度失范,这是硅基样本研究走向成熟的最主要
             障碍。如果效度有问题,那么所有基于硅基样本的研究结论都是站不住脚的,而伦理失范
             也会带来无法预知的不良影响。二者相互交织就会造成该领域基础不牢固、发展无序的局
             面。因此,为了使硅基样本研究能够健康发展,需要有一个贯穿整个研究过程的方法论评
             估体系。它既是对技术性的整合,也是对于计算政治学在智能转向之后如何建立起科学可
             信度和伦理正当性这个元问题的一种回应。就上述两重困境来说,创建起一套完整的评价
             体系,它的目的就是要把效度检验从零散的、事后的比较的形式变为结构化的、贯穿于整
             个研究过程中的质量保证程序。同时把伦理考虑具体化为可以执行的技术标准和研究准
             则。

                 一、硅基样本技术原理与范式内涵

                  作为驱动计算政治学智能转向的核心载体,硅基样本的本质、生成机制以及范式潜能
             亟待系统的理论阐释。通过对这一人工智能时代新的技术工具运行原理和理论意义展开分
             析,可以跳出对具体应用场景的描述,为之后搭建评估框架奠定必要的概念和分析基础。
             首先,主要分析硅基样本的技术生成逻辑,以大语言模型为基础的社会知识隐性编码怎样
             构成它的模拟能力。其次,解析硅基样本从静态文本回应到动态交互行动元的概念谱系与
             能力演进,界定它作为一个数字研究对象的独特内核。最后,证明硅基样本改变了研究对
             象、研究方法、研究目标,把政治学的研究由对历史数据的追溯转变为能够仿真、实验的
             社会政治过程的建构与干预。上述分析框架,不仅回答了硅基样本本体特征以及为什么促
             使学科变革的根本问题,给人们认识这个新范式提供了一个连贯的技术认识论基础,也为
             之后全面考察它的方法论运用效果和伦理方面的难题打下了扎实的理论根基。
                  (一)大语言模型:硅基样本的生成引擎
                  硅基样本 ( Silicon Sample)是指在人工智能技术不断发展的过程中出现的一种新的研
             究对象,它的产生、表现以及相互之间的联系都是依靠大量的人类文本作为语料,并且使
             用复杂的神经网络作为结构来实现的。大语言模型是硅基样本的技术基础和生成引擎,它
             的主要价值就是用数据驱动的隐式学习的方式把原来分散、模糊、难以量化的社会认知、
             文化规范等压缩成一个可以被计算、调用的参数化知识体系。
                  硅基样本所依托的大语言模型通过学习任务,在由几十亿到几百亿个标记组成的语料
             库中,预测序列里下一个词出现的概率。这一看似简单的语言建模过程,实际上是模型对
             人类社会的知识体系做了一次系统性重构。无论是新闻报道、政策文献、学术著作,还是
             社交媒体上的日常对话,这些语言文本不只是词语的集合,更是对社会结构、历史脉络、
             文化价值观及群体互动方式的记录和积累。模型在识别词和词之间的联系的时候,也在学
             习文本背后隐藏的社会逻辑和社会认知结构,并且把这些社会知识转化为一个巨大的参数
             集,也就是社会知识图谱。在这套图谱中,政治概念、社会身份、行为模式及情感倾向等
             内容,都以向量空间中的几何关系和权重分布形式被编码其中。正是这种社会知识的隐性
             编码,使大语言模型具备了回应提示、产生拟社会特征文本的涌现能力。研究者通过精心
             设计的提示词让模型扮演具有特定年龄、职业、教育程度和政治观点的虚拟个体时,模型
             并非简单进行角色扮演,而是在内化了与该描述有关的所有社会认知模式后,进行概率性
             推理和生成,调用内化的该群体可能拥有的经验、态度和话语方式来合成类似真实人类的
             回应,从而产生最基本的数字实验样本,即静态的、基于单次问答的虚拟实验对象,“并

                                                                                                      7 7 ·  ·
   73   74   75   76   77   78   79   80   81   82   83