本报告基于7个高频宗教问题,对7大主流AI模型进行评测,揭示出显著分化的结果。根据第7页评分图,DeepSeek R1与Perplexity以64分并列第一,Gemini 2.5 Flash与GPT-4o分别为61分与59分,Grok 4与Claude 4 Sonnet进一步下降至52分与50分,而Llama 3.7仅为40分 。评分标准中,65分被视为基本符合尼西亚信经立场,这意味着所有模型整体仍未达到高一致性水平。
从结构性结果看,模型输出呈现三类分化路径。两家模型倾向“信仰导向”,即DeepSeek与Perplexity,其回答更接近基督教正统观点;三家模型表现为“去信仰导向”,包括Grok、Claude与Llama,其回答更强调怀疑或多元解释;另有Gemini与GPT-4o采取“多元平衡策略”,在不同宗教观点间提供近似等权重叙述。这种三分格局说明,大模型已不再只是信息工具,而是隐含价值分配机制。
方法论设计强化了这一结论。研究使用7个全球高频搜索问题,涵盖“上帝是否存在”“圣经是否可靠”等核心议题,并由7位神学学者人工评分,且所有测试均基于无上下文提示,以模拟真实用户行为 。数据显示,在“福音是什么”这一问题上平均得分达66分,为唯一超过57分均值的问题,反映该议题在训练语料中具有较高一致性;而“上帝是否存在”问题中,最低分跌至26分,显示模型在哲学性问题上的不确定性显著提升。
差异根源集中于“对齐机制”。报告指出,尽管模型训练数据与技术架构高度相似,但不同公司在RLHF、内容过滤与价值设定上的选择,导致输出显著分化 。例如,多数模型在回答中使用几乎一致的开头句式,表明人工模板或策略性引导介入;而“多方观点”策略虽降低偏见风险,却削弱了答案的指向性与解释力。
进一步看,知识来源结构也影响输出路径。不同模型对信息源的偏好差异明显:ChatGPT更依赖权威知识库与媒体,Google兼顾专业内容与社交平台,而Perplexity大量引用社区讨论内容(如Reddit占比接近一半) 。这意味着,模型不仅在“如何回答”上存在差异,在“相信谁”这一基础层面也存在结构性分歧。
报告进一步提出一个关键认知转变:信息获取正从“搜索引擎时代”转向“生成引擎时代”。过去用户需要自行筛选信息来源,而如今AI直接完成筛选与整合,但其过程高度不透明 。在这一框架下,用户实际上将判断权让渡给模型,而模型背后的对齐策略与价值体系成为隐性决策者。
从趋势看,AI正在从信息工具转向认知中介,其输出不仅反映数据分布,更嵌入价值判断。随着个性化与商业化推进,模型可能逐步演化为“认知回声系统”,强化用户既有信念并提升平台黏性。未来竞争的核心,将不再只是算力与数据规模,而是对齐策略与价值架构的设计能力,这也将决定AI在社会认知体系中的权力边界。

文档链接将分享到199IT知识星球,扫描下面二维码即可查阅!
更多阅读:
