文章主要内容总结
本文聚焦大型语言模型(LLMs)在演绎定性编码中的可靠性评估,以ChatGPT为研究对象,通过比较议程项目(CAP)主编码手册,将美国最高法院案例摘要分类为21个主要政策领域,系统测试了四种干预策略(零样本、少样本、基于定义、分步任务分解)的效果。研究发现:
- 分步任务分解策略表现最优,准确率达0.775,Cohen’s κ为0.744,Krippendorff’s α为0.746,达到“实质性一致”阈值;
- 干预策略对分类结果影响显著(如基于定义与少样本策略的Cramér’s V=0.613);
- 即使案例摘要存在语义模糊,ChatGPT在不同样本中仍表现出稳定一致性,包括低支持度子类的高F1分数。
研究表明,通过针对性干预,LLMs可达到足以融入严谨定性编码工作流的可靠性水平。
创新点
- 聚焦未充分探索的领域:现有研究多关注LLMs在归纳编码中的应用,本文首次系统探究其在结构化演绎编码中的表现;
- 提出新型干预策略:设计“分步任务分解策略”,通过引导模型明确推理步骤(识别参与者、确定核心政策问题等),显著提升可靠性,效果优于传统零样本、少样本等方法;
- 多维度评估体系:结合准确率、F1分数、Cohen’s κ、Krippendorff’s α等指标,同时通过卡方检验和Cramér’s V分析结构效度,全面评估不同干预策略的差异及政策领域特异性。