观点与研究方案 · 研究稿
人工智能辅助写作:证据约束与事实核验
摘要
人工智能辅助写作需要同时满足可读性与事实可追溯性。本文综合 12 篇生成、检索与事实评价研究,提出证据台账及独立审核流程,检验其能否在不降低必需事实覆盖率、不增加拒答的条件下提高事实支持比例。拟议方案在匹配预算下成对比较人工、直接生成和检索增强流程,分别记录支持、覆盖、遗漏、待核查主张与验证成本。本文不报告原创实验,历史选文不能证明当前产品性能或专业领域事实保证;所提方法仍需实证检验及责任作者审定。
1 问题与核心论点
当写作需要保留数字、来源和限定条件时,怎样把可读性与可核查性同时纳入流程?本文关注公开或获授权材料的写作,不把一般模型能力推断为专业领域事实保证。
2 文献范围与研究脉络
本文目的性选取 12 篇研究文献,按研究问题进行叙述性综合,不是系统综述或荟萃分析。所选文献首次提交于 2017—2024 年,未覆盖截至 2026 年的全部进展。2026 年 9 月 8 日核对题名、作者、提交日期、公开摘要、来源页与 PDF 入口;区分原始研究、技术报告和综述,不将它们视为同等强度的实验证据。对 FActScore、ALCE、EvalPlus 与 τ-bench 的相关方法段落此前进行了定向核查,未逐篇全文审查或复现实验。
Transformer 以注意力机制构建序列转换架构,为后续语言生成研究提供了重要技术基础。[1]GPT-3 研究展示了通过文本示例完成多种任务的少样本能力,同时报告了任务差异与训练语料带来的方法学问题。[2]
T5 将语言任务统一为文本到文本问题,并比较预训练目标、架构和数据等因素;任务形式的统一不等于评价标准相同。[3]BART 通过破坏文本再重建的去噪预训练研究生成与理解任务,说明训练目标是影响文本生成能力的一项设计因素。[4]
RAG 将参数化语言模型与外部检索记忆结合,使知识密集型生成任务能够利用检索段落。[5]REALM 把知识检索器纳入语言模型预训练,探索从大规模文档中获取知识,而非仅依赖模型参数保存事实。[6]
InstructGPT 通过人类示范与偏好反馈改进指令遵循;作者也明确指出,经过这一过程的模型仍会犯简单错误。[7]TruthfulQA 以容易诱发常见误解的问题评价回答真实性,提醒研究者区分语言模仿能力与事实正确性。[8]
FActScore 把长文本拆成原子事实,评价其中得到可靠知识来源支持的比例,而不是给整篇文字一个笼统的真假判断。[9]ALCE 将流畅度、正确性与引用质量分别评价;附有引文的回答,仍可能存在证据不能完整支撑论述的问题。[10]
Chain-of-Verification 采用初稿、验证问题、独立回答和修订的流程,在所研究任务中减少幻觉。[11]Lost in the Middle 发现相关信息在上下文中的位置会影响所测模型的表现,长输入容量并不自动保证充分利用全部材料。[12]
3 综合论证与拟议方法
上述研究分别处理训练、检索和评价,不能合并成一个“写作准确率”。本文据此提出:先列出事实及原文位置,再组织段落;无法定位证据的内容保留为问题,不让流畅表达掩盖材料缺口。长材料应按主题建立可追溯摘录,而不是只增加输入长度。
为每条可核查主张保存原句、来源、页码或段落、访问日期和核验结论。初稿后另行检查数字、名称、因果关系及“计划/已经”等状态词。模型自查可以生成核验清单,但最终确认必须回到材料;付诸发布前由负责人审阅。
4 研究命题与对照
在必需事实覆盖率和拒答率不劣于基线的条件下,证据台账能否提高事实支持比例?如果提升只来自省略困难主张,假设不获支持。
以人工写作、直接生成、检索后生成为基线;完整流程增加证据台账和独立审核。分别移除台账、独立审核进行消融,固定材料、模型版本、检索集合和总时间预算。
5 操作定义与判定边界
设 Sᵢ 为任务 i 中有证据支持的可核查主张集合,Aᵢ 为全部可核查主张集合;Kᵢ 为预先规定的必需事实,Dᵢ 为输出中正确保留的必需事实。分别报告事实支持比例 Pᵢ 与覆盖率 Cᵢ,避免以少说或不说获得虚高分。分母为零时记为不适用,另报拒答和遗漏。
建议对同一批非敏感材料比较人工流程与 AI 辅助流程,预先约定事实拆分规则,并记录支持、矛盾和无法判断三种状态。本站建议的“证据支持比例”是有来源支持的主张数除以全部可核查主张数;它不是完整复现 FActScore。没有可核查主张时记为不适用。另记遗漏事实数、核验耗时与读者理解情况,不仅比较初稿速度。
6 可检验的评价方案
以任务而非同一任务的重复输出为独立抽样单位。先用独立先导样本确定标注可行性、成本与效应量范围,再据精度或功效目标确定正式样本量;先导集不进入保留评估集。中文和英文任务分别分层,翻译对应的任务视为配对而非独立样本。公开任务纳入与排除标准,冻结输入、版本、权限及预算。
条件顺序随机化,同一任务成对比较;评审者在可行时不知道任务所属条件。报告原始计数、任务层面的效应差与区间,不把重复运行当作额外独立任务。对多任务族分层汇报,并进行缺失与超时处理的敏感性分析。超时、拒答和人工接管保留且分别计数;若需更改原定方案,应说明变更时间和理由。
复核材料应包含任务清单、数据授权状态、模型与工具版本、提示模板、随机种子(如可设定)、测试与判定规则、失败日志和分析脚本。含个人或受限信息的材料不因复现需要而直接公开;可发布脱敏结构和受控访问说明。上述材料是拟议的研究产物,本站目前不提供已完成实验的数据集或分析代码。
7 解释边界与替代解释
FActScore 的主要评估场景是人物传记与相应知识源,不能直接证明复杂因果论述的真实性;ALCE 的自动蕴含判定也会出错。因此,下面的主张比例是本文建议的操作定义,不是完整复现这些评测。[9][10]
本稿没有原创实验或当前产品比较。额外工具、人工审查或预算差异可能解释表面提升;只挑选成功任务也会引入偏差。研究结果若与预期不符,应保留失败及负结果,并报告模型、语言、任务族和环境边界,不能把历史基准外推为当前系统保证。
8 结论
可核查写作的关键不是引文数量,而是主张、出处与限定条件之间的可审计对应。证据台账是否值得额外成本仍需成对试验验证。
本文是人工智能+总论的专题展开,与总论共享文献和框架,不构成独立的实证研究。阅读总论。
9 声明与可用性
数据与代码:本文未生成原创实验数据;文献来源逐项链接。实验与分析代码尚未实现,不将网页代码作为实验复现包。
作者、贡献、资助与利益冲突:Alsay 是网页发布主体,不据此推定学术作者身份。真实作者名单、贡献分工、资助和利益冲突须由责任人确认;本稿不代填“无利益冲突”,也不虚构单位、学位或伦理批准。
AI 使用与版本:检索、结构组织、文字编辑和中英翻译使用 AI 辅助。两版为同一研究稿的对应语言版本,不是两项独立研究;责任作者的学术审定仍待完成。本文未宣称经同行评审、被期刊录用或已完成预注册。
参考文献
按 arXiv 公开版本著录,未逐篇核实同行评审状态。来源页与 PDF 入口于 2026-09-08 检查可访问;不保证长期可用或全文结论正确。
- [1] Vaswani, Ashish; Shazeer, Noam; Parmar, Niki; et al.. Attention Is All You Need. arXiv:1706.03762 (2017). doi:10.48550/arXiv.1706.03762. PDF. ↩1
- [2] Brown, Tom B.; Mann, Benjamin; Ryder, Nick; et al.. Language Models are Few-Shot Learners. arXiv:2005.14165 (2020). doi:10.48550/arXiv.2005.14165. PDF. ↩1
- [3] Raffel, Colin; Shazeer, Noam; Roberts, Adam; et al.. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. arXiv:1910.10683 (2019). doi:10.48550/arXiv.1910.10683. PDF. ↩1
- [4] Lewis, Mike; Liu, Yinhan; Goyal, Naman; et al.. BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and Comprehension. arXiv:1910.13461 (2019). doi:10.48550/arXiv.1910.13461. PDF. ↩1
- [5] Lewis, Patrick; Perez, Ethan; Piktus, Aleksandra; et al.. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. arXiv:2005.11401 (2020). doi:10.48550/arXiv.2005.11401. PDF. ↩1
- [6] Guu, Kelvin; Lee, Kenton; Tung, Zora; et al.. REALM: Retrieval-Augmented Language Model Pre-Training. arXiv:2002.08909 (2020). doi:10.48550/arXiv.2002.08909. PDF. ↩1
- [7] Ouyang, Long; Wu, Jeff; Jiang, Xu; et al.. Training language models to follow instructions with human feedback. arXiv:2203.02155 (2022). doi:10.48550/arXiv.2203.02155. PDF. ↩1
- [8] Lin, Stephanie; Hilton, Jacob; Evans, Owain. TruthfulQA: Measuring How Models Mimic Human Falsehoods. arXiv:2109.07958 (2021). doi:10.48550/arXiv.2109.07958. PDF. ↩1
- [9] Min, Sewon; Krishna, Kalpesh; Lyu, Xinxi; et al.. FActScore: Fine-grained Atomic Evaluation of Factual Precision in Long Form Text Generation. arXiv:2305.14251 (2023). doi:10.48550/arXiv.2305.14251. PDF. ↩1 ↩2
- [10] Gao, Tianyu; Yen, Howard; Yu, Jiatong; et al.. Enabling Large Language Models to Generate Text with Citations. arXiv:2305.14627 (2023). doi:10.48550/arXiv.2305.14627. PDF. ↩1 ↩2
- [11] Dhuliawala, Shehzaad; Komeili, Mojtaba; Xu, Jing; et al.. Chain-of-Verification Reduces Hallucination in Large Language Models. arXiv:2309.11495 (2023). doi:10.48550/arXiv.2309.11495. PDF. ↩1
- [12] Liu, Nelson F.; Lin, Kevin; Hewitt, John; et al.. Lost in the Middle: How Language Models Use Long Contexts. arXiv:2307.03172 (2023). doi:10.48550/arXiv.2307.03172. PDF. ↩1