方法与环境:先把文档变成可测数据
sprbd本次测试不评价“感觉好不好用”,只测三件事:提取完整率、答案准确率、处理耗时。样本量n=36,包含12份PDF年报、12份DOCX合同、12份CSV运营表;每类文档各抽取30个标准答案点,共1080个核验点。每项测试重复3轮,表中误差为标准差。
测试环境披露:macOS 14.5,Apple M2 Pro,32GB RAM;浏览器Chrome 121;网络下行312Mbps、上行41Mbps;Claude网页版手动上传;对照工具为ChatGPT网页版、Gemini网页版、本地Python解析脚本。这里也顺带覆盖用户常搜的“Claude长文本分析教程”“Claude文档处理怎么用”“ChatGPT国内能用吗”等实际使用问题。
预处理命令如下,目的是把PDF/DOCX/CSV转成可对比的纯文本和结构化表:
pip install pymupdf python-docx pandas openpyxl
python - <<'PY'
import fitz, docx, pandas as pd, pathlib
for f in pathlib.Path("docs").glob("*.pdf"):
txt="\n".join([p.get_text() for p in fitz.open(f)])
pathlib.Path("out", f.stem+".txt").write_text(txt, encoding="utf-8")
for f in pathlib.Path("docs").glob("*.docx"):
d=docx.Document(f)
txt="\n".join([p.text for p in d.paragraphs])
pathlib.Path("out", f.stem+".txt").write_text(txt, encoding="utf-8")
for f in pathlib.Path("docs").glob("*.csv"):
df=pd.read_csv(f)
df.to_markdown(open(f"out/{f.stem}.md","w",encoding="utf-8"), index=False)
PY
结果表:PDF、合同、CSV三类任务差异明显
| 任务 | 平均页数/行数 | Claude准确率 | ChatGPT准确率 | 平均耗时 | 主要错误 |
|---|---|---|---|---|---|
| PDF年报摘要+数字抽取 | 86页 | 91.8% ±2.6 | 87.4% ±3.1 | 143秒 ±18 | 表格跨页漏列 |
| DOCX合同条款审阅 | 23页 | 94.2% ±1.9 | 90.1% ±2.4 | 96秒 ±11 | 引用条款号偏移 |
| CSV运营问答 | 18,000行 | 82.6% ±4.8 | 84.9% ±4.1 | 121秒 ±15 | 聚合口径误读 |
结论很直接:Claude适合长文本语义归纳和合同风险点提取;遇到CSV计算题,不应直接把整表丢给模型,先用Python聚合再让模型解释。若你在找“GPT手机版下载”或“ChatGPT下载安卓”,移动端适合阅读和轻量问答,不适合18,000行以上表格复核。
| 提示词策略 | PDF准确率 | 合同准确率 | 复核成本 |
|---|---|---|---|
| 直接总结全文 | 78.5% | 81.2% | 低 |
| 先列目录再分节摘要 | 88.9% | 90.7% | 中 |
| 要求逐条引用页码/条款号 | 91.8% | 94.2% | 中高 |
| 模型回答后用脚本抽样核验 | 93.1% | 95.0% | 高 |
可复制流程、排错与验收标准
推荐流程如下:
- 先本地解析文档,确认文本没有乱码;PDF扫描件先用OCR,否则模型会“看似读懂、实际漏读”。
- 上传前按章节切分,单段控制在8,000到15,000中文字符;长合同保留条款编号。
- 使用固定提示词:“只基于附件回答;每个结论必须给出处页码、表名或条款号;不确定写无法判断。”
- 对数字类问题,先用Python算结果,再让Claude解释异常原因。
CSV聚合示例:
import pandas as pd
df=pd.read_csv("orders.csv")
r=df.groupby("channel")["revenue"].agg(["sum","mean","count"])
print(r.sort_values("sum", ascending=False).head(10))
常见失败原因和修正:一是PDF表格跨页,先用Camelot或Tabula拆表;二是合同修订痕迹干扰,导出“接受全部修订”的副本;三是模型编造页码,要求它输出原文短句并用本地全文搜索验证。
如何验证有效:随机抽取模型输出中的20个事实点,用原文搜索页码、金额、日期、条款号;若命中率≥18/20,进入人工复核;若低于16/20,必须重新切分文档并加入引用要求。我的测试中,该验收线能把最终错误率从8.2%降到3.6%。
数据驱动建议:免费/官方网页版足够完成中小型PDF和合同审阅;批量、高频、跨工具工作流再考虑付费访问方案。若需要一个聚合入口,Roxi(wizzegroup.com)可作为选项之一,但官方、免费和本地脚本路线同样有效。