LangMatch
文言文能否作为大模型的自然语言压缩提示?一项关于质量–成本权衡的受控研究。 访问项目主页 · 在 GitHub 上查看
研究性探索 · 2026 年 5 月 · 按短论文的方式记录,但结果太小未作发表——结论为初步观察,非正式结果。

1 · 研究背景
大模型的推理成本与上下文长度直接相关:输入越长,通常意味着更高的 token 成本、更高的时延与更强的上下文占用。 prompt compression 研究已证明,在尽量保持性能的前提下压缩输入,是提升 LLM 效率的一条重要路径。另一条文献指出 tokenizer 对不同语言并不公平——相同语义在不同语言中被切分为不同数量的 token;而跨语言 prompting 研究显示,提示语言不仅影响 token 数,还会影响模型行为、推理路径与格式服从性。
文言文天然凝练、信息密度高、语法省略强,直觉上可能是一种适合 LLM 的「自然语言压缩提示」。但直觉无法直接回答两点: (1) 文言文在 tokenizer 视角下是否真的更省 token;(2) 即便更省,任务成功率能否保持。
2 · 研究目的与研究问题
核心比较不是「哪种语言更短」,而是:在任务固定、模型后端固定的前提下,更凝练的提示语言能否带来更优的质量–成本前沿?只改 system prompt 的语言,任务本身不变。
- RQ1 — 语义等价下,文言文 system prompt 能否稳定减少输入 token?
- RQ2 — token 节省是否伴随成功率 / 指令遵循 / 准确率的下降?
- RQ3 — 差异主要来自 tokenizer 切分,还是来自语言风格对模型行为的诱导?
- RQ4 — 该现象能否跨模型族(开源 vs 闭源)复现?
3 · 相关工作
- 古汉语 / 文言文 LLM(C3Bench、TongGu、Fuxi、WenyanGPT)已把古汉语作为可单独建模、评测的一等对象——但聚焦理解与生成,而非 token 效率。
- 跨语言 prompting 表明提示语言会改变模型行为、推理与格式服从,而不只是表层 token 数。
- Token tax / tokenizer 公平性 表明相同信息在不同语言上成本不同——语言本身就是一个成本变量。
- Prompt compression(LLMLingua、Selective Context)证明压缩 prompt 有价值——但走的是算法式压缩,而非利用语言自身的表达密度。
这四条线此前从未被合并成一个可检验问题:文言文能否作为 LLM 的自然语言压缩提示?LangMatch 就是这个受控实验 ——不训练新的文言文模型,而是在严格控制变量下,评估文言文作为 system prompt 语言的效率与代价。
4 · 实验设计
三种功能等价的 system prompt 模式——任务、模型、输出预算都相同,只改提示语言:
base — 英文精简版
You are a helpful assistant. Follow the user's instructions carefully. Except for code and direct quotations, keep explanations and narration concise. Avoid colloquial filler. Eliminate redundancy and aim for compact, clear expression.
zh_compact — 现代汉语
你是一个有帮助的助手。请严格遵循用户要求。除代码和直接指令外,所有解释与叙述都尽量写得简洁。禁止口语化赘述,删繁就简,要求表达精炼、意思清楚。
wy — 文言文
汝为善应人问之助手,当谨循其命。凡码与引文外,释理叙事宜从简。禁绝白话冗词,务求辞约义明。
- 模型:gpt-4o、gpt-5.4、qwen3-1.7b、qwen3-4b——API 与本地 Transformers 后端统一在一条流水线
- 基准:IFEval(指令遵循)、MATH-500(纯文本子集,只评最终答案)、MMLU-Pro
- 指标:输入 / 输出 / 总 token;基准 Score 或 SR;以及每千 token 得分作为效率轴
- 预算与审计:统一 2048 token 输出预算 + 逐次 token 记账;runner 记录
configured_max_tokens、finish_reason与用量,使截断被检出而非被静默计分
清单(固定任务子集) → 跑遍 任务 × 提示模式 × 模型 组合 → 原始 results.jsonl + 逐次汇总 → 跨运行聚合为矩阵报告 → 帕累托前沿图(分数 vs. 总 token)
严谨性说明。早期 pilot 采用过紧的 cap(IFEval 192、MATH-500 64、MMLU-Pro 8),产生了截断伪影——最典型的是 gpt-5.4 / IFEval 返回空的可见输出、 却仍耗尽整个输出预算,使模型显得偏弱。主矩阵在 2048 下重跑,清除了 gpt-4o、gpt-5.4、qwen3-4b 的伪影(0 次触顶);qwen3-1.7b 仍有 4 次触顶(finish_reason=length),需谨慎解读。 以下所有数字均为修正后的 2048 重跑。
后续 三次对照 固定语言(base / zh / wy),转而改变交互设置——explicit_process(显式推理)、hidden(思考但不外显)、compact_visible(简短可见推理)——以区分「提示语言」与「推理可见性」各自的作用。
5 · 实验结果
5.1 主矩阵(2048 token 预算)
跨基准聚合的整体结果(每个点为一个 模型 × 提示模式 组合):
| 模型 | 提示 | N | 分数 | 输入 Tok | 输出 Tok | 总 Tok | 分/千Tok |
|---|---|---|---|---|---|---|---|
| gpt-4o | base | 59 | 0.593 | 182.93 | 37.12 | 220.05 | 2.696 |
| gpt-4o | zh_compact | 59 | 0.627 | 200.93 | 29.59 | 230.53 | 2.720 |
| gpt-4o | wy | 59 | 0.576 | 187.93 | 32.86 | 220.80 | 2.610 |
| gpt-5.4 | base | 59 | 0.729 | 181.93 | 54.64 | 236.58 | 3.081 |
| gpt-5.4 | zh_compact | 59 | 0.746 | 199.93 | 49.05 | 248.98 | 2.995 |
| gpt-5.4 | wy | 59 | 0.763 | 186.93 | 45.15 | 232.08 | 3.286 |
| qwen3-1.7b | base | 59 | 0.339 | 197.85 | 127.00 | 324.85 | 1.044 |
| qwen3-1.7b | zh_compact | 59 | 0.271 | 203.85 | 125.20 | 329.05 | 0.824 |
| qwen3-1.7b | wy | 59 | 0.254 | 197.85 | 228.12 | 425.97 | 0.597 |
| qwen3-4b | base | 59 | 0.441 | 197.85 | 121.95 | 319.80 | 1.378 |
| qwen3-4b | zh_compact | 59 | 0.475 | 203.85 | 69.98 | 273.83 | 1.733 |
| qwen3-4b | wy | 59 | 0.475 | 197.85 | 98.71 | 296.56 | 1.600 |
gpt-5.4 是整体最强的模型,其早前偏弱的 IFEval 已确认是截断伪影而非真实缺陷。zh_compact 是最稳定的提示族(对 gpt-4o 最佳,对 qwen3-4b 并列最佳);wy 是条件性收益——在 gpt-5.4 上是单项最强模式。
分基准的「分数 vs. 总 token」帕累托图(点击图片查看原图):
IFEval
去掉 cap 伪影后,gpt-5.4 在三种模式下均达 1.000 SR;qwen3-4b 也饱和。在该基准上,高容量模型在多种提示语言下都能完成任务。
| 模型 | 提示 | N | 分数 | 输入 Tok | 输出 Tok | 总 Tok | 分/千Tok |
|---|---|---|---|---|---|---|---|
| gpt-4o | base | 11 | 0.909 | 92.45 | 182.36 | 274.82 | 3.308 |
| gpt-4o | zh_compact | 11 | 0.909 | 110.45 | 141.82 | 252.27 | 3.604 |
| gpt-4o | wy | 11 | 0.818 | 97.45 | 161.45 | 258.91 | 3.160 |
| gpt-5.4 | base | 11 | 1.000 | 91.45 | 269.36 | 360.82 | 2.771 |
| gpt-5.4 | zh_compact | 11 | 1.000 | 109.45 | 239.09 | 348.55 | 2.869 |
| gpt-5.4 | wy | 11 | 1.000 | 96.45 | 218.18 | 314.64 | 3.178 |
| qwen3-1.7b | base | 11 | 0.909 | 101.00 | 314.55 | 415.55 | 2.188 |
| qwen3-1.7b | zh_compact | 11 | 0.909 | 107.00 | 319.91 | 426.91 | 2.129 |
| qwen3-1.7b | wy | 11 | 1.000 | 101.00 | 391.45 | 492.45 | 2.031 |
| qwen3-4b | base | 11 | 1.000 | 101.00 | 177.82 | 278.82 | 3.587 |
| qwen3-4b | zh_compact | 11 | 1.000 | 107.00 | 129.64 | 236.64 | 4.226 |
| qwen3-4b | wy | 11 | 1.000 | 101.00 | 151.73 | 252.73 | 3.957 |
MATH-500
最关键的分化:zh_compact 对 gpt-4o 最佳,而 wy 对 gpt-5.4 最佳——在足够强的模型与凝练推理任务上,文言文成为真正的质量–成本竞争者。qwen3-4b 的最高分在 wy,而 zh_compact 总 token 略省。
| 模型 | 提示 | N | 分数 | 输入 Tok | 输出 Tok | 总 Tok | 分/千Tok |
|---|---|---|---|---|---|---|---|
| gpt-4o | base | 24 | 0.542 | 146.79 | 5.29 | 152.08 | 3.562 |
| gpt-4o | zh_compact | 24 | 0.708 | 164.79 | 5.46 | 170.25 | 4.161 |
| gpt-4o | wy | 24 | 0.583 | 151.79 | 4.71 | 156.50 | 3.727 |
| gpt-5.4 | base | 24 | 0.625 | 145.79 | 5.88 | 151.67 | 4.121 |
| gpt-5.4 | zh_compact | 24 | 0.667 | 163.79 | 6.00 | 169.79 | 3.926 |
| gpt-5.4 | wy | 24 | 0.708 | 150.79 | 6.00 | 156.79 | 4.518 |
| qwen3-1.7b | base | 24 | 0.208 | 158.21 | 78.12 | 236.33 | 0.882 |
| qwen3-1.7b | zh_compact | 24 | 0.083 | 164.21 | 23.54 | 187.75 | 0.444 |
| qwen3-1.7b | wy | 24 | 0.000 | 158.21 | 120.92 | 279.12 | 0.000 |
| qwen3-4b | base | 24 | 0.250 | 158.21 | 155.62 | 313.83 | 0.797 |
| qwen3-4b | zh_compact | 24 | 0.250 | 164.21 | 108.46 | 272.67 | 0.917 |
| qwen3-4b | wy | 24 | 0.292 | 158.21 | 165.50 | 323.71 | 0.901 |
MMLU-Pro
最保守的基准:对文言文的奖励不如 MATH-500 明显。去掉截断后 gpt-5.4 在三种模式下一致很强;gpt-4o 仍偏爱 base,qwen3-4b 仍偏爱 zh_compact——这一模型-任务交互在重跑后依然成立。
| 模型 | 提示 | N | 分数 | 输入 Tok | 输出 Tok | 总 Tok | 分/千Tok |
|---|---|---|---|---|---|---|---|
| gpt-4o | base | 24 | 0.500 | 260.54 | 2.38 | 262.92 | 1.902 |
| gpt-4o | zh_compact | 24 | 0.417 | 278.54 | 2.29 | 280.83 | 1.484 |
| gpt-4o | wy | 24 | 0.458 | 265.54 | 2.08 | 267.62 | 1.713 |
| gpt-5.4 | base | 24 | 0.708 | 259.54 | 5.00 | 264.54 | 2.678 |
| gpt-5.4 | zh_compact | 24 | 0.708 | 277.54 | 5.00 | 282.54 | 2.507 |
| gpt-5.4 | wy | 24 | 0.708 | 264.54 | 5.00 | 269.54 | 2.628 |
| qwen3-1.7b | base | 24 | 0.208 | 281.88 | 89.92 | 371.79 | 0.560 |
| qwen3-1.7b | zh_compact | 24 | 0.167 | 287.88 | 137.62 | 425.50 | 0.392 |
| qwen3-1.7b | wy | 24 | 0.167 | 281.88 | 260.46 | 542.33 | 0.307 |
| qwen3-4b | base | 24 | 0.375 | 281.88 | 62.67 | 344.54 | 1.088 |
| qwen3-4b | zh_compact | 24 | 0.458 | 287.88 | 4.17 | 292.04 | 1.569 |
| qwen3-4b | wy | 24 | 0.417 | 281.88 | 7.62 | 289.50 | 1.439 |
5.2 LangMatch 三次对照(交互设置)
固定语言,改变交互设置。显式 / 隐藏 / 紧凑可见三种推理下的整体 SR vs. token (本次导出中 IFEval 面板为缺失数据占位,并非负面结果):
explicit_process
| 模型 | 设置 | N | SR | 输入 Tok | 输出 Tok | 总 Tok |
|---|---|---|---|---|---|---|
| gpt-4o | base | 48 | 0.688 | 205.67 | 488.21 | 693.88 |
| gpt-4o | wy | 48 | 0.708 | 241.58 | 342.77 | 584.35 |
| gpt-4o | zh | 48 | 0.688 | 232.52 | 543.54 | 776.06 |
| gpt-5.4 | base | 48 | 0.646 | 204.67 | 180.90 | 385.56 |
| gpt-5.4 | wy | 48 | 0.833 | 240.58 | 337.83 | 578.42 |
| gpt-5.4 | zh | 48 | 0.667 | 231.52 | 206.10 | 437.62 |
| qwen3-4b | base | 48 | 0.583 | 215.54 | 1180.71 | 1396.25 |
| qwen3-4b | wy | 48 | 0.396 | 232.06 | 1014.48 | 1246.54 |
| qwen3-4b | zh | 48 | 0.646 | 216.90 | 1149.19 | 1366.08 |
hidden
| 模型 | 设置 | N | SR | 输入 Tok | 输出 Tok | 总 Tok |
|---|---|---|---|---|---|---|
| gpt-4o | base | 48 | 0.562 | 207.17 | 8.38 | 215.54 |
| gpt-4o | wy | 48 | 0.438 | 240.38 | 21.83 | 262.21 |
| gpt-4o | zh | 48 | 0.479 | 229.29 | 8.44 | 237.73 |
| gpt-5.4 | base | 48 | 0.625 | 206.17 | 11.02 | 217.19 |
| gpt-5.4 | wy | 48 | 0.604 | 239.38 | 11.29 | 250.67 |
| gpt-5.4 | zh | 48 | 0.604 | 228.29 | 18.60 | 246.90 |
| qwen3-4b | base | 48 | 0.667 | 217.04 | 1017.15 | 1234.19 |
| qwen3-4b | wy | 48 | 0.438 | 229.38 | 899.08 | 1128.46 |
| qwen3-4b | zh | 48 | 0.646 | 214.21 | 1002.83 | 1217.04 |
compact_visible
| 模型 | 设置 | N | SR | 输入 Tok | 输出 Tok | 总 Tok |
|---|---|---|---|---|---|---|
| gpt-4o | base | 48 | 0.667 | 225.67 | 151.27 | 376.94 |
| gpt-4o | wy | 48 | 0.646 | 268.42 | 135.17 | 403.58 |
| gpt-4o | zh | 48 | 0.688 | 252.12 | 164.65 | 416.77 |
| gpt-5.4 | base | 48 | 0.583 | 224.67 | 12.35 | 237.02 |
| gpt-5.4 | wy | 48 | 0.833 | 267.42 | 114.50 | 381.92 |
| gpt-5.4 | zh | 48 | 0.562 | 251.12 | 16.90 | 268.02 |
| qwen3-4b | base | 48 | 0.708 | 235.54 | 842.60 | 1078.15 |
| qwen3-4b | wy | 48 | 0.479 | 254.08 | 824.71 | 1078.79 |
| qwen3-4b | zh | 48 | 0.667 | 236.00 | 713.25 | 949.25 |
gpt-5.4 + wy 在 explicit_process 与 compact_visible 下都最突出(SR 0.833);hidden 主要降低成本而非提高分数;qwen3-4b 无稳定的文言文优势。
完整结果报告:
6 · 结论要点
- 提示语言的影响真实存在,但高度依赖模型与任务。
zh_compact是跨闭源 / 开源模型族最稳健的默认选择。wy在强模型上是有力候选——其在 gpt-5.4 上的收益在修正重跑后依然成立,且在 gpt-5.4 / MATH-500 上最佳——但并非普适。- 在三次对照中,推理可见性与语言同样重要;
hidden是降本设置,而非提分设置。
工作结论:文言文是一种条件性的提示压缩策略,而非普适策略——应按模型逐一开启,而非默认使用。
7 · 严谨性与局限
- 2048 重跑清除了 gpt-4o、gpt-5.4、qwen3-4b 的截断伪影;
qwen3-1.7b仍有 4 次触顶,需谨慎解读。 - token 计数来自各自原生后端(GPT 日志用 openai,qwen 日志用 transformers)——应在同一模型内比较,而非当作跨厂商 tokenizer 完全一致。
- 三种提示模式功能相近但并非严格逐句对齐;「风格 vs 密度」的混杂已通过纳入现代汉语压缩对照(
zh_compact)缓解,但未完全消除。
早期阶段——结论为初步观察,非正式结果。





