LangMatch

文言文能否作为大模型的自然语言压缩提示?一项关于质量–成本权衡的受控研究。 访问项目主页 · 在 GitHub 上查看

研究性探索 · 2026 年 5 月 · 按短论文的方式记录,但结果太小未作发表——结论为初步观察,非正式结果。

LangMatch —— 更压缩的提示语言能否带来更优的质量–成本前沿?

1 · 研究背景

大模型的推理成本与上下文长度直接相关:输入越长,通常意味着更高的 token 成本、更高的时延与更强的上下文占用。 prompt compression 研究已证明,在尽量保持性能的前提下压缩输入,是提升 LLM 效率的一条重要路径。另一条文献指出 tokenizer 对不同语言并不公平——相同语义在不同语言中被切分为不同数量的 token;而跨语言 prompting 研究显示,提示语言不仅影响 token 数,还会影响模型行为、推理路径与格式服从性。

文言文天然凝练、信息密度高、语法省略强,直觉上可能是一种适合 LLM 的「自然语言压缩提示」。但直觉无法直接回答两点: (1) 文言文在 tokenizer 视角下是否真的更省 token;(2) 即便更省,任务成功率能否保持。

2 · 研究目的与研究问题

核心比较不是「哪种语言更短」,而是:在任务固定、模型后端固定的前提下,更凝练的提示语言能否带来更优的质量–成本前沿?只改 system prompt 的语言,任务本身不变。

  • RQ1 — 语义等价下,文言文 system prompt 能否稳定减少输入 token?
  • RQ2 — token 节省是否伴随成功率 / 指令遵循 / 准确率的下降?
  • RQ3 — 差异主要来自 tokenizer 切分,还是来自语言风格对模型行为的诱导?
  • RQ4 — 该现象能否跨模型族(开源 vs 闭源)复现?

3 · 相关工作

  • 古汉语 / 文言文 LLM(C3Bench、TongGu、Fuxi、WenyanGPT)已把古汉语作为可单独建模、评测的一等对象——但聚焦理解与生成,而非 token 效率。
  • 跨语言 prompting 表明提示语言会改变模型行为、推理与格式服从,而不只是表层 token 数。
  • Token tax / tokenizer 公平性 表明相同信息在不同语言上成本不同——语言本身就是一个成本变量。
  • Prompt compression(LLMLingua、Selective Context)证明压缩 prompt 有价值——但走的是算法式压缩,而非利用语言自身的表达密度。

这四条线此前从未被合并成一个可检验问题:文言文能否作为 LLM 的自然语言压缩提示?LangMatch 就是这个受控实验 ——不训练新的文言文模型,而是在严格控制变量下,评估文言文作为 system prompt 语言的效率与代价。

4 · 实验设计

三种功能等价的 system prompt 模式——任务、模型、输出预算都相同,只改提示语言:

base — 英文精简版

You are a helpful assistant. Follow the user's instructions carefully. Except for code and direct quotations, keep explanations and narration concise. Avoid colloquial filler. Eliminate redundancy and aim for compact, clear expression.

zh_compact — 现代汉语

你是一个有帮助的助手。请严格遵循用户要求。除代码和直接指令外,所有解释与叙述都尽量写得简洁。禁止口语化赘述,删繁就简,要求表达精炼、意思清楚。

wy — 文言文

汝为善应人问之助手,当谨循其命。凡码与引文外,释理叙事宜从简。禁绝白话冗词,务求辞约义明。

  • 模型:gpt-4o、gpt-5.4、qwen3-1.7b、qwen3-4b——API 与本地 Transformers 后端统一在一条流水线
  • 基准:IFEval(指令遵循)、MATH-500(纯文本子集,只评最终答案)、MMLU-Pro
  • 指标:输入 / 输出 / 总 token;基准 Score 或 SR;以及每千 token 得分作为效率轴
  • 预算与审计:统一 2048 token 输出预算 + 逐次 token 记账;runner 记录 configured_max_tokensfinish_reason 与用量,使截断被检出而非被静默计分
清单(固定任务子集)
  → 跑遍 任务 × 提示模式 × 模型 组合
  → 原始 results.jsonl + 逐次汇总
  → 跨运行聚合为矩阵报告
  → 帕累托前沿图(分数 vs. 总 token)

严谨性说明。早期 pilot 采用过紧的 cap(IFEval 192、MATH-500 64、MMLU-Pro 8),产生了截断伪影——最典型的是 gpt-5.4 / IFEval 返回空的可见输出、 却仍耗尽整个输出预算,使模型显得偏弱。主矩阵在 2048 下重跑,清除了 gpt-4o、gpt-5.4、qwen3-4b 的伪影(0 次触顶);qwen3-1.7b 仍有 4 次触顶(finish_reason=length),需谨慎解读。 以下所有数字均为修正后的 2048 重跑。

后续 三次对照 固定语言(base / zh / wy),转而改变交互设置——explicit_process(显式推理)、hidden(思考但不外显)、compact_visible(简短可见推理)——以区分「提示语言」与「推理可见性」各自的作用。

5 · 实验结果

5.1 主矩阵(2048 token 预算)

跨基准聚合的整体结果(每个点为一个 模型 × 提示模式 组合):

模型提示N分数输入 Tok输出 Tok总 Tok分/千Tok
gpt-4obase590.593182.9337.12220.052.696
gpt-4ozh_compact590.627200.9329.59230.532.720
gpt-4owy590.576187.9332.86220.802.610
gpt-5.4base590.729181.9354.64236.583.081
gpt-5.4zh_compact590.746199.9349.05248.982.995
gpt-5.4wy590.763186.9345.15232.083.286
qwen3-1.7bbase590.339197.85127.00324.851.044
qwen3-1.7bzh_compact590.271203.85125.20329.050.824
qwen3-1.7bwy590.254197.85228.12425.970.597
qwen3-4bbase590.441197.85121.95319.801.378
qwen3-4bzh_compact590.475203.8569.98273.831.733
qwen3-4bwy590.475197.8598.71296.561.600

gpt-5.4 是整体最强的模型,其早前偏弱的 IFEval 已确认是截断伪影而非真实缺陷。zh_compact 是最稳定的提示族(对 gpt-4o 最佳,对 qwen3-4b 并列最佳);wy 是条件性收益——在 gpt-5.4 上是单项最强模式。

分基准的「分数 vs. 总 token」帕累托图(点击图片查看原图):

IFEval:分数 vs. 总 token 帕累托权衡

IFEval——qwen3-4b 以最低 token 成本达到同等分数;gpt-5.4 的 wy 变体是其最省的一档。

MATH-500:分数 vs. 总 token 帕累托权衡

MATH-500——偏好依模型分化:gpt-4o 偏爱 zh_compact,gpt-5.4 偏爱 wy。

MMLU-Pro:分数 vs. 总 token 帕累托权衡

MMLU-Pro——zh_compact 稳居最可靠默认。

IFEval

去掉 cap 伪影后,gpt-5.4 在三种模式下均达 1.000 SR;qwen3-4b 也饱和。在该基准上,高容量模型在多种提示语言下都能完成任务。

模型提示N分数输入 Tok输出 Tok总 Tok分/千Tok
gpt-4obase110.90992.45182.36274.823.308
gpt-4ozh_compact110.909110.45141.82252.273.604
gpt-4owy110.81897.45161.45258.913.160
gpt-5.4base111.00091.45269.36360.822.771
gpt-5.4zh_compact111.000109.45239.09348.552.869
gpt-5.4wy111.00096.45218.18314.643.178
qwen3-1.7bbase110.909101.00314.55415.552.188
qwen3-1.7bzh_compact110.909107.00319.91426.912.129
qwen3-1.7bwy111.000101.00391.45492.452.031
qwen3-4bbase111.000101.00177.82278.823.587
qwen3-4bzh_compact111.000107.00129.64236.644.226
qwen3-4bwy111.000101.00151.73252.733.957

MATH-500

最关键的分化:zh_compact 对 gpt-4o 最佳,而 wy 对 gpt-5.4 最佳——在足够强的模型与凝练推理任务上,文言文成为真正的质量–成本竞争者。qwen3-4b 的最高分在 wy,而 zh_compact 总 token 略省。

模型提示N分数输入 Tok输出 Tok总 Tok分/千Tok
gpt-4obase240.542146.795.29152.083.562
gpt-4ozh_compact240.708164.795.46170.254.161
gpt-4owy240.583151.794.71156.503.727
gpt-5.4base240.625145.795.88151.674.121
gpt-5.4zh_compact240.667163.796.00169.793.926
gpt-5.4wy240.708150.796.00156.794.518
qwen3-1.7bbase240.208158.2178.12236.330.882
qwen3-1.7bzh_compact240.083164.2123.54187.750.444
qwen3-1.7bwy240.000158.21120.92279.120.000
qwen3-4bbase240.250158.21155.62313.830.797
qwen3-4bzh_compact240.250164.21108.46272.670.917
qwen3-4bwy240.292158.21165.50323.710.901

MMLU-Pro

最保守的基准:对文言文的奖励不如 MATH-500 明显。去掉截断后 gpt-5.4 在三种模式下一致很强;gpt-4o 仍偏爱 base,qwen3-4b 仍偏爱 zh_compact——这一模型-任务交互在重跑后依然成立。

模型提示N分数输入 Tok输出 Tok总 Tok分/千Tok
gpt-4obase240.500260.542.38262.921.902
gpt-4ozh_compact240.417278.542.29280.831.484
gpt-4owy240.458265.542.08267.621.713
gpt-5.4base240.708259.545.00264.542.678
gpt-5.4zh_compact240.708277.545.00282.542.507
gpt-5.4wy240.708264.545.00269.542.628
qwen3-1.7bbase240.208281.8889.92371.790.560
qwen3-1.7bzh_compact240.167287.88137.62425.500.392
qwen3-1.7bwy240.167281.88260.46542.330.307
qwen3-4bbase240.375281.8862.67344.541.088
qwen3-4bzh_compact240.458287.884.17292.041.569
qwen3-4bwy240.417281.887.62289.501.439

5.2 LangMatch 三次对照(交互设置)

固定语言,改变交互设置。显式 / 隐藏 / 紧凑可见三种推理下的整体 SR vs. token (本次导出中 IFEval 面板为缺失数据占位,并非负面结果):

显式推理 / 整体:分数 vs. token 帕累托权衡

显式推理——gpt-5.4 + wy 是最突出的一个点。

隐藏推理 / 整体:分数 vs. token 帕累托权衡

隐藏推理——主要把点左移(更省),而非上移。

紧凑可见 / 整体:分数 vs. token 帕累托权衡

紧凑可见——成本与分数之间的折中。

explicit_process

模型设置NSR输入 Tok输出 Tok总 Tok
gpt-4obase480.688205.67488.21693.88
gpt-4owy480.708241.58342.77584.35
gpt-4ozh480.688232.52543.54776.06
gpt-5.4base480.646204.67180.90385.56
gpt-5.4wy480.833240.58337.83578.42
gpt-5.4zh480.667231.52206.10437.62
qwen3-4bbase480.583215.541180.711396.25
qwen3-4bwy480.396232.061014.481246.54
qwen3-4bzh480.646216.901149.191366.08

hidden

模型设置NSR输入 Tok输出 Tok总 Tok
gpt-4obase480.562207.178.38215.54
gpt-4owy480.438240.3821.83262.21
gpt-4ozh480.479229.298.44237.73
gpt-5.4base480.625206.1711.02217.19
gpt-5.4wy480.604239.3811.29250.67
gpt-5.4zh480.604228.2918.60246.90
qwen3-4bbase480.667217.041017.151234.19
qwen3-4bwy480.438229.38899.081128.46
qwen3-4bzh480.646214.211002.831217.04

compact_visible

模型设置NSR输入 Tok输出 Tok总 Tok
gpt-4obase480.667225.67151.27376.94
gpt-4owy480.646268.42135.17403.58
gpt-4ozh480.688252.12164.65416.77
gpt-5.4base480.583224.6712.35237.02
gpt-5.4wy480.833267.42114.50381.92
gpt-5.4zh480.562251.1216.90268.02
qwen3-4bbase480.708235.54842.601078.15
qwen3-4bwy480.479254.08824.711078.79
qwen3-4bzh480.667236.00713.25949.25

gpt-5.4 + wy 在 explicit_processcompact_visible 下都最突出(SR 0.833);hidden 主要降低成本而非提高分数;qwen3-4b 无稳定的文言文优势。

完整结果报告:

6 · 结论要点

  • 提示语言的影响真实存在,但高度依赖模型与任务
  • zh_compact 是跨闭源 / 开源模型族最稳健的默认选择。
  • wy 在强模型上是有力候选——其在 gpt-5.4 上的收益在修正重跑后依然成立,且在 gpt-5.4 / MATH-500 上最佳——但并非普适。
  • 在三次对照中,推理可见性与语言同样重要hidden 是降本设置,而非提分设置。

工作结论:文言文是一种条件性的提示压缩策略,而非普适策略——应按模型逐一开启,而非默认使用。

7 · 严谨性与局限

  • 2048 重跑清除了 gpt-4o、gpt-5.4、qwen3-4b 的截断伪影;qwen3-1.7b 仍有 4 次触顶,需谨慎解读。
  • token 计数来自各自原生后端(GPT 日志用 openai,qwen 日志用 transformers)——应在同一模型内比较,而非当作跨厂商 tokenizer 完全一致。
  • 三种提示模式功能相近但并非严格逐句对齐;「风格 vs 密度」的混杂已通过纳入现代汉语压缩对照(zh_compact)缓解,但未完全消除。

早期阶段——结论为初步观察,非正式结果。