2026-09-08。数据源:t.urongda.com 语文590条下载任务 → 432 结构化文档 → 201个分析场次 / 4,464条题目记录。
可视化版本:Artifact「高考语文命题图谱」暫不放出。
1. 语料全景与样本数据说明
本报告依托的语料库经过多轮数据处理与质量核查(端到端抓取、系统文本化、控制字符清洗、行内句中水印剔除、WMF矢量字元逆向回补、跨命名格式场次去重,以及规则精度闸门控制)。为明确教研与研究使用边界,现将全部底层样本的规模、年代、地域覆盖及去重口径完整说明如下:
1.1 样本规模与数据流转流水线
- 原始文档层:自
t.urongda.com 全量抓取语文科目 590 个任务,解压后共 598 个文件(本次目录实数:312档 .doc、253档 .pdf、31档 .docx、1份 .jpg、1份 .csv 清单;不能把598都称为试卷),物理体积 2.0 GB(2 128 451 623 字节)。
- 纯文本化层:经系统
textutil(343档)、Apple Vision OCR(72 档纯扫描件,片段 CER 1.05%)及 pdftotext(17 档)转换为 432 份纯文本 TXT,总字数达 549.8 万字。经 T1 控制字符清洗、24 条行内水印/Word域码剥离,以及 GBK WMF 矢量字元逆向提取(补回 docx 缺失字元,彻底修复 2024 新课标Ⅱ卷断句题缺失的「是」字),上述为既有局部校验结果,不代表全库逐字验收。
- 题目结构化层:经规则状态机与两轮高精度选项提取(实测精度 99.918%),解析出 9 249 条题目记录。
- 分析代表集(Canonical Set):432 份文档中存在同场考试的多版本并存(如空白卷与解析卷并存、学科网版与菁优网版并存,多者一场考试有 5 份重卷)。本库以
(年份, 卷别, 季/卷型) 为主键建立 exam_id,每场考试仅取结构与答案最完整的一份作为分析代表卷(canonical,并非官方权威版本),最终沉淀为 201 场独立考试 canonical 试卷 / 4 464 道题目记录(其中 2008–2024 年历史主分析样本为 191 套 / 4 348 题)。
1.2 年代分布与完备性说明(2008–2026)
本库跨越 2008 至 2026 年共 19 个年份的高考真题。各年份具体套数、题目数及空白卷实测规模如下:
| 年份 |
试卷套数 (canonical) |
题目总数 |
每卷平均题数 |
空白卷测算字数 |
样本完备度与使用口径 |
| 2008 |
11 |
242 |
22.0 |
7 176 |
历史分析样本,完整性未逐卷验收 |
| 2009 |
12 |
311 |
25.9 |
7 269 |
历史分析样本,完整性未逐卷验收 |
| 2010 |
12 |
272 |
22.7 |
7 240 |
历史分析样本,完整性未逐卷验收 |
| 2011 |
11 |
284 |
25.8 |
7 060 |
历史分析样本,完整性未逐卷验收 |
| 2012 |
17 |
349 |
20.5 |
5 575 |
历史分析区间(部分空白卷源文件缺作文题致字数偏低) |
| 2013 |
18 |
397 |
22.1 |
7 094 |
历史分析区间,分省命题鼎盛期 |
| 2014 |
18 |
381 |
21.2 |
6 824 |
历史分析区间,分省命题鼎盛期 |
| 2015 |
15 |
312 |
20.8 |
7 590 |
历史分析区间,分省命题转向前夕 |
| 2016 |
8 |
148 |
18.5 |
8 099 |
历史分析区间,全国卷收拢元年 |
| 2017 |
8 |
212 |
26.5 |
8 813 |
历史分析区间,新课标推展期 |
| 2018 |
7 |
199 |
28.4 |
7 647 |
历史分析区间 |
| 2019 |
10 |
211 |
21.1 |
7 911 |
历史分析区间 |
| 2020 |
11 |
260 |
23.6 |
8 268 |
历史分析区间,新高考启动期 |
| 2021 |
10 |
256 |
25.6 |
8 010 |
历史分析区间,新高考落地期 |
| 2022 |
9 |
188 |
20.9 |
8 093 |
历史分析区间 |
| 2023 |
9 |
210 |
23.3 |
8 301 |
历史分析区间 |
| 2024 |
5 |
116 |
23.2 |
8 610 |
历史分析区间(天津卷缺口待外部清单核验;不得将全国乙卷未出现直接判作漏收) |
| 2025 |
8 |
100 |
12.5 |
8 343 |
网络收集残卷,题量不全,仅用于素材检索,不入趋势线 |
| 2026 |
2 |
16 |
8.0 |
— |
严重残缺;来源性质需逐卷核查,不入趋势或词频比较 |
| 总计 |
201 |
4 464 |
22.2 |
— |
2008–2024 有效样本:191 套 / 4 348 题 |
1.3 地域与卷别全景覆盖
语料库涵盖了中国高考从「分省自主命题蓬勃期」到「全国统一命题收拢期」再到「新高考分类命题期」的三大历史阶段,包含多种历史卷别与少量残卷;当前region_normalized有26个非空取值,另1场未标明,卷名并组仍需复核:
- 直辖市独立命题卷(历史自主命题样本):
- 上海卷:共 29 套(2008–2026,含秋季高考 20 套、春季高考 5 套、其他版本 4 套)。属于本库较多的卷别,但混有春秋季及其他版本;不作全国完备性排名。
- 北京卷:共 18 套(2008–2025)。以微写作与大作文、深层思辨评价见长。
- 天津卷:共 17 套(2008–2025)。以高选择题比重、传统稳健风格见长。
- 重庆卷:共 4 套(2012–2015)。自主命题收尾期样本。
- 分省自主命题省份(在 2016 年收归全国卷或新高考改革前的独立样本):
- 江苏卷:13 套(2008–2020)。自主命题期以文学性深、大阅读难度高闻名。
- 山东卷:10 套(2008–2017)。
- 浙江卷:9 套(2009–2021)。持续坚持自主命题至新高考过渡期。
- 四川卷(8 套,2008–2015)、广东卷(8 套,2008–2015)、湖南卷(8 套,2008–2015)、安徽卷(4 套,2012–2015)、湖北卷(4 套,2012–2015)、福建卷(4 套,2012–2015)、江西卷(3 套)、辽宁卷(3 套)。
- 国家统考与新课标 / 新高考卷族(教育部考试中心统命题):
- 新课标Ⅰ卷:11 套(2013–2025;本库另有新高考Ⅰ卷3套,尚未合并)。
- 新课标Ⅱ卷:11 套(2013–2025;本库另有新高考Ⅱ卷3套,尚未合并)。
- 新课标Ⅲ卷:5 套(2016–2020)。
- 全国Ⅰ卷 / Ⅱ卷:各 5 套(2008–2026)。
- 全国甲卷 / 乙卷:甲卷 4 套(2021–2024)、乙卷 3 套(2021–2023)。
- 早期新课标 / 大纲卷 / 海南宁夏卷:共 13 套。
2. 命题术语表
第2–7节为已有统计快照,尚未全部重新生成。正文更正及第9节复核优先;所有“首现/末现”只指本样本,不表示历史首次/最后一次。
对 4 464 道题干做 n-gram 挖掘后归并成可核对的固定用语。「题数」为命中题数,「卷数」为覆盖的 canonical 卷数。
选择题指令
| 术语 |
题数 |
卷数 |
首现–末现 |
| 不正确的一项是 |
614 |
174 |
2008–2025 |
| 正确的一项是 |
281 |
153 |
2008–2026 |
主观题指令
| 术语 |
题数 |
卷数 |
首现–末现 |
| 分析…作用 |
210 |
131 |
2008–2025 |
| 赏析 |
207 |
126 |
2008–2025 |
答题限制
| 术语 |
题数 |
卷数 |
首现–末现 |
| 不少于800字 |
195 |
176 |
2008–2026 |
主观题指令
| 术语 |
题数 |
卷数 |
首现–末现 |
| 简要分析 |
172 |
94 |
2008–2025 |
| 翻译成现代汉语 |
158 |
153 |
2008–2025 |
答题限制
| 术语 |
题数 |
卷数 |
首现–末现 |
| 不超过N字 |
152 |
104 |
2008–2025 |
选择题指令
| 术语 |
题数 |
卷数 |
首现–末现 |
| 最恰当的一项是 |
150 |
110 |
2008–2026 |
答题限制
| 术语 |
题数 |
卷数 |
首现–末现 |
| 自拟标题 |
138 |
133 |
2008–2026 |
主观题指令
| 术语 |
题数 |
卷数 |
首现–末现 |
| 补写出空缺部分 |
123 |
120 |
2008–2026 |
限定语
| 术语 |
题数 |
卷数 |
首现–末现 |
| 请根据要求 |
118 |
107 |
2008–2026 |
主观题指令
| 术语 |
题数 |
卷数 |
首现–末现 |
| 断句 |
111 |
106 |
2008–2025 |
限定语
| 术语 |
题数 |
卷数 |
首现–末现 |
| 根据原文 |
110 |
99 |
2008–2025 |
答题限制
| 术语 |
题数 |
卷数 |
首现–末现 |
| 不得抄袭 |
106 |
105 |
2008–2026 |
选择题指令
| 术语 |
题数 |
卷数 |
首现–末现 |
| 两项/多选 |
102 |
72 |
2008–2025 |
限定语
| 术语 |
题数 |
卷数 |
首现–末现 |
| 根据材料 |
98 |
46 |
2012–2026 |
选择题指令
| 术语 |
题数 |
卷数 |
首现–末现 |
| 没有语病的一句 |
86 |
83 |
2008–2021 |
| 符合原文意思的一项 |
83 |
59 |
2008–2021 |
限定语
| 术语 |
题数 |
卷数 |
首现–末现 |
| 结合全文 |
80 |
61 |
2008–2025 |
选择题指令
| 术语 |
题数 |
卷数 |
首现–末现 |
| 不符合原文意思的一项 |
59 |
45 |
2008–2021 |
| 不恰当的一项是 |
58 |
49 |
2008–2025 |
限定语
| 术语 |
题数 |
卷数 |
首现–末现 |
| 结合具体内容 |
57 |
44 |
2008–2025 |
选择题指令
| 术语 |
题数 |
卷数 |
首现–末现 |
| 意义和用法相同的一组 |
54 |
53 |
2008–2025 |
主观题指令
| 术语 |
题数 |
卷数 |
首现–末现 |
| 谈谈你的理解 |
51 |
41 |
2008–2025 |
| 评价 |
48 |
39 |
2008–2025 |
| 简要概括 |
42 |
30 |
2008–2024 |
| 简要说明 |
42 |
33 |
2009–2024 |
限定语
| 术语 |
题数 |
卷数 |
首现–末现 |
| 结合上下文 |
32 |
28 |
2008–2025 |
主观题指令
| 术语 |
题数 |
卷数 |
首现–末现 |
| 探究 |
27 |
25 |
2008–2021 |
| 请简述 |
25 |
21 |
2008–2025 |
答题限制
| 术语 |
题数 |
卷数 |
首现–末现 |
| 只填序号 |
7 |
7 |
2008–2015 |
主观题指令
| 术语 |
题数 |
卷数 |
首现–末现 |
| 解释加点词 |
6 |
6 |
2019–2025 |
答题限制
| 术语 |
题数 |
卷数 |
首现–末现 |
| 限N处 |
6 |
6 |
2008–2020 |
选择题指令
| 术语 |
题数 |
卷数 |
首现–末现 |
| 有语病的一句 |
4 |
4 |
2008–2013 |
使用寿命值得注意:只填序号 止于 2015 年,符合原文意思的一项 止于 2021 年,
而 根据材料 到 2012 年才首次出现——它是信息类文本阅读进入高考的标志词。
设问极性
| 年份 |
反向(选错误项) |
正向(选正确项) |
反向占比 |
| 2008 |
32 |
28 |
53.3% |
| 2009 |
39 |
31 |
55.7% |
| 2010 |
31 |
38 |
44.9% |
| 2011 |
34 |
33 |
50.7% |
| 2012 |
42 |
48 |
46.7% |
| 2013 |
48 |
54 |
47.1% |
| 2014 |
50 |
56 |
47.2% |
| 2015 |
42 |
41 |
50.6% |
| 2016 |
21 |
21 |
50.0% |
| 2017 |
38 |
30 |
55.9% |
| 2018 |
46 |
30 |
60.5% |
| 2019 |
47 |
24 |
66.2% |
| 2020 |
61 |
28 |
68.5% |
| 2021 |
48 |
33 |
59.3% |
| 2022 |
39 |
23 |
62.9% |
| 2023 |
41 |
21 |
66.1% |
| 2024 |
26 |
14 |
65.0% |
年度等权平均为2008–2016年49.6%、2018–2024年64.1%;按期间合并的可判极性设问计数则为339/689(49.20%)与308/481(64.03%)。原n=1,267撤回,详见9.2。此结果不能推广至所有选择题,更不能作为默认选择负向答案的策略。
3. 考点全谱
体系来源:语料中 73 份菁优网试卷自带的 576 条原文 【考点】 标签,归并为 22 细类 / 9 大类。
大类分布
多标签命中数,不能相加解释为题型权重;未标注不等于未考查。
| 大类 |
标签数 |
| 语言运用综合 |
786 |
| 文言文阅读 |
470 |
| 写作 |
219 |
| 名篇名句默写 |
195 |
| 古诗词鉴赏 |
194 |
| 文学类文本阅读 |
70 |
| 论述类文本阅读 |
58 |
| 文学常识与名著 |
40 |
| 实用类文本阅读 |
14 |
细类总量
| 考点 |
标签数 |
| 写作 |
219 |
| 文言文阅读 |
204 |
| 名篇名句默写 |
195 |
| 古诗词鉴赏 |
194 |
| 文言翻译 |
156 |
| 成语与词语运用 |
143 |
| 病句辨析修改 |
135 |
| 语言运用综合 |
133 |
| 文言断句 |
110 |
| 字音 |
90 |
| 文学类文本阅读 |
70 |
| 论述类文本阅读 |
58 |
| 字形 |
56 |
| 图文转换 |
53 |
| 语句衔接与排序 |
50 |
| 句式变换与仿写 |
48 |
| 文学常识与名著 |
40 |
| 简明连贯得体 |
29 |
| 标点符号 |
25 |
| 词义辨析 |
21 |
| 实用类文本阅读 |
14 |
| 修辞方法 |
3 |
历史样本标签出现率(不代表必考或退出)
按 2017–2024 年 69 份 canonical 卷的出现率排序,与 2008–2015 年 114 份对照。
| 考点 |
2017–2024 |
2008–2015 |
变化 |
| 写作 |
96% |
96% |
+0 pp |
| 名篇名句默写 |
87% |
88% |
-1 pp |
| 古诗词鉴赏 |
86% |
71% |
+15 pp |
| 文言翻译 |
83% |
76% |
+7 pp |
| 文言断句 |
78% |
36% |
+42 pp |
| 成语与词语运用 |
49% |
73% |
-24 pp |
| 文言文阅读 |
48% |
82% |
-34 pp |
| 病句辨析修改 |
43% |
82% |
-39 pp |
| 语言运用综合 |
39% |
41% |
-2 pp |
| 图文转换 |
25% |
25% |
+0 pp |
| 语句衔接与排序 |
20% |
32% |
-12 pp |
| 简明连贯得体 |
17% |
10% |
+7 pp |
| 文学类文本阅读 |
16% |
17% |
-1 pp |
| 论述类文本阅读 |
16% |
9% |
+7 pp |
| 字音 |
13% |
67% |
-54 pp |
| 文学常识与名著 |
13% |
19% |
-6 pp |
| 句式变换与仿写 |
9% |
28% |
-19 pp |
| 字形 |
3% |
42% |
-39 pp |
| 标点符号 |
3% |
17% |
-14 pp |
| 词义辨析 |
3% |
11% |
-8 pp |
| 修辞方法 |
1% |
1% |
+0 pp |
| 实用类文本阅读 |
1% |
7% |
-6 pp |
注意:细类「文言文阅读」出现率下降34个百分点,可能涉及标签重分配;需要同题映射证据才能确认,不能解释为文言阅读能力退场。
大类层面文言文阅读为 95% → 97%,稳中有升。看趋势请以大类为准。
年度热力(每卷平均出现次数)
| 考点 |
08 |
09 |
10 |
11 |
12 |
13 |
14 |
15 |
16 |
17 |
18 |
19 |
20 |
21 |
22 |
23 |
24 |
| 名篇名句默写 |
1.0 |
1.2 |
0.8 |
1.1 |
1.0 |
0.9 |
0.9 |
0.9 |
1.0 |
1.0 |
1.0 |
0.9 |
0.9 |
1.0 |
0.9 |
0.9 |
1.0 |
| 古诗词鉴赏 |
0.8 |
0.8 |
1.1 |
1.2 |
0.8 |
0.8 |
0.6 |
1.1 |
0.9 |
1.0 |
1.6 |
0.9 |
1.4 |
1.2 |
1.2 |
1.4 |
1.0 |
| 文言断句 |
0.3 |
0.2 |
0.4 |
0.4 |
0.3 |
0.4 |
0.4 |
0.5 |
0.2 |
0.8 |
0.9 |
0.8 |
0.8 |
0.9 |
1.0 |
1.2 |
0.8 |
| 文言翻译 |
0.8 |
0.8 |
0.7 |
0.7 |
0.8 |
0.8 |
0.8 |
0.8 |
0.4 |
1.0 |
1.0 |
0.8 |
0.7 |
1.0 |
0.9 |
0.9 |
0.8 |
| 成语与词语运用 |
0.9 |
0.8 |
0.8 |
0.9 |
0.8 |
0.9 |
1.0 |
0.7 |
1.1 |
0.8 |
0.7 |
0.3 |
0.6 |
0.5 |
0.6 |
0.3 |
0.2 |
| 病句辨析修改 |
0.9 |
1.0 |
0.9 |
1.0 |
0.7 |
0.9 |
0.9 |
0.7 |
0.6 |
0.6 |
0.6 |
0.4 |
0.6 |
0.6 |
0.3 |
0.1 |
0.2 |
| 字音 |
0.7 |
0.8 |
0.9 |
0.8 |
0.7 |
0.7 |
0.7 |
0.4 |
0.2 |
0.4 |
0.1 |
0.2 |
0.0 |
0.1 |
0.1 |
0.1 |
0.0 |
| 字形 |
0.3 |
0.4 |
0.6 |
0.6 |
0.5 |
0.4 |
0.4 |
0.4 |
0.0 |
0.2 |
0.0 |
0.0 |
0.0 |
0.0 |
0.0 |
0.0 |
0.0 |
| 语句衔接与排序 |
0.3 |
0.3 |
0.3 |
0.3 |
0.3 |
0.3 |
0.4 |
0.3 |
0.0 |
0.5 |
0.0 |
0.3 |
0.2 |
0.4 |
0.0 |
0.0 |
0.2 |
| 句式变换与仿写 |
0.5 |
0.4 |
0.5 |
0.6 |
0.3 |
0.3 |
0.3 |
0.1 |
0.1 |
0.1 |
0.3 |
0.0 |
0.0 |
0.3 |
0.0 |
0.1 |
0.0 |
| 图文转换 |
0.1 |
0.2 |
0.2 |
0.3 |
0.1 |
0.5 |
0.3 |
0.4 |
0.2 |
0.4 |
0.7 |
0.4 |
0.2 |
0.2 |
0.1 |
0.2 |
0.0 |
| 简明连贯得体 |
0.0 |
0.1 |
0.1 |
0.2 |
0.1 |
0.1 |
0.1 |
0.1 |
0.5 |
0.6 |
0.6 |
0.2 |
0.1 |
0.1 |
0.0 |
0.1 |
0.0 |
| 标点符号 |
0.3 |
0.1 |
0.1 |
0.2 |
0.2 |
0.3 |
0.2 |
0.2 |
0.0 |
0.0 |
0.0 |
0.0 |
0.2 |
0.0 |
0.0 |
0.0 |
0.0 |
| 词义辨析 |
0.2 |
0.2 |
0.3 |
0.1 |
0.0 |
0.0 |
0.1 |
0.3 |
0.6 |
0.1 |
0.0 |
0.1 |
0.0 |
0.0 |
0.0 |
0.0 |
0.0 |
| 论述类文本阅读 |
0.1 |
0.0 |
0.0 |
0.0 |
0.3 |
0.3 |
0.3 |
0.5 |
0.4 |
0.8 |
0.0 |
0.1 |
0.3 |
0.6 |
0.7 |
0.7 |
0.6 |
| 文学类文本阅读 |
0.6 |
0.3 |
0.0 |
0.5 |
0.3 |
0.3 |
0.4 |
0.3 |
0.8 |
0.8 |
0.0 |
0.2 |
0.2 |
0.6 |
0.7 |
0.7 |
0.0 |
| 文学常识与名著 |
0.2 |
0.2 |
0.2 |
0.4 |
0.2 |
0.2 |
0.2 |
0.3 |
0.2 |
0.2 |
0.1 |
0.5 |
0.1 |
0.0 |
0.1 |
0.1 |
0.0 |
4. 卷面规模
只取空白卷计算(解析卷混入解析文字不可用)。指数以 2008 = 100。
| 年份 |
空白卷字数 |
指数 |
每卷题数 |
指数 |
| 2008 |
7176 |
100 |
22 |
100 |
| 2009 |
7269 |
101 |
25.9 |
118 |
| 2010 |
7240 |
101 |
22.7 |
103 |
| 2011 |
7060 |
98 |
25.8 |
117 |
| 2012 |
5575 |
78 |
20.5 |
93 |
| 2013 |
7094 |
99 |
22.1 |
100 |
| 2014 |
6824 |
95 |
21.2 |
96 |
| 2015 |
7590 |
106 |
20.8 |
95 |
| 2016 |
8099 |
113 |
18.5 |
84 |
| 2017 |
8813 |
123 |
26.5 |
120 |
| 2018 |
7647 |
107 |
28.4 |
129 |
| 2019 |
7911 |
110 |
21.1 |
96 |
| 2020 |
8268 |
115 |
23.6 |
107 |
| 2021 |
8010 |
112 |
25.6 |
116 |
| 2022 |
8093 |
113 |
20.9 |
95 |
| 2023 |
8301 |
116 |
23.3 |
106 |
| 2024 |
8610 |
120 |
23.2 |
105 |
2012 年下探是该年多份空白卷源文件本身截断(缺作文题),非命题变化。
分值结构
| 题型 |
有分值样本 |
中位数 |
众数 |
| 简答 |
1057 |
4 |
4 分 |
| 选择 |
536 |
3.0 |
3 分 |
| 默写 |
137 |
6 |
6 分 |
| 作文 |
135 |
60 |
60 分 |
| 翻译 |
76 |
5.0 |
3 分 |
| 未定 |
36 |
3.5 |
2 分 |
| 断句 |
30 |
3.5 |
3 分 |
另有 5 551 道题的分值只写在大题标题(如「一、(9 分)」),是整组总分,语料中单存为 section_score,不与单题分值混用。
5. 作文命题形式
| 年份 |
材料作文 |
命题作文 |
话题作文 |
未归类 |
| 2008 |
3 |
4 |
2 |
1 |
| 2009 |
4 |
6 |
1 |
3 |
| 2010 |
5 |
5 |
1 |
3 |
| 2011 |
6 |
5 |
0 |
4 |
| 2012 |
13 |
1 |
0 |
4 |
| 2013 |
15 |
0 |
0 |
5 |
| 2014 |
16 |
0 |
0 |
1 |
| 2015 |
10 |
1 |
0 |
4 |
| 2016 |
4 |
1 |
0 |
2 |
| 2017 |
3 |
1 |
0 |
5 |
| 2018 |
6 |
1 |
0 |
3 |
| 2019 |
6 |
1 |
0 |
2 |
| 2020 |
7 |
1 |
0 |
3 |
| 2021 |
7 |
2 |
0 |
2 |
| 2022 |
5 |
1 |
0 |
3 |
| 2023 |
5 |
2 |
0 |
3 |
| 2024 |
3 |
2 |
0 |
2 |
分类快照中,2008年材料/命题为3:4,2012年为13:1;2013–2014年命题标签为零,2010年后未检出话题作文标签。212条作文记录中有51条未归类,因此“零命中”不能写成实际退出,也不足以确定2012年为全国转折点。
6. 地域命题画像
只列 canonical 卷数 ≥ 4 的卷别。「反向」为选错误项占该卷别选择题设问的比例;「卷面字数」只统计空白卷。
| 卷别 |
卷数 |
年份 |
题/卷 |
选择% |
简答分类% |
默写% |
翻译% |
断句% |
反向% |
空白卷字数 |
高频考点 |
| 上海 |
29 |
2008–2026 |
27.2 |
24 |
62 |
2 |
3 |
2 |
39 |
6355 |
写作、古诗词鉴赏、文言翻译 |
| 北京 |
18 |
2008–2025 |
23.4 |
51 |
39 |
0 |
0 |
2 |
66 |
— |
写作、文言文阅读、古诗词鉴赏 |
| 天津 |
17 |
2008–2025 |
23.2 |
55 |
33 |
4 |
4 |
0 |
49 |
8316 |
文言文阅读、古诗词鉴赏、名篇名句默写 |
| 江苏 |
13 |
2008–2020 |
22.3 |
32 |
47 |
4 |
4 |
2 |
61 |
— |
古诗词鉴赏、语言运用综合、名篇名句默写 |
| 新课标Ⅰ卷 |
11 |
2013–2025 |
19.1 |
51 |
32 |
5 |
4 |
1 |
65 |
— |
名篇名句默写、古诗词鉴赏、成语与词语运用 |
| 新课标Ⅱ卷 |
11 |
2013–2025 |
18.5 |
46 |
33 |
6 |
4 |
1 |
58 |
— |
名篇名句默写、写作、古诗词鉴赏 |
| 山东 |
10 |
2008–2017 |
21.8 |
52 |
34 |
5 |
5 |
0 |
37 |
8796 |
文言文阅读、成语与词语运用、名篇名句默写 |
| 浙江 |
9 |
2009–2021 |
24.6 |
36 |
47 |
3 |
3 |
4 |
55 |
7249 |
文言文阅读、语言运用综合、病句辨析修改 |
| 四川 |
8 |
2008–2015 |
26.8 |
43 |
41 |
5 |
5 |
1 |
47 |
— |
文言文阅读、古诗词鉴赏、字音 |
| 广东 |
8 |
2008–2015 |
23.8 |
40 |
49 |
4 |
1 |
2 |
41 |
7936 |
文学类文本阅读、文言文阅读、标点符号 |
| 湖南 |
8 |
2008–2015 |
20.1 |
48 |
36 |
6 |
5 |
0 |
40 |
— |
文言文阅读、名篇名句默写、写作 |
| 全国Ⅰ卷 |
5 |
2008–2026 |
14.8 |
32 |
49 |
9 |
4 |
0 |
50 |
— |
名篇名句默写、古诗词鉴赏、写作 |
| 全国Ⅱ卷 |
5 |
2008–2025 |
18.2 |
43 |
43 |
5 |
4 |
0 |
58 |
— |
古诗词鉴赏、名篇名句默写、成语与词语运用 |
| 新课标卷 |
5 |
2008–2012 |
18.4 |
47 |
37 |
5 |
4 |
0 |
86 |
— |
古诗词鉴赏、文学类文本阅读、名篇名句默写 |
| 新课标Ⅲ卷 |
5 |
2016–2020 |
18.2 |
54 |
29 |
5 |
4 |
0 |
62 |
— |
文学类文本阅读、论述类文本阅读、古诗词鉴赏 |
| 安徽 |
4 |
2012–2015 |
21.0 |
39 |
42 |
10 |
5 |
0 |
42 |
— |
名篇名句默写、文言文阅读、文言翻译 |
| 湖北 |
4 |
2012–2015 |
22.5 |
50 |
32 |
4 |
4 |
4 |
60 |
— |
论述类文本阅读、语言运用综合、字音 |
| 福建 |
4 |
2012–2015 |
18.2 |
36 |
47 |
7 |
5 |
0 |
77 |
— |
论述类文本阅读、语言运用综合、文言翻译 |
| 重庆 |
4 |
2012–2015 |
20.8 |
36 |
48 |
4 |
5 |
0 |
50 |
5849 |
文言文阅读、文言翻译、病句辨析修改 |
| 全国甲卷 |
4 |
2021–2024 |
22.0 |
51 |
31 |
6 |
5 |
2 |
69 |
— |
论述类文本阅读、语言运用综合、文学类文本阅读 |
三组对比:
- 上海样本中简答分类较多:选择题仅 24%(多数卷别 40–55%),简答分类约62%(不是全部主观题),反向设问 39%(不能据此作全部卷别最低排名);每卷27.2条记录,须先统一大题/子题口径才能排名,卷面 6 355 字却偏少——题多、字少、主观题为主。
- 部分全国卷族的可识别设问偏负向:2008–2012 新课标卷 86%,新课标Ⅰ卷 65%,全国甲卷 69%,此处未控制年份和识别率,未做显著性检验,不概括为所有自主命题卷的反面。
- 江苏(32%)、重庆(36%)、广东(40%)偏主观,与山东(52%)、北京(51%)、天津(55%)分成两个阵营。
上海默写率是下限:上海卷默写写作「(1)___,___。(李白《蜀道难》)」,无「默写/补写」字样,
题型分类器把一部分归成了简答。分析时已就地修正 24 道但覆盖不全。这是本次分析反过来发现的数据层缺陷,前几轮质量核查没有抓到。
7. 命题素材
文言文:正史传记,集中在三部
语料中带「节选自/选自」的出处共 433 处,正史类 65 处。
| 正史 |
被选次数 |
| 《宋史》 |
15 |
| 《史记》 |
12 |
| 《明史》 |
11 |
| 《晋书》 |
5 |
| 《新唐书》 |
3 |
| 《后汉书》 |
3 |
| 《宋书》 |
3 |
| 《汉书》 |
3 |
| 《三国志》 |
2 |
| 《元史》 |
2 |
| 《旧唐书》 |
2 |
| 《隋书》 |
2 |
| 《清史稿》 |
1 |
| 《陈书》 |
1 |
《宋史》《史记》《明史》占正史选材的 58%,以人物传记为主。
古诗词体裁
| 体裁标注 |
次数 |
| 诗 |
140 |
| 词 |
44 |
| 宋诗 |
34 |
| 唐诗 |
32 |
| 宋词 |
24 |
| 清诗 |
1 |
| 元曲 |
1 |
明确标注朝代者:宋 25、唐 25、明 17、清 16、元 5——明清诗词已占三分之一,不再是唐宋独大。
名句默写高频篇目与作者
从默写题的篇目引用提取:488 处引用、192 个篇目、68 位作者。
| 篇目 |
次 |
|
作者 |
次 |
| 《赤壁赋》 |
26 |
|
苏轼 |
39 |
| 《蜀道难》 |
22 |
|
杜甫 |
32 |
| 《离骚》 |
20 |
|
李白 |
31 |
| 《琵琶行》 |
15 |
|
辛弃疾 |
21 |
| 《登高》 |
12 |
|
屈原 |
21 |
| 《论语》 |
12 |
|
白居易 |
20 |
| 《阿房宫赋》 |
10 |
|
陶渊明 |
17 |
| 《锦瑟》 |
10 |
|
杜牧 |
11 |
| 《滕王阁序》 |
10 |
|
李商隐 |
11 |
| 《劝学》 |
9 |
|
王勃 |
11 |
| 《过秦论》 |
7 |
|
司马迁 |
10 |
| 《兰亭集序》 |
7 |
|
韩愈 |
9 |
| 《师说》 |
7 |
|
荀子 |
9 |
| 《出师表》 |
6 |
|
李清照 |
7 |
| 《归去来兮辞》 |
6 |
|
王安石 |
7 |
| 《桃花源记》 |
5 |
|
|
|
| 《荀子•劝学》 |
5 |
|
|
|
| 《游褒禅山记》 |
5 |
|
|
|
| 《念奴娇•赤壁怀古》 |
5 |
|
|
|
| 《归园田居》 |
5 |
|
|
|
苏轼 39、杜甫 32、李白 31 构成第一梯队;七位高频作者(苏、杜、李、辛弃疾、屈原、白居易、陶渊明)合计占全部引用的 37%。
8. 从命题描述到教学用途
8.1 目前最值得保留的研究方向
- 设问语言如何组织思考:比较“分析作用”“根据材料”“评价”等指令,逐题查看要求、限制与证据位置。术语表首先是检索入口,不是作答模板。
- 知识考查如何进入情境:字音、字形独立标签减少,不意味着语言基础不再考查;下一步需要核对这些能力是否转入阅读、修改与表达任务。
- 同一能力在不同卷族中的表现:先按年份、正式卷名、春/秋季、课程改革阶段分层,再比较任务形式。不能把旧新课标卷与新高考卷仅按罗马数字并组。
- 选材与设问的关系:出处频次可帮助寻找对照材料,但应按作品/材料组去重,不能把同一材料的多个子题当成多次选材。
官方背景可参照教育部发布的2024年全国高考语文试题评析:其中强调情境、应用以及语言运用向阅读的渗透。该页面本次搜索摘要可得、全文抓取超时,仅作背景索引,不据此确认本文任何统计比例或逐题判断。
8.2 教学应用边界
- 学生:按目标年份与卷别检索审题练习;历史频率不得显示为预测概率。“逐项核对文本证据”比机械默认选择错误项更稳妥。
- 教师:把同一指令、不同材料的题组成比较阅读,讨论证据链与表达要求;材料与答案必须先人工核验。
- 命题者:以目标地区当年正式试卷和课程要求为蓝本。本报告不规定8,600字、22–23题、60%反向题或统一分值;这些混合样本均值不能作模拟卷硬门槛。
- 分区域建议:原稿将北京、上海、天津与全国卷多年平均混写为现行备考规则,现撤回这一写法。分区域版本应逐年核查正式卷、评分要求和适用省份,再提出建议。45分钟阅读、10分钟微写作等可作为教师试行安排,不能声称由本语料证明。
8.3 尚未得到回答的问题
没有考生作答、得分和耗时数据,无法分析难度、区分度、学生能力提升或阅读负荷。没有独立完整卷清单,无法估算漏题率。没有跨年固定卷族与代表性标注评估,无法把频率变化归因为全国命题政策变化。
9. 复核证据、可重算口径与发布门槛
9.1 本次直接重算结果
读取 _index.json 指向的432个JSON,只保留 is_canonical=true,题目排除 readiness=answer_record。标签覆盖按非空 knowledge_points 计数;来源按 knowledge_point_source 计数。
| 指标 |
本次结果 |
解释 |
| 文档/canonical |
432/201 |
代表卷算法仍需身份正确性抽查 |
| 题目记录/2008–2024记录 |
4,464/4,348 |
与原报告相符 |
| 有标签记录 |
2,020(45.25%) |
其余2,444条无标签;不等于45%为推断 |
| 原文标签来源 |
503(全部记录11.27%) |
source_label_jyeoo |
| 规则推断 |
1,440(32.26%) |
rule_inferred;不代表独立测试准确率 |
| 未验证规则推断 |
77(1.72%) |
rule_inferred_unvalidated,主分析应排除或另层显示 |
| ready/needs_review/unusable |
3,497/906/61 |
ready只是管线状态,不等于已人工验证可判卷 |
| 对照期场次 |
2008–2015:114;2017–2024:69 |
是卷数,不是考生数或省份数 |
已标注记录中1,517/2,020(75.10%)来自两种规则来源。原文标签用来调规则又用来测一致率,存在评估偏乐观风险;不能将91.3%层级一致率推广为全库精度。旧报告中的531/576等计数属于不同处理阶段或标签层级,应保留在原始质量报告中,不与本次canonical记录数混用。
输入指纹:433文件(索引+其引用文件),按相对路径字典序依次输入“路径UTF-8、NUL、文件原始字节”计算 SHA-256:8c770ae4d6674a6e8254a078ebb5279a75aaeecf3d480fc2163f3460be7708fa。
基础核查可在现有环境直接执行(不写语料,不产生缓存):
/Users/ylsuen/.venv/bin/python -B - <<'PYCODE'
import json, hashlib
from pathlib import Path
from collections import Counter
r = Path('/Users/ylsuen/Downloads/urongda-gaokao-yuwen-structured')
idx = json.loads((r / '_index.json').read_text())
docs = [json.loads((r / x['structured_file']).read_text()) for x in idx]
canonical = [d for d in docs if d['is_canonical']]
rows = [(d, q) for d in canonical for q in d['questions']
if q['readiness'] != 'answer_record']
print('documents/canonical/questions:', len(docs), len(canonical), len(rows))
print('core:', sum(2008 <= d['year'] <= 2024 for d in canonical),
sum(2008 <= d['year'] <= 2024 for d, q in rows))
print('labelled:', sum(bool(q['knowledge_points']) for d, q in rows))
print('sources:', Counter(q['knowledge_point_source'] for d, q in rows))
print('readiness:', Counter(q['readiness'] for d, q in rows))
print('years:', sorted(Counter(d['year'] for d, q in rows).items()))
h = hashlib.sha256()
for name in sorted(['_index.json'] + [x['structured_file'] for x in idx]):
h.update(name.encode()); h.update(b'\0'); h.update((r / name).read_bytes())
print('sha256:', h.hexdigest())
PYCODE
这段代码仅重算上述基础事实,不声称重建第2–7节所有图表。那些表保留为旧分析快照,除本节明确复核项外仍待生成器与逐题命中清单补齐。
9.2 已发现的统计风险
| 问题 |
证据 |
必须修正的使用方式 |
| 空白卷未证明场次去重 |
analysis.json中2024年8份空白文档/5个canonical;2010为13/12,2017为9/8 |
字数图暂不作结论;记录具体文件、排除原因、每年有效n,按相同exam_id取一个无解析完整版本 |
| 选择题分母不清 |
旧年度正负向计数2008–2024合计1,238,含2025–2026则1,261,不等于原文1,267 |
分母为可判极性的设问;另报全部选择题与无法判定数,不把答案字母归一化数混入 |
| 年均与合并率混用 |
原49.6%/64.1%为各年等权平均;本次49.20%/64.03%为期间题目合并率 |
两种均可描述不同问题,但必须明确权重、n和期间 |
| 类型与能力维度混合 |
断句可同时是选择题;“简答”也吸收漏识别默写 |
拆成作答形式与考查内容两轴,未分类单列 |
| 分值异常 |
score_by_type中选择最大25、简答最大70;翻译众数3而中位数5 |
不把段落总分、子题分或解析误抽当统一单题赋分;撤回“翻译众数5分” |
| 卷名归并有误导 |
当前新课标Ⅰ/Ⅱ各11套,新高考Ⅰ/Ⅱ各3套单列 |
先建立正式卷名、时期、季节映射;不直接合并、不推断现行省份 |
| 2024全国乙卷缺口断言 |
仅凭源站未出现不能证明当年应有此卷 |
先核对当年官方实际卷种清单,再计算覆盖缺口 |
| 区域极值错误 |
上海反向39%并非表内最低(山东37%);各行又混有不同时期和残卷 |
删除“全国最低/最多”等未同口径排序结论 |
| 年份与完整性 |
2025每卷12.5条、2026每卷8条;源文档仍可能有内容/文件名冲突 |
两年仅作待核查检索,不能参与词频或地区趋势排名 |
9.3 从研究底稿到公开结果的验收
- 每张公开图有指标定义、分母、有效n、排除数、年份/卷族范围、输入指纹、生成代码和对应题目ID清单。
- canonical与空白卷以统一exam_id联结;问题卷隔离;2025–2026不进入主趋势。先做北京、上海秋考及同一全国卷族的连续年份比较,再对照全样本。
- 人工审阅拟公开的全部案例;标签评估另建未参与规则设计的分层样本,报告精确率和召回,不以规则内部一致性代替。
- 设问比率应同时展示分子/分母;考点多标签不能解释为总和100%的份额;字数不命名为难度或阅读耗时。
- 博客可以先发表项目方法、已重算规模及研究边界;未通过上述核查的图表与强趋势结论不公开定论。互动研究页的公开数字也必须过同一门槛。