浏览 AI 知识库
评分量规怎样写到不同老师给分也基本一致
评分量规要描述可观察证据,不写“优秀、较好、一般”。先选真正影响任务质量的维度,再用样例校准不同教师的判断。
需要哪一项,就直接查到哪一段
把表格、命令、清单或规则作为工作中的查询工具,不要求从头顺序阅读。
两位老师都按“逻辑性 20 分”评分,同一作业却一个给 18、一个给 11
量规只写“逻辑清晰 16–20 分、较清晰 11–15 分、不清晰 0–10 分”。老师 A 重视结构,老师 B 重视证据,学生也不知道怎样改进。分数差异不是老师不认真,而是标准没有说明观察什么。
可用量规需要四部分:互不重叠的关键维度;每个维度的可观察表现;层级之间真正改变质量的差异;与任务目标和权重一致的计分方式。正式使用前用真实匿名样例做校准。
- 选出少而关键的评分维度
- 写出可观察的层级描述
- 用样例和复评检验评分一致性
层级描述要告诉评分者“在哪里能看到差异”
| 维度 | 含糊描述 | 可观察描述示例 |
|---|---|---|
| 论点 | 观点深刻 | 提出明确、可辩护的中心判断,并贯穿主要段落 |
| 证据 | 资料丰富 | 关键主张由相关来源支持,能区分证据、推断与作者观点 |
| 分析 | 分析充分 | 比较至少两种解释,使用证据排除或限定其中一种 |
| 结构 | 逻辑清楚 | 段落顺序支持论证推进,过渡说明前后判断关系 |
| 规范 | 格式良好 | 引用、图表、字数和文件要求均满足任务说明 |
示例只展示可观察性。正式维度和表现必须从具体课程目标与任务中推导。
先定义合格表现,再扩展高低层级
- 01
从课程目标提取表现
只评价作业真正能展示的目标。不能用一次短答作业测“团队协作”或长期能力。
- 02
合并重叠维度
论证、逻辑、结构若描述同一现象,应重新划界;通常 4–7 个核心维度比十几个碎项更可用。
- 03
先写达标层
说明一份合格作业必须出现哪些证据和质量,再写高一层增加什么、低一层缺少什么。
- 04
避免按数量假装质量
引用 10 篇不一定比 5 篇好。数量只在与任务实质相关时使用,并说明相关性和准确性。
- 05
设置权重和不可补偿项
权重反映课程目标;若抄袭、数据造假或缺关键组件有单独规则,应在任务说明中明确,不隐藏在量规小字。
- 06
用锚定样例校准
多位评分者独立评分匿名样例,讨论差异来自标准、证据还是算分;修改后再测一次。
一行一个维度,一列一个质量层级
量规底稿
维度—层级—证据
criterion,linked_outcome,weight,exceeds,meets,approaches,not_yet,evidence_location,common_misread,anchor_example,calibration_note
{维度},{课程目标},{权重},{超出标准的可观察表现},{达标表现},{接近达标},{尚未达标},{作业中看哪里},{常见误判},{匿名样例编号},{校准记录}如使用总分,需明确边界值、舍入、缺交项目和学术诚信事件怎样处理,并服从学校政策。
学生和两位教师读完,应能指出同一份证据落在哪一层
以‘证据使用’维度为例,每一档都能从作业中观察
| 等级/分值 | 可观察表现 | 作品证据 | 教师判定 |
|---|---|---|---|
| 4 分 | 核心主张均有合适来源;能比较来源差异并说明限制 | 正文引用与证据表一一对应,无关键来源缺失 | 达到并能解释证据边界 |
| 3 分 | 核心主张有来源,少数次要主张或限制说明不足 | 抽查主要段落可回到来源,存在不影响结论的小缺口 | 达到合格标准 |
| 2 分 | 部分核心主张缺来源,或只罗列来源未建立对应关系 | 至少一个主要结论无法追到证据 | 未达到,需补主张—证据映射 |
| 1 分 | 大部分判断无可核验来源,或引用与主张明显不符 | 无法用来源支持主要结论 | 未达到,需重建证据结构 |
这是一个维度的输出示例。完整量规还要写其他独立维度、权重、边界样例,并通过多位教师盲评校准。
发布前用同一批匿名作业做校准
量规必须与课程目标、评价政策和具体任务共同设计
核对成绩构成、复核、申诉、迟交、学术诚信和材料保存要求。
量规有效性来自本课程真实任务的校准,不来自照搬通用模板。
