RESEARCH / 研究

研究的核心,不是再做一个更高的分数。

而是建立一条可以被质疑、被复核,也能指导真实干预的证据链。

RESEARCH MAP

Problem → Assumption → Identification → Estimation → Validation

代码审查行为因果问题可识别效应可信结论

从关联到干预效应

同样一条“审查策略与更高质量相关”的结果,可能来自策略本身,也可能只是因为经验丰富的开发者更愿意采用它。

研究问题

哪些变量同时影响审查行为与结果?在什么假设下,观察数据能够识别审查干预的因果效应?

方法关注

DAG、调整集、倾向得分、敏感性分析、因果发现稳定性,以及未测混杂对结论的影响。

目标

把“模型显示显著”改写成一套透明的识别声明,让结论强度与证据等级相匹配。

反事实代码审查

真正想知道的不是“用了工具的人表现如何”,而是同一个开发者在同一个任务上,如果没有这次工具介入,会发生什么。

Treatment

评论解释类型、审查策略、AI 来源标签、上下文呈现与自动化工具介入。

Outcome

缺陷发现、评论采纳、修改正确性、审查时延、认知负荷与下游代码质量。

异质效应

关注经验水平、任务复杂度、缺陷类别和仓库特征如何改变干预效果。

仓库级代码理解

审查对象是一段 diff,但正确性往往藏在当前文件之外:定义、调用链、测试、约定与历史修改共同决定一条建议是否成立。

上下文定位

通过标识符定义、静态分析和调用图找到真正必要的证据,而不是盲目塞入整个仓库。

上下文使用

研究检索、压缩与推理怎样协同,区分“找到了”与“真正利用了”。

可靠评价

以编译、测试、标识符一致性和专家判断补足纯词法指标的不足。

可信评价与证据边界

Benchmark 上的领先并不自动等于真实审查中的有效。评价必须解释数据怎样被选择、指标测量了什么,以及工具预算是否公平。

构念效度

接受率、评论解决率和自动指标究竟在多大程度上代表“有用”或“正确”。

偏差审查

选择偏差、聚合偏差、测量偏差、数据泄漏与 benchmark artifacts。

外部有效性

把结论放回不同语言、仓库、团队结构和真实工作流中,明确可以推广到哪里。