AIRESEARCHMETHOD EVALUATION

研究评估

这一页评估的是研究方法本身,不是任何一家公司的结论。每次研究做完时记录一条: 机器指标由工具运行时自己写,阅读评分由人读完报告当场打。

已评估研究2一次研究一条,追加式不改写
阅读评分均分3.8五项各 1–5 分的平均
校验一次通过率50%第 4 步首轮即达标的比例
改变了仓位0 / 2比自评分更诚实的行为指标
未发现缺陷0 / 2合法结果;长期偏高说明这一项在走过场

LEDGER

研究台账

样本量为 2 条,不足 10 条,因此只列台账、不画趋势线—— 几个点连成的折线读不出趋势,只会造成看出了趋势的错觉。

公司评分日可信洞察好读可执行密度均分比上次校验干预 / 纠错输出 token投入分钟skill
中国平安保险(集团)股份有限公司2026-08-09443443.8更好一次过0 / 0465,51239280c597
盛和资源控股股份有限公司2026-08-08445333.8差不多0 轮— / —1592a7b

成本指标取自会话日志,取不到时显示 —— 而不是 0;它依赖编辑器的内部日志格式, 因此被有意设计成可缺失。校验轮数与得分取自工具自己写的运行事件,是一等事实。

DEFECTS

最差的一处

五个分数一定会随习惯向上漂移直至饱和,这一条不会——改研究方法时, 改的应该是这里记下的失败,而不是印象里的问题。 「暂时没发现」是合法结果、不产生记录,因此这里的条数少于研究次数是正常的; 但上面那格「未发现缺陷」的比例长期偏高,说明的多半不是报告变好了。

METHOD

怎么读这一页

正确性、依从性、自主性、成本、稳定性都是代理指标,阅读评分才是目的本身。 判定一次研究方法的改动是不是改进,标准是:固定模型与固定任务下,其中至少一项显著提升、 其余不回归、成本不显著变差。任何一项回归都不算改进。

这套自我评价本身也可被怀疑:五项评分会漂移会饱和,真正承载信号的是「最差的一处」 与「是否改变仓位」这两个不易自欺的字段。若台账上的分数长期贴在高位而缺陷仍在稳定产出, 应当相信后者。原始记录在仓库的 research/evals/ 下,逐条可核对。

← 回到公司研究