零晋级,不等于零科研产出
最重要的结果是一张负面知识地图:哪些“新机制”其实是经典 queueing、paging、Lyapunov、setup batching、precedence scheduling 或 probing 的改名;哪些 gap 只在删除真实 runtime capability 后才成立。
从这里进入研究材料
仓库保留了生成、审计、反驳和闭包过程。建议先读总报告,再按问题、机制、轮次和证据层级下钻。
13 小时、22 轮审计报告
中文、自包含、可离线阅读;含轮次演化、R22 分支、Sherlock 勘误、负结果和人工决策。
Run archive22 轮不可变研究记录
研究 brief、任务合同、primary sources、formal cells、审计和 closure decisions。
IdeasIdea Cards 与拒绝理由
完整问题、方法、实验假设、最近工作差异、失败条件和 reviewer attacks。
Workflow科研工作流与 stage gates
从 scope freeze、全文 grounding 到 novelty、feasibility、smoke test 和 submission gate。
Evaluation晋级与淘汰标准
拒绝只换 benchmark、加权指标拼接、无 observation 的 prompt engineering 和不可复现实验。
Prompts多代理角色与首轮提示
文献、理论、serving、observation、novelty、feasibility、citation 和 tournament 角色。
接下来需要人,而不是更多自动生成
当前更合理的动作是由 PI 选择研究哲学,而不是继续横向生成 cache-aware、confidence-aware、criticality-aware 的组合。
- Observation-first:只授权 CPU-only observation replay,先验证现象是否存在。
- Theorem-first:选择一个 faithful residual,不通过删除关键 runtime capability 换定理。
- Recent-policy limitation:先正式关闭 R22,再判断忠实 limitation 是否值得写作。
所有预期结果仍是 hypothesis。自动 reviewer 分数是弱证据。任何重大算力、venue 选择、科学 finding 或投稿都需要人工确认。