研究轮次
22Source: Corpus audit metrics
截至报告快照的独立研究 run。
Exact snapshot rows for dataset corpus_metrics.
Data Analytics report
对 2026 年 7 月 28 日 Agentic Workflow scheduling 多代理研究的中文技术复盘。
结论先行:这 13 小时没有找到一个可以诚实晋级到 smoke test 的新机制,但建立了一份坚实的负面知识地图。 研究覆盖 22 个 run、171 个隔离任务目录、966 个非空文件;663 个 YAML 全部可解析。121 份 primary-sources.yaml 跨 schema 记录了 1,197 条非去重来源,其中 101 份使用统一 sources: 结构,含 1,012 条记录。可直接统计的 formal、theorem、mechanism 与 observation-theory cell 下界为 208;严格 discovery-gate survivor 为 0。
这不是“什么都没做”。研究系统性排除了大量看似新颖、实际可归约的方向:把 agent、verification、prefix、cache、workflow、human oversight 或 uncertainty 换成新名词,并不会自动越过 queueing、caching、Online Service with Delay、Gittins/index policy、Lyapunov virtual queue、transaction/Saga、setup batching、precedence scheduling、stochastic probing、POMDP 或 robust control 的已有边界。
最重要的认识是一种反复出现的理论张力:模型越忠实地保留 agentic runtime 的动态揭示、语义失效、共享状态、回滚、版本与跨层资源耦合,正定理越难闭合;一旦限制模型使证明闭合,agentic coupling 往往消失,结果又精确退化为经典模型。 下一步不应继续横向批量生成 idea,而应由 PI 在 observation-first、theorem-first 或 recent-policy limitation 三条研究哲学中只选一条。
研究轮次
22Source: Corpus audit metrics
截至报告快照的独立研究 run。
Exact snapshot rows for dataset corpus_metrics.
非空文件
966Source: Corpus audit metrics
runs/ 下全部非空研究文件。
Exact snapshot rows for dataset corpus_metrics.
任务分支
171Source: Corpus audit metrics
tasks/ 下直接隔离任务目录。
Exact snapshot rows for dataset corpus_metrics.
来源记录
1,197Source: Corpus audit metrics
跨 schema 非去重来源记录;同一论文可在多个分支重复。
Exact snapshot rows for dataset corpus_metrics.
候选 cells 下界
208Source: Corpus audit metrics
显式 formal/theorem/mechanism/observation-theory cell 的保守下界。
Exact snapshot rows for dataset corpus_metrics.
严格 survivor
0Source: Corpus audit metrics
通过完整 discovery gate 的候选。
Exact snapshot rows for dataset corpus_metrics.
已运行实验
0Source: Corpus audit metrics
已运行实验、实现、smoke test 与 experiment contract 均为零。
Exact snapshot rows for dataset corpus_metrics.
Exact snapshot rows for dataset audit_counts.
| 统计口径 | 数量 |
|---|---|
| 轮次 | 22 |
| 任务 | 171 |
| Cells | 208 |
| YAML | 663 |
| 文件 | 966 |
| 来源 | 1,197 |
这些计数是研究过程的审计证据,不是论文影响力指标。1,197Source: 22 轮 corpus 规模与完整性审计 是跨分支重复出现的来源记录,不等于 1,197Source: 22 轮 corpus 规模与完整性审计 篇独立论文;208Source: 22 轮 corpus 规模与完整性审计 是按显式 cell 文件保守聚合的下界,不等于穷尽所有可能机制;0Source: 22 轮 corpus 规模与完整性审计 survivor 只表示没有候选通过本项目的严格 discovery gate,不表示该领域不存在贡献机会。
全库没有 experiment-contract.yaml,没有代码或 notebook 产物,450Source: 22 轮 corpus 规模与完整性审计 个与实验、实现、smoke test 或 contract 创建有关的明确布尔记录全部为 false。因此本报告讨论的是文献、建模、归约、反例和研究决策,不是实验发现。
文件、YAML、来源记录、cell 下界、survivor 与无实验状态的机械审计。
本项目研究的不是单个 LLM request 排队,而是会动态生成、揭示、验证、撤销、合并或重做工作的 Agentic Workflow。节点可以是生成、检索、工具执行、代码执行或验证;资源包括异构模型端点、CPU/GPU worker、KV/prefix cache、网络传输、人工 reviewer、token 与货币预算;动作包括 ready-node ordering、模型路由、并行分支、验证器放置、重试、剪枝、合并、暂停、迁移和停止。
三个区分贯穿全部轮次:
研究循环、证据规则、stage gates、实验合同与人工 checkpoint。
阅读不是按“Agentic Workflow”单一关键词展开,而是把同一个机制翻译到相邻研究社区,再寻找最强直接 refuter。下表概括反复出现的跨社区映射。
四个轮次区段汇总与 corpus 审计的根级综合。
首轮按 research brief → 全文与代码 grounding → problem/observation map → 独立 idea generation → novelty/feasibility/citation audit → 匿名 tournament 的完整链条执行。生成者不能作为唯一 novelty judge;晋级方向必须有机制级 closest-work difference、可测 observation、可执行 smoke test 和明确 falsifier。
后续轮次不断更换发现策略:formal gap、原子动作、live transformation、近期论文 limitation、strategic behavior、decentralized coordination、recursive work、human oversight、compositional contracts、nonstationarity、impossibility、constructive intersections、local observation、identifiability、micro-motif theorem、near-miss theorem salvage,最后到 recent-policy falsify-and-repair。
每个候选都要经受四个问题:状态是否真实可观测;动作是否改变可行状态转移而非只改权重;定理是否对非平凡 workload class 成立;与 strongest comparator 是否存在 cost-preserving nonreduction。任何一项未闭合就不晋级。
研究循环、证据规则、stage gates、实验合同与人工 checkpoint。
R1 生成了完整的问题图、术语图、25 条 observation 和 12 张 Idea Card;R2 又生成 15 张理论优先卡。但两个阶段的独立 novelty 与 tournament 都是零晋级。R3–R5 随即停止继续堆卡,转而逐个关闭 rank、testing、cache、reveal、compaction、redundancy、transaction、salvage、handoff 等最强残余。
首轮到 Round 5 的问题、阅读、Idea Cards、审计与 closure。
下表保留所有首轮 idea,而不是只展示两个相对靠前的方向。C01 与 W01 只是未晋级 backup:前者只允许先观察 reveal-induced blocking,后者只允许先补 transaction/provenance nearest work;都没有授权实现。
12 张 Idea Card 的独立 audit、决定性缺口与最终处置。
这六轮共 36 个隔离分支。核心发现是:新信息、接口包装、隐私层、交易层、auction、consensus 或 lease 并不自动产生新调度动作。只要它们能编译进产品状态或已知动作菜单,问题仍属于 recourse、matching、metareasoning、preemption、transaction、mechanism design、BFT、backpressure 或 caching。
控制面、版本、limitation、strategic behavior 与 decentralized coordination。
这六轮共 36 个分支、71 个显式尝试 cell、310 条轮内来源记录,仍为零 survivor。研究已不再依赖“动态 DAG”这一表面差异,而是主动寻找内生 work generation、human learning/fatigue、contract composition、common shock、impossibility boundary 和跨层非可分动作;结果依旧被成熟模型吸收,或在 strongest comparator 下失去 separation。
递归工作、人类监督、SLO、非平稳性、impossibility 与构造机制。
最后五轮是整个研究最有价值的策略演化。R18 先问现有代码和日志能否稳定显示异常;R19 追问这些现象是否从现实 telemetry 可识别;R20 在完全观测的小型 motif 上寻找 threshold/index;R21 给 near-miss 加结构,要求完成正定理;R22 则从 2025–2026 具体论文的明确策略出发,忠实保留其 runtime capability,再构造 limitation 与 matching repair。
observation、identifiability、constructive motif、proof salvage 与 recent-policy audit。
R22 的 11Source: R18–R22 只读研究汇总 个 theorem cells 已由六个分支完成,branch survivor 为 0Source: R18–R22 只读研究汇总。需要精确保留状态:root mechanical audit 已完成,但正式根级 closure 仍缺“每分支一个 strongest direct refuter 的 fresh refetch”和最终 decision,因此当前是 frozen-for-report,不是正式 closed。
observation、identifiability、constructive motif、proof salvage 与 recent-policy audit。
observation、identifiability、constructive motif、proof salvage 与 recent-policy audit。
第一,Agentic vocabulary 经常掩盖经典数学核心。 verifier queue 可能是 inspection/active testing;semantic cache 可能是 weighted paging;speculation budget 可能是 token bucket;quality debt 可能是 Lyapunov virtual queue;hidden successor 可能是 revealed precedence;resume/offload 可能是 Online Service with Delay;human escalation 可能是 state-dependent queue。
第二,真正可能新颖的地方不是目标函数,而是 action-dependent state transition。 加权 latency、cost、accuracy、risk 或 confidence 通常只改变 scoring。更有希望的是动作会改变未来图的揭示、共享状态的可复用性、验证后的失效传播、不可逆 side effect 的发布边界,或多个资源层的可行转移集合。
第三,faithfulness–tractability 张力是当前最大障碍。 保留 dynamic graph revelation、cache capacity、shared rollback、late join、preemption、migration 和 policy tie-breaking 后,证明常出现 Palm term、endogenous release、correlated burst 或 nonseparable state 的缺口;删掉这些细节后,证明虽闭合,却又退化为已有模型。
第四,数学完整不等于机制新颖。 本研究出现过完整 lower bound、4-competitive policy、1-competitive restricted repair、exact batch-debt optimum 和稳定性证明,但仍因 cost-preserving reduction、policy mismatch 或 nontrivial lift 缺失而被拒绝。
四个轮次区段汇总与 corpus 审计的根级综合。
下面这些不是“候选已通过”,而是当前证据仍未完全消解的高价值问题。它们只有在精确定义 state、action、information 和 comparator 后才值得继续。
四个轮次区段汇总与 corpus 审计的根级综合。
研究过程中多次发现搜索索引会把 arXiv ID、标题或摘要映射到错误论文。因此搜索 snippet 永远不进入 evidence graph;promotion-critical source 必须 fresh HTTP 200Source: Sherlock metadata erratum、PDF magic、标题、作者、版本、机制位置或定理位置全部闭合。网站 502Source: Sherlock metadata erratum、503Source: Sherlock metadata erratum、timeout 或中断后,相关分支会作废 stale preflight,重新读取规则、重新执行 nonce create/read/delete/absence,并重新取得全文。
R21 曾把 arXiv:2511.00330v1 错标为视觉语言模型审计论文;实际 PDF 是 Sherlock: Reliable and Efficient Agentic Workflow Execution,第一作者 Yeonju Ro,1,876,474 bytes,SHA-256Source: Sherlock metadata erratum 为 8c6fc9b8fde6123dc0ce67f0ed347373b249b76a1dfb00315cbfe739446a79aa。错误只在 bibliographic metadata,分支使用的 PDF bytes 和机制内容正确,因此 decision 与 survivor count 不变。原记录按 append-only 规则保留,权威更正在 erratum 中。
Sherlock 正确标题、版本、作者、PDF hash 与影响评估。
这份报告有五个边界。第一,来源记录未跨分支去重,也不能全部等同于全文。第二,不同轮次的 cell schema、搜索策略和 gate 强度不同,因此没有画“22 轮 survivor 趋势图”;那会制造虚假的同质可比性。第三,0 survivor 是研究流程判定,不是统计检验。第四,R22 尚未正式 root closure。第五,没有实验,因此不能声称任何 observation 已复现、任何策略有效或任何负结果具有现实 prevalence。
已执行的 robustness checks 包括:663/663 YAML parse;0 空文件;显式 source-ID 闭包;独立 generator/evaluator;双 novelty 与双 tournament;policy fidelity;strongest comparator;full-text direct refuter;中断后 fresh preflight;无实验/实现/secret 访问审计。
我的建议是停止继续横向批量扩展。 继续生成更多“cache-aware、criticality-aware、confidence-aware”组合,大概率只会重复现有归约。PI 应先选择一种研究哲学:
IDEA-C01 的 CPU-only observation replay,只测 reveal-induced capacity blocking,不实现 reserve。它最便宜、最可证伪,也最能决定隐藏 successor 是否真是问题。在任何实现前,必须记录问题冻结、workload/trace、O0 信息、主指标、falsifier、strongest baselines、预算、seed、统计方法、停止规则、raw output 路径和安全边界,并由 PI 明确授权创建 experiment-contract.yaml。目前 GPU、API、付费数据、人工评审和 substantial compute 的授权仍为零。
实现前必须由 PI 明确记录的选择、冻结项和授权。
研究循环、证据规则、stage gates、实验合同与人工 checkpoint。
文件、YAML、来源记录、cell 下界、survivor 与无实验状态的机械审计。
首轮到 Round 5 的问题、阅读、Idea Cards、审计与 closure。
控制面、版本、limitation、strategic behavior 与 decentralized coordination。
递归工作、人类监督、SLO、非平稳性、impossibility 与构造机制。
observation、identifiability、constructive motif、proof salvage 与 recent-policy audit。
12 张 Idea Card 的独立 audit、决定性缺口与最终处置。
实现前必须由 PI 明确记录的选择、冻结项和授权。
Sherlock 正确标题、版本、作者、PDF hash 与影响评估。
六分支零 survivor、root mechanical audit 完成与 closure 待办。
四个轮次区段汇总与 corpus 审计的根级综合。
Exact snapshot rows for dataset corpus_metrics.
SELECT * FROM "corpus_metrics";Exact snapshot rows for dataset audit_counts.
SELECT * FROM "audit_counts";Exact snapshot rows for dataset communities.
SELECT * FROM "communities";Exact snapshot rows for dataset rounds_r1_r5.
SELECT * FROM "rounds_r1_r5";Exact snapshot rows for dataset r1_ideas.
SELECT * FROM "r1_ideas";Exact snapshot rows for dataset rounds_r6_r11.
SELECT * FROM "rounds_r6_r11";Exact snapshot rows for dataset rounds_r12_r17.
SELECT * FROM "rounds_r12_r17";Exact snapshot rows for dataset rounds_r18_r22.
SELECT * FROM "rounds_r18_r22";Exact snapshot rows for dataset r22_branches.
SELECT * FROM "r22_branches";Exact snapshot rows for dataset rejection_patterns.
SELECT * FROM "rejection_patterns";Exact snapshot rows for dataset residuals.
SELECT * FROM "residuals";Exact snapshot rows for dataset human_decisions.
SELECT * FROM "human_decisions";