{"messages":[{"content":"You are a constitutional council ranking individual git commits for ownership allocation.\n\nCompare these two commits. Decide which contributed more lasting value to the project.\n\nJudge substance, not spectacle:\n- Prefer correct, lasting design and real bugfixes over churn, formatting, renames, or generated noise.\n- Prefer clarity and necessity over sheer line count. A small precise change can beat a large diffuse one.\n- Do not favor a side merely because its patch is longer or noisier.\n- Weight what the change does for the project, not the contributor's name.\n\nReturn ONLY a JSON object: {\"winner\": \"A\" or \"B\", \"ratio\": \"N:M\", \"explanation\": \"...\"}\nThe explanation must cite concrete differences in the patches (1-3 sentences).\n\nSide A — contributor: tommy-mor\nSide A — commit message:\n[7bb7145d] url stuff\n\nSide A — unified diff (full patch):\ndiff --git a/AGENTS.md b/AGENTS.md\nindex e60b9ba6012593361ef10e8fdd9439cd9932e09b..babb889d6fbfb1fa7176c9e6b7544ae17b61dd2e 100644\n--- a/AGENTS.md\n+++ b/AGENTS.md\n@@ -58,4 +58,4 @@ Use **tmux** for `cargo run --package sorter2-server` (dev server). Rebuild afte\n \n - First `cargo test` / `cargo build --release` is slow; Clojure smoke test always does a release build.\n - `legacy/` and `ideas/` are not part of the workspace build.\n-- **ItemId** for web URLs is a canonical full URL (`https://reddit.com/r/rust`). Rules live in [`server/src/url_rules/`](server/src/url_rules/) (composable Rust, not a config DSL). After changing canonicalization rules, rebuild the projection: `cargo run --package sorter2-server -- replay-index`.\n+- **ItemId** for web URLs is a canonical full URL (`https://reddit.com/r/rust`). Rules live in [`server/src/url_rules/graph.rs`](server/src/url_rules/graph.rs): a semantic graph (DFA on host + path, query params in `Context`) with a generic internet fallback for unknown sites. After changing rules, rebuild the projection: `cargo run --package sorter2-server -- replay-index`.\ndiff --git a/server/src/url_rules/engine.rs b/server/src/url_rules/engine.rs\ndeleted file mode 100644\nindex e29b6b48c08deb7bffe031b1e542b1e25a7bef15..0000000000000000000000000000000000000000\n--- a/server/src/url_rules/engine.rs\n+++ /dev/null\n@@ -1,187 +0,0 @@\n-//! Composable URL normalization primitives.\n-\n-use std::collections::HashMap;\n-\n-use url::Url;\n-\n-/// Mutable URL view used by rule combinators before serializing to a canonical string.\n-#[derive(Debug, Clone)]\n-pub struct ParsedUrl {\n- pub scheme: String,\n- pub host: String,\n- pub path_segments: Vec,\n- pub query: HashMap,\n- pub fragment: Option,\n-}\n-\n-impl ParsedUrl {\n- pub fn parse(raw: &str) -> Option {\n- let trimmed = raw.trim();\n- if trimmed.is_empty() {\n- return None;\n- }\n-\n- let with_scheme = if trimmed.contains(\"://\") {\n- trimmed.to_string()\n- } else if trimmed.starts_with(\"r/\") || trimmed.starts_with(\"/r/\") {\n- let rest = trimmed.trim_start_matches('/').trim_start_matches(\"r/\");\n- format!(\"https://reddit.com/r/{rest}\")\n- } else if trimmed.contains('.') && !trimmed.starts_with('/') {\n- format!(\"https://{trimmed}\")\n- } else {\n- trimmed.to_string()\n- };\n-\n- let url = Url::parse(&with_scheme).ok()?;\n- let host = url.host_str()?.to_string();\n- let path_segments: Vec = url\n- .path_segments()\n- .map(|segs| segs.filter(|s| !s.is_empty()).map(str::to_string).collect())\n- .unwrap_or_default();\n-\n- let mut query = HashMap::new();\n- for (k, v) in url.query_pairs() {\n- query.insert(k.into_owned(), v.into_owned());\n- }\n-\n- Some(Self {\n- scheme: url.scheme().to_string(),\n- path_segments,\n- query,\n- fragment: url.fragment().map(str::to_string),\n- host,\n- })\n- }\n-\n- pub fn with_path_segments(&self, segments: &[String]) -> Self {\n- let mut u = self.clone();\n- u.path_segments = segments.to_vec();\n- u\n- }\n-\n- pub fn to_url(&self) -> Option {\n- let mut url = if self.path_segments.is_empty() {\n- Url::parse(&format!(\"{}://{}\", self.scheme, self.host)).ok()?\n- } else {\n- let path = format!(\"/{}\", self.path_segments.join(\"/\"));\n- Url::parse(&format!(\"{}://{}{}\", self.scheme, self.host, path)).ok()?\n- };\n- if !self.query.is_empty() {\n- let mut pairs: Vec<_> = self.query.iter().collect();\n- pairs.sort_by(|a, b| a.0.cmp(b.0));\n- url.query_pairs_mut().clear();\n- for (k, v) in pairs {\n- url.query_pairs_mut().append_pair(k, v);\n- }\n- }\n- if let Some(ref frag) = self.fragment {\n- url.set_fragment(Some(frag));\n- }\n- Some(url)\n- }\n-\n- pub fn canonical_string(&self) -> Option {\n- let url = self.to_url()?;\n- let mut s = url.to_string();\n- if self.path_segments.is_empty() {\n- s = s.trim_end_matches('/').to_string();\n- }\n- Some(s)\n- }\n-}\n-\n-pub fn force_https(u: &mut ParsedUrl) {\n- if u.scheme == \"http\" {\n- u.scheme = \"https\".to_string();\n- }\n-}\n-\n-pub fn drop_fragment(u: &mut ParsedUrl) {\n- u.fragment = None;\n-}\n-\n-pub fn strip_www(u: &mut ParsedUrl) {\n- if u.host.starts_with(\"www.\") {\n- u.host = u.host[4..].to_string();\n- }\n-}\n-\n-pub fn lowercase_host(u: &mut ParsedUrl) {\n- u.host = u.host.to_ascii_lowercase();\n-}\n-\n-pub fn lowercase_path(u: &mut ParsedUrl) {\n- for seg in &mut u.path_segments {\n- *seg = seg.to_ascii_lowercase();\n- }\n-}\n-\n-pub fn clear_query(u: &mut ParsedUrl) {\n- u.query.clear();\n-}\n-\n-pub fn keep_only_query(u: &mut ParsedUrl, keys: &[&str]) {\n- u.query\n- .retain(|k, _| keys.iter().any(|want| want == &k.as_str()));\n-}\n-\n-pub fn strip_tracking_params(u: &mut ParsedUrl) {\n- u.query.retain(|k, _| {\n- let lower = k.to_ascii_lowercase();\n- !(lower.starts_with(\"utm_\")\n- || matches!(\n- lower.as_str(),\n- \"fbclid\" | \"gclid\" | \"ref\" | \"ref_src\" | \"ref_source\" | \"mc_cid\" | \"mc_eid\"\n- ))\n- });\n-}\n-\n-pub fn truncate_after_segment(u: &mut ParsedUrl, name: &str, keep: usize) {\n- if let Some(i) = u.path_segments.iter().position(|s| s == name) {\n- let end = (i + 1 + keep).min(u.path_segments.len());\n- u.path_segments.truncate(end);\n- }\n-}\n-\n-pub fn drop_listing_suffix(u: &mut ParsedUrl, suffixes: &[&str]) {\n- if u.path_segments.len() >= 3 && u.path_segments.first().map(String::as_str) == Some(\"r\") {\n- if let Some(last) = u.path_segments.last() {\n- if suffixes.iter().any(|s| *s == last.as_str()) {\n- u.path_segments.pop();\n- }\n- }\n- }\n-}\n-\n-pub fn normalize_reddit_host(u: &mut ParsedUrl) {\n- if matches!(\n- u.host.as_str(),\n- \"old.reddit.com\" | \"new.reddit.com\" | \"www.reddit.com\"\n- ) {\n- u.host = \"reddit.com\".to_string();\n- }\n-}\n-\n-pub fn rewrite_youtu_be(u: &mut ParsedUrl) {\n- if u.host == \"youtu.be\" && u.path_segments.len() == 1 {\n- let id = u.path_segments[0].clone();\n- u.host = \"youtube.com\".to_string();\n- u.path_segments = vec![\"watch\".to_string()];\n- u.query.insert(\"v\".to_string(), id);\n- }\n-}\n-\n-pub fn rewrite_youtube_shorts(u: &mut ParsedUrl) {\n- if u.host == \"youtube.com\" && u.path_segments.first().map(String::as_str) == Some(\"shorts\") {\n- if let Some(id) = u.path_segments.get(1).cloned() {\n- u.path_segments = vec![\"watch\".to_string()];\n- u.query.insert(\"v\".to_string(), id);\n- }\n- }\n-}\n-\n-pub fn normalize_youtube_host(u: &mut ParsedUrl) {\n- if matches!(u.host.as_str(), \"m.youtube.com\" | \"www.youtube.com\") {\n- u.host = \"youtube.com\".to_string();\n- }\n-}\ndiff --git a/server/src/url_rules/mod.rs b/server/src/url_rules/mod.rs\nindex 03d53bd3e82d704a01ba3fd8dd02b7d31422c0de..9e1445346ce77a49dd6a7e7713bf9c57aef353cc 100644\n--- a/server/src/url_rules/mod.rs\n+++ b/server/src/url_rules/mod.rs\n@@ -1,8 +1,12 @@\n-//! URL canonicalization and hierarchy rules for [`crate::path_types::ItemId`].\n+//! URL canonicalization and hierarchy via a semantic graph (DFA + generic fallback).\n \n-mod engine;\n+mod graph;\n+mod parse;\n mod registry;\n \n+#[cfg(test)]\n+mod registry_tests;\n+\n pub use registry::{\n canonicalize_raw, looks_like_url, navigable_breadcrumbs, parent_url, resolve_id, CanonicalResult,\n };\ndiff --git a/server/src/url_rules/registry.rs b/server/src/url_rules/registry.rs\nindex 14514e9af8385fb2b9b2f35eb9ee14d453d4b97c..8e6c012ea1fc74b864307bdacdf5a0f5db5259fc 100644\n--- a/server/src/url_rules/registry.rs\n+++ b/server/src/url_rules/registry.rs\n@@ -1,12 +1,7 @@\n-//! Per-domain canonicalization and hierarchy rules.\n+//! Public API: canonical identity and hierarchy via the URL graph.\n \n-use std::collections::HashSet;\n-\n-use super::engine::{\n- clear_query, drop_fragment, drop_listing_suffix, force_https, keep_only_query, lowercase_host,\n- lowercase_path, normalize_reddit_host, normalize_youtube_host, rewrite_youtu_be,\n- rewrite_youtube_shorts, strip_tracking_params, strip_www, truncate_after_segment, ParsedUrl,\n-};\n+use super::graph::graph;\n+use super::parse::UrlParts;\n \n /// Result of canonicalizing a raw URL string.\n #[derive(Debug, Clone, PartialEq, Eq)]\n@@ -16,71 +11,16 @@ pub struct CanonicalResult {\n pub alias_of: Option,\n }\n \n-fn apply_global(u: &mut ParsedUrl) {\n- force_https(u);\n- drop_fragment(u);\n- strip_www(u);\n- lowercase_host(u);\n- strip_tracking_params(u);\n-}\n-\n-fn normalize_reddit(u: &mut ParsedUrl) {\n- normalize_reddit_host(u);\n- lowercase_path(u);\n- truncate_after_segment(u, \"comments\", 1);\n- drop_listing_suffix(u, &[\"hot\", \"top\", \"new\", \"rising\", \"controversial\"]);\n- clear_query(u);\n-}\n-\n-fn normalize_youtube(u: &mut ParsedUrl) {\n- rewrite_youtu_be(u);\n- normalize_youtube_host(u);\n- rewrite_youtube_shorts(u);\n- keep_only_query(u, &[\"v\", \"list\"]);\n-}\n-\n-fn normalize_default(_u: &mut ParsedUrl) {\n- // Global rules only.\n-}\n-\n-fn domain_key(host: &str) -> &'static str {\n- if host == \"reddit.com\" || host.ends_with(\".reddit.com\") {\n- \"reddit.com\"\n- } else if host == \"youtube.com\" || host == \"youtu.be\" {\n- \"youtube.com\"\n- } else {\n- \"default\"\n- }\n-}\n-\n-fn normalize_for_host(u: &mut ParsedUrl) {\n- apply_global(u);\n- match domain_key(&u.host) {\n- \"reddit.com\" => normalize_reddit(u),\n- \"youtube.com\" => normalize_youtube(u),\n- _ => normalize_default(u),\n- }\n-}\n-\n-/// Structural path segments that must not become standalone tree nodes when more path follows.\n-fn structural_trailing(host: &str) -> &'static [&'static str] {\n- match domain_key(host) {\n- \"reddit.com\" => &[\"comments\"],\n- _ => &[],\n- }\n-}\n-\n /// Canonicalize a raw URL. Returns `None` if the input is not URL-like.\n pub fn canonicalize_raw(raw: &str) -> Option {\n let trimmed = raw.trim();\n if trimmed.is_empty() {\n return None;\n }\n- let mut u = ParsedUrl::parse(trimmed)?;\n- let input_snapshot = u.canonical_string()?;\n- normalize_for_host(&mut u);\n- let canonical = u.canonical_string()?;\n- let alias_of = if input_snapshot != canonical {\n+ let parts = UrlParts::parse(trimmed)?;\n+ let g = graph();\n+ let canonical = g.resolve_canonical(&parts)?;\n+ let alias_of = if trimmed != canonical {\n Some(trimmed.to_string())\n } else {\n None\n@@ -98,35 +38,14 @@ pub fn resolve_id(raw: &str) -> Option {\n \n /// Navigable ancestor URLs from domain root up to and including `canonical` (full URLs).\n pub fn navigable_breadcrumbs(canonical: &str) -> Vec {\n- let Some(u) = ParsedUrl::parse(canonical) else {\n- return vec![canonical.to_string()];\n+ let parts = match UrlParts::parse(canonical) {\n+ Some(p) => p,\n+ None => return vec![canonical.to_string()],\n };\n- let structural: HashSet<&str> = structural_trailing(&u.host).iter().copied().collect();\n- let n = u.path_segments.len();\n- let mut out = Vec::new();\n-\n- // Domain root (no path segments).\n- if let Some(base) = u.with_path_segments(&[]).canonical_string() {\n- out.push(base);\n- }\n-\n- for i in 0..n {\n- let segs: Vec = u.path_segments[..=i].to_vec();\n- let is_last = i == n - 1;\n- let seg = u.path_segments[i].as_str();\n- if structural.contains(seg) && !is_last {\n- continue;\n- }\n- if let Some(url) = u.with_path_segments(&segs).canonical_string() {\n- if out.last() != Some(&url) {\n- out.push(url);\n- }\n- }\n- }\n- out\n+ graph().breadcrumbs(&parts)\n }\n \n-/// Immediate parent scope URL, or `None` for tree root / opaque single-segment ids.\n+/// Immediate parent scope URL, or `None` for tree root.\n pub fn parent_url(canonical: &str) -> Option {\n let crumbs = navigable_breadcrumbs(canonical);\n if crumbs.len() <= 1 {\n@@ -148,88 +67,3 @@ pub fn looks_like_url(raw: &str) -> bool {\n || t.starts_with(\"youtu.be/\")\n }\n \n-#[cfg(test)]\n-mod tests {\n- use super::*;\n-\n- #[test]\n- fn reddit_post_drops_slug_and_normalizes_host() {\n- let r = canonicalize_raw(\n- \"https://old.reddit.com/r/AmItheAsshole/comments/1trnvdl/aita_for_cancelling/\",\n- )\n- .unwrap();\n- assert_eq!(\n- r.canonical,\n- \"https://reddit.com/r/amitheasshole/comments/1trnvdl\"\n- );\n- }\n-\n- #[test]\n- fn reddit_strips_query_and_listing() {\n- assert_eq!(\n- canonicalize_raw(\"https://www.reddit.com/r/rust/?sort=top\")\n- .unwrap()\n- .canonical,\n- \"https://reddit.com/r/rust\"\n- );\n- assert_eq!(\n- canonicalize_raw(\"https://www.reddit.com/r/programming/hot\")\n- .unwrap()\n- .canonical,\n- \"https://reddit.com/r/programming\"\n- );\n- }\n-\n- #[test]\n- fn reddit_short_path() {\n- assert_eq!(\n- canonicalize_raw(\"r/rust\").unwrap().canonical,\n- \"https://reddit.com/r/rust\"\n- );\n- }\n-\n- #[test]\n- fn reddit_breadcrumbs_skip_phantom_comments() {\n- let post = \"https://reddit.com/r/aww/comments/1trnvdl\";\n- let crumbs = navigable_breadcrumbs(post);\n- assert!(!crumbs.iter().any(|c| c.ends_with(\"/comments\")));\n- assert_eq!(\n- crumbs.last().map(String::as_str),\n- Some(post)\n- );\n- assert!(crumbs.contains(&\"https://reddit.com/r/aww\".to_string()));\n- }\n-\n- #[test]\n- fn reddit_parent_of_post_is_subreddit() {\n- assert_eq!(\n- parent_url(\"https://reddit.com/r/aww/comments/1trnvdl\").as_deref(),\n- Some(\"https://reddit.com/r/aww\")\n- );\n- }\n-\n- #[test]\n- fn youtube_youtu_be_and_watch_same_canonical() {\n- let a = canonicalize_raw(\"https://youtu.be/dQw4w9WgXcQ\").unwrap().canonical;\n- let b = canonicalize_raw(\"https://www.youtube.com/watch?v=dQw4w9WgXcQ&t=10\").unwrap();\n- assert_eq!(a, b.canonical);\n- assert_eq!(a, \"https://youtube.com/watch?v=dQw4w9WgXcQ\");\n- }\n-\n- #[test]\n- fn legacy_schemeless_upgrades() {\n- assert_eq!(\n- canonicalize_raw(\"reddit.com/r/rust/comments/aaa/announcing_rust_199\")\n- .unwrap()\n- .canonical,\n- \"https://reddit.com/r/rust/comments/aaa\"\n- );\n- }\n-\n- #[test]\n- fn alias_recorded_when_input_differs() {\n- let r = canonicalize_raw(\"https://youtu.be/abc123\").unwrap();\n- assert_eq!(r.canonical, \"https://youtube.com/watch?v=abc123\");\n- assert!(r.alias_of.is_some());\n- }\n-}\n\n\nSide B — contributor: tommy-mor\nSide B — commit message:\n[bda5f8aa] Remove legacy evidence projection; Evidence envelopes only.\n\nEpoch and commit pages no longer invent history from bare GitDiscovery rows. Production ledger will be wiped to re-emit under the current schema.\n\nCo-authored-by: Cursor \n\nSide B — unified diff (full patch):\ndiff --git a/constitution.py b/constitution.py\nindex 4dd5b9dfbba231d46289c490f91b1dd5b1018bcf..26ba130e885e0e69fb7874ca5c3f07f42100a150 100644\n--- a/constitution.py\n+++ b/constitution.py\n@@ -210,10 +210,10 @@ class Emission:\n distributions: dict # author -> amount str\n ranking: dict # author -> score str\n models_used: list\n- discovery_snapshot_id: str = \"\" # empty only for pre-discovery ledger history\n- evidence_schema_version: int = 1\n- ranking_run_id: str = \"\"\n- ranking_event_id: str = \"\"\n+ discovery_snapshot_id: str\n+ evidence_schema_version: int\n+ ranking_run_id: str\n+ ranking_event_id: str\n \n \n @event\n@@ -502,26 +502,6 @@ def _epochs_in_ledger() -> list[int]:\n return sorted(epochs)\n \n \n-def _legacy_commit_row(commit_id: str) -> tuple[GitDiscovery | None, dict | None]:\n- for discovery in store.read():\n- if not isinstance(discovery, GitDiscovery):\n- continue\n- for commit in discovery.commits:\n- if commit_id_for_oid(commit[\"oid\"]) == commit_id:\n- return discovery, commit\n- return None, None\n-\n-\n-def _legacy_observation(commit_id: str) -> tuple[GitDiscovery | None, dict | None]:\n- for discovery in store.read():\n- if not isinstance(discovery, GitDiscovery):\n- continue\n- for obs in discovery.observations:\n- if commit_id_for_oid(obs[\"oid\"]) == commit_id:\n- return discovery, obs\n- return None, None\n-\n-\n def build_pairwise_prompt(side_a: dict, side_b: dict) -> str:\n return f\"\"\"You are ranking contributions to an open source project.\n Compare these two sides (each may be one or more commits). Decide which side contributed more.\n@@ -2040,7 +2020,7 @@ def _strip_heavy_fields(obj: dict) -> dict:\n \n @app.get(\"/api/ledger\")\n async def get_ledger(offset: int = 0, limit: int = 100, full: int = 0):\n- \"\"\"List of ledger dicts (backward-compatible). Heavy blobs stripped unless full=1.\"\"\"\n+ \"\"\"List of ledger dicts. Heavy blobs stripped unless full=1.\"\"\"\n limit = max(1, min(limit, 500))\n rows = []\n for e in store.read()[offset:offset + limit]:\n@@ -2274,23 +2254,25 @@ async def epochs_index():\n epochs = _epochs_in_ledger()\n rows = []\n for epoch in epochs:\n- discovery = _discovery_for_epoch(epoch)\n emission = _emission_for_epoch(epoch)\n- evidence_n = sum(\n- 1 for e in evidence_by_kind() if e.epoch == epoch\n+ evidence_n = sum(1 for e in evidence_by_kind() if e.epoch == epoch)\n+ disc = next(\n+ (\n+ e for e in evidence_by_kind(\"git.discovery_completed\")\n+ if e.epoch == epoch\n+ ),\n+ None,\n )\n detail = []\n- if discovery:\n+ if disc:\n detail.append(\n- f\"{len(discovery.commits)} eligible / \"\n- f\"{len(discovery.observations)} observed\"\n+ f\"{disc.payload.get('eligible_count', 0)} eligible / \"\n+ f\"{disc.payload.get('observation_count', 0)} observed\"\n )\n if emission:\n detail.append(f\"emitted {emission.total_emitted}\")\n if evidence_n:\n detail.append(f\"{evidence_n} evidence events\")\n- elif discovery or emission:\n- detail.append(\"legacy (no Evidence envelopes)\")\n rows.append([\"li\",\n _a(_evidence_path(\"epoch\", str(epoch)), f\"epoch {epoch}\"),\n \" — \",\n@@ -2307,37 +2289,37 @@ async def epochs_index():\n \n @app.get(\"/epochs/{epoch}\")\n async def epoch_detail(epoch: int):\n- discovery = _discovery_for_epoch(epoch)\n emission = _emission_for_epoch(epoch)\n evidence_rows = [e for e in evidence_by_kind() if e.epoch == epoch]\n+ if not evidence_rows and emission is None:\n+ return _evidence_page(f\"epoch {epoch}\", [\n+ _evidence_nav(),\n+ [\"h1\", f\"epoch {epoch}\"],\n+ [\"p.note\", \"No evidence for this epoch.\"],\n+ ])\n+\n commit_evs = [e for e in evidence_rows if e.kind == \"git.commit\"]\n comparison_evs = [e for e in evidence_rows if e.kind == \"comparison.input\"]\n judgment_evs = [e for e in evidence_rows if e.kind == \"llm.judgment\"]\n+ discovery_ev = next(\n+ (e for e in evidence_rows if e.kind == \"git.discovery_completed\"), None\n+ )\n ranking_started = next(\n (e for e in evidence_rows if e.kind == \"ranking.started\"), None\n )\n ranking_completed = next(\n (e for e in evidence_rows if e.kind == \"ranking.completed\"), None\n )\n- legacy = not evidence_rows and (discovery is not None or emission is not None)\n-\n- commit_links: list[tuple[str, str]] = []\n- if commit_evs:\n- for e in commit_evs:\n- cid = e.payload.get(\"commit_id\") or \"\"\n- label = (\n- f\"{e.payload.get('oid', cid)[:24]} \"\n- f\"({e.payload.get('contributor', '?')})\"\n- )\n- commit_links.append((label, _evidence_path(\"commit\", cid)))\n- elif discovery:\n- for c in discovery.commits:\n- cid = commit_id_for_oid(c[\"oid\"])\n- commit_links.append((\n- f\"{c['oid'][:24]} ({c.get('contributor', '?')})\",\n- _evidence_path(\"commit\", cid),\n- ))\n \n+ commit_links = [\n+ (\n+ f\"{e.payload.get('oid', e.payload.get('commit_id', ''))[:24]} \"\n+ f\"({e.payload.get('contributor', '?')})\",\n+ _evidence_path(\"commit\", e.payload[\"commit_id\"]),\n+ )\n+ for e in commit_evs\n+ if e.payload.get(\"commit_id\")\n+ ]\n comparison_links = [\n (\n e.payload.get(\"summary\") or e.payload.get(\"comparison_id\", e.event_id),\n@@ -2360,16 +2342,13 @@ async def epoch_detail(epoch: int):\n ]\n \n excluded = []\n- if discovery:\n- for obs in discovery.observations:\n+ if discovery_ev:\n+ for obs in discovery_ev.payload.get(\"observations\") or []:\n if obs.get(\"eligible\"):\n continue\n oid = obs.get(\"oid\", \"?\")\n reason = obs.get(\"exclusion_reason\") or \"excluded\"\n- excluded.append([\"li\",\n- f\"{oid[:28]} — {reason} — \",\n- [\"span.note\", \"legacy evidence unavailable\"],\n- ])\n+ excluded.append([\"li\", f\"{oid[:28]} — {reason}\"])\n \n ranking_nodes: list = []\n if ranking_completed:\n@@ -2388,21 +2367,10 @@ async def epoch_detail(epoch: int):\n indent=2, sort_keys=True,\n )],\n ]\n- elif emission:\n- if legacy and len(emission.ranking or {}) <= 1:\n- ranking_nodes.append([\"p.note\",\n- \"Single-contributor epoch — no LLM judgments.\"\n- ])\n- ranking_nodes.extend([\n- [\"p\", \"Projected from Emission (no ranking Evidence event).\"],\n- [\"pre.blob\", json.dumps(emission.ranking, indent=2, sort_keys=True)],\n- ])\n+ elif ranking_started:\n+ ranking_nodes = [[\"p.note\", f\"Ranking started: {ranking_started.event_id}\"]]\n else:\n- ranking_nodes = [[\"p.note\", \"No ranking recorded.\"]]\n- if ranking_started and not ranking_completed:\n- ranking_nodes.insert(0, [\"p.note\",\n- f\"Ranking started: {ranking_started.event_id}\"\n- ])\n+ ranking_nodes = [[\"p.note\", \"No ranking evidence.\"]]\n \n if emission:\n emission_node = _dl_rows([\n@@ -2411,44 +2379,41 @@ async def epoch_detail(epoch: int):\n (\"pool_after\", emission.pool_after),\n (\"discovery_snapshot_id\", emission.discovery_snapshot_id),\n (\"ranking_run_id\", emission.ranking_run_id or None),\n+ (\"ranking_event_id\", emission.ranking_event_id or None),\n (\"models_used\", \", \".join(emission.models_used or [])),\n (\"distributions\", json.dumps(emission.distributions, sort_keys=True)),\n ])\n else:\n emission_node = [\"p.note\", \"No emission for this epoch.\"]\n \n- single_contributor = False\n- if discovery:\n- single_contributor = len({c.get(\"contributor\") for c in discovery.commits}) <= 1\n- elif emission:\n- single_contributor = len(emission.ranking or {}) <= 1\n+ contributors = {\n+ e.payload.get(\"contributor\")\n+ for e in commit_evs\n+ if e.payload.get(\"contributor\")\n+ }\n+ no_comparisons_note = \"No comparisons.\"\n+ if len(contributors) <= 1:\n+ no_comparisons_note += \" Single-contributor — no LLM judgments.\"\n \n body = [\n _evidence_nav(),\n [\"div.eyebrow\", f\"epoch {epoch}\"],\n [\"h1\", f\"epoch {epoch}\"],\n ]\n- if legacy:\n- body.append([\"p.note\",\n- \"Legacy epoch: projected from GitDiscovery/Emission without Evidence \"\n- \"envelopes. Eligible commits use discovery patches; discarded observation \"\n- \"metadata is marked legacy evidence unavailable. Single-contributor \"\n- \"epochs have no LLM judgments.\"\n- ])\n- if discovery:\n+ if discovery_ev:\n body.extend([\n [\"h2\", \"discovery\"],\n _dl_rows([\n- (\"snapshot_id\", discovery.snapshot_id),\n- (\"config_digest\", discovery.config_digest),\n- (\"initial_snapshot\", discovery.initial_snapshot),\n- (\"observations\", len(discovery.observations)),\n- (\"eligible\", len(discovery.commits)),\n+ (\"snapshot_id\", discovery_ev.payload.get(\"snapshot_id\")),\n+ (\"config_digest\", discovery_ev.payload.get(\"config_digest\")),\n+ (\"observations\", discovery_ev.payload.get(\"observation_count\")),\n+ (\"eligible\", discovery_ev.payload.get(\"eligible_count\")),\n+ (\"event\", _a(\n+ _evidence_path(\"event\", discovery_ev.event_id),\n+ discovery_ev.event_id,\n+ )),\n ]),\n ])\n- no_comparisons_note = \"No comparisons.\"\n- if single_contributor:\n- no_comparisons_note += \" Single-contributor — no LLM judgments.\"\n body.extend([\n [\"h2\", \"commits\"],\n _link_list(commit_links),\n@@ -2471,92 +2436,42 @@ async def epoch_detail(epoch: int):\n @app.get(\"/commits/{commit_id}\")\n async def commit_detail(commit_id: str):\n ev = find_evidence_payload(\"git.commit\", \"commit_id\", commit_id)\n- discovery, legacy_row = (None, None)\n if not ev:\n- discovery, legacy_row = _legacy_commit_row(commit_id)\n- if not ev and not legacy_row:\n- discovery, obs = _legacy_observation(commit_id)\n- if obs is not None:\n- epoch = discovery.epoch if discovery else \"?\"\n- return _evidence_page(f\"commit {commit_id[:24]}\", [\n- _evidence_nav(\n- _a(_evidence_path(\"epoch\", str(epoch)), f\"epoch {epoch}\")\n- ),\n- [\"div.eyebrow\", \"commit\"],\n- [\"h1\", commit_id],\n- [\"p.note\", \"legacy evidence unavailable\"],\n- _dl_rows([\n- (\"oid\", obs.get(\"oid\")),\n- (\"eligible\", obs.get(\"eligible\")),\n- (\"exclusion_reason\", obs.get(\"exclusion_reason\")),\n- (\"epoch\", str(epoch)),\n- ]),\n- ])\n return _evidence_page(\"commit not found\", [\n _evidence_nav(),\n [\"h1\", \"commit not found\"],\n [\"p\", commit_id],\n ])\n- if ev:\n- p = ev.payload\n- epoch = ev.epoch\n- oid = p.get(\"oid\", \"\")\n- contributor = p.get(\"contributor\", \"\")\n- message = _blob_text(p.get(\"message\"))\n- patch = _blob_text(p.get(\"patch\"))\n- meta = _dl_rows([\n+ p = ev.payload\n+ epoch = ev.epoch\n+ return _evidence_page(f\"commit {commit_id[:24]}\", [\n+ _evidence_nav(_a(_evidence_path(\"epoch\", str(epoch)), f\"epoch {epoch}\")),\n+ [\"div.eyebrow\", \"commit\"],\n+ [\"h1\", commit_id],\n+ _dl_rows([\n (\"commit_id\", commit_id),\n- (\"oid\", oid),\n- (\"contributor\", contributor),\n+ (\"oid\", p.get(\"oid\", \"\")),\n+ (\"contributor\", p.get(\"contributor\", \"\")),\n (\"patch_sha256\", p.get(\"patch_sha256\")),\n (\"patch_identity\", p.get(\"patch_identity\")),\n (\"committer_timestamp_ms\", p.get(\"committer_timestamp_ms\")),\n (\"evidence_event\", _a(_evidence_path(\"event\", ev.event_id), ev.event_id)),\n (\"epoch\", _a(_evidence_path(\"epoch\", str(epoch)), str(epoch))),\n- ])\n- legacy_note = None\n- else:\n- assert legacy_row is not None and discovery is not None\n- epoch = discovery.epoch\n- oid = legacy_row.get(\"oid\", \"\")\n- contributor = legacy_row.get(\"contributor\", \"\")\n- message = legacy_row.get(\"message\") or \"\"\n- patch = legacy_row.get(\"patch\") or \"\"\n- meta = _dl_rows([\n- (\"commit_id\", commit_id),\n- (\"oid\", oid),\n- (\"contributor\", contributor),\n- (\"patch_sha256\", legacy_row.get(\"patch_sha256\")),\n- (\"patch_identity\", legacy_row.get(\"patch_identity\")),\n- (\"committer_timestamp_ms\", legacy_row.get(\"committer_timestamp_ms\")),\n- (\"epoch\", _a(_evidence_path(\"epoch\", str(epoch)), str(epoch))),\n- (\"source\", \"legacy GitDiscovery projection\"),\n- ])\n- legacy_note = [\"p.note\", \"Projected from GitDiscovery — Evidence envelope absent.\"]\n- return _evidence_page(f\"commit {commit_id[:24]}\", [\n- _evidence_nav(_a(_evidence_path(\"epoch\", str(epoch)), f\"epoch {epoch}\")),\n- [\"div.eyebrow\", \"commit\"],\n- [\"h1\", commit_id],\n- *([legacy_note] if legacy_note else []),\n- meta,\n+ ]),\n [\"p\", _a(f\"/commits/{commit_id}/patch\", \"download patch\")],\n [\"h2\", \"message\"],\n- _pre_blob(message),\n+ _pre_blob(_blob_text(p.get(\"message\"))),\n [\"h2\", \"patch\"],\n- _pre_blob(patch),\n+ _pre_blob(_blob_text(p.get(\"patch\"))),\n ])\n \n \n @app.get(\"/commits/{commit_id}/patch\")\n async def commit_patch_download(commit_id: str):\n ev = find_evidence_payload(\"git.commit\", \"commit_id\", commit_id)\n- if ev:\n- raw = _decode_blob(ev.payload.get(\"patch\")) or _blob_text(ev.payload.get(\"patch\")).encode()\n- else:\n- _, row = _legacy_commit_row(commit_id)\n- if not row:\n- return PlainTextResponse(\"not found\", status_code=404)\n- raw = (row.get(\"patch\") or \"\").encode(\"utf-8\")\n+ if not ev:\n+ return PlainTextResponse(\"not found\", status_code=404)\n+ raw = _decode_blob(ev.payload.get(\"patch\")) or _blob_text(ev.payload.get(\"patch\")).encode()\n return Response(\n content=raw,\n media_type=\"text/plain; charset=utf-8\",\n@@ -3226,7 +3141,9 @@ async def watch():\n [\"div.controls\",\n [\"button#play\", {\"type\": \"button\", \"disabled\": \"true\"}, \"▶ Play live feed\"],\n [\"button#pause\", {\"type\": \"button\"}, \"Ⅱ Pause feed\"],\n- [\"span.note\", \"Pause stops local updates; the constitutional process continues.\"],\n+ [\"span.note\",\n+ \"Play/pause only affect this browser feed — they do not run or stop emission. \"\n+ \"The server emits at each epoch boundary; status above is that process.\"],\n ],\n ],\n [\"section.panel\",\ndiff --git a/tests/integration.clj b/tests/integration.clj\nindex 204b0fedfbad57846205cb140c4ed9406b5f8e0e..11140e95a8cd86768a661a30e6b29a3ddfc95fcc 100644\n--- a/tests/integration.clj\n+++ b/tests/integration.clj\n@@ -247,7 +247,10 @@\n :decay_rate \"0.003253356063468\"\n :distributions {\"alice\" \"381.4282558872\" \"bob\" \"190.7141279436\"}\n :ranking {\"alice\" \"0.6666\" \"bob\" \"0.3334\"}\n- :models_used [\"mock/chat-v1\" \"mock/chat-v2\"]}]\n+ :models_used [\"mock/chat-v1\" \"mock/chat-v2\"]\n+ :evidence_schema_version 2\n+ :ranking_run_id \"seed-rank\"\n+ :ranking_event_id \"seed-rank-ev\"}]\n (spit path (str (json/generate-string entry) \"\\n\"))))\n \n ;; ---------------------------------------------------------------------------\ndiff --git a/tests/test_evidence.py b/tests/test_evidence.py\nindex 76adcd343eec3a65dec58fda93b068356fb1adcd..7cb74fd7fb1bcd0ab17d2cbe2e6ca7e61e164221 100644\n--- a/tests/test_evidence.py\n+++ b/tests/test_evidence.py\n@@ -1,4 +1,4 @@\n-\"\"\"HTML evidence graph: byte fidelity, resume, legacy projection, private ack.\"\"\"\n+\"\"\"HTML evidence graph: byte fidelity, resume, and Evidence-only pages.\"\"\"\n \n from __future__ import annotations\n \n@@ -86,55 +86,10 @@ def test_html_evidence_pages_escape_and_link(evidence_store):\n assert patch_resp.headers[\"content-disposition\"].startswith(\"attachment\")\n \n \n-def test_legacy_epoch_projects_from_gitdiscovery_without_evidence(evidence_store):\n- oid = \"sha1:\" + \"b\" * 40\n- discovery = c.GitDiscovery(\n- schema_version=1,\n- epoch=3,\n- snapshot_id=\"legacy-snap\",\n- timestamp_ms=1,\n- config_digest=\"d\",\n- initial_snapshot=True,\n- configuration={\"repositories\": [], \"contributors\": {}},\n- repositories=[],\n- observations=[{\n- \"oid\": oid,\n- \"eligible\": False,\n- \"exclusion_reason\": \"before_genesis\",\n- \"first_sources\": [],\n- }, {\n- \"oid\": \"sha1:\" + \"c\" * 40,\n- \"eligible\": True,\n- \"exclusion_reason\": None,\n- \"first_sources\": [],\n- }],\n- commits=[{\n- \"oid\": \"sha1:\" + \"c\" * 40,\n- \"contributor\": \"tommy-mor\",\n- \"message\": \"eligible\",\n- \"patch\": \"diff --git a/x b/x\\n\",\n- }],\n- )\n- emission = c.Emission(\n- epoch=3,\n- timestamp_ms=2,\n- pool_before=\"1\",\n- total_emitted=\"0.1\",\n- pool_after=\"0.9\",\n- decay_rate=\"0.1\",\n- distributions={\"tommy-mor\": \"0.1\"},\n- ranking={\"tommy-mor\": \"1\"},\n- models_used=[],\n- discovery_snapshot_id=\"legacy-snap\",\n- )\n- asyncio.run(c.store.append(discovery))\n- asyncio.run(c.store.append(emission))\n- html = asyncio.run(c.epoch_detail(3)).body.decode()\n- assert \"legacy\" in html.lower()\n- assert \"Single-contributor\" in html or \"no LLM\" in html\n- excluded_id = c.commit_id_for_oid(oid)\n- excluded_html = asyncio.run(c.commit_detail(excluded_id)).body.decode()\n- assert \"legacy evidence unavailable\" in excluded_html.lower()\n+def test_commit_without_evidence_is_not_found(evidence_store):\n+ html = asyncio.run(c.commit_detail(\"c_missing\")).body.decode()\n+ assert \"commit not found\" in html\n+ assert \"legacy\" not in html.lower()\n \n \n def test_ranking_resume_skips_duplicate_provider_calls(evidence_store, monkeypatch):\n@@ -202,6 +157,10 @@ def test_epochs_index_lists_epochs(evidence_store):\n distributions={},\n ranking={},\n models_used=[],\n+ discovery_snapshot_id=\"snap\",\n+ evidence_schema_version=c.EVIDENCE_SCHEMA_VERSION,\n+ ranking_run_id=\"r\",\n+ ranking_event_id=\"e\",\n )))\n html = asyncio.run(c.epochs_index()).body.decode()\n assert \"/epochs/3\" in html\n","role":"user"}],"model":"~anthropic/claude-sonnet-latest"}