{"messages":[{"content":"You are a constitutional council ranking individual git commits for ownership allocation.\n\nCompare these two commits. Decide which contributed more lasting value to the project.\n\nJudge substance, not spectacle:\n- Prefer correct, lasting design and real bugfixes over churn, formatting, renames, or generated noise.\n- Prefer clarity and necessity over sheer line count. A small precise change can beat a large diffuse one.\n- Do not favor a side merely because its patch is longer or noisier.\n- Weight what the change does for the project, not the contributor's name.\n\nReturn ONLY a JSON object: {\"winner\": \"A\" or \"B\", \"ratio\": \"N:M\", \"explanation\": \"...\"}\nThe explanation must cite concrete differences in the patches (1-3 sentences).\n\nSide A — contributor: tommy-mor\nSide A — commit message:\n[15e1037a] url stuff\n\nSide A — unified diff (full patch):\ndiff --git a/server/src/url_rules/graph.rs b/server/src/url_rules/graph.rs\nnew file mode 100644\nindex 0000000000000000000000000000000000000000..f7ac0f9a551a1727cb2f9294778c283b9885b147\n--- /dev/null\n+++ b/server/src/url_rules/graph.rs\n@@ -0,0 +1,831 @@\n+//! Semantic URL graph: DFA traversal on host + path, query in context, generic fallback.\n+\n+use std::collections::HashMap;\n+use std::sync::OnceLock;\n+\n+use url::Url;\n+\n+use super::graph_builder::GraphBuilder;\n+use super::parse::{normalize_match_host, strip_tracking_query, UrlParts};\n+\n+#[derive(Debug, Clone, Default)]\n+pub struct Context {\n+ pub vars: HashMap,\n+ pub query: HashMap,\n+}\n+\n+pub type CanonicalFn = fn(&Context) -> Option;\n+\n+#[derive(Clone, Copy)]\n+pub enum EdgePattern {\n+ Literal(&'static str),\n+ Variable(&'static str),\n+ /// Absorb any trailing segment without leaving this node (e.g. post title slug).\n+ AbsorbAny,\n+ /// Absorb segment when `cond(seg)` (e.g. subreddit listing suffix).\n+ AbsorbIf(fn(&str) -> bool),\n+}\n+\n+pub struct Edge {\n+ pub pattern: EdgePattern,\n+ pub target: &'static str,\n+}\n+\n+pub struct Node {\n+ pub edges: Vec,\n+ pub canonical: CanonicalFn,\n+ pub parent: Option<&'static str>,\n+}\n+\n+impl Node {\n+ pub(crate) fn empty() -> Self {\n+ Self {\n+ edges: Vec::new(),\n+ canonical: |_| None,\n+ parent: None,\n+ }\n+ }\n+}\n+\n+pub struct Graph {\n+ pub nodes: HashMap<&'static str, Node>,\n+}\n+\n+static GRAPH: OnceLock = OnceLock::new();\n+\n+pub fn graph() -> &'static Graph {\n+ GRAPH.get_or_init(build_graph)\n+}\n+\n+impl Graph {\n+ pub fn resolve_canonical(&self, parts: &UrlParts) -> Option {\n+ let mut query = parts.query.clone();\n+ strip_tracking_query(&mut query);\n+ let mut ctx = Context {\n+ vars: HashMap::new(),\n+ query,\n+ };\n+\n+ if let Some(node_id) = self.traverse(parts, &mut ctx) {\n+ if let Some(canon) = (self.nodes.get(node_id)?.canonical)(&ctx) {\n+ return Some(canon);\n+ }\n+ }\n+ Some(generic_canonical(parts))\n+ }\n+\n+ pub fn breadcrumbs(&self, parts: &UrlParts) -> Vec {\n+ let mut query = parts.query.clone();\n+ strip_tracking_query(&mut query);\n+ let mut ctx = Context {\n+ vars: HashMap::new(),\n+ query,\n+ };\n+\n+ if let Some(mut node_id) = self.traverse(parts, &mut ctx) {\n+ let mut paths = Vec::new();\n+ loop {\n+ let node = match self.nodes.get(node_id) {\n+ Some(n) => n,\n+ None => break,\n+ };\n+ if let Some(url) = (node.canonical)(&ctx) {\n+ if paths.last() != Some(&url) {\n+ paths.push(url);\n+ }\n+ }\n+ match node.parent {\n+ Some(p) => node_id = p,\n+ None => break,\n+ }\n+ }\n+ paths.reverse();\n+ if !paths.is_empty() {\n+ return paths;\n+ }\n+ }\n+ generic_breadcrumbs(parts)\n+ }\n+\n+ fn traverse(&self, parts: &UrlParts, ctx: &mut Context) -> Option<&'static str> {\n+ let host = parts.match_host();\n+ let mut node_id = match host.as_str() {\n+ \"reddit.com\" => \"reddit_root\",\n+ \"youtube.com\" => \"youtube_root\",\n+ \"youtu.be\" => \"youtu_be_entry\",\n+ _ => return None,\n+ };\n+\n+ let segs: Vec<&str> = parts.path_segments.iter().map(String::as_str).collect();\n+ let mut i = 0;\n+ while i < segs.len() {\n+ let seg = segs[i];\n+ match self.follow_edge(node_id, seg, ctx) {\n+ Ok(next) => {\n+ node_id = next;\n+ i += 1;\n+ }\n+ Err(()) => {\n+ if self.try_absorb(node_id, seg) {\n+ i += 1;\n+ continue;\n+ }\n+ return None;\n+ }\n+ }\n+ }\n+ Some(node_id)\n+ }\n+\n+ fn follow_edge(\n+ &self,\n+ node_id: &'static str,\n+ seg: &str,\n+ ctx: &mut Context,\n+ ) -> Result<&'static str, ()> {\n+ let node = self.nodes.get(node_id).ok_or(())?;\n+ for edge in &node.edges {\n+ match edge.pattern {\n+ EdgePattern::Literal(lit) if lit == seg => return Ok(edge.target),\n+ EdgePattern::Variable(name) => {\n+ ctx.vars.insert(name.to_string(), seg.to_string());\n+ return Ok(edge.target);\n+ }\n+ EdgePattern::AbsorbAny\n+ | EdgePattern::AbsorbIf(_)\n+ | EdgePattern::Literal(_)\n+ | EdgePattern::Variable(_) => {}\n+ }\n+ }\n+ Err(())\n+ }\n+\n+ fn try_absorb(&self, node_id: &'static str, seg: &str) -> bool {\n+ let node = match self.nodes.get(node_id) {\n+ Some(n) => n,\n+ None => return false,\n+ };\n+ for edge in &node.edges {\n+ match edge.pattern {\n+ EdgePattern::AbsorbAny => return true,\n+ EdgePattern::AbsorbIf(cond) if cond(seg) => return true,\n+ EdgePattern::AbsorbIf(_) | EdgePattern::Literal(_) | EdgePattern::Variable(_) => {}\n+ }\n+ }\n+ false\n+ }\n+\n+ /// Test hook: terminal graph node and captured context after traversal.\n+ #[cfg(test)]\n+ pub fn traverse_terminal(&self, parts: &UrlParts) -> Option<(&'static str, Context)> {\n+ let mut query = parts.query.clone();\n+ strip_tracking_query(&mut query);\n+ let mut ctx = Context {\n+ vars: HashMap::new(),\n+ query,\n+ };\n+ let node = self.traverse(parts, &mut ctx)?;\n+ Some((node, ctx))\n+ }\n+}\n+\n+fn is_reddit_listing_suffix(seg: &str) -> bool {\n+ matches!(seg, \"hot\" | \"top\" | \"new\" | \"rising\" | \"controversial\")\n+}\n+\n+/// Percent-encode a path or query fragment so `&`, `?`, etc. cannot break URL structure.\n+fn enc(s: &str) -> String {\n+ urlencoding::encode(s).into_owned()\n+}\n+\n+// --- Canonical formatters ---\n+\n+fn canon_reddit_root(_: &Context) -> Option {\n+ Some(\"https://reddit.com\".to_string())\n+}\n+\n+fn canon_reddit_r_hub(_: &Context) -> Option {\n+ Some(\"https://reddit.com/r\".to_string())\n+}\n+\n+fn canon_reddit_subreddit(ctx: &Context) -> Option {\n+ let sub = ctx.vars.get(\"subreddit\")?;\n+ Some(format!(\n+ \"https://reddit.com/r/{}\",\n+ enc(&sub.to_ascii_lowercase())\n+ ))\n+}\n+\n+fn canon_reddit_post(ctx: &Context) -> Option {\n+ let sub = ctx.vars.get(\"subreddit\")?.to_ascii_lowercase();\n+ let id = ctx.vars.get(\"post_id\")?;\n+ Some(format!(\n+ \"https://reddit.com/r/{}/comments/{}\",\n+ enc(&sub),\n+ enc(id)\n+ ))\n+}\n+\n+fn canon_youtube_root(_: &Context) -> Option {\n+ Some(\"https://youtube.com\".to_string())\n+}\n+\n+fn canon_youtube_watch(ctx: &Context) -> Option {\n+ let v = ctx\n+ .query\n+ .get(\"v\")\n+ .or_else(|| ctx.vars.get(\"video_id\"))?;\n+ Some(format!(\"https://youtube.com/watch?v={}\", enc(v)))\n+}\n+\n+fn canon_youtu_be(ctx: &Context) -> Option {\n+ let v = ctx.vars.get(\"vid_id\")?;\n+ Some(format!(\"https://youtube.com/watch?v={}\", enc(v)))\n+}\n+\n+pub fn build_graph() -> Graph {\n+ GraphBuilder::new()\n+ .node(\"reddit_root\")\n+ .canonical(canon_reddit_root)\n+ .edge(EdgePattern::Literal(\"r\"), \"reddit_r_hub\")\n+ .node(\"reddit_r_hub\")\n+ .parent(\"reddit_root\")\n+ .canonical(canon_reddit_r_hub)\n+ .edge(EdgePattern::Variable(\"subreddit\"), \"reddit_subreddit\")\n+ .node(\"reddit_subreddit\")\n+ .parent(\"reddit_r_hub\")\n+ .canonical(canon_reddit_subreddit)\n+ .edge(\n+ EdgePattern::AbsorbIf(is_reddit_listing_suffix),\n+ \"reddit_subreddit\",\n+ )\n+ .edge(EdgePattern::Literal(\"comments\"), \"reddit_comments_gate\")\n+ .node(\"reddit_comments_gate\")\n+ .parent(\"reddit_subreddit\")\n+ .canonical(canon_reddit_subreddit)\n+ .edge(EdgePattern::Variable(\"post_id\"), \"reddit_post\")\n+ .node(\"reddit_post\")\n+ .parent(\"reddit_subreddit\")\n+ .canonical(canon_reddit_post)\n+ .edge(EdgePattern::AbsorbAny, \"reddit_post\")\n+ .node(\"youtube_root\")\n+ .canonical(canon_youtube_root)\n+ .edge(EdgePattern::Literal(\"watch\"), \"youtube_watch\")\n+ .edge(EdgePattern::Literal(\"shorts\"), \"youtube_shorts_gate\")\n+ .node(\"youtube_watch\")\n+ .parent(\"youtube_root\")\n+ .canonical(canon_youtube_watch)\n+ .node(\"youtube_shorts_gate\")\n+ .parent(\"youtube_root\")\n+ .canonical(canon_youtube_root)\n+ .edge(EdgePattern::Variable(\"video_id\"), \"youtube_watch\")\n+ .node(\"youtu_be_entry\")\n+ .canonical(canon_youtube_root)\n+ .edge(EdgePattern::Variable(\"vid_id\"), \"youtu_be_video\")\n+ .node(\"youtu_be_video\")\n+ .parent(\"youtube_root\")\n+ .canonical(canon_youtu_be)\n+ .build()\n+}\n+\n+// --- Generic internet fallback ---\n+\n+pub fn generic_canonical(parts: &UrlParts) -> String {\n+ let host = normalize_match_host(&parts.host);\n+ let path_segments: Vec = parts.path_segments.clone();\n+ let mut query = parts.query.clone();\n+ strip_tracking_query(&mut query);\n+\n+ let mut url = if path_segments.is_empty() {\n+ Url::parse(&format!(\"https://{host}\"))\n+ .unwrap_or_else(|_| Url::parse(\"https://invalid\").unwrap())\n+ } else {\n+ let path = format!(\"/{}\", path_segments.join(\"/\"));\n+ Url::parse(&format!(\"https://{host}{path}\"))\n+ .unwrap_or_else(|_| Url::parse(\"https://invalid\").unwrap())\n+ };\n+\n+ if !query.is_empty() {\n+ let mut pairs: Vec<_> = query.iter().collect();\n+ pairs.sort_by(|a, b| a.0.cmp(b.0));\n+ url.query_pairs_mut().clear();\n+ for (k, v) in pairs {\n+ url.query_pairs_mut().append_pair(k, v);\n+ }\n+ }\n+\n+ let mut s = url.to_string();\n+ if path_segments.is_empty() {\n+ s = s.trim_end_matches('/').to_string();\n+ }\n+ s\n+}\n+\n+pub fn generic_breadcrumbs(parts: &UrlParts) -> Vec {\n+ let host = normalize_match_host(&parts.host);\n+ let n = parts.path_segments.len();\n+ let mut out = Vec::new();\n+\n+ let base = generic_canonical(&UrlParts {\n+ scheme: \"https\".to_string(),\n+ host: host.clone(),\n+ path_segments: vec![],\n+ query: HashMap::new(),\n+ });\n+ out.push(base);\n+\n+ for i in 0..n {\n+ let segs: Vec = parts.path_segments[..=i].to_vec();\n+ let url = generic_canonical(&UrlParts {\n+ scheme: \"https\".to_string(),\n+ host: host.clone(),\n+ path_segments: segs,\n+ query: HashMap::new(),\n+ });\n+ if out.last() != Some(&url) {\n+ out.push(url);\n+ }\n+ }\n+ out\n+}\n+\n+#[cfg(test)]\n+mod tests {\n+ use super::*;\n+ use crate::url_rules::parse::test_parts;\n+\n+ fn g() -> &'static Graph {\n+ graph()\n+ }\n+\n+ fn canon(parts: &UrlParts) -> String {\n+ g().resolve_canonical(parts).unwrap()\n+ }\n+\n+ fn crumbs(parts: &UrlParts) -> Vec {\n+ g().breadcrumbs(parts)\n+ }\n+\n+ fn terminal(parts: &UrlParts) -> Option<&'static str> {\n+ g().traverse_terminal(parts).map(|(n, _)| n)\n+ }\n+\n+ fn vars(parts: &UrlParts) -> HashMap {\n+ g().traverse_terminal(parts)\n+ .map(|(_, c)| c.vars)\n+ .unwrap_or_default()\n+ }\n+\n+ #[test]\n+ fn youtu_be_malicious_segment_encoded_not_injected() {\n+ let p = test_parts(\"youtu.be\", &[\"abc&t=1\"], &[]);\n+ assert_eq!(canon(&p), \"https://youtube.com/watch?v=abc%26t%3D1\");\n+ assert!(!canon(&p).contains(\"abc&t=1\"));\n+ }\n+\n+ #[test]\n+ fn youtube_query_v_encoded() {\n+ let p = test_parts(\"youtube.com\", &[\"watch\"], &[(\"v\", \"a&b=c\")]);\n+ assert_eq!(canon(&p), \"https://youtube.com/watch?v=a%26b%3Dc\");\n+ }\n+\n+ #[test]\n+ fn absorb_patterns_live_on_edges_not_in_engine() {\n+ let g = build_graph();\n+ let sub = g.nodes.get(\"reddit_subreddit\").unwrap();\n+ assert!(sub\n+ .edges\n+ .iter()\n+ .any(|e| matches!(e.pattern, EdgePattern::AbsorbIf(_))));\n+ let post = g.nodes.get(\"reddit_post\").unwrap();\n+ assert!(post\n+ .edges\n+ .iter()\n+ .any(|e| matches!(e.pattern, EdgePattern::AbsorbAny)));\n+ }\n+\n+ #[test]\n+ fn builder_rejects_missing_parent() {\n+ let result = std::panic::catch_unwind(|| {\n+ GraphBuilder::new()\n+ .node(\"orphan\")\n+ .parent(\"nonexistent_parent\")\n+ .build();\n+ });\n+ assert!(result.is_err());\n+ }\n+\n+ #[test]\n+ fn generic_canonical_forces_https_and_strips_www() {\n+ let p = test_parts(\"www.example.com\", &[\"blog\", \"post\"], &[]);\n+ assert_eq!(canon(&p), \"https://example.com/blog/post\");\n+ }\n+\n+ #[test]\n+ fn generic_canonical_sorts_query_keys() {\n+ let p = test_parts(\"example.com\", &[\"search\"], &[(\"q\", \"rust\"), (\"page\", \"2\")]);\n+ assert_eq!(canon(&p), \"https://example.com/search?page=2&q=rust\");\n+ }\n+\n+ #[test]\n+ fn generic_canonical_strips_tracking_from_query() {\n+ let p = test_parts(\n+ \"news.ycombinator.com\",\n+ &[\"item\"],\n+ &[(\"id\", \"1\"), (\"utm_medium\", \"social\")],\n+ );\n+ assert_eq!(canon(&p), \"https://news.ycombinator.com/item?id=1\");\n+ }\n+\n+ #[test]\n+ fn generic_breadcrumbs_cumulative_path() {\n+ let p = test_parts(\"paulgraham.com\", &[\"articles\", \"lisp.html\"], &[]);\n+ assert_eq!(\n+ crumbs(&p),\n+ vec![\n+ \"https://paulgraham.com\",\n+ \"https://paulgraham.com/articles\",\n+ \"https://paulgraham.com/articles/lisp.html\"\n+ ]\n+ );\n+ }\n+\n+ #[test]\n+ fn generic_breadcrumbs_domain_only() {\n+ let p = test_parts(\"example.com\", &[], &[]);\n+ assert_eq!(crumbs(&p), vec![\"https://example.com\"]);\n+ }\n+\n+ #[test]\n+ fn unknown_host_uses_generic_not_graph() {\n+ let p = test_parts(\"hackernews.com\", &[\"item\", \"123\"], &[]);\n+ assert_eq!(terminal(&p), None);\n+ assert_eq!(canon(&p), \"https://hackernews.com/item/123\");\n+ }\n+\n+ #[test]\n+ fn traverse_captures_subreddit_variable() {\n+ let p = test_parts(\"reddit.com\", &[\"r\", \"Rust\"], &[]);\n+ assert_eq!(terminal(&p), Some(\"reddit_subreddit\"));\n+ assert_eq!(vars(&p).get(\"subreddit\").map(String::as_str), Some(\"Rust\"));\n+ }\n+\n+ #[test]\n+ fn traverse_captures_post_id() {\n+ let p = test_parts(\"reddit.com\", &[\"r\", \"aww\", \"comments\", \"abc123\"], &[]);\n+ assert_eq!(terminal(&p), Some(\"reddit_post\"));\n+ assert_eq!(vars(&p).get(\"post_id\").map(String::as_str), Some(\"abc123\"));\n+ }\n+\n+ #[test]\n+ fn traverse_absorbs_listing_suffix_stays_on_subreddit() {\n+ let p = test_parts(\"reddit.com\", &[\"r\", \"rust\", \"hot\"], &[]);\n+ assert_eq!(terminal(&p), Some(\"reddit_subreddit\"));\n+ assert_eq!(canon(&p), \"https://reddit.com/r/rust\");\n+ }\n+\n+ #[test]\n+ fn traverse_absorbs_all_listing_suffixes() {\n+ for suffix in [\"hot\", \"top\", \"new\", \"rising\", \"controversial\"] {\n+ let p = test_parts(\"reddit.com\", &[\"r\", \"test\", suffix], &[]);\n+ assert_eq!(terminal(&p), Some(\"reddit_subreddit\"), \"suffix {suffix}\");\n+ assert_eq!(canon(&p), \"https://reddit.com/r/test\", \"suffix {suffix}\");\n+ }\n+ }\n+\n+ #[test]\n+ fn traverse_absorbs_post_title_slug() {\n+ let p = test_parts(\n+ \"reddit.com\",\n+ &[\"r\", \"rust\", \"comments\", \"aaa\", \"my_great_post_title\"],\n+ &[],\n+ );\n+ assert_eq!(terminal(&p), Some(\"reddit_post\"));\n+ assert_eq!(canon(&p), \"https://reddit.com/r/rust/comments/aaa\");\n+ }\n+\n+ #[test]\n+ fn traverse_unknown_segment_falls_back_to_generic() {\n+ let p = test_parts(\"reddit.com\", &[\"r\", \"rust\", \"wiki\", \"faq\"], &[]);\n+ assert_eq!(terminal(&p), None);\n+ assert_eq!(canon(&p), \"https://reddit.com/r/rust/wiki/faq\");\n+ }\n+\n+ #[test]\n+ fn traverse_youtube_watch_requires_v_in_query() {\n+ let p = test_parts(\"youtube.com\", &[\"watch\"], &[(\"v\", \"xyz\")]);\n+ assert_eq!(terminal(&p), Some(\"youtube_watch\"));\n+ }\n+\n+ #[test]\n+ fn traverse_youtu_be_captures_vid_id() {\n+ let p = test_parts(\"youtu.be\", &[\"dQw4w9WgXcQ\"], &[]);\n+ assert_eq!(terminal(&p), Some(\"youtu_be_video\"));\n+ assert_eq!(vars(&p).get(\"vid_id\").map(String::as_str), Some(\"dQw4w9WgXcQ\"));\n+ }\n+\n+ #[test]\n+ fn traverse_shorts_sets_video_id_var() {\n+ let p = test_parts(\"youtube.com\", &[\"shorts\", \"abc99\"], &[]);\n+ assert_eq!(terminal(&p), Some(\"youtube_watch\"));\n+ assert_eq!(vars(&p).get(\"video_id\").map(String::as_str), Some(\"abc99\"));\n+ }\n+\n+ #[test]\n+ fn reddit_domain_canonical() {\n+ let p = test_parts(\"reddit.com\", &[], &[]);\n+ assert_eq!(canon(&p), \"https://reddit.com\");\n+ }\n+\n+ #[test]\n+ fn reddit_r_hub_canonical() {\n+ let p = test_parts(\"reddit.com\", &[\"r\"], &[]);\n+ assert_eq!(terminal(&p), Some(\"reddit_r_hub\"));\n+ assert_eq!(canon(&p), \"https://reddit.com/r\");\n+ }\n+\n+ #[test]\n+ fn reddit_subreddit_lowercases_name() {\n+ let p = test_parts(\"reddit.com\", &[\"r\", \"AmITheAsshole\"], &[]);\n+ assert_eq!(canon(&p), \"https://reddit.com/r/amitheasshole\");\n+ }\n+\n+ #[test]\n+ fn reddit_host_aliases_old_new_www() {\n+ for host in [\"old.reddit.com\", \"new.reddit.com\", \"www.reddit.com\"] {\n+ let p = test_parts(host, &[\"r\", \"rust\"], &[]);\n+ assert_eq!(canon(&p), \"https://reddit.com/r/rust\", \"host {host}\");\n+ }\n+ }\n+\n+ #[test]\n+ fn reddit_post_strips_slug_and_query() {\n+ let p = test_parts(\n+ \"old.reddit.com\",\n+ &[\"r\", \"Rust\", \"comments\", \"1abc\", \"title_slug_here\"],\n+ &[(\"sort\", \"new\")],\n+ );\n+ assert_eq!(canon(&p), \"https://reddit.com/r/rust/comments/1abc\");\n+ }\n+\n+ #[test]\n+ fn reddit_post_multiple_slugs_absorbed() {\n+ let p = test_parts(\n+ \"reddit.com\",\n+ &[\"r\", \"x\", \"comments\", \"id1\", \"slug1\", \"extra\"],\n+ &[],\n+ );\n+ assert_eq!(canon(&p), \"https://reddit.com/r/x/comments/id1\");\n+ }\n+\n+ #[test]\n+ fn reddit_listing_with_query_only() {\n+ let p = test_parts(\"www.reddit.com\", &[\"r\", \"programming\"], &[(\"sort\", \"top\")]);\n+ assert_eq!(canon(&p), \"https://reddit.com/r/programming\");\n+ }\n+\n+ #[test]\n+ fn reddit_subreddit_breadcrumbs_include_r_hub() {\n+ let p = test_parts(\"reddit.com\", &[\"r\", \"movies\"], &[]);\n+ assert_eq!(\n+ crumbs(&p),\n+ vec![\n+ \"https://reddit.com\",\n+ \"https://reddit.com/r\",\n+ \"https://reddit.com/r/movies\"\n+ ]\n+ );\n+ }\n+\n+ #[test]\n+ fn reddit_post_breadcrumbs_skip_comments_node() {\n+ let p = test_parts(\"reddit.com\", &[\"r\", \"aww\", \"comments\", \"1trnvdl\"], &[]);\n+ let c = crumbs(&p);\n+ assert!(!c.iter().any(|u| u.ends_with(\"/comments\")));\n+ assert_eq!(\n+ c.last().map(String::as_str),\n+ Some(\"https://reddit.com/r/aww/comments/1trnvdl\")\n+ );\n+ assert!(c.contains(&\"https://reddit.com/r/aww\".to_string()));\n+ }\n+\n+ #[test]\n+ fn reddit_post_parent_is_subreddit_not_comments() {\n+ let p = test_parts(\"reddit.com\", &[\"r\", \"aww\", \"comments\", \"1trnvdl\"], &[]);\n+ let c = crumbs(&p);\n+ let parent = c.get(c.len() - 2).unwrap();\n+ assert_eq!(parent, \"https://reddit.com/r/aww\");\n+ }\n+\n+ #[test]\n+ fn reddit_domain_parent_is_none_in_breadcrumb_chain() {\n+ let p = test_parts(\"reddit.com\", &[], &[]);\n+ assert_eq!(crumbs(&p), vec![\"https://reddit.com\"]);\n+ }\n+\n+ #[test]\n+ fn youtube_watch_canonical_uses_v_only() {\n+ let p = test_parts(\"youtube.com\", &[\"watch\"], &[(\"v\", \"abc\"), (\"t\", \"99\")]);\n+ assert_eq!(canon(&p), \"https://youtube.com/watch?v=abc\");\n+ }\n+\n+ #[test]\n+ fn youtube_query_order_independent() {\n+ let a = test_parts(\"youtube.com\", &[\"watch\"], &[(\"v\", \"abc\"), (\"t\", \"4\")]);\n+ let b = test_parts(\"youtube.com\", &[\"watch\"], &[(\"t\", \"4\"), (\"v\", \"abc\")]);\n+ assert_eq!(canon(&a), canon(&b));\n+ }\n+\n+ #[test]\n+ fn youtube_host_aliases() {\n+ for host in [\"www.youtube.com\", \"m.youtube.com\"] {\n+ let p = test_parts(host, &[\"watch\"], &[(\"v\", \"x\")]);\n+ assert_eq!(canon(&p), \"https://youtube.com/watch?v=x\", \"host {host}\");\n+ }\n+ }\n+\n+ #[test]\n+ fn youtube_shorts_canonical_matches_watch() {\n+ let shorts = test_parts(\"youtube.com\", &[\"shorts\", \"vid123\"], &[]);\n+ let watch = test_parts(\"youtube.com\", &[\"watch\"], &[(\"v\", \"vid123\")]);\n+ assert_eq!(canon(&shorts), canon(&watch));\n+ assert_eq!(canon(&shorts), \"https://youtube.com/watch?v=vid123\");\n+ }\n+\n+ #[test]\n+ fn youtu_be_matches_youtube_watch() {\n+ let be = test_parts(\"youtu.be\", &[\"dQw4w9WgXcQ\"], &[]);\n+ let watch = test_parts(\"youtube.com\", &[\"watch\"], &[(\"v\", \"dQw4w9WgXcQ\")]);\n+ assert_eq!(canon(&be), canon(&watch));\n+ }\n+\n+ #[test]\n+ fn youtube_breadcrumbs_domain_then_watch() {\n+ let p = test_parts(\"youtube.com\", &[\"watch\"], &[(\"v\", \"abc\")]);\n+ assert_eq!(\n+ crumbs(&p),\n+ vec![\"https://youtube.com\", \"https://youtube.com/watch?v=abc\"]\n+ );\n+ }\n+\n+ #[test]\n+ fn youtu_be_breadcrumbs_include_youtube_domain() {\n+ let p = test_parts(\"youtu.be\", &[\"abc\"], &[]);\n+ let c = crumbs(&p);\n+ assert_eq!(c.first().map(String::as_str), Some(\"https://youtube.com\"));\n+ assert_eq!(\n+ c.last().map(String::as_str),\n+ Some(\"https://youtube.com/watch?v=abc\")\n+ );\n+ }\n+\n+ #[test]\n+ fn parsed_urls_match_hand_built_parts() {\n+ let raw = \"https://www.reddit.com/r/rust/comments/aaa/title/?utm=x\";\n+ let parsed = UrlParts::parse(raw).unwrap();\n+ let hand = test_parts(\n+ \"www.reddit.com\",\n+ &[\"r\", \"rust\", \"comments\", \"aaa\", \"title\"],\n+ &[(\"utm\", \"x\")],\n+ );\n+ assert_eq!(canon(&parsed), canon(&hand));\n+ }\n+\n+ #[test]\n+ fn equivalence_cluster_youtube_formats() {\n+ let urls = [\n+ \"https://youtu.be/abc123\",\n+ \"https://www.youtube.com/watch?v=abc123\",\n+ \"https://youtube.com/watch?v=abc123&t=1\",\n+ \"https://m.youtube.com/watch?t=1&v=abc123\",\n+ ];\n+ let canonical: Vec<_> = urls\n+ .iter()\n+ .map(|u| canon(&UrlParts::parse(u).unwrap()))\n+ .collect();\n+ assert!(canonical.iter().all(|c| *c == \"https://youtube.com/watch?v=abc123\"));\n+ }\n+\n+ #[test]\n+ fn equivalence_cluster_reddit_post_formats() {\n+ let urls = [\n+ \"https://old.reddit.com/r/Rust/comments/aaa/slug/\",\n+ \"reddit.com/r/rust/comments/aaa/other_slug\",\n+ \"https://reddit.com/r/RUST/comments/aaa\",\n+ ];\n+ let canonical: Vec<_> = urls\n+ .iter()\n+ .map(|u| canon(&UrlParts::parse(u).unwrap()))\n+ .collect();\n+ assert!(\n+ canonical\n+ .iter()\n+ .all(|c| *c == \"https://reddit.com/r/rust/comments/aaa\")\n+ );\n+ }\n+\n+ #[test]\n+ fn graph_nodes_all_have_valid_parent_links() {\n+ let g = build_graph();\n+ for (id, node) in &g.nodes {\n+ if let Some(parent) = node.parent {\n+ assert!(g.nodes.contains_key(parent), \"node {id} parent {parent}\");\n+ }\n+ }\n+ }\n+\n+ #[test]\n+ fn graph_terminal_canonical_always_succeeds_for_reddit_paths() {\n+ let cases: &[(&[&str], &str)] = &[\n+ (&[\"r\", \"rust\"], \"https://reddit.com/r/rust\"),\n+ (\n+ &[\"r\", \"rust\", \"comments\", \"x\"],\n+ \"https://reddit.com/r/rust/comments/x\",\n+ ),\n+ ];\n+ for (segs, want) in cases {\n+ let p = test_parts(\"reddit.com\", segs, &[]);\n+ assert_eq!(canon(&p), *want);\n+ }\n+ }\n+\n+ #[test]\n+ fn breadcrumb_parent_walk_matches_parent_url_semantics() {\n+ let p = test_parts(\"reddit.com\", &[\"r\", \"aww\", \"comments\", \"id1\"], &[]);\n+ let c = crumbs(&p);\n+ assert_eq!(c.len(), 4);\n+ assert_eq!(\n+ c.get(c.len() - 2).map(String::as_str),\n+ Some(\"https://reddit.com/r/aww\")\n+ );\n+ }\n+\n+ #[test]\n+ fn youtube_watch_without_v_falls_back_to_generic() {\n+ let p = test_parts(\"youtube.com\", &[\"watch\"], &[]);\n+ assert_eq!(terminal(&p), Some(\"youtube_watch\"));\n+ assert_eq!(canon(&p), \"https://youtube.com/watch\");\n+ }\n+\n+ #[test]\n+ fn reddit_only_comments_path_stops_at_gate() {\n+ let p = test_parts(\"reddit.com\", &[\"r\", \"rust\", \"comments\"], &[]);\n+ assert_eq!(terminal(&p), Some(\"reddit_comments_gate\"));\n+ assert_eq!(canon(&p), \"https://reddit.com/r/rust\");\n+ }\n+\n+ #[test]\n+ fn generic_deep_path_many_segments() {\n+ let segs: Vec<&str> = (0..10)\n+ .map(|i| match i {\n+ 0 => \"a\",\n+ 1 => \"b\",\n+ 2 => \"c\",\n+ 3 => \"d\",\n+ 4 => \"e\",\n+ 5 => \"f\",\n+ 6 => \"g\",\n+ 7 => \"h\",\n+ 8 => \"i\",\n+ _ => \"j\",\n+ })\n+ .collect();\n+ let p = test_parts(\"site.com\", &segs, &[]);\n+ assert_eq!(crumbs(&p).len(), 11);\n+ }\n+\n+ #[test]\n+ fn traverse_literal_r_required_for_subreddit() {\n+ let p = test_parts(\"reddit.com\", &[\"rust\"], &[]);\n+ assert_eq!(terminal(&p), None);\n+ }\n+\n+ #[test]\n+ fn http_scheme_upgraded_via_generic_fallback_host() {\n+ let parsed = UrlParts::parse(\"http://example.com/page\").unwrap();\n+ assert_eq!(canon(&parsed), \"https://example.com/page\");\n+ }\n+\n+ #[test]\n+ fn each_graph_node_canonical_is_invokable() {\n+ let g = build_graph();\n+ let empty = Context::default();\n+ for (id, node) in &g.nodes {\n+ let _ = (node.canonical)(&empty);\n+ let _ = id;\n+ }\n+ }\n+\n+ #[test]\n+ fn reddit_double_listing_suffix_both_absorbed() {\n+ let p = test_parts(\"reddit.com\", &[\"r\", \"rust\", \"hot\", \"new\"], &[]);\n+ assert_eq!(terminal(&p), Some(\"reddit_subreddit\"));\n+ assert_eq!(canon(&p), \"https://reddit.com/r/rust\");\n+ }\n+\n+ #[test]\n+ fn youtu_be_empty_path_stays_at_entry() {\n+ let p = test_parts(\"youtu.be\", &[], &[]);\n+ assert_eq!(terminal(&p), Some(\"youtu_be_entry\"));\n+ }\n+}\ndiff --git a/server/src/url_rules/graph_builder.rs b/server/src/url_rules/graph_builder.rs\nnew file mode 100644\nindex 0000000000000000000000000000000000000000..243204ad5ca514fff459057956080cacb5bf38e2\n--- /dev/null\n+++ b/server/src/url_rules/graph_builder.rs\n@@ -0,0 +1,73 @@\n+//! Declarative construction of the URL graph with build-time link validation.\n+\n+use std::collections::HashMap;\n+\n+use super::graph::{CanonicalFn, Edge, EdgePattern, Graph, Node};\n+\n+pub struct GraphBuilder {\n+ nodes: HashMap<&'static str, Node>,\n+ current: Option<&'static str>,\n+}\n+\n+impl GraphBuilder {\n+ pub fn new() -> Self {\n+ Self {\n+ nodes: HashMap::new(),\n+ current: None,\n+ }\n+ }\n+\n+ pub fn node(mut self, id: &'static str) -> Self {\n+ self.nodes.entry(id).or_insert_with(Node::empty);\n+ self.current = Some(id);\n+ self\n+ }\n+\n+ pub fn canonical(mut self, f: CanonicalFn) -> Self {\n+ let id = self.current.expect(\"canonical() without node()\");\n+ self.nodes.get_mut(id).expect(\"node missing\").canonical = f;\n+ self\n+ }\n+\n+ pub fn parent(mut self, parent_id: &'static str) -> Self {\n+ let id = self.current.expect(\"parent() without node()\");\n+ self.nodes.get_mut(id).expect(\"node missing\").parent = Some(parent_id);\n+ self\n+ }\n+\n+ pub fn edge(mut self, pattern: EdgePattern, target: &'static str) -> Self {\n+ let id = self.current.expect(\"edge() without node()\");\n+ self.nodes\n+ .get_mut(id)\n+ .expect(\"node missing\")\n+ .edges\n+ .push(Edge { pattern, target });\n+ self\n+ }\n+\n+ pub fn build(self) -> Graph {\n+ for (id, node) in &self.nodes {\n+ if let Some(parent) = node.parent {\n+ assert!(\n+ self.nodes.contains_key(parent),\n+ \"node {id}: parent {parent} does not exist\"\n+ );\n+ }\n+ for edge in &node.edges {\n+ if !matches!(\n+ edge.pattern,\n+ EdgePattern::AbsorbAny | EdgePattern::AbsorbIf(_)\n+ ) {\n+ assert!(\n+ self.nodes.contains_key(edge.target),\n+ \"node {id}: edge target {} does not exist\",\n+ edge.target\n+ );\n+ }\n+ }\n+ }\n+ Graph {\n+ nodes: self.nodes,\n+ }\n+ }\n+}\ndiff --git a/server/src/url_rules/mod.rs b/server/src/url_rules/mod.rs\nindex 9e1445346ce77a49dd6a7e7713bf9c57aef353cc..ba4ac662acc7bd4d50ee34613eb7eb6fccbfb17b 100644\n--- a/server/src/url_rules/mod.rs\n+++ b/server/src/url_rules/mod.rs\n@@ -1,6 +1,7 @@\n //! URL canonicalization and hierarchy via a semantic graph (DFA + generic fallback).\n \n mod graph;\n+mod graph_builder;\n mod parse;\n mod registry;\n \ndiff --git a/server/src/url_rules/parse.rs b/server/src/url_rules/parse.rs\nnew file mode 100644\nindex 0000000000000000000000000000000000000000..19d0c82feb718817168b8b445fcbfa39cf6aa6ba\n--- /dev/null\n+++ b/server/src/url_rules/parse.rs\n@@ -0,0 +1,169 @@\n+//! Parse raw strings into host, path segments, and query (order-independent).\n+\n+use std::collections::HashMap;\n+\n+use url::Url;\n+\n+#[derive(Debug, Clone)]\n+pub struct UrlParts {\n+ pub scheme: String,\n+ pub host: String,\n+ pub path_segments: Vec,\n+ pub query: HashMap,\n+}\n+\n+impl UrlParts {\n+ pub fn parse(raw: &str) -> Option {\n+ let trimmed = raw.trim();\n+ if trimmed.is_empty() {\n+ return None;\n+ }\n+\n+ let with_scheme = if trimmed.contains(\"://\") {\n+ trimmed.to_string()\n+ } else if trimmed.starts_with(\"r/\") || trimmed.starts_with(\"/r/\") {\n+ let rest = trimmed.trim_start_matches('/').trim_start_matches(\"r/\");\n+ format!(\"https://reddit.com/r/{rest}\")\n+ } else if trimmed.contains('.') && !trimmed.starts_with('/') {\n+ format!(\"https://{trimmed}\")\n+ } else {\n+ trimmed.to_string()\n+ };\n+\n+ let url = Url::parse(&with_scheme).ok()?;\n+ let host = url.host_str()?.to_string();\n+ let path_segments: Vec = url\n+ .path_segments()\n+ .map(|segs| segs.filter(|s| !s.is_empty()).map(str::to_string).collect())\n+ .unwrap_or_default();\n+\n+ let mut query = HashMap::new();\n+ for (k, v) in url.query_pairs() {\n+ query.insert(k.into_owned(), v.into_owned());\n+ }\n+\n+ Some(Self {\n+ scheme: url.scheme().to_string(),\n+ path_segments,\n+ query,\n+ host,\n+ })\n+ }\n+\n+ /// Host normalized for graph entry matching (lowercase, aliases).\n+ pub fn match_host(&self) -> String {\n+ normalize_match_host(&self.host)\n+ }\n+}\n+\n+pub fn normalize_match_host(host: &str) -> String {\n+ let h = host\n+ .strip_prefix(\"www.\")\n+ .unwrap_or(host)\n+ .to_ascii_lowercase();\n+ match h.as_str() {\n+ \"old.reddit.com\" | \"new.reddit.com\" => \"reddit.com\".to_string(),\n+ \"m.youtube.com\" => \"youtube.com\".to_string(),\n+ _ => h,\n+ }\n+}\n+\n+pub fn strip_tracking_query(query: &mut HashMap) {\n+ query.retain(|k, _| {\n+ let lower = k.to_ascii_lowercase();\n+ !(lower.starts_with(\"utm_\")\n+ || matches!(\n+ lower.as_str(),\n+ \"fbclid\" | \"gclid\" | \"ref\" | \"ref_src\" | \"ref_source\" | \"mc_cid\" | \"mc_eid\"\n+ ))\n+ });\n+}\n+\n+#[cfg(test)]\n+pub(crate) fn test_parts(host: &str, segs: &[&str], query: &[(&str, &str)]) -> UrlParts {\n+ UrlParts {\n+ scheme: \"https\".to_string(),\n+ host: host.to_string(),\n+ path_segments: segs.iter().map(|s| (*s).to_string()).collect(),\n+ query: query\n+ .iter()\n+ .map(|(k, v)| (k.to_string(), v.to_string()))\n+ .collect(),\n+ }\n+}\n+\n+#[cfg(test)]\n+mod tests {\n+ use super::*;\n+\n+ #[test]\n+ fn parse_full_url_splits_host_path_query() {\n+ let p = UrlParts::parse(\"https://www.youtube.com/watch?v=abc&t=4\").unwrap();\n+ assert_eq!(p.host, \"www.youtube.com\");\n+ assert_eq!(p.path_segments, vec![\"watch\"]);\n+ assert_eq!(p.query.get(\"v\").map(String::as_str), Some(\"abc\"));\n+ assert_eq!(p.query.get(\"t\").map(String::as_str), Some(\"4\"));\n+ }\n+\n+ #[test]\n+ fn parse_r_shortcut_expands_to_reddit() {\n+ let p = UrlParts::parse(\"r/rust\").unwrap();\n+ assert_eq!(p.match_host(), \"reddit.com\");\n+ assert_eq!(p.path_segments, vec![\"r\", \"rust\"]);\n+ }\n+\n+ #[test]\n+ fn parse_slash_r_shortcut() {\n+ let p = UrlParts::parse(\"/r/aww\").unwrap();\n+ assert_eq!(p.path_segments, vec![\"r\", \"aww\"]);\n+ }\n+\n+ #[test]\n+ fn parse_schemeless_host_path() {\n+ let p = UrlParts::parse(\"reddit.com/r/rust/comments/aaa/slug\").unwrap();\n+ assert_eq!(p.match_host(), \"reddit.com\");\n+ assert_eq!(\n+ p.path_segments,\n+ vec![\"r\", \"rust\", \"comments\", \"aaa\", \"slug\"]\n+ );\n+ }\n+\n+ #[test]\n+ fn parse_empty_returns_none() {\n+ assert!(UrlParts::parse(\"\").is_none());\n+ assert!(UrlParts::parse(\" \").is_none());\n+ }\n+\n+ #[test]\n+ fn normalize_match_host_reddit_aliases() {\n+ assert_eq!(normalize_match_host(\"old.reddit.com\"), \"reddit.com\");\n+ assert_eq!(normalize_match_host(\"NEW.reddit.com\"), \"reddit.com\");\n+ assert_eq!(normalize_match_host(\"www.reddit.com\"), \"reddit.com\");\n+ }\n+\n+ #[test]\n+ fn normalize_match_host_youtube_aliases() {\n+ assert_eq!(normalize_match_host(\"m.youtube.com\"), \"youtube.com\");\n+ assert_eq!(normalize_match_host(\"www.youtube.com\"), \"youtube.com\");\n+ }\n+\n+ #[test]\n+ fn strip_tracking_query_removes_known_params() {\n+ let mut q = HashMap::from([\n+ (\"v\".into(), \"1\".into()),\n+ (\"utm_source\".into(), \"x\".into()),\n+ (\"fbclid\".into(), \"y\".into()),\n+ (\"ref\".into(), \"z\".into()),\n+ ]);\n+ strip_tracking_query(&mut q);\n+ assert_eq!(q.len(), 1);\n+ assert_eq!(q.get(\"v\").map(String::as_str), Some(\"1\"));\n+ }\n+\n+ #[test]\n+ fn strip_tracking_query_utm_prefix() {\n+ let mut q = HashMap::from([(\"utm_campaign\".into(), \"email\".into())]);\n+ strip_tracking_query(&mut q);\n+ assert!(q.is_empty());\n+ }\n+}\ndiff --git a/server/src/url_rules/registry_tests.rs b/server/src/url_rules/registry_tests.rs\nnew file mode 100644\nindex 0000000000000000000000000000000000000000..7b76b550f808f590e011469fdae02adf603b43d2\n--- /dev/null\n+++ b/server/src/url_rules/registry_tests.rs\n@@ -0,0 +1,195 @@\n+//! End-to-end tests for the public registry API (`canonicalize_raw`, breadcrumbs, parent).\n+\n+use super::registry::{\n+ canonicalize_raw, looks_like_url, navigable_breadcrumbs, parent_url, resolve_id,\n+};\n+\n+fn canon(raw: &str) -> String {\n+ canonicalize_raw(raw).unwrap().canonical\n+}\n+\n+#[test]\n+fn looks_like_url_positive_cases() {\n+ for raw in [\n+ \"https://reddit.com/r/rust\",\n+ \"r/rust\",\n+ \"/r/aww\",\n+ \"reddit.com/r/x\",\n+ \"www.example.com/path\",\n+ \"youtu.be/abc\",\n+ ] {\n+ assert!(looks_like_url(raw), \"{raw}\");\n+ }\n+}\n+\n+#[test]\n+fn looks_like_url_negative_cases() {\n+ for raw in [\"alpha\", \"beta\", \"\", \"hello world\", \"no-dots\"] {\n+ assert!(!looks_like_url(raw), \"{raw}\");\n+ }\n+}\n+\n+#[test]\n+fn resolve_id_matches_canonicalize_raw() {\n+ let raw = \"https://youtu.be/xyz\";\n+ assert_eq!(\n+ resolve_id(raw).as_deref(),\n+ Some(canon(raw).as_str())\n+ );\n+}\n+\n+#[test]\n+fn canonicalize_empty_returns_none() {\n+ assert!(canonicalize_raw(\"\").is_none());\n+}\n+\n+#[test]\n+fn alias_when_slug_stripped() {\n+ let r = canonicalize_raw(\n+ \"https://reddit.com/r/rust/comments/aaa/very_long_title_slug\",\n+ )\n+ .unwrap();\n+ assert_eq!(r.canonical, \"https://reddit.com/r/rust/comments/aaa\");\n+ assert!(r.alias_of.is_some());\n+}\n+\n+#[test]\n+fn alias_none_when_already_canonical() {\n+ let raw = \"https://reddit.com/r/rust\";\n+ let r = canonicalize_raw(raw).unwrap();\n+ assert_eq!(r.canonical, raw);\n+ assert!(r.alias_of.is_none());\n+}\n+\n+#[test]\n+fn parent_url_subreddit_under_r_hub() {\n+ assert_eq!(\n+ parent_url(\"https://reddit.com/r/movies\").as_deref(),\n+ Some(\"https://reddit.com/r\")\n+ );\n+}\n+\n+#[test]\n+fn parent_url_domain_has_none() {\n+ assert_eq!(parent_url(\"https://reddit.com\").as_deref(), None);\n+}\n+\n+#[test]\n+fn parent_url_generic_site() {\n+ assert_eq!(\n+ parent_url(\"https://example.com/a/b\").as_deref(),\n+ Some(\"https://example.com/a\")\n+ );\n+}\n+\n+#[test]\n+fn breadcrumbs_from_canonical_string_roundtrip() {\n+ let id = \"https://reddit.com/r/golang/comments/abc123\";\n+ let crumbs = navigable_breadcrumbs(id);\n+ assert_eq!(crumbs.last().map(String::as_str), Some(id));\n+}\n+\n+// --- Table: Reddit raw URLs → canonical ---\n+\n+#[test]\n+fn reddit_canonical_matrix() {\n+ let cases: &[(&str, &str)] = &[\n+ (\"r/rust\", \"https://reddit.com/r/rust\"),\n+ (\"/r/aww\", \"https://reddit.com/r/aww\"),\n+ (\"https://reddit.com/r/rust\", \"https://reddit.com/r/rust\"),\n+ (\n+ \"https://www.reddit.com/r/programming/new\",\n+ \"https://reddit.com/r/programming\",\n+ ),\n+ (\n+ \"https://old.reddit.com/r/test/comments/xyz/slug/\",\n+ \"https://reddit.com/r/test/comments/xyz\",\n+ ),\n+ (\n+ \"reddit.com/r/Movies/comments/abc/Title_Case_Slug\",\n+ \"https://reddit.com/r/movies/comments/abc\",\n+ ),\n+ ];\n+ for (raw, want) in cases {\n+ assert_eq!(canon(raw), *want, \"raw={raw}\");\n+ }\n+}\n+\n+// --- Table: YouTube raw URLs → canonical ---\n+\n+#[test]\n+fn youtube_canonical_matrix() {\n+ let cases: &[(&str, &str)] = &[\n+ (\n+ \"https://youtube.com/watch?v=abc\",\n+ \"https://youtube.com/watch?v=abc\",\n+ ),\n+ (\n+ \"https://www.youtube.com/watch?v=abc&t=1&feature=share\",\n+ \"https://youtube.com/watch?v=abc\",\n+ ),\n+ (\"https://youtu.be/abc\", \"https://youtube.com/watch?v=abc\"),\n+ (\n+ \"https://youtube.com/shorts/abc\",\n+ \"https://youtube.com/watch?v=abc\",\n+ ),\n+ ];\n+ for (raw, want) in cases {\n+ assert_eq!(canon(raw), *want, \"raw={raw}\");\n+ }\n+}\n+\n+// --- Table: generic sites ---\n+\n+#[test]\n+fn generic_canonical_matrix() {\n+ let cases: &[(&str, &str)] = &[\n+ (\n+ \"https://news.ycombinator.com/item?id=38472\",\n+ \"https://news.ycombinator.com/item?id=38472\",\n+ ),\n+ (\n+ \"https://www.github.com/rust-lang/rust/issues/1?utm_source=x\",\n+ \"https://github.com/rust-lang/rust/issues/1\",\n+ ),\n+ (\"https://example.com\", \"https://example.com\"),\n+ ];\n+ for (raw, want) in cases {\n+ assert_eq!(canon(raw), *want, \"raw={raw}\");\n+ }\n+}\n+\n+// --- Phantom /comments/ regression (sorter2-specific) ---\n+\n+#[test]\n+fn phantom_comments_not_in_breadcrumbs_for_post() {\n+ let crumbs = navigable_breadcrumbs(\"https://reddit.com/r/rust/comments/aaa\");\n+ assert!(!crumbs.iter().any(|c| c.ends_with(\"/comments\")));\n+}\n+\n+#[test]\n+fn phantom_comments_not_sibling_of_subreddit_in_breadcrumb_chain() {\n+ let crumbs = navigable_breadcrumbs(\"https://reddit.com/r/rust/comments/aaa\");\n+ let subs: Vec<_> = crumbs\n+ .iter()\n+ .filter(|c| c.contains(\"/r/rust\") && !c.contains(\"/comments/\"))\n+ .collect();\n+ assert_eq!(subs, vec![\"https://reddit.com/r/rust\"]);\n+}\n+\n+// --- Distinct items must stay distinct ---\n+\n+#[test]\n+fn different_posts_different_canonical() {\n+ let a = canon(\"https://reddit.com/r/rust/comments/aaa\");\n+ let b = canon(\"https://reddit.com/r/rust/comments/bbb\");\n+ assert_ne!(a, b);\n+}\n+\n+#[test]\n+fn different_subreddits_different_canonical() {\n+ assert_ne!(\n+ canon(\"https://reddit.com/r/rust\"),\n+ canon(\"https://reddit.com/r/golang\")\n+ );\n+}\n\n\nSide B — contributor: tommy-mor\nSide B — commit message:\n[4e327784] deploy live constitution dashboard\n\nExpose auditable progress and event streaming, configure the production roots and runtime, and make tested main-branch commits the deployment authority.\n\nCo-authored-by: Cursor \n\nSide B — unified diff (full patch):\ndiff --git a/.dockerignore b/.dockerignore\nnew file mode 100644\nindex 0000000000000000000000000000000000000000..c9d63a722beba0a0297fc853089332c460ab78dd\n--- /dev/null\n+++ b/.dockerignore\n@@ -0,0 +1,7 @@\n+.git\n+.venv\n+.hypothesis\n+__pycache__\n+tests\n+*.json\n+*.bsp\ndiff --git a/.github/workflows/deploy.yml b/.github/workflows/deploy.yml\nnew file mode 100644\nindex 0000000000000000000000000000000000000000..76dcdf82d53177c1e47d86b23a54523239d232a6\n--- /dev/null\n+++ b/.github/workflows/deploy.yml\n@@ -0,0 +1,49 @@\n+name: Test and deploy\n+\n+on:\n+ push:\n+ branches: [main]\n+\n+concurrency:\n+ group: production\n+ cancel-in-progress: false\n+\n+permissions:\n+ contents: read\n+\n+jobs:\n+ test:\n+ runs-on: ubuntu-latest\n+ steps:\n+ - uses: actions/checkout@v4\n+\n+ - uses: astral-sh/setup-uv@v6\n+ with:\n+ enable-cache: true\n+\n+ - name: Run Python tests\n+ run: uv run pytest -q\n+\n+ - name: Install Babashka\n+ run: |\n+ curl -fsSL https://raw.githubusercontent.com/babashka/babashka/master/install \\\n+ | sudo bash -s -- --dir /usr/local/bin\n+\n+ - name: Run process integration tests\n+ run: bb TEST.sh\n+\n+ deploy:\n+ needs: test\n+ runs-on: ubuntu-latest\n+ environment:\n+ name: production\n+ url: https://token.slug.social\n+ steps:\n+ - uses: actions/checkout@v4\n+\n+ - uses: superfly/flyctl-actions/setup-flyctl@master\n+\n+ - name: Deploy to Fly\n+ run: flyctl deploy --remote-only\n+ env:\n+ FLY_API_TOKEN: ${{ secrets.FLY_API_TOKEN }}\ndiff --git a/Dockerfile b/Dockerfile\nnew file mode 100644\nindex 0000000000000000000000000000000000000000..c9a5c00782371c19ad5ab5c58cf6f5a8ffec0141\n--- /dev/null\n+++ b/Dockerfile\n@@ -0,0 +1,17 @@\n+FROM ghcr.io/astral-sh/uv:python3.11-bookworm-slim\n+\n+RUN apt-get update \\\n+ && apt-get install -y --no-install-recommends git ca-certificates \\\n+ && rm -rf /var/lib/apt/lists/*\n+\n+WORKDIR /app\n+COPY pyproject.toml uv.lock ./\n+RUN uv sync --frozen --no-install-project\n+\n+COPY constitution.py ./\n+\n+ENV PATH=\"/app/.venv/bin:${PATH}\" \\\n+ PYTHONUNBUFFERED=\"1\"\n+\n+EXPOSE 8080\n+CMD [\"python\", \"constitution.py\"]\ndiff --git a/constitution.py b/constitution.py\nindex 4bee9f83663ab7fb36db95129b92b64b4ef57258..a58257e1881b21d1d6fa8e68a3faa222e4f661ef 100644\n--- a/constitution.py\n+++ b/constitution.py\n@@ -24,12 +24,12 @@ A daily GitHub Action backs up the JSONL ledger to the same repo.\n Run: uv run constitution.py\n \"\"\"\n \n-from decimal import Decimal, getcontext\n+from decimal import Decimal, getcontext, DefaultContext\n from datetime import datetime, timezone\n from fastapi import FastAPI, Request, Response\n from fastapi.responses import PlainTextResponse, HTMLResponse\n from starlette.middleware.sessions import SessionMiddleware\n-import json, time, os, asyncio, httpx, pathlib, subprocess, hashlib, re, fcntl\n+import json, time, os, asyncio, httpx, pathlib, subprocess, hashlib, re, fcntl, base64\n import sympy as sp # type: ignore[reportMissingImports]\n from tenacity import retry, retry_if_exception, stop_after_attempt, wait_exponential\n from evaleval import (\n@@ -37,6 +37,7 @@ from evaleval import (\n exec_event, One, Two, Three, Selector, MORPH, PREPEND,\n )\n \n+DefaultContext.prec = 50\n getcontext().prec = 50\n \n app = FastAPI()\n@@ -129,14 +130,47 @@ OPENROUTER_BASE_URL = os.environ.get(\"OPENROUTER_BASE_URL\", \"https://openrouter.\n # using the exact same source; their normalized values are committed to every\n # discovery event.\n DEFAULT_REPOSITORIES = [\n+ {\n+ \"id\": \"constitution\",\n+ \"url\": \"https://github.com/sortersocial/constitution.git\",\n+ \"refs\": [\"refs/heads/**\"],\n+ },\n {\n \"id\": \"slug\",\n- \"url\": \"https://github.com/tommy-mor/slug.git\",\n+ \"url\": \"https://github.com/sortersocial/slug.git\",\n+ \"refs\": [\"refs/heads/**\"],\n+ },\n+ {\n+ \"id\": \"sorter\",\n+ \"url\": \"https://github.com/sorterisntonline/sorter.git\",\n+ \"refs\": [\"refs/heads/**\"],\n+ },\n+ {\n+ \"id\": \"sorter2\",\n+ \"url\": \"https://github.com/sortersocial/sorter2.git\",\n+ \"refs\": [\"refs/heads/**\"],\n+ },\n+ {\n+ \"id\": \"sorter-oldest\",\n+ \"url\": \"https://github.com/tommy-mor/sorter.git\",\n \"refs\": [\"refs/heads/**\"],\n },\n ]\n DEFAULT_CONTRIBUTORS = {\n \"tommy-mor\": [\"thmorriss@gmail.com\"],\n+ \"christopher-whitman\": [\n+ \"chris@cwwhitman.com\",\n+ \"7566903+cwwhitman@users.noreply.github.com\",\n+ ],\n+ \"jake-chvatal\": [\n+ \"jake+github@uln.industries\",\n+ \"jakechvatal@gmail.com\",\n+ \"jake@isnt.online\",\n+ ],\n+ \"lara\": [\"me@lara.lv\"],\n+ \"nat-reid\": [\"nathanielreid@gmail.com\"],\n+ \"zod\": [\"jason.p.mcel@gmail.com\", \"me@zod.tf\"],\n+ \"jovan\": [\"jovan@slug.social\", \"jovan@getcivicai.com\"],\n }\n \n REPOSITORIES = json.loads(\n@@ -147,6 +181,7 @@ CONTRIBUTORS = json.loads(\n )\n GIT_MIRROR_DIR = pathlib.Path(os.environ.get(\"GIT_MIRROR_DIR\", \"/data/git\"))\n GIT_TIMEOUT_SECONDS = int(os.environ.get(\"GIT_TIMEOUT_SECONDS\", \"120\"))\n+GITHUB_TOKEN = os.environ.get(\"GITHUB_TOKEN\", \"\")\n \n # Council model IDs: slug.social garden rank under this parent (bodies = OpenRouter URLs), then top-up from OpenRouter list.\n SLUG_SOCIAL_BASE_URL = os.environ.get(\"SLUG_SOCIAL_BASE_URL\", \"https://slug.social\").rstrip(\"/\")\n@@ -661,20 +696,30 @@ def _git(repo: pathlib.Path | None, *args: str, input_bytes: bytes | None = None\n if repo is not None:\n command += [\"-C\", str(repo)]\n command += list(args)\n+ git_env = {\n+ **os.environ,\n+ \"GIT_CONFIG_NOSYSTEM\": \"1\",\n+ \"GIT_CONFIG_GLOBAL\": os.devnull,\n+ \"GIT_NO_REPLACE_OBJECTS\": \"1\",\n+ \"LC_ALL\": \"C\",\n+ \"TZ\": \"UTC\",\n+ }\n+ if GITHUB_TOKEN:\n+ credential = base64.b64encode(\n+ f\"x-access-token:{GITHUB_TOKEN}\".encode()\n+ ).decode()\n+ git_env.update({\n+ \"GIT_CONFIG_COUNT\": \"1\",\n+ \"GIT_CONFIG_KEY_0\": \"http.https://github.com/.extraHeader\",\n+ \"GIT_CONFIG_VALUE_0\": f\"Authorization: Basic {credential}\",\n+ })\n try:\n result = subprocess.run(\n command,\n input=input_bytes,\n stdout=subprocess.PIPE,\n stderr=subprocess.PIPE,\n- env={\n- **os.environ,\n- \"GIT_CONFIG_NOSYSTEM\": \"1\",\n- \"GIT_CONFIG_GLOBAL\": os.devnull,\n- \"GIT_NO_REPLACE_OBJECTS\": \"1\",\n- \"LC_ALL\": \"C\",\n- \"TZ\": \"UTC\",\n- },\n+ env=git_env,\n timeout=GIT_TIMEOUT_SECONDS,\n check=False,\n )\n@@ -844,9 +889,15 @@ def _build_discovery(epoch_n: int, boundary_ms: int, events: list) -> GitDiscove\n canonical_location = min(\n locations[qualified_oid], key=lambda x: (x[0], x[1])\n )\n+ # One commit may be reachable from dozens of refs in the same mirror.\n+ # Verify its object once per repository, not once per source ref.\n+ object_locations = {\n+ (str(m), raw_oid): (m, raw_oid)\n+ for _, _, m, raw_oid in locations[qualified_oid]\n+ }\n object_hashes = {\n hashlib.sha256(_git(m, \"cat-file\", \"commit\", raw_oid)).hexdigest()\n- for _, _, m, raw_oid in locations[qualified_oid]\n+ for m, raw_oid in object_locations.values()\n }\n if len(object_hashes) != 1:\n raise RuntimeError(f\"conflicting Git objects share OID {qualified_oid}\")\n@@ -994,11 +1045,55 @@ async def discover_repositories(epoch_n: int, boundary_ms: int) -> GitDiscovery:\n \n \n SSE_CLIENTS = []\n+AUDIT_HISTORY = []\n+AUDIT_SEQUENCE = 0\n+PROCESS_STATE = {\n+ \"running\": False,\n+ \"phase\": \"idle\",\n+ \"progress\": 100,\n+ \"message\": \"Waiting for the next epoch\",\n+}\n+\n+\n+def _sse_event(event_name: str, payload: dict) -> str:\n+ return (\n+ f\"event: {event_name}\\n\"\n+ f\"data: {json.dumps(payload, separators=(',', ':'))}\\n\\n\"\n+ )\n+\n+\n+async def broadcast_audit(\n+ kind: str,\n+ message: str,\n+ *,\n+ progress: int | None = None,\n+ phase: str | None = None,\n+) -> dict:\n+ global AUDIT_SEQUENCE\n+ AUDIT_SEQUENCE += 1\n+ if progress is not None:\n+ PROCESS_STATE[\"progress\"] = max(0, min(100, int(progress)))\n+ if phase is not None:\n+ PROCESS_STATE[\"phase\"] = phase\n+ PROCESS_STATE[\"message\"] = message\n+ payload = {\n+ \"id\": AUDIT_SEQUENCE,\n+ \"timestamp_ms\": int(time.time() * 1000),\n+ \"kind\": kind,\n+ \"message\": message,\n+ **PROCESS_STATE,\n+ }\n+ AUDIT_HISTORY.append(payload)\n+ del AUDIT_HISTORY[:-200]\n+ wire = _sse_event(\"audit\", payload)\n+ for queue in list(SSE_CLIENTS):\n+ await queue.put(wire)\n+ return payload\n \n \n async def broadcast_js(js: str):\n \"\"\"Send a JS snippet to all connected SSE clients.\"\"\"\n- for queue in SSE_CLIENTS:\n+ for queue in list(SSE_CLIENTS):\n await queue.put(js)\n \n \n@@ -1006,10 +1101,29 @@ async def rank_commits(commits: list[dict]):\n if not commits:\n return {}, []\n \n- models = await fetch_top_models(n=3)\n contributors = sorted(set(c[\"contributor\"] for c in commits))\n- if len(contributors) > 1 and not models:\n+ if len(contributors) == 1:\n+ await broadcast_audit(\n+ \"ranking\",\n+ f\"Only {contributors[0]} is eligible; rank is 1.0\",\n+ progress=90,\n+ phase=\"finalizing\",\n+ )\n+ return {contributors[0]: Decimal(\"1\")}, []\n+ if not (OPENROUTER_API_KEY or \"\").strip():\n+ raise RuntimeError(\n+ \"OPENROUTER_API_KEY is required when multiple contributors need ranking\"\n+ )\n+\n+ models = await fetch_top_models(n=3)\n+ if not models:\n raise RuntimeError(\"no council models available for contributor ranking\")\n+ await broadcast_audit(\n+ \"council\",\n+ f\"Council selected: {', '.join(models)}\",\n+ progress=35,\n+ phase=\"ranking\",\n+ )\n await broadcast_js(exec_event(Three[Selector(\"#emission-log\")][PREPEND][\n [\"div.log-council\", f\"Council: {', '.join(models)} — {len(commits)} commits\"]\n ]))\n@@ -1035,6 +1149,11 @@ async def rank_commits(commits: list[dict]):\n \n async def compare_fn(i, j):\n a1, a2 = authors[i], authors[j]\n+ await broadcast_audit(\n+ \"comparison\",\n+ f\"Comparing {a1} with {a2}\",\n+ phase=\"ranking\",\n+ )\n await broadcast_js(exec_event(Three[Selector(\"#emission-status\")][MORPH][\n [\"div#emission-status\", f\"Comparing {a1} vs {a2}…\"]\n ]))\n@@ -1050,6 +1169,11 @@ async def rank_commits(commits: list[dict]):\n if winner_weight <= 0 or loser_weight <= 0:\n raise ValueError(\"ratio weights must be positive\")\n results.append((w, l, winner_weight, loser_weight))\n+ await broadcast_audit(\n+ \"vote\",\n+ f\"{model}: {authors[w]} over {authors[l]} ({result['ratio']})\",\n+ phase=\"ranking\",\n+ )\n await broadcast_js(exec_event(Three[Selector(\"#emission-log\")][PREPEND][\n [\"div.log-vote\",\n [\"span.model\", model], \" — \",\n@@ -1059,6 +1183,11 @@ async def rank_commits(commits: list[dict]):\n ]\n ]))\n except Exception as e:\n+ await broadcast_audit(\n+ \"error\",\n+ f\"{model} failed: {e}\",\n+ phase=\"error\",\n+ )\n await broadcast_js(exec_event(Three[Selector(\"#emission-log\")][PREPEND][\n [\"div.log-error\", f\"⚠ {model}: {e}\"]\n ]))\n@@ -1068,8 +1197,13 @@ async def rank_commits(commits: list[dict]):\n async def progress_fn(ev):\n if ev[\"phase\"] == \"spanning_tree\":\n label = f\"Spanning tree: {ev['step']}/{ev['total']}\"\n+ percent = 35 + round(35 * ev[\"step\"] / max(ev[\"total\"], 1))\n else:\n label = f\"Zip pass {ev['pass']}: {ev['step']}/{ev['total']}\"\n+ percent = 70 + round(20 * ev[\"step\"] / max(ev[\"total\"], 1))\n+ await broadcast_audit(\n+ \"progress\", label, progress=percent, phase=\"ranking\"\n+ )\n await broadcast_js(exec_event(Three[Selector(\"#emission-status\")][MORPH][\n [\"div#emission-status\", label]\n ]))\n@@ -1083,6 +1217,12 @@ async def rank_commits(commits: list[dict]):\n scores = rank_centrality(pairs)\n ranking = {authors[i]: Decimal(str(scores[i])) for i in range(len(authors))}\n ranking_rows = sorted(ranking.items(), key=lambda x: x[1], reverse=True)\n+ await broadcast_audit(\n+ \"ranking\",\n+ \"Ranking: \" + \", \".join(f\"{a} {s:.4f}\" for a, s in ranking_rows),\n+ progress=90,\n+ phase=\"finalizing\",\n+ )\n await broadcast_js(exec_event(Three[Selector(\"#emission-log\")][PREPEND][\n [\"div.log-ranking\",\n [\"b\", \"Ranking: \"],\n@@ -1104,11 +1244,33 @@ def pool_remaining(events: list) -> Decimal:\n \n \n async def run_emission(epoch_n, boundary_ms):\n+ PROCESS_STATE[\"running\"] = True\n+ await broadcast_audit(\n+ \"start\",\n+ f\"Epoch {epoch_n} emission started\",\n+ progress=2,\n+ phase=\"starting\",\n+ )\n await broadcast_js(exec_event(Three[Selector(\"#emission-log\")][PREPEND][\n [\"div.log-start\", f\"⚡ Epoch {epoch_n} emission started\"]\n ]))\n \n+ await broadcast_audit(\n+ \"discovery\",\n+ \"Fetching configured repositories and snapshotting refs\",\n+ progress=8,\n+ phase=\"discovery\",\n+ )\n discovery = await discover_repositories(epoch_n, boundary_ms)\n+ await broadcast_audit(\n+ \"discovery\",\n+ (\n+ f\"Discovered {len(discovery.observations)} new commits; \"\n+ f\"{len(discovery.commits)} are eligible\"\n+ ),\n+ progress=30,\n+ phase=\"discovery\",\n+ )\n ranking, models = await rank_commits(discovery.commits)\n \n def make_emission(events):\n@@ -1146,6 +1308,13 @@ async def run_emission(epoch_n, boundary_ms):\n \n entry = await store.atomic(make_emission)\n if entry:\n+ PROCESS_STATE[\"running\"] = False\n+ await broadcast_audit(\n+ \"complete\",\n+ f\"Epoch {entry.epoch} complete; emitted {entry.total_emitted} SLG\",\n+ progress=100,\n+ phase=\"idle\",\n+ )\n await broadcast_js(exec_event(Three[Selector(\"#emission-log\")][PREPEND][\n [\"div.log-amount\",\n f\"Pool {entry.pool_before} → emit {entry.total_emitted} → {entry.pool_after}\"]\n@@ -1189,13 +1358,24 @@ async def distribute_usdc(holdings, treasury_balance):\n async def epoch_loop():\n while True:\n epoch_n, current_start, next_boundary = current_epoch()\n+ processed = {e.epoch for e in store.read() if isinstance(e, Emission)}\n+ if epoch_n >= 0 and epoch_n not in processed:\n+ try:\n+ await run_emission(epoch_n, current_start)\n+ except Exception as exc:\n+ PROCESS_STATE[\"running\"] = False\n+ await broadcast_audit(\n+ \"error\",\n+ f\"Epoch {epoch_n} failed: {exc}; retrying in 60 seconds\",\n+ phase=\"error\",\n+ )\n+ print(f\"epoch {epoch_n} emission failed: {exc}\", flush=True)\n+ await asyncio.sleep(60)\n+ continue\n+\n now = int(time.time() * 1000)\n wait_ms = next_boundary - now\n-\n if wait_ms <= 0:\n- processed = {e.epoch for e in store.read() if isinstance(e, Emission)}\n- if epoch_n not in processed and epoch_n >= 0:\n- await run_emission(epoch_n, current_start)\n await asyncio.sleep(60)\n elif wait_ms < 86_400_000:\n await broadcast_js(exec_event(Three[Selector(\"#emission-status\")][MORPH][\n@@ -1243,6 +1423,36 @@ async def get_ranking():\n return {\"ranking\": latest.ranking, \"epoch\": latest.epoch}\n \n \n+@app.get(\"/api/status\")\n+async def get_status():\n+ events = store.read()\n+ discoveries = [e for e in events if isinstance(e, GitDiscovery)]\n+ emissions = [e for e in events if isinstance(e, Emission)]\n+ return {\n+ **PROCESS_STATE,\n+ \"epoch\": current_epoch()[0],\n+ \"openrouter_configured\": bool((OPENROUTER_API_KEY or \"\").strip()),\n+ \"sse_clients\": len(SSE_CLIENTS),\n+ \"latest_discovery\": (\n+ {\n+ \"epoch\": discoveries[-1].epoch,\n+ \"snapshot_id\": discoveries[-1].snapshot_id,\n+ \"observations\": len(discoveries[-1].observations),\n+ \"eligible_commits\": len(discoveries[-1].commits),\n+ }\n+ if discoveries else None\n+ ),\n+ \"latest_emission\": (\n+ {\n+ \"epoch\": emissions[-1].epoch,\n+ \"total_emitted\": emissions[-1].total_emitted,\n+ \"ranking\": emissions[-1].ranking,\n+ }\n+ if emissions else None\n+ ),\n+ }\n+\n+\n @app.get(\"/api/contributor/{github_username}\")\n async def get_contributor(github_username: str):\n history = [\n@@ -1306,13 +1516,6 @@ async def test_emit():\n \n # ===========================================================================\n # §9. SSE — live audit stream of the pairwise voting process\n-#\n-# TODO: the /sse emission audit page needs a real SSE-driven UI. votes arrive\n-# incrementally during rank_commits(), and the client should show a live\n-# progress bar and per-vote results as they stream in. this requires a\n-# dedicated page that connects to /sse and updates the DOM on each event\n-# (council, comparing, vote, ranking, emission_complete). defer until we\n-# have playwright tests to cover it — the incremental rendering is fiddly.\n # ===========================================================================\n \n @app.get(\"/sse\")\n@@ -1322,6 +1525,13 @@ async def sse_stream(request: Request):\n \n async def generate():\n try:\n+ yield _sse_event(\"audit\", {\n+ \"id\": AUDIT_SEQUENCE,\n+ \"timestamp_ms\": int(time.time() * 1000),\n+ \"kind\": \"connection\",\n+ \"message\": f\"Connected to epoch {current_epoch()[0]}\",\n+ **PROCESS_STATE,\n+ })\n yield exec_event(Three[Selector(\"#emission-status\")][MORPH][\n [\"div#emission-status\", f\"Connected — epoch {current_epoch()[0]}\"]\n ])\n@@ -1334,10 +1544,15 @@ async def sse_stream(request: Request):\n except asyncio.TimeoutError:\n yield \": keepalive\\n\\n\"\n finally:\n- SSE_CLIENTS.remove(queue)\n+ if queue in SSE_CLIENTS:\n+ SSE_CLIENTS.remove(queue)\n \n from starlette.responses import StreamingResponse\n- return StreamingResponse(generate(), media_type=\"text/event-stream\")\n+ return StreamingResponse(\n+ generate(),\n+ media_type=\"text/event-stream\",\n+ headers={\"Cache-Control\": \"no-cache\", \"X-Accel-Buffering\": \"no\"},\n+ )\n \n \n # ===========================================================================\n@@ -1359,6 +1574,7 @@ def _page(title: str, body: list) -> HTMLResponse:\n [\"meta\", {\"charset\": \"utf-8\"}],\n [\"meta\", {\"name\": \"viewport\", \"content\": \"width=device-width, initial-scale=1\"}],\n [\"title\", title],\n+ [\"style\", RawContent(_WATCH_CSS)],\n ],\n [\"body\",\n body,\n@@ -1367,6 +1583,387 @@ def _page(title: str, body: list) -> HTMLResponse:\n ]))\n \n \n+_WATCH_CSS = \"\"\"\n+/* ================================================================\n+ ZIGGURAT — bevel-first dark theme\n+ --spread (0→1) controls bevel depth. 0 = flat. 1 = full relief.\n+ Light source: top-left. Shadow: bottom-right.\n+ Platforms nest. Each level is raised. Nothing is rounded.\n+ ================================================================ */\n+\n+:root {\n+ color-scheme: dark;\n+ --spread: 1;\n+\n+ --g0: #080808;\n+ --g1: #131313;\n+ --g2: #1c1c1c;\n+ --g3: #252525;\n+ --g4: #2e2e2e;\n+ --g5: #383838;\n+\n+ --hi: #5e5e5e;\n+ --lo: #050505;\n+ --bv: calc(var(--spread) * 4px + 1px);\n+ --bv-lg: calc(var(--spread) * 6px + 2px);\n+\n+ --signal: #f0f0f0;\n+ --prose: #c2c2c2;\n+ --ui: #888;\n+ --meta: #4a4a4a;\n+ --link: #8899ee;\n+ --code-fg: #c8dda0;\n+\n+ --font-prose: \"Iowan Old Style\", \"Palatino Linotype\", Palatino, \"Book Antiqua\", Georgia, serif;\n+ --font-ui: system-ui, -apple-system, sans-serif;\n+ --font-code: ui-monospace, \"Cascadia Code\", \"SF Mono\", Menlo, monospace;\n+}\n+\n+*, *::before, *::after { box-sizing: border-box; }\n+html, body { margin: 0; padding: 0; }\n+\n+body {\n+ background: var(--g0);\n+ color: var(--prose);\n+ font-family: var(--font-ui);\n+ font-size: 14px;\n+ line-height: 1.6;\n+ margin: 0 auto;\n+ max-width: 560px;\n+ min-height: 100vh;\n+ padding: 0 16px 48px;\n+}\n+main { width: 100%; padding: 18px 0 48px; }\n+\n+h1, h2, h3 {\n+ color: var(--signal);\n+ font-size: 11px;\n+ font-weight: bold;\n+ letter-spacing: 0.12em;\n+ margin: 14px 0 6px;\n+ text-transform: uppercase;\n+}\n+a { color: var(--link); text-decoration: none; }\n+a:hover { color: var(--signal); }\n+.eyebrow {\n+ background: var(--g2);\n+ border: var(--bv) solid;\n+ border-color: var(--hi) var(--lo) var(--lo) var(--hi);\n+ color: var(--ui);\n+ font-size: 11px;\n+ letter-spacing: 0.12em;\n+ padding: 4px 10px;\n+ text-transform: uppercase;\n+ width: fit-content;\n+}\n+\n+/* Every dashboard section is a raised platform. */\n+.panel {\n+ background: var(--g2);\n+ border: var(--bv-lg) solid;\n+ border-color: var(--hi) var(--lo) var(--lo) var(--hi);\n+ margin: 8px 0;\n+ padding: 10px;\n+ width: 100%;\n+}\n+.status-row {\n+ align-items: center;\n+ display: flex;\n+ flex-wrap: wrap;\n+ gap: 8px;\n+ justify-content: space-between;\n+}\n+#process-status { color: var(--signal); font-family: var(--font-code); font-weight: bold; }\n+.badge {\n+ align-items: center;\n+ background: var(--g3);\n+ border: var(--bv) solid;\n+ border-color: var(--hi) var(--lo) var(--lo) var(--hi);\n+ color: var(--ui);\n+ display: inline-flex;\n+ font-size: 11px;\n+ gap: 7px;\n+ padding: 3px 8px;\n+}\n+.dot { background: var(--meta); height: 8px; width: 8px; }\n+.live .dot { background: #7acc7a; }\n+.warn .dot { background: #cc9955; }\n+\n+/* The progress track is inset; its signal is raised inside it. */\n+.progress-shell {\n+ background: var(--g1);\n+ border: var(--bv-lg) solid;\n+ border-color: var(--lo) var(--hi) var(--hi) var(--lo);\n+ height: 58px;\n+ margin: 14px 0 10px;\n+ overflow: hidden;\n+ position: relative;\n+}\n+#progress-fill {\n+ background: var(--link);\n+ border: var(--bv) solid;\n+ border-color: var(--hi) var(--lo) var(--lo) var(--hi);\n+ height: 100%;\n+ transition: width .35s steps(8, end);\n+ width: 0;\n+}\n+#progress-label {\n+ color: var(--signal);\n+ display: grid;\n+ font-family: var(--font-code);\n+ font-size: 18px;\n+ font-weight: bold;\n+ inset: 0;\n+ place-items: center;\n+ position: absolute;\n+ text-shadow: 1px 1px var(--lo);\n+}\n+\n+.controls { align-items: center; display: flex; flex-wrap: wrap; gap: 8px; }\n+button {\n+ background: var(--g5);\n+ border: var(--bv) solid;\n+ border-color: var(--hi) var(--lo) var(--lo) var(--hi);\n+ color: var(--signal);\n+ cursor: pointer;\n+ font: inherit;\n+ font-size: 12px;\n+ padding: 4px 10px;\n+}\n+button:hover { background: #404040; }\n+button:active {\n+ background: var(--g4);\n+ border-color: var(--lo) var(--hi) var(--hi) var(--lo);\n+ transform: translate(1px, 1px);\n+}\n+button:disabled { cursor: default; opacity: .4; }\n+.note { color: var(--meta); font-size: 11px; margin: 4px 0; }\n+\n+.feed-head { align-items: baseline; display: flex; justify-content: space-between; }\n+#audit-feed {\n+ background: var(--g1);\n+ border: var(--bv) solid;\n+ border-color: var(--lo) var(--hi) var(--hi) var(--lo);\n+ display: flex;\n+ flex-direction: column;\n+ gap: 5px;\n+ margin-top: 8px;\n+ padding: 6px;\n+}\n+.event {\n+ background: var(--g3);\n+ border: var(--bv) solid;\n+ border-color: var(--hi) var(--lo) var(--lo) var(--hi);\n+ display: grid;\n+ gap: 6px;\n+ grid-template-columns: 82px 88px 1fr;\n+ padding: 5px 8px;\n+}\n+.event[data-kind=\"error\"] { border-left-color: #cc5555; }\n+.event[data-kind=\"complete\"], .event[data-kind=\"ranking\"] { border-left-color: #7acc7a; }\n+.event[data-kind=\"vote\"] { border-left-color: var(--link); }\n+.event time, .event-kind { color: var(--meta); font-family: var(--font-code); font-size: 10px; }\n+.event-kind { text-transform: uppercase; }\n+.event-message { color: var(--prose); font-family: var(--font-prose); }\n+\n+code {\n+ background: var(--g1);\n+ border: 2px solid;\n+ border-color: var(--lo) var(--hi) var(--hi) var(--lo);\n+ color: var(--code-fg);\n+ font-family: var(--font-code);\n+ font-size: 12px;\n+ padding: 1px 4px;\n+}\n+\n+@media (max-width: 520px) {\n+ .event { grid-template-columns: 72px 1fr; }\n+ .event-message { grid-column: 1 / -1; }\n+}\n+\"\"\"\n+\n+\n+def _watch_initial_state() -> dict:\n+ events = store.read()\n+ feed = []\n+ for event_ in events[-40:]:\n+ if isinstance(event_, GitDiscovery):\n+ feed.append({\n+ \"id\": f\"discovery-{event_.snapshot_id}\",\n+ \"timestamp_ms\": event_.timestamp_ms,\n+ \"kind\": \"discovery\",\n+ \"message\": (\n+ f\"Epoch {event_.epoch}: observed {len(event_.observations)} commits; \"\n+ f\"{len(event_.commits)} eligible\"\n+ ),\n+ })\n+ elif isinstance(event_, Emission):\n+ feed.append({\n+ \"id\": f\"emission-{event_.epoch}\",\n+ \"timestamp_ms\": event_.timestamp_ms,\n+ \"kind\": \"complete\",\n+ \"message\": (\n+ f\"Epoch {event_.epoch}: emitted {event_.total_emitted} SLG; \"\n+ f\"ranking {event_.ranking}\"\n+ ),\n+ })\n+ feed.extend(AUDIT_HISTORY)\n+ return {\n+ \"process\": dict(PROCESS_STATE),\n+ \"openrouter_configured\": bool((OPENROUTER_API_KEY or \"\").strip()),\n+ \"epoch\": current_epoch()[0],\n+ \"feed\": feed[-200:],\n+ }\n+\n+\n+_WATCH_JS = \"\"\"\n+const initial = __INITIAL__;\n+const feed = document.querySelector('#audit-feed');\n+const processStatus = document.querySelector('#process-status');\n+const connection = document.querySelector('#connection-status');\n+const fill = document.querySelector('#progress-fill');\n+const progressLabel = document.querySelector('#progress-label');\n+const play = document.querySelector('#play');\n+const pause = document.querySelector('#pause');\n+const seen = new Set();\n+let source = null;\n+\n+function setProgress(value) {\n+ const n = Math.max(0, Math.min(100, Number(value ?? 0)));\n+ fill.style.width = `${n}%`;\n+ progressLabel.textContent = `${Math.round(n)}%`;\n+ document.querySelector('.progress-shell').setAttribute('aria-valuenow', String(n));\n+}\n+\n+function addEvent(event) {\n+ const id = String(event.id);\n+ if (seen.has(id)) return;\n+ seen.add(id);\n+ const row = document.createElement('div');\n+ row.className = 'event';\n+ row.dataset.kind = event.kind || 'event';\n+ const when = document.createElement('time');\n+ when.dateTime = new Date(event.timestamp_ms).toISOString();\n+ when.textContent = new Date(event.timestamp_ms).toLocaleTimeString();\n+ const kind = document.createElement('span');\n+ kind.className = 'event-kind';\n+ kind.textContent = event.kind || 'event';\n+ const message = document.createElement('span');\n+ message.className = 'event-message';\n+ message.textContent = event.message;\n+ row.append(when, kind, message);\n+ feed.prepend(row);\n+ while (feed.children.length > 200) feed.lastElementChild.remove();\n+}\n+\n+function applyState(event) {\n+ processStatus.textContent = event.message || 'Waiting for the next epoch';\n+ setProgress(event.progress);\n+ if (event.kind !== 'connection') addEvent(event);\n+}\n+\n+function connect() {\n+ if (source) return;\n+ source = new EventSource('/sse');\n+ connection.classList.remove('warn');\n+ connection.classList.add('live');\n+ connection.querySelector('span:last-child').textContent = 'connecting';\n+ play.disabled = true;\n+ pause.disabled = false;\n+ source.onopen = () => {\n+ connection.querySelector('span:last-child').textContent = 'live';\n+ };\n+ source.addEventListener('audit', event => applyState(JSON.parse(event.data)));\n+ source.onerror = () => {\n+ connection.classList.remove('live');\n+ connection.classList.add('warn');\n+ connection.querySelector('span:last-child').textContent = 'reconnecting';\n+ };\n+}\n+\n+function disconnect() {\n+ if (source) source.close();\n+ source = null;\n+ connection.classList.remove('live');\n+ connection.classList.add('warn');\n+ connection.querySelector('span:last-child').textContent = 'paused locally';\n+ play.disabled = false;\n+ pause.disabled = true;\n+}\n+\n+play.addEventListener('click', connect);\n+pause.addEventListener('click', disconnect);\n+initial.feed.forEach(addEvent);\n+processStatus.textContent = initial.process.message;\n+setProgress(initial.process.progress);\n+connect();\n+\"\"\"\n+\n+\n+@app.get(\"/watch\")\n+async def watch():\n+ initial = json.dumps(\n+ _watch_initial_state(), separators=(\",\", \":\")\n+ ).replace(\" 0\")\n \n- ;; 9. SSE connects and sends initial event\n+ ;; 9. watch UI exposes progress, controls, readiness, and live SSE\n+ (println \"\\nchecking /watch UI…\")\n+ (bind watch-html (slurp (str base-url \"/watch\")))\n+ (assert! (str/includes? watch-html \"role=\\\"progressbar\\\"\")\n+ \"watch page has progress bar\")\n+ (assert! (str/includes? watch-html \"id=\\\"play\\\"\")\n+ \"watch page has play control\")\n+ (assert! (str/includes? watch-html \"id=\\\"pause\\\"\")\n+ \"watch page has pause control\")\n+ (assert! (str/includes? watch-html \"OpenRouter configured\")\n+ \"watch page reports council readiness\")\n+ (bind status-resp (get-json base-url \"/api/status\"))\n+ (assert! (true? (:openrouter_configured status-resp))\n+ \"status API reports OpenRouter configuration\")\n+\n+ ;; 10. SSE connects and sends initial event\n (println \"\\nchecking /sse initial event…\")\n (bind sse-events (read-sse-events (str base-url \"/sse\") 1 5000))\n (assert! (= 1 (count sse-events)) \"received 1 SSE event\")\n (assert! (not (str/blank? (first sse-events)))\n \"initial SSE event contains executable audit data\")\n \n- ;; 10. POST /test/emit — full ranking pipeline hits mocks\n+ ;; 11. POST /test/emit — full ranking pipeline hits mocks\n (println \"\\ntriggering /test/emit (epoch 1)…\")\n (bind emit-resp (post-json! base-url \"/test/emit\"))\n (assert! (= \"emission\" (:type emit-resp)) \"emit response type is emission\")\n@@ -503,7 +518,7 @@\n (bind rank-after (get-json base-url \"/api/ranking\"))\n (assert! (= 1 (:epoch rank-after)) \"latest ranking is epoch 1\")\n \n- ;; 11. kill and restart — prove replay determinism\n+ ;; 12. kill and restart — prove replay determinism\n (println \"\\nkilling server for replay test…\")\n (.destroyForcibly (:proc server))\n (deref server)\ndiff --git a/tests/test_git_discovery.py b/tests/test_git_discovery.py\nindex 0dd31bc42a19bc8c59842dc61f193c595c474659..5a9e167e16ad2ffb25988af85820f6f19e8910cd 100644\n--- a/tests/test_git_discovery.py\n+++ b/tests/test_git_discovery.py\n@@ -393,7 +393,9 @@ def test_empty_epoch_records_zero_emission_without_burning_pool(\n monkeypatch.setattr(c, \"store\", c.JsonlStore(discovery_config / \"ledger.jsonl\"))\n \n async def discover(_epoch, _boundary):\n- return SimpleNamespace(commits=[], snapshot_id=\"empty-snapshot\")\n+ return SimpleNamespace(\n+ observations=[], commits=[], snapshot_id=\"empty-snapshot\"\n+ )\n \n async def rank(_commits):\n return {}, []\n@@ -412,7 +414,11 @@ def test_emission_distribution_sums_exactly_to_total(\n monkeypatch.setattr(c, \"store\", c.JsonlStore(discovery_config / \"ledger.jsonl\"))\n \n async def discover(_epoch, _boundary):\n- return SimpleNamespace(commits=[{\"x\": 1}], snapshot_id=\"ranked-snapshot\")\n+ return SimpleNamespace(\n+ observations=[{\"x\": 1}],\n+ commits=[{\"x\": 1}],\n+ snapshot_id=\"ranked-snapshot\",\n+ )\n \n async def rank(_commits):\n return {\n@@ -454,6 +460,7 @@ def test_any_council_failure_aborts_ranking(monkeypatch):\n \n monkeypatch.setattr(c, \"fetch_top_models\", models)\n monkeypatch.setattr(c, \"llm_pairwise_compare\", compare)\n+ monkeypatch.setattr(c, \"OPENROUTER_API_KEY\", \"test-key\")\n commits = [\n {\n \"contributor\": contributor,\n@@ -465,3 +472,54 @@ def test_any_council_failure_aborts_ranking(monkeypatch):\n ]\n with pytest.raises(RuntimeError, match=\"council model failed\"):\n asyncio.run(c.rank_commits(commits))\n+\n+\n+def test_contested_ranking_requires_openrouter_key(monkeypatch):\n+ monkeypatch.setattr(c, \"OPENROUTER_API_KEY\", \"\")\n+ commits = [\n+ {\n+ \"contributor\": contributor,\n+ \"oid\": \"sha1:\" + char * 40,\n+ \"message\": contributor,\n+ \"patch\": \"patch\",\n+ }\n+ for contributor, char in [(\"alice\", \"a\"), (\"bob\", \"b\")]\n+ ]\n+ with pytest.raises(RuntimeError, match=\"OPENROUTER_API_KEY\"):\n+ asyncio.run(c.rank_commits(commits))\n+\n+\n+def test_watch_page_has_live_controls_progress_and_key_warning(\n+ discovery_config, monkeypatch\n+):\n+ monkeypatch.setattr(c, \"store\", c.JsonlStore(discovery_config / \"ledger.jsonl\"))\n+ monkeypatch.setattr(c, \"OPENROUTER_API_KEY\", \"\")\n+ monkeypatch.setattr(c, \"current_epoch\", lambda: (3, 0, 1))\n+ response = asyncio.run(c.watch())\n+ html = response.body.decode()\n+ assert 'role=\"progressbar\"' in html\n+ assert 'id=\"play\"' in html\n+ assert 'id=\"pause\"' in html\n+ assert \"new EventSource('/sse')\" in html\n+ assert \"OpenRouter key missing\" in html\n+\n+\n+def test_audit_events_are_json_sse_and_update_process_state(monkeypatch):\n+ clients = []\n+ history = []\n+ monkeypatch.setattr(c, \"SSE_CLIENTS\", clients)\n+ monkeypatch.setattr(c, \"AUDIT_HISTORY\", history)\n+ queue = asyncio.Queue()\n+ clients.append(queue)\n+\n+ async def emit():\n+ event = await c.broadcast_audit(\n+ \"progress\", \"halfway\", progress=50, phase=\"ranking\"\n+ )\n+ return event, await queue.get()\n+\n+ event, wire = asyncio.run(emit())\n+ assert event[\"progress\"] == 50\n+ assert event[\"phase\"] == \"ranking\"\n+ assert wire.startswith(\"event: audit\\ndata: {\")\n+ assert '\"message\":\"halfway\"' in wire\n","role":"user"}],"model":"~anthropic/claude-sonnet-latest"}