{"messages":[{"content":"You are a constitutional council ranking individual git commits for ownership allocation.\n\nCompare these two commits. Decide which contributed more lasting value to the project.\n\nJudge substance, not spectacle:\n- Prefer correct, lasting design and real bugfixes over churn, formatting, renames, or generated noise.\n- Prefer clarity and necessity over sheer line count. A small precise change can beat a large diffuse one.\n- Do not favor a side merely because its patch is longer or noisier.\n- Weight what the change does for the project, not the contributor's name.\n\nReturn ONLY a JSON object: {\"winner\": \"A\" or \"B\", \"ratio\": \"N:M\", \"explanation\": \"...\"}\nThe explanation must cite concrete differences in the patches (1-3 sentences).\n\nSide A — contributor: tommy-mor\nSide A — commit message:\n[7bb7145d] url stuff\n\nSide A — unified diff (full patch):\ndiff --git a/AGENTS.md b/AGENTS.md\nindex e60b9ba6012593361ef10e8fdd9439cd9932e09b..babb889d6fbfb1fa7176c9e6b7544ae17b61dd2e 100644\n--- a/AGENTS.md\n+++ b/AGENTS.md\n@@ -58,4 +58,4 @@ Use **tmux** for `cargo run --package sorter2-server` (dev server). Rebuild afte\n \n - First `cargo test` / `cargo build --release` is slow; Clojure smoke test always does a release build.\n - `legacy/` and `ideas/` are not part of the workspace build.\n-- **ItemId** for web URLs is a canonical full URL (`https://reddit.com/r/rust`). Rules live in [`server/src/url_rules/`](server/src/url_rules/) (composable Rust, not a config DSL). After changing canonicalization rules, rebuild the projection: `cargo run --package sorter2-server -- replay-index`.\n+- **ItemId** for web URLs is a canonical full URL (`https://reddit.com/r/rust`). Rules live in [`server/src/url_rules/graph.rs`](server/src/url_rules/graph.rs): a semantic graph (DFA on host + path, query params in `Context`) with a generic internet fallback for unknown sites. After changing rules, rebuild the projection: `cargo run --package sorter2-server -- replay-index`.\ndiff --git a/server/src/url_rules/engine.rs b/server/src/url_rules/engine.rs\ndeleted file mode 100644\nindex e29b6b48c08deb7bffe031b1e542b1e25a7bef15..0000000000000000000000000000000000000000\n--- a/server/src/url_rules/engine.rs\n+++ /dev/null\n@@ -1,187 +0,0 @@\n-//! Composable URL normalization primitives.\n-\n-use std::collections::HashMap;\n-\n-use url::Url;\n-\n-/// Mutable URL view used by rule combinators before serializing to a canonical string.\n-#[derive(Debug, Clone)]\n-pub struct ParsedUrl {\n- pub scheme: String,\n- pub host: String,\n- pub path_segments: Vec,\n- pub query: HashMap,\n- pub fragment: Option,\n-}\n-\n-impl ParsedUrl {\n- pub fn parse(raw: &str) -> Option {\n- let trimmed = raw.trim();\n- if trimmed.is_empty() {\n- return None;\n- }\n-\n- let with_scheme = if trimmed.contains(\"://\") {\n- trimmed.to_string()\n- } else if trimmed.starts_with(\"r/\") || trimmed.starts_with(\"/r/\") {\n- let rest = trimmed.trim_start_matches('/').trim_start_matches(\"r/\");\n- format!(\"https://reddit.com/r/{rest}\")\n- } else if trimmed.contains('.') && !trimmed.starts_with('/') {\n- format!(\"https://{trimmed}\")\n- } else {\n- trimmed.to_string()\n- };\n-\n- let url = Url::parse(&with_scheme).ok()?;\n- let host = url.host_str()?.to_string();\n- let path_segments: Vec = url\n- .path_segments()\n- .map(|segs| segs.filter(|s| !s.is_empty()).map(str::to_string).collect())\n- .unwrap_or_default();\n-\n- let mut query = HashMap::new();\n- for (k, v) in url.query_pairs() {\n- query.insert(k.into_owned(), v.into_owned());\n- }\n-\n- Some(Self {\n- scheme: url.scheme().to_string(),\n- path_segments,\n- query,\n- fragment: url.fragment().map(str::to_string),\n- host,\n- })\n- }\n-\n- pub fn with_path_segments(&self, segments: &[String]) -> Self {\n- let mut u = self.clone();\n- u.path_segments = segments.to_vec();\n- u\n- }\n-\n- pub fn to_url(&self) -> Option {\n- let mut url = if self.path_segments.is_empty() {\n- Url::parse(&format!(\"{}://{}\", self.scheme, self.host)).ok()?\n- } else {\n- let path = format!(\"/{}\", self.path_segments.join(\"/\"));\n- Url::parse(&format!(\"{}://{}{}\", self.scheme, self.host, path)).ok()?\n- };\n- if !self.query.is_empty() {\n- let mut pairs: Vec<_> = self.query.iter().collect();\n- pairs.sort_by(|a, b| a.0.cmp(b.0));\n- url.query_pairs_mut().clear();\n- for (k, v) in pairs {\n- url.query_pairs_mut().append_pair(k, v);\n- }\n- }\n- if let Some(ref frag) = self.fragment {\n- url.set_fragment(Some(frag));\n- }\n- Some(url)\n- }\n-\n- pub fn canonical_string(&self) -> Option {\n- let url = self.to_url()?;\n- let mut s = url.to_string();\n- if self.path_segments.is_empty() {\n- s = s.trim_end_matches('/').to_string();\n- }\n- Some(s)\n- }\n-}\n-\n-pub fn force_https(u: &mut ParsedUrl) {\n- if u.scheme == \"http\" {\n- u.scheme = \"https\".to_string();\n- }\n-}\n-\n-pub fn drop_fragment(u: &mut ParsedUrl) {\n- u.fragment = None;\n-}\n-\n-pub fn strip_www(u: &mut ParsedUrl) {\n- if u.host.starts_with(\"www.\") {\n- u.host = u.host[4..].to_string();\n- }\n-}\n-\n-pub fn lowercase_host(u: &mut ParsedUrl) {\n- u.host = u.host.to_ascii_lowercase();\n-}\n-\n-pub fn lowercase_path(u: &mut ParsedUrl) {\n- for seg in &mut u.path_segments {\n- *seg = seg.to_ascii_lowercase();\n- }\n-}\n-\n-pub fn clear_query(u: &mut ParsedUrl) {\n- u.query.clear();\n-}\n-\n-pub fn keep_only_query(u: &mut ParsedUrl, keys: &[&str]) {\n- u.query\n- .retain(|k, _| keys.iter().any(|want| want == &k.as_str()));\n-}\n-\n-pub fn strip_tracking_params(u: &mut ParsedUrl) {\n- u.query.retain(|k, _| {\n- let lower = k.to_ascii_lowercase();\n- !(lower.starts_with(\"utm_\")\n- || matches!(\n- lower.as_str(),\n- \"fbclid\" | \"gclid\" | \"ref\" | \"ref_src\" | \"ref_source\" | \"mc_cid\" | \"mc_eid\"\n- ))\n- });\n-}\n-\n-pub fn truncate_after_segment(u: &mut ParsedUrl, name: &str, keep: usize) {\n- if let Some(i) = u.path_segments.iter().position(|s| s == name) {\n- let end = (i + 1 + keep).min(u.path_segments.len());\n- u.path_segments.truncate(end);\n- }\n-}\n-\n-pub fn drop_listing_suffix(u: &mut ParsedUrl, suffixes: &[&str]) {\n- if u.path_segments.len() >= 3 && u.path_segments.first().map(String::as_str) == Some(\"r\") {\n- if let Some(last) = u.path_segments.last() {\n- if suffixes.iter().any(|s| *s == last.as_str()) {\n- u.path_segments.pop();\n- }\n- }\n- }\n-}\n-\n-pub fn normalize_reddit_host(u: &mut ParsedUrl) {\n- if matches!(\n- u.host.as_str(),\n- \"old.reddit.com\" | \"new.reddit.com\" | \"www.reddit.com\"\n- ) {\n- u.host = \"reddit.com\".to_string();\n- }\n-}\n-\n-pub fn rewrite_youtu_be(u: &mut ParsedUrl) {\n- if u.host == \"youtu.be\" && u.path_segments.len() == 1 {\n- let id = u.path_segments[0].clone();\n- u.host = \"youtube.com\".to_string();\n- u.path_segments = vec![\"watch\".to_string()];\n- u.query.insert(\"v\".to_string(), id);\n- }\n-}\n-\n-pub fn rewrite_youtube_shorts(u: &mut ParsedUrl) {\n- if u.host == \"youtube.com\" && u.path_segments.first().map(String::as_str) == Some(\"shorts\") {\n- if let Some(id) = u.path_segments.get(1).cloned() {\n- u.path_segments = vec![\"watch\".to_string()];\n- u.query.insert(\"v\".to_string(), id);\n- }\n- }\n-}\n-\n-pub fn normalize_youtube_host(u: &mut ParsedUrl) {\n- if matches!(u.host.as_str(), \"m.youtube.com\" | \"www.youtube.com\") {\n- u.host = \"youtube.com\".to_string();\n- }\n-}\ndiff --git a/server/src/url_rules/mod.rs b/server/src/url_rules/mod.rs\nindex 03d53bd3e82d704a01ba3fd8dd02b7d31422c0de..9e1445346ce77a49dd6a7e7713bf9c57aef353cc 100644\n--- a/server/src/url_rules/mod.rs\n+++ b/server/src/url_rules/mod.rs\n@@ -1,8 +1,12 @@\n-//! URL canonicalization and hierarchy rules for [`crate::path_types::ItemId`].\n+//! URL canonicalization and hierarchy via a semantic graph (DFA + generic fallback).\n \n-mod engine;\n+mod graph;\n+mod parse;\n mod registry;\n \n+#[cfg(test)]\n+mod registry_tests;\n+\n pub use registry::{\n canonicalize_raw, looks_like_url, navigable_breadcrumbs, parent_url, resolve_id, CanonicalResult,\n };\ndiff --git a/server/src/url_rules/registry.rs b/server/src/url_rules/registry.rs\nindex 14514e9af8385fb2b9b2f35eb9ee14d453d4b97c..8e6c012ea1fc74b864307bdacdf5a0f5db5259fc 100644\n--- a/server/src/url_rules/registry.rs\n+++ b/server/src/url_rules/registry.rs\n@@ -1,12 +1,7 @@\n-//! Per-domain canonicalization and hierarchy rules.\n+//! Public API: canonical identity and hierarchy via the URL graph.\n \n-use std::collections::HashSet;\n-\n-use super::engine::{\n- clear_query, drop_fragment, drop_listing_suffix, force_https, keep_only_query, lowercase_host,\n- lowercase_path, normalize_reddit_host, normalize_youtube_host, rewrite_youtu_be,\n- rewrite_youtube_shorts, strip_tracking_params, strip_www, truncate_after_segment, ParsedUrl,\n-};\n+use super::graph::graph;\n+use super::parse::UrlParts;\n \n /// Result of canonicalizing a raw URL string.\n #[derive(Debug, Clone, PartialEq, Eq)]\n@@ -16,71 +11,16 @@ pub struct CanonicalResult {\n pub alias_of: Option,\n }\n \n-fn apply_global(u: &mut ParsedUrl) {\n- force_https(u);\n- drop_fragment(u);\n- strip_www(u);\n- lowercase_host(u);\n- strip_tracking_params(u);\n-}\n-\n-fn normalize_reddit(u: &mut ParsedUrl) {\n- normalize_reddit_host(u);\n- lowercase_path(u);\n- truncate_after_segment(u, \"comments\", 1);\n- drop_listing_suffix(u, &[\"hot\", \"top\", \"new\", \"rising\", \"controversial\"]);\n- clear_query(u);\n-}\n-\n-fn normalize_youtube(u: &mut ParsedUrl) {\n- rewrite_youtu_be(u);\n- normalize_youtube_host(u);\n- rewrite_youtube_shorts(u);\n- keep_only_query(u, &[\"v\", \"list\"]);\n-}\n-\n-fn normalize_default(_u: &mut ParsedUrl) {\n- // Global rules only.\n-}\n-\n-fn domain_key(host: &str) -> &'static str {\n- if host == \"reddit.com\" || host.ends_with(\".reddit.com\") {\n- \"reddit.com\"\n- } else if host == \"youtube.com\" || host == \"youtu.be\" {\n- \"youtube.com\"\n- } else {\n- \"default\"\n- }\n-}\n-\n-fn normalize_for_host(u: &mut ParsedUrl) {\n- apply_global(u);\n- match domain_key(&u.host) {\n- \"reddit.com\" => normalize_reddit(u),\n- \"youtube.com\" => normalize_youtube(u),\n- _ => normalize_default(u),\n- }\n-}\n-\n-/// Structural path segments that must not become standalone tree nodes when more path follows.\n-fn structural_trailing(host: &str) -> &'static [&'static str] {\n- match domain_key(host) {\n- \"reddit.com\" => &[\"comments\"],\n- _ => &[],\n- }\n-}\n-\n /// Canonicalize a raw URL. Returns `None` if the input is not URL-like.\n pub fn canonicalize_raw(raw: &str) -> Option {\n let trimmed = raw.trim();\n if trimmed.is_empty() {\n return None;\n }\n- let mut u = ParsedUrl::parse(trimmed)?;\n- let input_snapshot = u.canonical_string()?;\n- normalize_for_host(&mut u);\n- let canonical = u.canonical_string()?;\n- let alias_of = if input_snapshot != canonical {\n+ let parts = UrlParts::parse(trimmed)?;\n+ let g = graph();\n+ let canonical = g.resolve_canonical(&parts)?;\n+ let alias_of = if trimmed != canonical {\n Some(trimmed.to_string())\n } else {\n None\n@@ -98,35 +38,14 @@ pub fn resolve_id(raw: &str) -> Option {\n \n /// Navigable ancestor URLs from domain root up to and including `canonical` (full URLs).\n pub fn navigable_breadcrumbs(canonical: &str) -> Vec {\n- let Some(u) = ParsedUrl::parse(canonical) else {\n- return vec![canonical.to_string()];\n+ let parts = match UrlParts::parse(canonical) {\n+ Some(p) => p,\n+ None => return vec![canonical.to_string()],\n };\n- let structural: HashSet<&str> = structural_trailing(&u.host).iter().copied().collect();\n- let n = u.path_segments.len();\n- let mut out = Vec::new();\n-\n- // Domain root (no path segments).\n- if let Some(base) = u.with_path_segments(&[]).canonical_string() {\n- out.push(base);\n- }\n-\n- for i in 0..n {\n- let segs: Vec = u.path_segments[..=i].to_vec();\n- let is_last = i == n - 1;\n- let seg = u.path_segments[i].as_str();\n- if structural.contains(seg) && !is_last {\n- continue;\n- }\n- if let Some(url) = u.with_path_segments(&segs).canonical_string() {\n- if out.last() != Some(&url) {\n- out.push(url);\n- }\n- }\n- }\n- out\n+ graph().breadcrumbs(&parts)\n }\n \n-/// Immediate parent scope URL, or `None` for tree root / opaque single-segment ids.\n+/// Immediate parent scope URL, or `None` for tree root.\n pub fn parent_url(canonical: &str) -> Option {\n let crumbs = navigable_breadcrumbs(canonical);\n if crumbs.len() <= 1 {\n@@ -148,88 +67,3 @@ pub fn looks_like_url(raw: &str) -> bool {\n || t.starts_with(\"youtu.be/\")\n }\n \n-#[cfg(test)]\n-mod tests {\n- use super::*;\n-\n- #[test]\n- fn reddit_post_drops_slug_and_normalizes_host() {\n- let r = canonicalize_raw(\n- \"https://old.reddit.com/r/AmItheAsshole/comments/1trnvdl/aita_for_cancelling/\",\n- )\n- .unwrap();\n- assert_eq!(\n- r.canonical,\n- \"https://reddit.com/r/amitheasshole/comments/1trnvdl\"\n- );\n- }\n-\n- #[test]\n- fn reddit_strips_query_and_listing() {\n- assert_eq!(\n- canonicalize_raw(\"https://www.reddit.com/r/rust/?sort=top\")\n- .unwrap()\n- .canonical,\n- \"https://reddit.com/r/rust\"\n- );\n- assert_eq!(\n- canonicalize_raw(\"https://www.reddit.com/r/programming/hot\")\n- .unwrap()\n- .canonical,\n- \"https://reddit.com/r/programming\"\n- );\n- }\n-\n- #[test]\n- fn reddit_short_path() {\n- assert_eq!(\n- canonicalize_raw(\"r/rust\").unwrap().canonical,\n- \"https://reddit.com/r/rust\"\n- );\n- }\n-\n- #[test]\n- fn reddit_breadcrumbs_skip_phantom_comments() {\n- let post = \"https://reddit.com/r/aww/comments/1trnvdl\";\n- let crumbs = navigable_breadcrumbs(post);\n- assert!(!crumbs.iter().any(|c| c.ends_with(\"/comments\")));\n- assert_eq!(\n- crumbs.last().map(String::as_str),\n- Some(post)\n- );\n- assert!(crumbs.contains(&\"https://reddit.com/r/aww\".to_string()));\n- }\n-\n- #[test]\n- fn reddit_parent_of_post_is_subreddit() {\n- assert_eq!(\n- parent_url(\"https://reddit.com/r/aww/comments/1trnvdl\").as_deref(),\n- Some(\"https://reddit.com/r/aww\")\n- );\n- }\n-\n- #[test]\n- fn youtube_youtu_be_and_watch_same_canonical() {\n- let a = canonicalize_raw(\"https://youtu.be/dQw4w9WgXcQ\").unwrap().canonical;\n- let b = canonicalize_raw(\"https://www.youtube.com/watch?v=dQw4w9WgXcQ&t=10\").unwrap();\n- assert_eq!(a, b.canonical);\n- assert_eq!(a, \"https://youtube.com/watch?v=dQw4w9WgXcQ\");\n- }\n-\n- #[test]\n- fn legacy_schemeless_upgrades() {\n- assert_eq!(\n- canonicalize_raw(\"reddit.com/r/rust/comments/aaa/announcing_rust_199\")\n- .unwrap()\n- .canonical,\n- \"https://reddit.com/r/rust/comments/aaa\"\n- );\n- }\n-\n- #[test]\n- fn alias_recorded_when_input_differs() {\n- let r = canonicalize_raw(\"https://youtu.be/abc123\").unwrap();\n- assert_eq!(r.canonical, \"https://youtube.com/watch?v=abc123\");\n- assert!(r.alias_of.is_some());\n- }\n-}\n\n\nSide B — contributor: tommy-mor\nSide B — commit message:\n[6e344666] Improve sorterc scan speed, errors, and ingest compile.\n\nMake scan a fast DSL parse pass with human-readable output, surface full parse_error details, and add compile --ingest for single-event replay from a log.\n\nCo-authored-by: Cursor \n\nSide B — unified diff (full patch):\ndiff --git a/server/src/offline.rs b/server/src/offline.rs\nindex 54ad0ded096a305ef8454ab2cdd1c3af71b14f5d..2db6f67e22e00a24ce673d13095644dd9fa9342d 100644\n--- a/server/src/offline.rs\n+++ b/server/src/offline.rs\n@@ -28,6 +28,10 @@ pub struct CompileResult {\n pub threads: Vec,\n pub rankings: Vec,\n pub stats: CompileStats,\n+ #[serde(skip_serializing_if = \"Option::is_none\")]\n+ pub ingest_id: Option,\n+ #[serde(skip_serializing_if = \"Option::is_none\")]\n+ pub ingest_line: Option,\n }\n \n #[derive(Debug, Clone, Serialize)]\n@@ -36,6 +40,8 @@ pub struct CompileError {\n pub error: String,\n #[serde(skip_serializing_if = \"Option::is_none\")]\n pub hint: Option,\n+ #[serde(skip_serializing_if = \"Option::is_none\")]\n+ pub parse_error: Option,\n }\n \n #[derive(Debug, Clone, Serialize)]\n@@ -50,7 +56,7 @@ pub struct MalformedIngest {\n pub id: String,\n pub room_id: String,\n pub thread_tag: String,\n- pub reason: String,\n+ pub parse_error: String,\n }\n \n #[derive(Debug, Clone, Serialize)]\n@@ -59,9 +65,36 @@ pub struct ScanResult {\n pub path: String,\n pub total_lines: usize,\n pub parsed_events: usize,\n+ pub ingest_events: usize,\n pub bad_json_lines: Vec,\n pub malformed_ingests: Vec,\n- pub skipped_ingests: usize,\n+}\n+\n+#[derive(Debug)]\n+pub enum CompileIngestError {\n+ NotFound(String),\n+ Io(std::io::Error),\n+ Compile(CompileError),\n+}\n+\n+impl CompileIngestError {\n+ pub fn into_compile_error(self) -> CompileError {\n+ match self {\n+ Self::NotFound(id) => CompileError {\n+ ok: false,\n+ error: format!(\"ingest not found: {id}\"),\n+ hint: Some(\"pass the ingest event id from events.jsonl\".into()),\n+ parse_error: None,\n+ },\n+ Self::Io(e) => CompileError {\n+ ok: false,\n+ error: format!(\"io error: {e}\"),\n+ hint: None,\n+ parse_error: None,\n+ },\n+ Self::Compile(e) => e,\n+ }\n+ }\n }\n \n fn document_stats(doc: &dsl::Document) -> CompileStats {\n@@ -166,19 +199,22 @@ fn rankings_for_simulated(\n .collect()\n }\n \n-/// Validate and simulate one `.sorter` document against optional base reducer state.\n-pub fn compile_document(\n+fn compile_document_inner(\n base: &ReducerState,\n room: &str,\n text: &str,\n+ ingest_id: Option,\n+ ingest_line: Option,\n ) -> Result {\n let room_key = room.trim();\n let scope = scope_from_room_wire(room_key);\n let validated = validate_ingest_document(base, text, &scope).map_err(|(_, message, hint)| {\n+ let parse_error = dsl::parse_full(text).err().map(|e| e.to_string());\n CompileError {\n ok: false,\n error: message,\n hint,\n+ parse_error,\n }\n })?;\n \n@@ -200,15 +236,27 @@ pub fn compile_document(\n threads: threads_in_document(text),\n rankings: rankings_for_simulated(&simulated, &scope, room_key, &validated.doc),\n stats: document_stats(&validated.doc),\n+ ingest_id,\n+ ingest_line,\n })\n }\n \n+/// Validate and simulate one `.sorter` document against optional base reducer state.\n+pub fn compile_document(\n+ base: &ReducerState,\n+ room: &str,\n+ text: &str,\n+) -> Result {\n+ compile_document_inner(base, room, text, None, None)\n+}\n+\n fn ingest_parse_error(raw: &str) -> Option {\n dsl::parse_full(raw).err().map(|e| e.to_string())\n }\n \n-fn load_events_from_jsonl(path: &Path) -> Result<(Vec<(usize, Event)>, Vec), std::io::Error> {\n+fn load_events_from_jsonl(path: &Path) -> Result<(usize, Vec<(usize, Event)>, Vec), std::io::Error> {\n let text = std::fs::read_to_string(path)?;\n+ let total_lines = text.lines().count();\n let mut events = Vec::new();\n let mut bad_json_lines = Vec::new();\n for (idx, line) in text.lines().enumerate() {\n@@ -225,61 +273,90 @@ fn load_events_from_jsonl(path: &Path) -> Result<(Vec<(usize, Event)>, Vec Result<(ReducerState, Vec), std::io::Error> {\n- let (events, bad_json_lines) = load_events_from_jsonl(path)?;\n+fn replay_events(events: &[(usize, Event)]) -> ReducerState {\n let mut state = ReducerState::default();\n for (_line_no, ev) in events {\n- state.apply_event(ev);\n+ state.apply_event(ev.clone());\n }\n- Ok((state, bad_json_lines))\n+ state\n }\n \n-/// Scan an events.jsonl for corrupt JSON lines and ingests that fail DSL replay.\n-pub fn scan_jsonl(path: &Path) -> Result {\n- let text = std::fs::read_to_string(path)?;\n- let total_lines = text.lines().count();\n- let (events, bad_json_lines) = load_events_from_jsonl(path)?;\n+/// Replay a JSONL event log into reducer state (same rules as server boot).\n+pub fn load_reducer_from_jsonl(path: &Path) -> Result<(ReducerState, Vec), std::io::Error> {\n+ let (_total_lines, events, bad_json_lines) = load_events_from_jsonl(path)?;\n+ Ok((replay_events(&events), bad_json_lines))\n+}\n \n- let mut malformed_ingests = Vec::new();\n- let mut skipped_ingests = 0usize;\n- let mut state = ReducerState::default();\n- let parsed_events = events.len();\n+/// Find one ingest in a log and compile it against all prior events as base state.\n+pub fn compile_ingest_from_log(path: &Path, ingest_id: &str) -> Result {\n+ let (_total_lines, events, bad_json_lines) = load_events_from_jsonl(path).map_err(CompileIngestError::Io)?;\n+ if !bad_json_lines.is_empty() {\n+ return Err(CompileIngestError::Compile(CompileError {\n+ ok: false,\n+ error: format!(\"jsonl has {} corrupt line(s)\", bad_json_lines.len()),\n+ hint: Some(\"fix the log or use `sorterc scan`\".into()),\n+ parse_error: None,\n+ }));\n+ }\n+\n+ let needle = ingest_id.trim();\n+ let mut found: Option<(usize, Ingest)> = None;\n+ let mut prior: Vec<(usize, Event)> = Vec::new();\n \n for (line_no, ev) in events {\n if let Event::Ingest(ref ing) = ev {\n- if let Some(reason) = ingest_parse_error(&ing.raw) {\n+ if ing.id == needle {\n+ found = Some((line_no, ing.clone()));\n+ break;\n+ }\n+ }\n+ prior.push((line_no, ev));\n+ }\n+\n+ let (line_no, ing) = found.ok_or_else(|| CompileIngestError::NotFound(needle.to_string()))?;\n+ let base = replay_events(&prior);\n+ compile_document_inner(&base, &ing.room_id, &ing.raw, Some(ing.id.clone()), Some(line_no))\n+ .map_err(CompileIngestError::Compile)\n+}\n+\n+/// Scan an events.jsonl for corrupt JSON lines and ingests whose DSL fails to parse.\n+///\n+/// This does not replay the log (which would run rank centrality on every ingest and\n+/// can take minutes on real logs). It matches what the server skips on boot: parse failure.\n+pub fn scan_jsonl(path: &Path) -> Result {\n+ let (total_lines, events, bad_json_lines) = load_events_from_jsonl(path)?;\n+\n+ let mut malformed_ingests = Vec::new();\n+ let mut ingest_events = 0usize;\n+\n+ for (line_no, ev) in &events {\n+ if let Event::Ingest(ing) = ev {\n+ ingest_events += 1;\n+ if let Some(parse_error) = ingest_parse_error(&ing.raw) {\n malformed_ingests.push(MalformedIngest {\n- line: line_no,\n+ line: *line_no,\n id: ing.id.clone(),\n room_id: ing.room_id.clone(),\n thread_tag: ing.thread_tag.clone(),\n- reason,\n+ parse_error,\n });\n }\n- let before = state.ingests_by_id.len();\n- state.apply_event(ev);\n- if state.ingests_by_id.len() == before {\n- skipped_ingests += 1;\n- }\n- } else {\n- state.apply_event(ev);\n }\n }\n \n- let ok = bad_json_lines.is_empty() && malformed_ingests.is_empty() && skipped_ingests == 0;\n+ let ok = bad_json_lines.is_empty() && malformed_ingests.is_empty();\n \n Ok(ScanResult {\n ok,\n path: path.display().to_string(),\n total_lines,\n- parsed_events,\n+ parsed_events: events.len(),\n+ ingest_events,\n bad_json_lines,\n malformed_ingests,\n- skipped_ingests,\n })\n }\n \n@@ -330,4 +407,25 @@ mod tests {\n assert!(!report.ok);\n assert_eq!(report.bad_json_lines.len(), 1);\n }\n+\n+ #[test]\n+ fn scan_reports_dsl_parse_error_detail() {\n+ let dir = tempfile::tempdir().unwrap();\n+ let path = dir.path().join(\"events.jsonl\");\n+ let ingest = serde_json::json!({\n+ \"type\": \"ingest\",\n+ \"ts\": 1,\n+ \"id\": \"bad-ingest-id\",\n+ \"raw\": \"{ no closing brace\\n~/a { body }\\n~/a 1:0 ~/b\",\n+ \"principal\": \"test\",\n+ \"room_id\": \"public\",\n+ \"thread_tag\": \"t\",\n+ });\n+ std::fs::write(&path, format!(\"{ingest}\\n\")).unwrap();\n+ let report = scan_jsonl(&path).unwrap();\n+ assert!(!report.ok);\n+ assert_eq!(report.malformed_ingests.len(), 1);\n+ assert_eq!(report.malformed_ingests[0].id, \"bad-ingest-id\");\n+ assert!(report.malformed_ingests[0].parse_error.contains(\"parse error\"));\n+ }\n }\ndiff --git a/sorterc/readme.md b/sorterc/readme.md\nindex 1ebcc3fc935541ea9e47e0458ec67a750fe19fff..e388615c34b40914ca51fc7a79cb738eebc2909b 100644\n--- a/sorterc/readme.md\n+++ b/sorterc/readme.md\n@@ -60,21 +60,33 @@ Rankings use the same structure as the server's dry-run check: parent scope, con\n \n ### `scan` — lint an `events.jsonl`\n \n-Reads a JSONL event log and reports problems without starting a server.\n+Fast single-pass check. Does **not** replay the log (replay runs rank centrality on every ingest and gets slow fast).\n \n ```bash\n cargo run -p sorterc -- scan events.jsonl\n-cargo run -p sorterc -- scan events.jsonl --pretty\n+cargo run -p sorterc -- scan events.jsonl --json\n+cargo run -p sorterc -- scan events.jsonl --json --pretty\n ```\n \n+Default output is human-readable with a blank line between each problem. Use `--json` for machine output.\n+\n Reports:\n \n - **bad JSON lines** — lines that are not valid JSON\n-- **malformed ingests** — ingest events whose `raw` DSL fails to parse\n-- **skipped ingests** — ingests dropped during replay (same behavior as server boot)\n+- **malformed ingests** — ingest events whose `raw` DSL fails to parse, with full `parse_error` text\n \n Exits 0 when clean, 1 when any issue is found.\n \n+### `compile --ingest` — compile one event from a log\n+\n+Replay all events **before** the target ingest as base state, then compile that ingest's DSL:\n+\n+```bash\n+cargo run -p sorterc -- compile --ingest cabd8adc-57ae-402d-a940-8e24339ac451 --from events.jsonl --pretty\n+```\n+\n+Output includes `ingest_id`, `ingest_line`, and rankings for that post only. This may take a while for ingests late in a large log (full replay up to that point).\n+\n ## Typical uses\n \n - Iterate on `.sorter` files in an editor and pipe through `compile` to see rankings instantly\ndiff --git a/sorterc/src/main.rs b/sorterc/src/main.rs\nindex 71382c180085cb0ad71043c852f8db5d3a48a284..5687c850d16973d28749380b8dc89f3bcebbfc56 100644\n--- a/sorterc/src/main.rs\n+++ b/sorterc/src/main.rs\n@@ -22,9 +22,15 @@ struct Cli {\n enum Command {\n /// Parse and simulate a .sorter document; emit ranking JSON to stdout.\n Compile {\n- /// `.sorter` file, or `-` for stdin.\n- file: PathBuf,\n- /// Room wire id (`public` or private room id).\n+ /// `.sorter` file, or `-` for stdin. Omit when using --ingest.\n+ file: Option,\n+ /// Compile one ingest event from a log (by event id / uuid).\n+ #[arg(long)]\n+ ingest: Option,\n+ /// events.jsonl containing the ingest (required with --ingest).\n+ #[arg(long)]\n+ from: Option,\n+ /// Room wire id (`public` or private room id). Ignored with --ingest.\n #[arg(long, default_value = \"public\")]\n room: String,\n /// Optional events.jsonl to replay before compiling (seed garden state).\n@@ -34,9 +40,13 @@ enum Command {\n #[arg(long)]\n pretty: bool,\n },\n- /// Scan an events.jsonl for corrupt JSON lines and malformed ingests.\n+ /// Scan an events.jsonl for corrupt JSON lines and DSL parse failures.\n Scan {\n file: PathBuf,\n+ /// Emit JSON instead of human-readable output.\n+ #[arg(long)]\n+ json: bool,\n+ /// Pretty-print JSON (requires --json).\n #[arg(long)]\n pretty: bool,\n },\n@@ -58,6 +68,7 @@ fn load_base_state(base: Option<&Path>) -> Result {\n let Some(path) = base else {\n return Ok(ReducerState::default());\n };\n+ eprintln!(\"sorterc: replaying {} for base state (may take a while on large logs)…\", path.display());\n let (state, bad_lines) = offline::load_reducer_from_jsonl(path)\n .with_context(|| format!(\"load base jsonl {}\", path.display()))?;\n if !bad_lines.is_empty() {\n@@ -78,25 +89,101 @@ fn print_json(value: &T, pretty: bool) -> Result<()> {\n Ok(())\n }\n \n-fn run_compile(file: PathBuf, room: String, base: Option, pretty: bool) -> Result<()> {\n- let text = read_input(&file)?;\n- let base_state = load_base_state(base.as_deref())?;\n- match offline::compile_document(&base_state, &room, &text) {\n- Ok(result) => {\n- print_json::(&result, pretty)?;\n- Ok(())\n+fn run_compile(\n+ file: Option,\n+ ingest: Option,\n+ from: Option,\n+ room: String,\n+ base: Option,\n+ pretty: bool,\n+) -> Result<()> {\n+ if ingest.is_some() ^ from.is_some() {\n+ bail!(\"--ingest and --from must be used together\");\n+ }\n+ if ingest.is_some() && (file.is_some() || base.is_some()) {\n+ bail!(\"with --ingest/--from, omit file and --base\");\n+ }\n+ if file.is_none() && ingest.is_none() {\n+ bail!(\"pass a .sorter file or --ingest --from events.jsonl\");\n+ }\n+\n+ if let (Some(ingest_id), Some(log_path)) = (ingest, from) {\n+ eprintln!(\n+ \"sorterc: compiling ingest {ingest_id} from {}…\",\n+ log_path.display()\n+ );\n+ match offline::compile_ingest_from_log(&log_path, &ingest_id) {\n+ Ok(result) => {\n+ print_json::(&result, pretty)?;\n+ Ok(())\n+ }\n+ Err(err) => {\n+ print_json::(&err.into_compile_error(), pretty)?;\n+ std::process::exit(1);\n+ }\n+ }\n+ } else {\n+ let file = file.expect(\"checked above\");\n+ let text = read_input(&file)?;\n+ let base_state = load_base_state(base.as_deref())?;\n+ match offline::compile_document(&base_state, &room, &text) {\n+ Ok(result) => {\n+ print_json::(&result, pretty)?;\n+ Ok(())\n+ }\n+ Err(err) => {\n+ print_json::(&err, pretty)?;\n+ std::process::exit(1);\n+ }\n+ }\n+ }\n+}\n+\n+fn print_scan_human(report: &ScanResult) {\n+ if report.ok {\n+ println!(\n+ \"ok: {} ({} lines, {} events, {} ingests)\",\n+ report.path, report.total_lines, report.parsed_events, report.ingest_events\n+ );\n+ return;\n+ }\n+\n+ let problems = report.bad_json_lines.len() + report.malformed_ingests.len();\n+ println!(\n+ \"{}: {} lines, {} events, {} ingests, {problems} problem(s)\",\n+ report.path, report.total_lines, report.parsed_events, report.ingest_events\n+ );\n+\n+ let mut first = true;\n+ for bad in &report.bad_json_lines {\n+ if !first {\n+ println!();\n }\n- Err(err) => {\n- print_json::(&err, pretty)?;\n- std::process::exit(1);\n+ first = false;\n+ println!(\"line {}: invalid JSON\", bad.line);\n+ println!(\"{}\", bad.message);\n+ }\n+\n+ for bad in &report.malformed_ingests {\n+ if !first {\n+ println!();\n }\n+ first = false;\n+ println!(\n+ \"line {}: ingest {} (#{} in {})\",\n+ bad.line, bad.id, bad.thread_tag, bad.room_id\n+ );\n+ println!(\"{}\", bad.parse_error);\n }\n }\n \n-fn run_scan(file: PathBuf, pretty: bool) -> Result<()> {\n- let report = offline::scan_jsonl(&file)\n- .with_context(|| format!(\"scan {}\", file.display()))?;\n- print_json::(&report, pretty)?;\n+fn run_scan(file: PathBuf, json: bool, pretty: bool) -> Result<()> {\n+ let report = offline::scan_jsonl(&file).with_context(|| format!(\"scan {}\", file.display()))?;\n+ if json {\n+ print_json::(&report, pretty)?;\n+ } else {\n+ print_scan_human(&report);\n+ }\n if !report.ok {\n std::process::exit(1);\n }\n@@ -108,10 +195,12 @@ fn main() -> Result<()> {\n match cli.cmd {\n Command::Compile {\n file,\n+ ingest,\n+ from,\n room,\n base,\n pretty,\n- } => run_compile(file, room, base, pretty),\n- Command::Scan { file, pretty } => run_scan(file, pretty),\n+ } => run_compile(file, ingest, from, room, base, pretty),\n+ Command::Scan { file, json, pretty } => run_scan(file, json, pretty),\n }\n }\n","role":"user"}],"model":"~anthropic/claude-sonnet-latest"}