{"messages":[{"content":"You are a constitutional council ranking individual git commits for ownership allocation.\n\nCompare these two commits. Decide which contributed more lasting value to the project.\n\nJudge substance, not spectacle:\n- Prefer correct, lasting design and real bugfixes over churn, formatting, renames, or generated noise.\n- Prefer clarity and necessity over sheer line count. A small precise change can beat a large diffuse one.\n- Do not favor a side merely because its patch is longer or noisier.\n- Weight what the change does for the project, not the contributor's name.\n\nReturn ONLY a JSON object: {\"winner\": \"A\" or \"B\", \"ratio\": \"N:M\", \"explanation\": \"...\"}\nThe explanation must cite concrete differences in the patches (1-3 sentences).\n\nSide A — contributor: tommy-mor\nSide A — commit message:\n[075d4d37] Fix OAuth test mocks so Clojure E2E auth flows work again.\n\nHttpServer handlers were crashing on query parsing and token POSTs, which broke Playwright login; also read alias/history via real CSS selectors.\n\nCo-authored-by: Cursor \n\nSide A — unified diff (full patch):\ndiff --git a/test/auth_login.clj b/test/auth_login.clj\nindex 6f2f00d7aa7340e63d1ac465b0a2234cec7a983f..aa63b66ccb2471b710ba3d168d0461252b39fc10 100644\n--- a/test/auth_login.clj\n+++ b/test/auth_login.clj\n@@ -14,27 +14,27 @@\n (defn- type-alias! [pg text]\n (page/evaluate pg\n (.replace\n- \"(() => { const i = document.getElementById('alias-input'); const f = document.getElementById('alias-check-form'); if (!i || !f) return;\n+ \"(() => { const i = document.getElementById('alias-input'); const f = document.getElementById('alias-check-form'); if (!i || !f) return Promise.resolve('missing-form');\n i.value = __TEXT__;\n const cf = document.getElementById('alias-claim-field'); if (cf) cf.value = i.value;\n return fetch(f.action, { method: 'POST', credentials: 'same-origin',\n headers: { 'Content-Type': 'application/x-www-form-urlencoded' },\n body: new URLSearchParams(new FormData(f)).toString() })\n .then(function (r) { return r.text(); })\n- .then(function (t) { eval(t); }); })()\"\n+ .then(function (t) { eval(t); return document.getElementById('alias-status')?.textContent || ''; }); })()\"\n \"__TEXT__\"\n- (pr-str text)))\n- (Thread/sleep 400))\n+ (pr-str text))))\n \n-(defn- element-text [pg test-id]\n+(defn- element-text [pg selector]\n (let [raw (page/evaluate pg\n- (str \"document.querySelector('[data-testid=\\\"\" test-id \"\\\"]')?.textContent || ''\"))]\n+ (str \"document.querySelector(\" (pr-str selector) \")?.textContent || ''\"))]\n (when (string? raw) (str/trim raw))))\n \n (defn- wait-for-text [pg test-id text timeout-ms]\n- (let [deadline (+ (System/currentTimeMillis) timeout-ms)]\n+ (let [deadline (+ (System/currentTimeMillis) timeout-ms)\n+ selector (str \"[data-testid=\\\"\" test-id \"\\\"]\")]\n (loop []\n- (let [got (or (element-text pg test-id) \"\")]\n+ (let [got (or (element-text pg selector) \"\")]\n (cond\n (= got text) got\n (< (System/currentTimeMillis) deadline) (do (Thread/sleep 200) (recur))\ndiff --git a/test/support/mock_oauth.clj b/test/support/mock_oauth.clj\nindex 5ba7e9be3cf6d2226648e9609a09ed45f306930f..333fe08d56cb06bac2a338cad1c73894d54c4495 100644\n--- a/test/support/mock_oauth.clj\n+++ b/test/support/mock_oauth.clj\n@@ -7,7 +7,7 @@\n (defn- query-param [query key]\n (when query\n (some (fn [pair]\n- (let [[k v] (str/split pair \"=\" 2)]\n+ (let [[k v] (str/split pair #\"=\" 2)]\n (when (= k key)\n (URLDecoder/decode (or v \"\") \"UTF-8\"))))\n (str/split query #\"&\"))))\n@@ -31,11 +31,11 @@\n \n (defn- send-redirect [^HttpExchange ex location]\n (.set (.getResponseHeaders ex) \"Location\" location)\n- (.sendResponseHeaders ex 302 -1)\n+ (.sendResponseHeaders ex 302 0)\n (.close (.getResponseBody ex)))\n \n (defn- read-form [^HttpExchange ex]\n- (let [body (slurp (.getInputStream ex))]\n+ (let [body (slurp (.getRequestBody ex))]\n {:code (query-param body \"code\")\n :grant (query-param body \"grant_type\")}))\n \n@@ -45,7 +45,7 @@\n (str/replace #\"^[Bb]earer \" \"\")))\n \n (defn- parse-token-user [token]\n- (when (str/starts-with? token \"mock:\")\n+ (when (and token (str/starts-with? token \"mock:\"))\n (parse-mock-user (subs token 5))))\n \n (defn- authorize-redirect [exchange query]\n@@ -55,7 +55,7 @@\n user (parse-mock-user mock-user)\n code (str \"mock:\" (:id user) \":\" (:login user))\n loc (str redirect-uri \"?code=\" (java.net.URLEncoder/encode code \"UTF-8\")\n- \"&state=\" (java.net.URLEncoder/encode state \"UTF-8\"))]\n+ \"&state=\" (java.net.URLEncoder/encode (or state \"\") \"UTF-8\"))]\n (send-redirect exchange loc)))\n \n (defn start-mock-oauth\n@@ -65,49 +65,56 @@\n handler\n (proxy [HttpHandler] []\n (handle [^HttpExchange exchange]\n- (let [uri (.getRequestURI exchange)\n- path (.getPath uri)\n- query (.getQuery uri)\n- method (.getRequestMethod exchange)]\n- (cond\n- ;; GitHub authorize\n- (str/ends-with? path \"/login/oauth/authorize\")\n- (authorize-redirect exchange query)\n+ (try\n+ (let [uri (.getRequestURI exchange)\n+ path (.getPath uri)\n+ query (.getQuery uri)\n+ method (.getRequestMethod exchange)]\n+ (cond\n+ ;; GitHub authorize\n+ (str/ends-with? path \"/login/oauth/authorize\")\n+ (authorize-redirect exchange query)\n \n- ;; Reddit authorize\n- (str/ends-with? path \"/api/v1/authorize\")\n- (authorize-redirect exchange query)\n+ ;; Reddit authorize\n+ (str/ends-with? path \"/api/v1/authorize\")\n+ (authorize-redirect exchange query)\n \n- ;; GitHub token\n- (and (= method \"POST\") (str/ends-with? path \"/login/oauth/access_token\"))\n- (let [code (or (:code (read-form exchange)) \"mock:1002:newbie\")]\n- (send-json exchange 200 (str \"{\\\"access_token\\\":\\\"\" code \"\\\",\\\"token_type\\\":\\\"bearer\\\"}\")))\n+ ;; GitHub token\n+ (and (= method \"POST\") (str/ends-with? path \"/login/oauth/access_token\"))\n+ (let [code (or (:code (read-form exchange)) \"mock:1002:newbie\")]\n+ (send-json exchange 200 (str \"{\\\"access_token\\\":\\\"\" code \"\\\",\\\"token_type\\\":\\\"bearer\\\"}\")))\n \n- ;; Reddit token (client_credentials for import + authorization_code for login)\n- (and (= method \"POST\") (str/ends-with? path \"/api/v1/access_token\"))\n- (let [form (read-form exchange)\n- grant (or (:grant form) \"\")\n- code (or (:code form) \"mock:t2_test:redditor\")]\n- (if (= grant \"client_credentials\")\n- (send-json exchange 200 \"{\\\"access_token\\\":\\\"app-token\\\",\\\"token_type\\\":\\\"bearer\\\",\\\"expires_in\\\":3600}\")\n- (send-json exchange 200 (str \"{\\\"access_token\\\":\\\"\" code \"\\\",\\\"token_type\\\":\\\"bearer\\\",\\\"expires_in\\\":3600}\"))))\n+ ;; Reddit token (client_credentials for import + authorization_code for login)\n+ (and (= method \"POST\") (str/ends-with? path \"/api/v1/access_token\"))\n+ (let [form (read-form exchange)\n+ grant (or (:grant form) \"\")\n+ code (or (:code form) \"mock:t2_test:redditor\")]\n+ (if (= grant \"client_credentials\")\n+ (send-json exchange 200 \"{\\\"access_token\\\":\\\"app-token\\\",\\\"token_type\\\":\\\"bearer\\\",\\\"expires_in\\\":3600}\")\n+ (send-json exchange 200 (str \"{\\\"access_token\\\":\\\"\" code \"\\\",\\\"token_type\\\":\\\"bearer\\\",\\\"expires_in\\\":3600}\"))))\n \n- ;; GitHub user\n- (= path \"/user\")\n- (let [token (bearer-token exchange)\n- user (or (parse-token-user token) {:id \"1002\" :login \"newbie\" :numeric? true})]\n- (send-json exchange 200\n- (str \"{\\\"id\\\":\" (:id user) \",\\\"login\\\":\\\"\" (:login user) \"\\\"}\")))\n+ ;; GitHub user\n+ (= path \"/user\")\n+ (let [token (bearer-token exchange)\n+ user (or (parse-token-user token) {:id \"1002\" :login \"newbie\" :numeric? true})]\n+ (send-json exchange 200\n+ (str \"{\\\"id\\\":\" (:id user) \",\\\"login\\\":\\\"\" (:login user) \"\\\"}\")))\n \n- ;; Reddit /api/v1/me\n- (str/ends-with? path \"/api/v1/me\")\n- (let [token (bearer-token exchange)\n- user (or (parse-token-user token) {:id \"t2_test\" :login \"redditor\"})]\n- (send-json exchange 200\n- (str \"{\\\"id\\\":\\\"\" (:id user) \"\\\",\\\"name\\\":\\\"\" (:login user) \"\\\"}\")))\n+ ;; Reddit /api/v1/me\n+ (str/ends-with? path \"/api/v1/me\")\n+ (let [token (bearer-token exchange)\n+ user (or (parse-token-user token) {:id \"t2_test\" :login \"redditor\"})]\n+ (send-json exchange 200\n+ (str \"{\\\"id\\\":\\\"\" (:id user) \"\\\",\\\"name\\\":\\\"\" (:login user) \"\\\"}\")))\n \n- :else\n- (send-json exchange 404 \"{\\\"error\\\":\\\"not found\\\"}\")))))]\n+ :else\n+ (send-json exchange 404 \"{\\\"error\\\":\\\"not found\\\"}\")))\n+ (catch Throwable t\n+ (binding [*out* *err*]\n+ (println \"mock-oauth handler error:\" t))\n+ (try\n+ (send-json exchange 500 \"{\\\"error\\\":\\\"mock-oauth internal\\\"}\")\n+ (catch Throwable _))))))]\n (.createContext server \"/\" handler)\n (.setExecutor server nil)\n (.start server)\ndiff --git a/test/support/mock_reddit.clj b/test/support/mock_reddit.clj\nindex a630cf0938722193e9af88382d60e777ff371be4..faa27945b6394363914c853627a0bad1e819a5f9 100644\n--- a/test/support/mock_reddit.clj\n+++ b/test/support/mock_reddit.clj\n@@ -12,7 +12,7 @@\n (defn- query-param [query key]\n (when query\n (some (fn [pair]\n- (let [[k v] (str/split pair \"=\" 2)]\n+ (let [[k v] (str/split pair #\"=\" 2)]\n (when (= k key)\n (URLDecoder/decode (or v \"\") \"UTF-8\"))))\n (str/split query #\"&\"))))\n@@ -34,11 +34,11 @@\n \n (defn- send-redirect [^HttpExchange ex location]\n (.set (.getResponseHeaders ex) \"Location\" location)\n- (.sendResponseHeaders ex 302 -1)\n+ (.sendResponseHeaders ex 302 0)\n (.close (.getResponseBody ex)))\n \n (defn- read-form [^HttpExchange ex]\n- (let [body (slurp (.getInputStream ex))]\n+ (let [body (slurp (.getRequestBody ex))]\n {:code (query-param body \"code\")\n :grant (query-param body \"grant_type\")}))\n \n@@ -48,7 +48,7 @@\n (str/replace #\"^[Bb]earer \" \"\")))\n \n (defn- parse-token-user [token]\n- (when (str/starts-with? token \"mock:\")\n+ (when (and token (str/starts-with? token \"mock:\"))\n (parse-mock-user (subs token 5))))\n \n (defn start-mock-reddit\n@@ -72,7 +72,7 @@\n user (parse-mock-user (query-param query \"mock_user\"))\n code (str \"mock:\" (:id user) \":\" (:login user))\n loc (str redirect-uri \"?code=\" (java.net.URLEncoder/encode code \"UTF-8\")\n- \"&state=\" (java.net.URLEncoder/encode state \"UTF-8\"))]\n+ \"&state=\" (java.net.URLEncoder/encode (or state \"\") \"UTF-8\"))]\n (send-redirect exchange loc))\n \n (and (= method \"POST\") (str/ends-with? path \"/api/v1/access_token\"))\n\n\nSide B — contributor: tommy-mor\nSide B — commit message:\n[7bb7145d] url stuff\n\nSide B — unified diff (full patch):\ndiff --git a/AGENTS.md b/AGENTS.md\nindex e60b9ba6012593361ef10e8fdd9439cd9932e09b..babb889d6fbfb1fa7176c9e6b7544ae17b61dd2e 100644\n--- a/AGENTS.md\n+++ b/AGENTS.md\n@@ -58,4 +58,4 @@ Use **tmux** for `cargo run --package sorter2-server` (dev server). Rebuild afte\n \n - First `cargo test` / `cargo build --release` is slow; Clojure smoke test always does a release build.\n - `legacy/` and `ideas/` are not part of the workspace build.\n-- **ItemId** for web URLs is a canonical full URL (`https://reddit.com/r/rust`). Rules live in [`server/src/url_rules/`](server/src/url_rules/) (composable Rust, not a config DSL). After changing canonicalization rules, rebuild the projection: `cargo run --package sorter2-server -- replay-index`.\n+- **ItemId** for web URLs is a canonical full URL (`https://reddit.com/r/rust`). Rules live in [`server/src/url_rules/graph.rs`](server/src/url_rules/graph.rs): a semantic graph (DFA on host + path, query params in `Context`) with a generic internet fallback for unknown sites. After changing rules, rebuild the projection: `cargo run --package sorter2-server -- replay-index`.\ndiff --git a/server/src/url_rules/engine.rs b/server/src/url_rules/engine.rs\ndeleted file mode 100644\nindex e29b6b48c08deb7bffe031b1e542b1e25a7bef15..0000000000000000000000000000000000000000\n--- a/server/src/url_rules/engine.rs\n+++ /dev/null\n@@ -1,187 +0,0 @@\n-//! Composable URL normalization primitives.\n-\n-use std::collections::HashMap;\n-\n-use url::Url;\n-\n-/// Mutable URL view used by rule combinators before serializing to a canonical string.\n-#[derive(Debug, Clone)]\n-pub struct ParsedUrl {\n- pub scheme: String,\n- pub host: String,\n- pub path_segments: Vec,\n- pub query: HashMap,\n- pub fragment: Option,\n-}\n-\n-impl ParsedUrl {\n- pub fn parse(raw: &str) -> Option {\n- let trimmed = raw.trim();\n- if trimmed.is_empty() {\n- return None;\n- }\n-\n- let with_scheme = if trimmed.contains(\"://\") {\n- trimmed.to_string()\n- } else if trimmed.starts_with(\"r/\") || trimmed.starts_with(\"/r/\") {\n- let rest = trimmed.trim_start_matches('/').trim_start_matches(\"r/\");\n- format!(\"https://reddit.com/r/{rest}\")\n- } else if trimmed.contains('.') && !trimmed.starts_with('/') {\n- format!(\"https://{trimmed}\")\n- } else {\n- trimmed.to_string()\n- };\n-\n- let url = Url::parse(&with_scheme).ok()?;\n- let host = url.host_str()?.to_string();\n- let path_segments: Vec = url\n- .path_segments()\n- .map(|segs| segs.filter(|s| !s.is_empty()).map(str::to_string).collect())\n- .unwrap_or_default();\n-\n- let mut query = HashMap::new();\n- for (k, v) in url.query_pairs() {\n- query.insert(k.into_owned(), v.into_owned());\n- }\n-\n- Some(Self {\n- scheme: url.scheme().to_string(),\n- path_segments,\n- query,\n- fragment: url.fragment().map(str::to_string),\n- host,\n- })\n- }\n-\n- pub fn with_path_segments(&self, segments: &[String]) -> Self {\n- let mut u = self.clone();\n- u.path_segments = segments.to_vec();\n- u\n- }\n-\n- pub fn to_url(&self) -> Option {\n- let mut url = if self.path_segments.is_empty() {\n- Url::parse(&format!(\"{}://{}\", self.scheme, self.host)).ok()?\n- } else {\n- let path = format!(\"/{}\", self.path_segments.join(\"/\"));\n- Url::parse(&format!(\"{}://{}{}\", self.scheme, self.host, path)).ok()?\n- };\n- if !self.query.is_empty() {\n- let mut pairs: Vec<_> = self.query.iter().collect();\n- pairs.sort_by(|a, b| a.0.cmp(b.0));\n- url.query_pairs_mut().clear();\n- for (k, v) in pairs {\n- url.query_pairs_mut().append_pair(k, v);\n- }\n- }\n- if let Some(ref frag) = self.fragment {\n- url.set_fragment(Some(frag));\n- }\n- Some(url)\n- }\n-\n- pub fn canonical_string(&self) -> Option {\n- let url = self.to_url()?;\n- let mut s = url.to_string();\n- if self.path_segments.is_empty() {\n- s = s.trim_end_matches('/').to_string();\n- }\n- Some(s)\n- }\n-}\n-\n-pub fn force_https(u: &mut ParsedUrl) {\n- if u.scheme == \"http\" {\n- u.scheme = \"https\".to_string();\n- }\n-}\n-\n-pub fn drop_fragment(u: &mut ParsedUrl) {\n- u.fragment = None;\n-}\n-\n-pub fn strip_www(u: &mut ParsedUrl) {\n- if u.host.starts_with(\"www.\") {\n- u.host = u.host[4..].to_string();\n- }\n-}\n-\n-pub fn lowercase_host(u: &mut ParsedUrl) {\n- u.host = u.host.to_ascii_lowercase();\n-}\n-\n-pub fn lowercase_path(u: &mut ParsedUrl) {\n- for seg in &mut u.path_segments {\n- *seg = seg.to_ascii_lowercase();\n- }\n-}\n-\n-pub fn clear_query(u: &mut ParsedUrl) {\n- u.query.clear();\n-}\n-\n-pub fn keep_only_query(u: &mut ParsedUrl, keys: &[&str]) {\n- u.query\n- .retain(|k, _| keys.iter().any(|want| want == &k.as_str()));\n-}\n-\n-pub fn strip_tracking_params(u: &mut ParsedUrl) {\n- u.query.retain(|k, _| {\n- let lower = k.to_ascii_lowercase();\n- !(lower.starts_with(\"utm_\")\n- || matches!(\n- lower.as_str(),\n- \"fbclid\" | \"gclid\" | \"ref\" | \"ref_src\" | \"ref_source\" | \"mc_cid\" | \"mc_eid\"\n- ))\n- });\n-}\n-\n-pub fn truncate_after_segment(u: &mut ParsedUrl, name: &str, keep: usize) {\n- if let Some(i) = u.path_segments.iter().position(|s| s == name) {\n- let end = (i + 1 + keep).min(u.path_segments.len());\n- u.path_segments.truncate(end);\n- }\n-}\n-\n-pub fn drop_listing_suffix(u: &mut ParsedUrl, suffixes: &[&str]) {\n- if u.path_segments.len() >= 3 && u.path_segments.first().map(String::as_str) == Some(\"r\") {\n- if let Some(last) = u.path_segments.last() {\n- if suffixes.iter().any(|s| *s == last.as_str()) {\n- u.path_segments.pop();\n- }\n- }\n- }\n-}\n-\n-pub fn normalize_reddit_host(u: &mut ParsedUrl) {\n- if matches!(\n- u.host.as_str(),\n- \"old.reddit.com\" | \"new.reddit.com\" | \"www.reddit.com\"\n- ) {\n- u.host = \"reddit.com\".to_string();\n- }\n-}\n-\n-pub fn rewrite_youtu_be(u: &mut ParsedUrl) {\n- if u.host == \"youtu.be\" && u.path_segments.len() == 1 {\n- let id = u.path_segments[0].clone();\n- u.host = \"youtube.com\".to_string();\n- u.path_segments = vec![\"watch\".to_string()];\n- u.query.insert(\"v\".to_string(), id);\n- }\n-}\n-\n-pub fn rewrite_youtube_shorts(u: &mut ParsedUrl) {\n- if u.host == \"youtube.com\" && u.path_segments.first().map(String::as_str) == Some(\"shorts\") {\n- if let Some(id) = u.path_segments.get(1).cloned() {\n- u.path_segments = vec![\"watch\".to_string()];\n- u.query.insert(\"v\".to_string(), id);\n- }\n- }\n-}\n-\n-pub fn normalize_youtube_host(u: &mut ParsedUrl) {\n- if matches!(u.host.as_str(), \"m.youtube.com\" | \"www.youtube.com\") {\n- u.host = \"youtube.com\".to_string();\n- }\n-}\ndiff --git a/server/src/url_rules/mod.rs b/server/src/url_rules/mod.rs\nindex 03d53bd3e82d704a01ba3fd8dd02b7d31422c0de..9e1445346ce77a49dd6a7e7713bf9c57aef353cc 100644\n--- a/server/src/url_rules/mod.rs\n+++ b/server/src/url_rules/mod.rs\n@@ -1,8 +1,12 @@\n-//! URL canonicalization and hierarchy rules for [`crate::path_types::ItemId`].\n+//! URL canonicalization and hierarchy via a semantic graph (DFA + generic fallback).\n \n-mod engine;\n+mod graph;\n+mod parse;\n mod registry;\n \n+#[cfg(test)]\n+mod registry_tests;\n+\n pub use registry::{\n canonicalize_raw, looks_like_url, navigable_breadcrumbs, parent_url, resolve_id, CanonicalResult,\n };\ndiff --git a/server/src/url_rules/registry.rs b/server/src/url_rules/registry.rs\nindex 14514e9af8385fb2b9b2f35eb9ee14d453d4b97c..8e6c012ea1fc74b864307bdacdf5a0f5db5259fc 100644\n--- a/server/src/url_rules/registry.rs\n+++ b/server/src/url_rules/registry.rs\n@@ -1,12 +1,7 @@\n-//! Per-domain canonicalization and hierarchy rules.\n+//! Public API: canonical identity and hierarchy via the URL graph.\n \n-use std::collections::HashSet;\n-\n-use super::engine::{\n- clear_query, drop_fragment, drop_listing_suffix, force_https, keep_only_query, lowercase_host,\n- lowercase_path, normalize_reddit_host, normalize_youtube_host, rewrite_youtu_be,\n- rewrite_youtube_shorts, strip_tracking_params, strip_www, truncate_after_segment, ParsedUrl,\n-};\n+use super::graph::graph;\n+use super::parse::UrlParts;\n \n /// Result of canonicalizing a raw URL string.\n #[derive(Debug, Clone, PartialEq, Eq)]\n@@ -16,71 +11,16 @@ pub struct CanonicalResult {\n pub alias_of: Option,\n }\n \n-fn apply_global(u: &mut ParsedUrl) {\n- force_https(u);\n- drop_fragment(u);\n- strip_www(u);\n- lowercase_host(u);\n- strip_tracking_params(u);\n-}\n-\n-fn normalize_reddit(u: &mut ParsedUrl) {\n- normalize_reddit_host(u);\n- lowercase_path(u);\n- truncate_after_segment(u, \"comments\", 1);\n- drop_listing_suffix(u, &[\"hot\", \"top\", \"new\", \"rising\", \"controversial\"]);\n- clear_query(u);\n-}\n-\n-fn normalize_youtube(u: &mut ParsedUrl) {\n- rewrite_youtu_be(u);\n- normalize_youtube_host(u);\n- rewrite_youtube_shorts(u);\n- keep_only_query(u, &[\"v\", \"list\"]);\n-}\n-\n-fn normalize_default(_u: &mut ParsedUrl) {\n- // Global rules only.\n-}\n-\n-fn domain_key(host: &str) -> &'static str {\n- if host == \"reddit.com\" || host.ends_with(\".reddit.com\") {\n- \"reddit.com\"\n- } else if host == \"youtube.com\" || host == \"youtu.be\" {\n- \"youtube.com\"\n- } else {\n- \"default\"\n- }\n-}\n-\n-fn normalize_for_host(u: &mut ParsedUrl) {\n- apply_global(u);\n- match domain_key(&u.host) {\n- \"reddit.com\" => normalize_reddit(u),\n- \"youtube.com\" => normalize_youtube(u),\n- _ => normalize_default(u),\n- }\n-}\n-\n-/// Structural path segments that must not become standalone tree nodes when more path follows.\n-fn structural_trailing(host: &str) -> &'static [&'static str] {\n- match domain_key(host) {\n- \"reddit.com\" => &[\"comments\"],\n- _ => &[],\n- }\n-}\n-\n /// Canonicalize a raw URL. Returns `None` if the input is not URL-like.\n pub fn canonicalize_raw(raw: &str) -> Option {\n let trimmed = raw.trim();\n if trimmed.is_empty() {\n return None;\n }\n- let mut u = ParsedUrl::parse(trimmed)?;\n- let input_snapshot = u.canonical_string()?;\n- normalize_for_host(&mut u);\n- let canonical = u.canonical_string()?;\n- let alias_of = if input_snapshot != canonical {\n+ let parts = UrlParts::parse(trimmed)?;\n+ let g = graph();\n+ let canonical = g.resolve_canonical(&parts)?;\n+ let alias_of = if trimmed != canonical {\n Some(trimmed.to_string())\n } else {\n None\n@@ -98,35 +38,14 @@ pub fn resolve_id(raw: &str) -> Option {\n \n /// Navigable ancestor URLs from domain root up to and including `canonical` (full URLs).\n pub fn navigable_breadcrumbs(canonical: &str) -> Vec {\n- let Some(u) = ParsedUrl::parse(canonical) else {\n- return vec![canonical.to_string()];\n+ let parts = match UrlParts::parse(canonical) {\n+ Some(p) => p,\n+ None => return vec![canonical.to_string()],\n };\n- let structural: HashSet<&str> = structural_trailing(&u.host).iter().copied().collect();\n- let n = u.path_segments.len();\n- let mut out = Vec::new();\n-\n- // Domain root (no path segments).\n- if let Some(base) = u.with_path_segments(&[]).canonical_string() {\n- out.push(base);\n- }\n-\n- for i in 0..n {\n- let segs: Vec = u.path_segments[..=i].to_vec();\n- let is_last = i == n - 1;\n- let seg = u.path_segments[i].as_str();\n- if structural.contains(seg) && !is_last {\n- continue;\n- }\n- if let Some(url) = u.with_path_segments(&segs).canonical_string() {\n- if out.last() != Some(&url) {\n- out.push(url);\n- }\n- }\n- }\n- out\n+ graph().breadcrumbs(&parts)\n }\n \n-/// Immediate parent scope URL, or `None` for tree root / opaque single-segment ids.\n+/// Immediate parent scope URL, or `None` for tree root.\n pub fn parent_url(canonical: &str) -> Option {\n let crumbs = navigable_breadcrumbs(canonical);\n if crumbs.len() <= 1 {\n@@ -148,88 +67,3 @@ pub fn looks_like_url(raw: &str) -> bool {\n || t.starts_with(\"youtu.be/\")\n }\n \n-#[cfg(test)]\n-mod tests {\n- use super::*;\n-\n- #[test]\n- fn reddit_post_drops_slug_and_normalizes_host() {\n- let r = canonicalize_raw(\n- \"https://old.reddit.com/r/AmItheAsshole/comments/1trnvdl/aita_for_cancelling/\",\n- )\n- .unwrap();\n- assert_eq!(\n- r.canonical,\n- \"https://reddit.com/r/amitheasshole/comments/1trnvdl\"\n- );\n- }\n-\n- #[test]\n- fn reddit_strips_query_and_listing() {\n- assert_eq!(\n- canonicalize_raw(\"https://www.reddit.com/r/rust/?sort=top\")\n- .unwrap()\n- .canonical,\n- \"https://reddit.com/r/rust\"\n- );\n- assert_eq!(\n- canonicalize_raw(\"https://www.reddit.com/r/programming/hot\")\n- .unwrap()\n- .canonical,\n- \"https://reddit.com/r/programming\"\n- );\n- }\n-\n- #[test]\n- fn reddit_short_path() {\n- assert_eq!(\n- canonicalize_raw(\"r/rust\").unwrap().canonical,\n- \"https://reddit.com/r/rust\"\n- );\n- }\n-\n- #[test]\n- fn reddit_breadcrumbs_skip_phantom_comments() {\n- let post = \"https://reddit.com/r/aww/comments/1trnvdl\";\n- let crumbs = navigable_breadcrumbs(post);\n- assert!(!crumbs.iter().any(|c| c.ends_with(\"/comments\")));\n- assert_eq!(\n- crumbs.last().map(String::as_str),\n- Some(post)\n- );\n- assert!(crumbs.contains(&\"https://reddit.com/r/aww\".to_string()));\n- }\n-\n- #[test]\n- fn reddit_parent_of_post_is_subreddit() {\n- assert_eq!(\n- parent_url(\"https://reddit.com/r/aww/comments/1trnvdl\").as_deref(),\n- Some(\"https://reddit.com/r/aww\")\n- );\n- }\n-\n- #[test]\n- fn youtube_youtu_be_and_watch_same_canonical() {\n- let a = canonicalize_raw(\"https://youtu.be/dQw4w9WgXcQ\").unwrap().canonical;\n- let b = canonicalize_raw(\"https://www.youtube.com/watch?v=dQw4w9WgXcQ&t=10\").unwrap();\n- assert_eq!(a, b.canonical);\n- assert_eq!(a, \"https://youtube.com/watch?v=dQw4w9WgXcQ\");\n- }\n-\n- #[test]\n- fn legacy_schemeless_upgrades() {\n- assert_eq!(\n- canonicalize_raw(\"reddit.com/r/rust/comments/aaa/announcing_rust_199\")\n- .unwrap()\n- .canonical,\n- \"https://reddit.com/r/rust/comments/aaa\"\n- );\n- }\n-\n- #[test]\n- fn alias_recorded_when_input_differs() {\n- let r = canonicalize_raw(\"https://youtu.be/abc123\").unwrap();\n- assert_eq!(r.canonical, \"https://youtube.com/watch?v=abc123\");\n- assert!(r.alias_of.is_some());\n- }\n-}\n","role":"user"}],"model":"openai/gpt-chat-latest"}