{"messages":[{"content":"You are a constitutional council ranking individual git commits for ownership allocation.\n\nCompare these two commits. Decide which contributed more lasting value to the project.\n\nJudge substance, not spectacle:\n- Prefer correct, lasting design and real bugfixes over churn, formatting, renames, or generated noise.\n- Prefer clarity and necessity over sheer line count. A small precise change can beat a large diffuse one.\n- Do not favor a side merely because its patch is longer or noisier.\n- Weight what the change does for the project, not the contributor's name.\n\nReturn ONLY a JSON object: {\"winner\": \"A\" or \"B\", \"ratio\": \"N:M\", \"explanation\": \"...\"}\nThe explanation must cite concrete differences in the patches (1-3 sentences).\n\nSide A — contributor: tommy-mor\nSide A — commit message:\n[af73743d] Replace GroupState with ScopeVotes and derive edges at ranking time.\n\nStore only uuid_votes and recent_votes per scope; rank centrality and pair logic rebuild edge weights on demand instead of maintaining cached state.\n\nCo-authored-by: Cursor \n\nSide A — unified diff (full patch):\ndiff --git a/server/src/events.rs b/server/src/events.rs\nindex 8a166d49b4f26835fbc2b58cb1f4bdbf002763b8..015208311f6c5c23a0e8aab068d002a69c89c4e1 100644\n--- a/server/src/events.rs\n+++ b/server/src/events.rs\n@@ -43,7 +43,7 @@ pub enum ViewEvent {\n #[derive(Debug, Clone, Serialize, Deserialize)]\n #[serde(tag = \"type\", rename_all = \"snake_case\")]\n pub enum Event {\n- /// Pairwise comparison vote (replayed into the parent node's [`crate::reducer::GroupState`] on boot).\n+ /// Pairwise comparison vote (replayed into the parent node's [`crate::reducer::ScopeVotes`] on boot).\n /// `scope` is the parent [`crate::path_types::ItemId`] string; empty string is the tree root.\n VoteRecorded {\n ts: i64,\ndiff --git a/server/src/html/mod.rs b/server/src/html/mod.rs\nindex 4eff2e19ed4d303ff8e80c1eabd8a15b4990e643..1e2e7a06856d8a62378741aaf5ed94a4ffed337e 100644\n--- a/server/src/html/mod.rs\n+++ b/server/src/html/mod.rs\n@@ -13,7 +13,7 @@ use crate::{\n form_template::template_json_compact,\n path_types::ItemId,\n ranking::{\n- connected_components_from_voted_pairs, ranked_items_subset, RankedItem, MAX_ITERS, TOL,\n+ ranked_items_subset, scope_components, RankedItem, MAX_ITERS, TOL,\n },\n reducer::{GlobalTree, NodeState},\n state::AppState,\n@@ -397,10 +397,9 @@ pub fn ranking_panel_with_highlights(\n tree: &GlobalTree,\n highlighted: &HashSet,\n ) -> Markup {\n- let group = &node.local_ranking;\n- let n = group.idx_to_item.len();\n- let (comps, _isolates) =\n- connected_components_from_voted_pairs(n, group.voted_pairs.iter().copied());\n+ let scope = &node.votes;\n+ let (comps, _isolates, _) =\n+ scope_components(scope);\n \n // Each connected component of voted items is its own ranking; isolated and\n // never-voted children fall into the \"unranked\" bucket below.\n@@ -410,7 +409,7 @@ pub fn ranking_panel_with_highlights(\n if comp.len() < 2 {\n continue;\n }\n- let ranked = ranked_items_subset(group, comp, MAX_ITERS, TOL);\n+ let ranked = ranked_items_subset(scope, comp, MAX_ITERS, TOL);\n for r in &ranked {\n ranked_ids.insert(r.item.clone());\n }\ndiff --git a/server/src/html/vote.rs b/server/src/html/vote.rs\nindex bf82aef3ad9c5f4e9e877c47dab27beb29a80b8f..3aa00c417c89a9cab3417c650b50ed7c73f08e20 100644\n--- a/server/src/html/vote.rs\n+++ b/server/src/html/vote.rs\n@@ -14,7 +14,7 @@ use crate::{\n html::{ranking_panel_with_highlights, scope_theme_style, JsBuilder},\n pair::{children_of, resolve_pair, suggest_next_pair_in_pool},\n path_types::ItemId,\n- reducer::{GlobalTree, GroupState, NodeState, VoteData},\n+ reducer::{GlobalTree, NodeState, ScopeVotes, VoteData},\n state::{parse_item_param, AppState},\n ui_action::UI_RPC_FIELD,\n };\n@@ -68,8 +68,8 @@ fn ratios_for_page(v: &VoteData, page_left: &ItemId, page_right: &ItemId) -> (i3\n }\n }\n \n-fn edge_votes(group: &GroupState, left: &ItemId, right: &ItemId) -> Vec {\n- group\n+fn edge_votes(scope: &ScopeVotes, left: &ItemId, right: &ItemId) -> Vec {\n+ scope\n .recent_votes\n .iter()\n .filter(|v| {\n@@ -113,11 +113,11 @@ fn slider_value_from_ratios(r_left: i32, r_right: i32) -> i32 {\n \n fn vote_edge_history(\n tree: &GlobalTree,\n- group: &GroupState,\n+ scope: &ScopeVotes,\n left: &ItemId,\n right: &ItemId,\n ) -> Markup {\n- let mut votes = edge_votes(group, left, right);\n+ let mut votes = edge_votes(scope, left, right);\n votes.sort_by(|a, b| b.ts.cmp(&a.ts));\n let legend_left = child_title(tree, left);\n let legend_right = child_title(tree, right);\n@@ -228,9 +228,9 @@ pub(crate) fn vote_recorded_morph(\n ) -> JsBuilder {\n let pool = children_of(tree, parent);\n let empty = NodeState::default();\n- let group = tree.get(parent).unwrap_or(&empty).local_ranking.clone();\n- let edge_history = vote_edge_history(tree, &group, left, right);\n- let next_pair = suggest_next(&group, left, right, &pool);\n+ let scope = tree.get(parent).unwrap_or(&empty).votes.clone();\n+ let edge_history = vote_edge_history(tree, &scope, left, right);\n+ let next_pair = suggest_next(&scope, left, right, &pool);\n let actions = vote_compare_actions(parent, next_pair.as_ref());\n let sidebar = vote_ranking_sidebar(tree, parent, left, right);\n JsBuilder::new()\n@@ -252,12 +252,12 @@ fn vote_compare_item_card(tree: &GlobalTree, item: &ItemId, side_class: &str) ->\n }\n \n fn suggest_next(\n- group: &GroupState,\n+ scope: &ScopeVotes,\n left: &ItemId,\n right: &ItemId,\n pool: &[ItemId],\n ) -> Option<(ItemId, ItemId)> {\n- suggest_next_pair_in_pool(group, pool, Some((left, right)))\n+ suggest_next_pair_in_pool(scope, pool, Some((left, right)))\n }\n \n pub async fn vote_page(\n@@ -284,9 +284,9 @@ pub async fn vote_page(\n };\n \n let pool = children_of(&tree, &parent);\n- let group = &parent_node.local_ranking;\n- let next_pair = suggest_next(group, &left, &right, &pool);\n- let edge_history = vote_edge_history(&tree, group, &left, &right);\n+ let scope = &parent_node.votes;\n+ let next_pair = suggest_next(&scope, &left, &right, &pool);\n+ let edge_history = vote_edge_history(&tree, &scope, &left, &right);\n \n let rpc_json = template_json_compact(&serde_json::json!({\n \"action\": \"record_vote\",\n@@ -388,8 +388,8 @@ mod polarity_tests {\n let mut tree = GlobalTree::new();\n tree.apply_vote(&parent, vote, TEST_ACTOR_UUID);\n \n- let group = &tree.get(&parent).unwrap().local_ranking;\n- let ranked = ranked_items(group);\n+ let scope = &tree.get(&parent).unwrap().votes;\n+ let ranked = ranked_items(scope);\n assert_eq!(\n ranked[0].item, left,\n \"left item should rank first when ratio favours the left\"\ndiff --git a/server/src/pair.rs b/server/src/pair.rs\nindex 42a1b1eb2adf16730d34d0fe23c13d5a75d7ba27..9873295c51526726089875bbfd2f97d7faa91872 100644\n--- a/server/src/pair.rs\n+++ b/server/src/pair.rs\n@@ -11,8 +11,8 @@ use std::collections::{HashMap, HashSet};\n \n use crate::{\n path_types::ItemId,\n- ranking::{connected_components_from_voted_pairs, ranked_items},\n- reducer::{GlobalTree, GroupState},\n+ ranking::{pair_is_voted, ranked_items, scope_components},\n+ reducer::{GlobalTree, ScopeVotes},\n };\n \n fn pairs_match(a: &ItemId, b: &ItemId, x: &ItemId, y: &ItemId) -> bool {\n@@ -23,26 +23,15 @@ fn pair_excluded(a: &ItemId, b: &ItemId, exclude: Option<(&ItemId, &ItemId)>) ->\n exclude.is_some_and(|(x, y)| pairs_match(a, b, x, y))\n }\n \n-fn pair_is_voted(group: &GroupState, a: &ItemId, b: &ItemId) -> bool {\n- let Some(&ai) = group.item_to_idx.get(a) else {\n- return false;\n- };\n- let Some(&bi) = group.item_to_idx.get(b) else {\n- return false;\n- };\n- let (i, j) = if ai < bi { (ai, bi) } else { (bi, ai) };\n- group.voted_pairs.contains(&(i, j))\n-}\n \n struct ComponentLayout {\n ids: HashMap,\n established: HashSet,\n }\n \n-fn component_layout(group: &GroupState, pool: &[ItemId]) -> ComponentLayout {\n- let n = group.idx_to_item.len();\n- let (comps, isolates) =\n- connected_components_from_voted_pairs(n, group.voted_pairs.iter().copied());\n+fn component_layout(scope: &ScopeVotes, pool: &[ItemId]) -> ComponentLayout {\n+ let (comps, isolates, idx_to_item) = scope_components(scope);\n+ let n = idx_to_item.len();\n \n let mut established = HashSet::new();\n let mut ids: HashMap = HashMap::new();\n@@ -52,14 +41,14 @@ fn component_layout(group: &GroupState, pool: &[ItemId]) -> ComponentLayout {\n }\n for &idx in comp {\n if idx < n {\n- ids.insert(group.idx_to_item[idx].clone(), comp_idx);\n+ ids.insert(idx_to_item[idx].clone(), comp_idx);\n }\n }\n }\n let mut next = comps.len();\n for &idx in &isolates {\n if idx < n {\n- ids.insert(group.idx_to_item[idx].clone(), next);\n+ ids.insert(idx_to_item[idx].clone(), next);\n next += 1;\n }\n }\n@@ -121,7 +110,7 @@ fn established_groups_in_pool<'a>(\n groups\n }\n \n-fn ranked_pool_order(group: &GroupState, pool: &[ItemId]) -> Vec {\n+fn ranked_pool_order(group: &ScopeVotes, pool: &[ItemId]) -> Vec {\n let pool_set: HashSet<_> = pool.iter().collect();\n ranked_items(group)\n .into_iter()\n@@ -132,7 +121,7 @@ fn ranked_pool_order(group: &GroupState, pool: &[ItemId]) -> Vec {\n \n /// Walk 1↔2, 2↔3, …; optional `require_unvoted` skips voted edges.\n fn zip_adjacent_pair(\n- group: &GroupState,\n+ group: &ScopeVotes,\n order: &[ItemId],\n exclude: Option<(&ItemId, &ItemId)>,\n require_unvoted: bool,\n@@ -153,7 +142,7 @@ fn zip_adjacent_pair(\n \n /// Grow the voted graph toward one component (no rank centrality).\n fn suggest_grow_pair(\n- group: &GroupState,\n+ group: &ScopeVotes,\n pool: &[ItemId],\n layout: &ComponentLayout,\n exclude: Option<(&ItemId, &ItemId)>,\n@@ -216,7 +205,7 @@ fn suggest_grow_pair(\n \n /// Pick the next pair to vote on within `pool`.\n pub fn suggest_next_pair_in_pool(\n- group: &GroupState,\n+ group: &ScopeVotes,\n pool: &[ItemId],\n exclude: Option<(&ItemId, &ItemId)>,\n ) -> Option<(ItemId, ItemId)> {\n@@ -315,7 +304,7 @@ pub fn resolve_pair(\n (None, None) => {\n let group = tree\n .get(parent)\n- .map(|n| &n.local_ranking)\n+ .map(|n| &n.votes)\n .cloned()\n .unwrap_or_default();\n suggest_next_pair_in_pool(&group, &children, None).ok_or(PairError::NoPair)\n@@ -398,7 +387,7 @@ mod tests {\n \"https://reddit.com/r/rust/b\",\n ],\n );\n- let group = tree.get(&parent).unwrap().local_ranking.clone();\n+ let group = tree.get(&parent).unwrap().votes.clone();\n let pool = children_of(&tree, &parent);\n assert!(!pair_is_voted(&group, &pool[0], &pool[1]));\n assert!(suggest_next_pair_in_pool(&group, &pool, None).is_some());\n@@ -417,7 +406,7 @@ mod tests {\n );\n let vote = test_vote(1, \"https://reddit.com/r/rust/a\", \"https://reddit.com/r/rust/b\", 2, 1);\n apply(&mut tree, &parent, vote);\n- let group = tree.get(&parent).unwrap().local_ranking.clone();\n+ let group = tree.get(&parent).unwrap().votes.clone();\n let pool = children_of(&tree, &parent);\n let (l, r) = suggest_next_pair_in_pool(&group, &pool, None).unwrap();\n let voted_ab = (l.as_str() == \"https://reddit.com/r/rust/a\" && r.as_str() == \"https://reddit.com/r/rust/b\")\n@@ -441,7 +430,7 @@ mod tests {\n let cd = test_vote(2, \"https://reddit.com/r/rust/c\", \"https://reddit.com/r/rust/d\", 2, 1);\n apply(&mut tree, &parent, ab);\n apply(&mut tree, &parent, cd);\n- let group = tree.get(&parent).unwrap().local_ranking.clone();\n+ let group = tree.get(&parent).unwrap().votes.clone();\n let pool = children_of(&tree, &parent);\n let pair = suggest_next_pair_in_pool(&group, &pool, None).unwrap();\n let chosen = pair_set(&pair);\n@@ -467,7 +456,7 @@ mod tests {\n );\n let ab = test_vote(1, \"https://reddit.com/r/rust/a\", \"https://reddit.com/r/rust/b\", 2, 1);\n apply(&mut tree, &parent, ab);\n- let group = tree.get(&parent).unwrap().local_ranking.clone();\n+ let group = tree.get(&parent).unwrap().votes.clone();\n let pool = children_of(&tree, &parent);\n let pair = suggest_next_pair_in_pool(&group, &pool, None).unwrap();\n let chosen = pair_set(&pair);\n@@ -496,7 +485,7 @@ mod tests {\n );\n let ab = test_vote(1, \"https://reddit.com/r/rust/a\", \"https://reddit.com/r/rust/b\", 2, 1);\n apply(&mut tree, &parent, ab);\n- let group = tree.get(&parent).unwrap().local_ranking.clone();\n+ let group = tree.get(&parent).unwrap().votes.clone();\n let pool = children_of(&tree, &parent);\n let pair = suggest_next_pair_in_pool(&group, &pool, None).unwrap();\n let chosen = pair_set(&pair);\n@@ -522,7 +511,7 @@ mod tests {\n let v = test_vote(1, a, b, l, r);\n apply(&mut tree, &parent, v);\n }\n- let group = tree.get(&parent).unwrap().local_ranking.clone();\n+ let group = tree.get(&parent).unwrap().votes.clone();\n let pool = children_of(&tree, &parent);\n let pair = suggest_next_pair_in_pool(&group, &pool, None).unwrap();\n let chosen = pair_set(&pair);\n@@ -550,7 +539,7 @@ mod tests {\n let v = test_vote(1, a, b, l, r);\n apply(&mut tree, &parent, v);\n }\n- let group = tree.get(&parent).unwrap().local_ranking.clone();\n+ let group = tree.get(&parent).unwrap().votes.clone();\n let pool = children_of(&tree, &parent);\n let pair = suggest_next_pair_in_pool(&group, &pool, None).unwrap();\n let chosen = pair_set(&pair);\ndiff --git a/server/src/projection_store.rs b/server/src/projection_store.rs\nindex 27fc0bb0519d9f035dceec1fc8b0fa74b00b6b40..8c1a466183a96173fe52b144fb67c2454b715fbd 100644\n--- a/server/src/projection_store.rs\n+++ b/server/src/projection_store.rs\n@@ -214,7 +214,7 @@ mod tests {\n \n let loaded = store.load_tree().unwrap();\n let root = loaded.get(&ItemId::root()).unwrap();\n- assert_eq!(root.local_ranking.idx_to_item.len(), 2);\n+ assert_eq!(crate::ranking::ranked_items(&root.votes).len(), 2);\n assert!(root.children.contains(&ItemId::opaque(\"alpha\")));\n }\n \ndiff --git a/server/src/ranking.rs b/server/src/ranking.rs\nindex 1fc3298d2b2864e9711cd262a034677e45c7090c..cc4de6da11b02135e5e6b1d2a68646cb77870b9d 100644\n--- a/server/src/ranking.rs\n+++ b/server/src/ranking.rs\n@@ -1,7 +1,7 @@\n-use std::collections::{HashMap, HashSet};\n+use std::collections::{BTreeSet, HashMap, HashSet};\n \n use crate::path_types::ItemId;\n-use crate::reducer::GroupState;\n+use crate::reducer::{canonical_pair_ids, ScopeVotes};\n \n #[derive(Debug, Clone)]\n pub struct RankedItem {\n@@ -9,15 +9,76 @@ pub struct RankedItem {\n pub score: f64,\n }\n \n-/// Power-iteration cap and convergence tolerance for rank centrality.\n pub const MAX_ITERS: usize = 10_000;\n pub const TOL: f64 = 1e-8;\n \n-/// Compute connected components over the voted-pairs graph (treated as undirected).\n-///\n-/// Returns:\n-/// - `components`: each component is a sorted list of node indices, excluding isolates.\n-/// - `isolates`: sorted list of node indices with degree 0 (no voted pairs).\n+pub fn item_index(scope: &ScopeVotes) -> (HashMap, Vec) {\n+ let mut item_strs: BTreeSet = BTreeSet::new();\n+ for vote in scope.uuid_votes.values() {\n+ item_strs.insert(vote.a.as_str().to_string());\n+ item_strs.insert(vote.b.as_str().to_string());\n+ }\n+ let mut idx_to_item: Vec = Vec::with_capacity(item_strs.len());\n+ let mut item_to_idx: HashMap = HashMap::with_capacity(item_strs.len());\n+ for s in item_strs {\n+ let id = ItemId::from_storage(&s).unwrap_or_else(|| ItemId::opaque(&s));\n+ let idx = idx_to_item.len();\n+ item_to_idx.insert(id.clone(), idx);\n+ idx_to_item.push(id);\n+ }\n+ (item_to_idx, idx_to_item)\n+}\n+\n+pub fn edges_from_scope(scope: &ScopeVotes) -> HashMap<(usize, usize), f64> {\n+ let (item_to_idx, _) = item_index(scope);\n+ let mut edges: HashMap<(usize, usize), f64> = HashMap::new();\n+ for vote in scope.uuid_votes.values() {\n+ let Some(&ai) = item_to_idx.get(&vote.a) else {\n+ continue;\n+ };\n+ let Some(&bi) = item_to_idx.get(&vote.b) else {\n+ continue;\n+ };\n+ let w_a = vote.ratio_left as f64 * vote.trust_weight;\n+ let w_b = vote.ratio_right as f64 * vote.trust_weight;\n+ if w_a > 0.0 {\n+ *edges.entry((bi, ai)).or_insert(0.0) += w_a;\n+ }\n+ if w_b > 0.0 {\n+ *edges.entry((ai, bi)).or_insert(0.0) += w_b;\n+ }\n+ }\n+ edges\n+}\n+\n+pub fn edge_weight_sum(scope: &ScopeVotes) -> f64 {\n+ edges_from_scope(scope).values().sum()\n+}\n+\n+pub fn voted_pair_indices(scope: &ScopeVotes) -> HashSet<(usize, usize)> {\n+ let (item_to_idx, _) = item_index(scope);\n+ let mut pairs = HashSet::new();\n+ for vote in scope.uuid_votes.values() {\n+ let Some(&ai) = item_to_idx.get(&vote.a) else {\n+ continue;\n+ };\n+ let Some(&bi) = item_to_idx.get(&vote.b) else {\n+ continue;\n+ };\n+ let (i, j) = if ai < bi { (ai, bi) } else { (bi, ai) };\n+ pairs.insert((i, j));\n+ }\n+ pairs\n+}\n+\n+pub fn pair_is_voted(scope: &ScopeVotes, a: &ItemId, b: &ItemId) -> bool {\n+ let (lo, hi) = canonical_pair_ids(a, b);\n+ scope\n+ .uuid_votes\n+ .keys()\n+ .any(|(_, l, h)| l == &lo && h == &hi)\n+}\n+\n pub fn connected_components_from_voted_pairs(\n n: usize,\n voted_pairs: impl Iterator,\n@@ -63,20 +124,25 @@ pub fn connected_components_from_voted_pairs(\n (comps, isolates)\n }\n \n-/// Compute rank-centrality scores for the whole group and return items sorted\n-/// by score (descending). Recomputed fresh from the edge set on every call —\n-/// there is no score cache.\n-pub fn ranked_items(group: &GroupState) -> Vec {\n- let n = group.idx_to_item.len();\n- let scores =\n- compute_scores_from_edges(n, group.edges.iter().map(|(&k, &w)| (k, w)), MAX_ITERS, TOL);\n+pub fn scope_components(scope: &ScopeVotes) -> (Vec>, Vec, Vec) {\n+ let (_, idx_to_item) = item_index(scope);\n+ let n = idx_to_item.len();\n+ let pairs = voted_pair_indices(scope);\n+ let (comps, isolates) = connected_components_from_voted_pairs(n, pairs.into_iter());\n+ (comps, isolates, idx_to_item)\n+}\n \n- let mut items: Vec = group\n- .idx_to_item\n- .iter()\n+pub fn ranked_items(scope: &ScopeVotes) -> Vec {\n+ let (_, idx_to_item) = item_index(scope);\n+ let n = idx_to_item.len();\n+ let edges = edges_from_scope(scope);\n+ let scores = compute_scores_from_edges(n, edges.into_iter(), MAX_ITERS, TOL);\n+\n+ let mut items: Vec = idx_to_item\n+ .into_iter()\n .enumerate()\n .map(|(i, item)| RankedItem {\n- item: item.clone(),\n+ item,\n score: *scores.get(i).unwrap_or(&0.0),\n })\n .collect();\n@@ -89,11 +155,8 @@ pub fn ranked_items(group: &GroupState) -> Vec {\n items\n }\n \n-/// Highest- and lowest-ranked items for a group. Returns up to `k` items from\n-/// each end with no overlap. If the group has `2*k` items or fewer, `top` holds\n-/// the full ranking and `bottom` is empty (so nothing is shown twice).\n-pub fn top_bottom(group: &GroupState, k: usize) -> (Vec, Vec) {\n- let items = ranked_items(group);\n+pub fn top_bottom(scope: &ScopeVotes, k: usize) -> (Vec, Vec) {\n+ let items = ranked_items(scope);\n if k == 0 || items.len() <= 2 * k {\n return (items, Vec::new());\n }\n@@ -115,7 +178,6 @@ pub fn compute_scores_from_edges(\n return vec![1.0];\n }\n \n- // Collect raw edges into a map for pairwise normalization.\n let mut raw: HashMap<(usize, usize), f64> = HashMap::new();\n for ((src, dst), w) in edges {\n if src >= n || dst >= n || w <= 0.0 {\n@@ -124,9 +186,6 @@ pub fn compute_scores_from_edges(\n *raw.entry((src, dst)).or_insert(0.0) += w;\n }\n \n- // Pairwise normalization: a_ij = A_ij / (A_ij + A_ji).\n- // This ensures repeated votes on the same pair don't inflate influence\n- // beyond what the ratio implies.\n let keys: Vec<(usize, usize)> = raw.keys().copied().collect();\n let mut normalized: HashMap<(usize, usize), f64> = HashMap::new();\n for (i, j) in keys {\n@@ -145,17 +204,6 @@ pub fn compute_scores_from_edges(\n }\n }\n \n- // Rank Centrality (Negahban, Oh, Shah 2012, §3.1):\n- // P_ij = (1/d_max) * A_ij for i ≠ j compared\n- // P_ii = 1 - (1/d_max) * Σ_k A_ik\n- // where d_i is the *degree* (number of distinct neighbors compared) and\n- // d_max = max_i d_i. Using the unweighted degree — not the sum of\n- // pairwise-normalized weights — is what guarantees aperiodicity: it\n- // forces P_ii > 0 for every non-maximum-degree node, and for max-degree\n- // nodes whenever any neighbor weight is below 1 (i.e. not a unanimous\n- // loss). Without this, regular comparison graphs (e.g. a pure star at\n- // ratio 2:1) produce a bipartite chain that oscillates instead of\n- // converging — see issue #146.\n let mut out_edges: Vec> = vec![Vec::new(); n];\n let mut neighbors: Vec> = vec![HashSet::new(); n];\n \n@@ -213,11 +261,8 @@ pub fn compute_scores_from_edges(\n scores\n }\n \n-/// Rank-centrality within a subset of items (an induced subgraph), using the group's aggregated edges.\n-///\n-/// `idxs` are indices into `group.idx_to_item`. The returned items use the original item names.\n pub fn ranked_items_subset(\n- group: &GroupState,\n+ scope: &ScopeVotes,\n idxs: &[usize],\n max_iters: usize,\n tol: f64,\n@@ -226,13 +271,15 @@ pub fn ranked_items_subset(\n return vec![];\n }\n \n- // Map original idx -> compact idx [0..m)\n+ let (_, idx_to_item) = item_index(scope);\n+ let edges = edges_from_scope(scope);\n+\n let mut map: HashMap = HashMap::with_capacity(idxs.len());\n for (j, &i) in idxs.iter().enumerate() {\n map.insert(i, j);\n }\n \n- let edges_iter = group.edges.iter().filter_map(|(&(src, dst), &w)| {\n+ let edges_iter = edges.into_iter().filter_map(|((src, dst), w)| {\n let s = *map.get(&src)?;\n let d = *map.get(&dst)?;\n Some(((s, d), w))\n@@ -240,12 +287,11 @@ pub fn ranked_items_subset(\n \n let scores = compute_scores_from_edges(idxs.len(), edges_iter, max_iters, tol);\n \n- // Filter out entries where idx_to_item doesn't have the slot (shouldn't happen, but be safe).\n let mut items: Vec = idxs\n .iter()\n .enumerate()\n .filter_map(|(j, &orig)| {\n- let item = group.idx_to_item.get(orig)?.clone();\n+ let item = idx_to_item.get(orig)?.clone();\n Some(RankedItem {\n item,\n score: *scores.get(j).unwrap_or(&0.0),\n@@ -261,8 +307,8 @@ pub fn ranked_items_subset(\n items\n }\n \n-pub fn group_summary_scores(group: &GroupState) -> HashMap {\n- ranked_items(group)\n+pub fn group_summary_scores(scope: &ScopeVotes) -> HashMap {\n+ ranked_items(scope)\n .into_iter()\n .map(|r| (r.item, r.score))\n .collect()\n@@ -274,32 +320,26 @@ mod tests {\n use crate::identity::{DEFAULT_PSEUDONYM, TEST_ACTOR_UUID};\n use crate::reducer::VoteData;\n \n- fn mk_group() -> GroupState {\n- GroupState::new()\n+ fn mk_scope() -> ScopeVotes {\n+ ScopeVotes::default()\n }\n \n fn vote(ts: i64, a: &str, b: &str, l: i32, r: i32) -> VoteData {\n VoteData::from_event(ts, a, b, l, r, DEFAULT_PSEUDONYM.to_string(), 1.0).unwrap()\n }\n \n- fn apply(g: &mut GroupState, v: VoteData) {\n- g.apply_vote(v, TEST_ACTOR_UUID);\n+ fn apply(scope: &mut ScopeVotes, v: VoteData) {\n+ scope.apply_vote(v, TEST_ACTOR_UUID);\n }\n \n- /// Regression for issue #146: pure forward star at default `>` ratio (2:1).\n- /// Under the old (sum-of-weights) divisor every node had P_ii = 0 and the\n- /// chain was bipartite; power iteration oscillated and returned the\n- /// uniform initial distribution after an even number of steps. Using the\n- /// paper's degree-based d_max gives every node a positive self-loop and\n- /// the chain converges to the correct stationary distribution.\n #[test]\n fn star_topology_winner_at_top_via_subset() {\n- let mut g = mk_group();\n- g.apply_vote(vote(1, \"zebra\", \"alpha\", 2, 1), TEST_ACTOR_UUID);\n- g.apply_vote(vote(2, \"zebra\", \"beta\", 2, 1), TEST_ACTOR_UUID);\n+ let mut scope = mk_scope();\n+ apply(&mut scope, vote(1, \"zebra\", \"alpha\", 2, 1));\n+ apply(&mut scope, vote(2, \"zebra\", \"beta\", 2, 1));\n \n- let mut items: Vec<(usize, String)> = g\n- .idx_to_item\n+ let (_, idx_to_item) = item_index(&scope);\n+ let mut items: Vec<(usize, String)> = idx_to_item\n .iter()\n .enumerate()\n .map(|(i, it)| (i, it.as_str().to_string()))\n@@ -307,78 +347,51 @@ mod tests {\n items.sort_by(|a, b| a.1.cmp(&b.1));\n let idxs: Vec = items.iter().map(|(i, _)| *i).collect();\n \n- let ranked = ranked_items_subset(&g, &idxs, 10000, 1e-8);\n- for r in &ranked {\n- eprintln!(\"{}: {}\", r.item.as_str(), r.score);\n- }\n- assert_eq!(\n- ranked[0].item.as_str(),\n- \"zebra\",\n- \"zebra won both votes and should rank #1\"\n- );\n+ let ranked = ranked_items_subset(&scope, &idxs, 10000, 1e-8);\n+ assert_eq!(ranked[0].item.as_str(), \"zebra\");\n }\n \n #[test]\n fn top_bottom_splits_ends_without_overlap() {\n- let mut g = mk_group();\n- // Chain a > b > c > d > e > f so ranks are well separated.\n+ let mut scope = mk_scope();\n for (hi, lo) in [(\"a\", \"b\"), (\"b\", \"c\"), (\"c\", \"d\"), (\"d\", \"e\"), (\"e\", \"f\")] {\n- apply(&mut g, vote(1, hi, lo, 2, 1));\n+ apply(&mut scope, vote(1, hi, lo, 2, 1));\n }\n- let (top, bottom) = top_bottom(&g, 2);\n+ let (top, bottom) = top_bottom(&scope, 2);\n assert_eq!(top.len(), 2);\n assert_eq!(bottom.len(), 2);\n- // No overlap between the two ends.\n for t in &top {\n assert!(bottom.iter().all(|b| b.item != t.item));\n }\n- // Best item ranks above the worst item.\n assert!(top[0].score >= bottom[bottom.len() - 1].score);\n }\n \n #[test]\n fn top_bottom_small_group_has_empty_bottom() {\n- let mut g = mk_group();\n- apply(&mut g, vote(1, \"a\", \"b\", 2, 1));\n- let (top, bottom) = top_bottom(&g, 5);\n+ let mut scope = mk_scope();\n+ apply(&mut scope, vote(1, \"a\", \"b\", 2, 1));\n+ let (top, bottom) = top_bottom(&scope, 5);\n assert_eq!(top.len(), 2);\n assert!(bottom.is_empty());\n }\n \n #[test]\n fn connected_components_split_disconnected_pairs() {\n- let mut g = mk_group();\n- // Two disconnected edges: (a,b) and (c,d)\n- apply(&mut g, vote(1, \"a\", \"b\", 3, 1));\n- apply(&mut g, vote(2, \"c\", \"d\", 3, 1));\n-\n- let n = g.idx_to_item.len();\n- let (mut comps, isolates) =\n- connected_components_from_voted_pairs(n, g.voted_pairs.iter().copied());\n+ let mut scope = mk_scope();\n+ apply(&mut scope, vote(1, \"a\", \"b\", 3, 1));\n+ apply(&mut scope, vote(2, \"c\", \"d\", 3, 1));\n+\n+ let (_, idx_to_item) = item_index(&scope);\n+ let (mut comps, isolates, _) = scope_components(&scope);\n assert!(isolates.is_empty());\n- // Order-independent: sort components by their item names for stable assert.\n comps.sort_by_key(|c| {\n c.iter()\n- .map(|&i| g.idx_to_item[i].clone())\n+ .map(|&i| idx_to_item[i].clone())\n .collect::>()\n });\n assert_eq!(comps.len(), 2);\n- let comp0 = comps[0]\n- .iter()\n- .map(|&i| g.idx_to_item[i].as_str())\n- .collect::>();\n- let comp1 = comps[1]\n- .iter()\n- .map(|&i| g.idx_to_item[i].as_str())\n- .collect::>();\n- assert_eq!(comp0, vec![\"a\", \"b\"]);\n- assert_eq!(comp1, vec![\"c\", \"d\"]);\n }\n \n- /// A random spanning tree over 26 items needs only n−1 = 25 pairwise votes.\n- /// When each vote uses the \"perfect\" ratio (strength left : strength right =\n- /// (idx_left+1) : (idx_right+1)), rank centrality recovers the true order.\n- /// See `rank-eric.py` (Eric's demo of Negahban–Oh–Shah rank centrality).\n #[test]\n fn twenty_five_random_votes_perfect_ratios_sort_alphabet() {\n use rand::seq::SliceRandom;\n@@ -390,13 +403,13 @@ mod tests {\n let mut perm: Vec = (0..N).collect();\n perm.shuffle(&mut rng);\n \n- let mut g = mk_group();\n+ let mut scope = mk_scope();\n for k in 1..N {\n let i = *perm[..k].choose(&mut rng).unwrap();\n let j = perm[k];\n let (a, b) = (letters[i], letters[j]);\n apply(\n- &mut g,\n+ &mut scope,\n vote(\n k as i64,\n &a.to_string(),\n@@ -407,34 +420,25 @@ mod tests {\n );\n }\n \n- let ranked = ranked_items(&g);\n+ let ranked = ranked_items(&scope);\n assert_eq!(ranked.len(), N);\n for (rank, item) in ranked.iter().enumerate() {\n let expected = char::from(b'a' + (N - 1 - rank) as u8);\n- assert_eq!(\n- item.item.as_str(),\n- expected.to_string(),\n- \"rank {rank}: expected '{expected}', got '{}'\",\n- item.item.as_str()\n- );\n+ assert_eq!(item.item.as_str(), expected.to_string());\n }\n }\n \n #[test]\n fn subset_ranking_ranks_within_component_only() {\n- let mut g = mk_group();\n- apply(&mut g, vote(1, \"a\", \"b\", 3, 1)); // a > b\n- apply(&mut g, vote(2, \"c\", \"d\", 1, 4)); // d > c\n-\n- let (comps, _) = connected_components_from_voted_pairs(\n- g.idx_to_item.len(),\n- g.voted_pairs.iter().copied(),\n- );\n+ let mut scope = mk_scope();\n+ apply(&mut scope, vote(1, \"a\", \"b\", 3, 1));\n+ apply(&mut scope, vote(2, \"c\", \"d\", 1, 4));\n+\n+ let (comps, _, _) = scope_components(&scope);\n assert_eq!(comps.len(), 2);\n \n- // Rank each component and ensure winner is first within that component.\n for comp in comps {\n- let ranked = ranked_items_subset(&g, &comp, 10000, 1e-8);\n+ let ranked = ranked_items_subset(&scope, &comp, 10000, 1e-8);\n assert_eq!(ranked.len(), 2);\n let names = ranked.iter().map(|r| r.item.as_str()).collect::>();\n if names.contains(&\"a\") {\ndiff --git a/server/src/reducer.rs b/server/src/reducer.rs\nindex 8c4c9f83635cbcbb037d680dbae2aa99cb2dc785..e6d8c8d2fe763f4928cfbd7c300c8d9768968a3f 100644\n--- a/server/src/reducer.rs\n+++ b/server/src/reducer.rs\n@@ -4,6 +4,24 @@ use serde::{Deserialize, Serialize};\n \n use crate::path_types::ItemId;\n \n+/// `(actor_uuid, min_item_id, max_item_id)` — one vote slot per human per pair.\n+pub type UuidVoteKey = (String, String, String);\n+\n+pub fn canonical_pair_ids(a: &ItemId, b: &ItemId) -> (String, String) {\n+ let ak = a.as_str().to_string();\n+ let bk = b.as_str().to_string();\n+ if ak <= bk {\n+ (ak, bk)\n+ } else {\n+ (bk, ak)\n+ }\n+}\n+\n+pub fn uuid_vote_key(actor_uuid: &str, a: &ItemId, b: &ItemId) -> UuidVoteKey {\n+ let (lo, hi) = canonical_pair_ids(a, b);\n+ (actor_uuid.to_string(), lo, hi)\n+}\n+\n /// Parsed pairwise vote (internal representation).\n #[derive(Debug, Clone, Serialize, Deserialize, PartialEq)]\n pub struct VoteData {\n@@ -44,118 +62,20 @@ impl VoteData {\n }\n }\n \n+/// Votes cast within one ranking scope (parent node). Edges and rankings are\n+/// derived on demand from [`Self::uuid_votes`].\n #[derive(Debug, Clone, Default, Serialize, Deserialize)]\n-pub struct GroupState {\n- pub item_to_idx: HashMap,\n- pub idx_to_item: Vec,\n- pub edges: HashMap<(usize, usize), f64>,\n- pub voted_pairs: HashSet<(usize, usize)>,\n- /// Latest vote per `(actor_uuid, min_idx, max_idx)` — Sybil dedup anchor.\n- pub uuid_votes: HashMap<(String, usize, usize), VoteData>,\n+pub struct ScopeVotes {\n+ pub uuid_votes: HashMap,\n pub recent_votes: Vec,\n }\n \n-impl GroupState {\n- pub fn new() -> Self {\n- Self {\n- item_to_idx: HashMap::new(),\n- idx_to_item: Vec::new(),\n- edges: HashMap::new(),\n- voted_pairs: HashSet::new(),\n- uuid_votes: HashMap::new(),\n- recent_votes: Vec::new(),\n- }\n- }\n-\n- fn ensure_item(&mut self, item: &ItemId) -> usize {\n- if let Some(&idx) = self.item_to_idx.get(item) {\n- return idx;\n- }\n- let idx = self.idx_to_item.len();\n- self.idx_to_item.push(item.clone());\n- self.item_to_idx.insert(item.clone(), idx);\n- idx\n- }\n-\n- fn add_edge_weight(&mut self, src: usize, dst: usize, w: f64) {\n- if w <= 0.0 {\n- return;\n- }\n- *self.edges.entry((src, dst)).or_insert(0.0) += w;\n- }\n-\n- fn subtract_edge_weight(&mut self, src: usize, dst: usize, w: f64) {\n- if w <= 0.0 {\n- return;\n- }\n- if let Some(entry) = self.edges.get_mut(&(src, dst)) {\n- *entry -= w;\n- if *entry <= 0.0 {\n- self.edges.remove(&(src, dst));\n- }\n- }\n- }\n-\n- fn apply_weights(&mut self, vote: &VoteData, a_idx: usize, b_idx: usize) {\n- let w_a = vote.ratio_left as f64 * vote.trust_weight;\n- let w_b = vote.ratio_right as f64 * vote.trust_weight;\n- let (i, j) = if a_idx < b_idx {\n- (a_idx, b_idx)\n- } else {\n- (b_idx, a_idx)\n- };\n- self.voted_pairs.insert((i, j));\n- self.add_edge_weight(b_idx, a_idx, w_a);\n- self.add_edge_weight(a_idx, b_idx, w_b);\n- }\n-\n- fn rollback_weights(&mut self, vote: &VoteData) {\n- let a_idx = match self.item_to_idx.get(&vote.a) {\n- Some(&i) => i,\n- None => return,\n- };\n- let b_idx = match self.item_to_idx.get(&vote.b) {\n- Some(&i) => i,\n- None => return,\n- };\n- let w_a = vote.ratio_left as f64 * vote.trust_weight;\n- let w_b = vote.ratio_right as f64 * vote.trust_weight;\n- self.subtract_edge_weight(b_idx, a_idx, w_a);\n- self.subtract_edge_weight(a_idx, b_idx, w_b);\n- }\n-\n- /// Apply a validated vote, deduplicating by `actor_uuid` per unordered pair.\n+impl ScopeVotes {\n pub fn apply_vote(&mut self, vote: VoteData, actor_uuid: &str) {\n- let a_idx = self.ensure_item(&vote.a);\n- let b_idx = self.ensure_item(&vote.b);\n- let (i, j) = if a_idx < b_idx {\n- (a_idx, b_idx)\n- } else {\n- (b_idx, a_idx)\n- };\n-\n- let dedupe_key = (actor_uuid.to_string(), i, j);\n- if let Some(old) = self.uuid_votes.get(&dedupe_key).cloned() {\n- self.rollback_weights(&old);\n- }\n-\n- self.apply_weights(&vote, a_idx, b_idx);\n- self.uuid_votes.insert(dedupe_key, vote.clone());\n+ let key = uuid_vote_key(actor_uuid, &vote.a, &vote.b);\n+ self.uuid_votes.insert(key, vote.clone());\n self.recent_votes.push(vote);\n }\n-\n- /// Rebuild edge weights from deduped uuid votes (load path — no rollback).\n- pub fn ingest_uuid_vote(&mut self, vote: VoteData, actor_uuid: &str) {\n- let a_idx = self.ensure_item(&vote.a);\n- let b_idx = self.ensure_item(&vote.b);\n- let (i, j) = if a_idx < b_idx {\n- (a_idx, b_idx)\n- } else {\n- (b_idx, a_idx)\n- };\n- self.apply_weights(&vote, a_idx, b_idx);\n- self.uuid_votes.insert((actor_uuid.to_string(), i, j), vote);\n- }\n }\n \n /// Structured data imported from Reddit or elsewhere.\n@@ -179,7 +99,7 @@ pub struct NodeState {\n /// Ephemeral display view (Reddit title/author/etc.; not event-logged).\n pub data: Option,\n pub children: HashSet,\n- pub local_ranking: GroupState,\n+ pub votes: ScopeVotes,\n }\n \n impl NodeState {\n@@ -242,7 +162,7 @@ impl GlobalTree {\n if let Some(node) = self.nodes.get_mut(parent) {\n node.children.insert(vote.a.clone());\n node.children.insert(vote.b.clone());\n- node.local_ranking.apply_vote(vote, actor_uuid);\n+ node.votes.apply_vote(vote, actor_uuid);\n }\n }\n \n@@ -276,6 +196,7 @@ impl GlobalTree {\n #[cfg(test)]\n mod tests {\n use super::*;\n+ use crate::ranking::edge_weight_sum;\n \n fn vote(ts: i64, a: &str, b: &str, l: i32, r: i32, pseudonym: &str) -> VoteData {\n VoteData {\n@@ -310,26 +231,23 @@ mod tests {\n \n #[test]\n fn same_uuid_replaces_prior_vote_on_pair() {\n- let mut g = GroupState::new();\n+ let mut scope = ScopeVotes::default();\n let uuid = \"u1\";\n- g.apply_vote(vote(1, \"a\", \"b\", 2, 1, \"alice\"), uuid);\n- let first_total: f64 = g.edges.values().sum();\n- assert_eq!(first_total, 3.0);\n+ scope.apply_vote(vote(1, \"a\", \"b\", 2, 1, \"alice\"), uuid);\n+ assert_eq!(edge_weight_sum(&scope), 3.0);\n \n- g.apply_vote(vote(2, \"a\", \"b\", 0, 1, \"bob\"), uuid);\n- let second_total: f64 = g.edges.values().sum();\n- assert_eq!(second_total, 1.0);\n- assert_eq!(g.uuid_votes.len(), 1);\n+ scope.apply_vote(vote(2, \"a\", \"b\", 0, 1, \"bob\"), uuid);\n+ assert_eq!(edge_weight_sum(&scope), 1.0);\n+ assert_eq!(scope.uuid_votes.len(), 1);\n }\n \n #[test]\n fn different_uuids_both_count() {\n- let mut g = GroupState::new();\n- g.apply_vote(vote(1, \"a\", \"b\", 2, 1, \"alice\"), \"u1\");\n- g.apply_vote(vote(2, \"a\", \"b\", 0, 1, \"bob\"), \"u2\");\n- let total: f64 = g.edges.values().sum();\n- assert_eq!(total, 4.0);\n- assert_eq!(g.uuid_votes.len(), 2);\n+ let mut scope = ScopeVotes::default();\n+ scope.apply_vote(vote(1, \"a\", \"b\", 2, 1, \"alice\"), \"u1\");\n+ scope.apply_vote(vote(2, \"a\", \"b\", 0, 1, \"bob\"), \"u2\");\n+ assert_eq!(edge_weight_sum(&scope), 4.0);\n+ assert_eq!(scope.uuid_votes.len(), 2);\n }\n \n #[test]\ndiff --git a/server/src/state.rs b/server/src/state.rs\nindex 8dabc93e95c39cbe18d69596dee79683b384ef86..dcb82ff4beeaac8f0820de0e0131ca1f6bd81dcc 100644\n--- a/server/src/state.rs\n+++ b/server/src/state.rs\n@@ -269,7 +269,7 @@ mod tests {\n use super::{normalize_scope, parse_item_param, AppConfig, AppState};\n use crate::{\n event_log::EventLog, events::Event, path_types::ItemId, projection_apply,\n- projection_store::ProjectionStore, reducer::EntityData,\n+ projection_store::ProjectionStore, ranking::edge_weight_sum, reducer::EntityData,\n };\n \n fn event_record(seq: u64, event: Event) -> crate::events::EventRecord {\n@@ -442,7 +442,7 @@ mod tests {\n assert_eq!(projection_store.last_applied_event_count().unwrap(), 1);\n let first = projection_store.scope_tree(&ItemId::root()).unwrap();\n let first_root = first.get(&ItemId::root()).unwrap();\n- let first_edge_total: f64 = first_root.local_ranking.edges.values().sum();\n+ let first_edge_total = edge_weight_sum(&first_root.votes);\n assert_eq!(first_edge_total, 3.0);\n \n super::catch_up_projection(&log, &projection_store)\n@@ -451,7 +451,7 @@ mod tests {\n assert_eq!(projection_store.last_applied_event_count().unwrap(), 1);\n let second = projection_store.scope_tree(&ItemId::root()).unwrap();\n let second_root = second.get(&ItemId::root()).unwrap();\n- let second_edge_total: f64 = second_root.local_ranking.edges.values().sum();\n+ let second_edge_total = edge_weight_sum(&second_root.votes);\n assert_eq!(second_edge_total, first_edge_total);\n }\n \n@@ -529,9 +529,8 @@ mod tests {\n let root = projected.get(&ItemId::root()).unwrap();\n assert!(root.children.contains(&ItemId::parse(\"alpha\").unwrap()));\n assert!(root.children.contains(&ItemId::parse(\"beta\").unwrap()));\n- assert_eq!(root.local_ranking.idx_to_item.len(), 2);\n- let edge_total: f64 = root.local_ranking.edges.values().sum();\n- assert_eq!(edge_total, 3.0);\n+ assert_eq!(crate::ranking::ranked_items(&root.votes).len(), 2);\n+ assert_eq!(edge_weight_sum(&root.votes), 3.0);\n }\n \n #[tokio::test]\n@@ -620,7 +619,7 @@ mod tests {\n let root = tree.get(&ItemId::root()).unwrap();\n assert!(root.children.contains(&ItemId::parse(\"beta\").unwrap()));\n assert!(root.children.contains(&ItemId::parse(\"gamma\").unwrap()));\n- assert_eq!(root.local_ranking.idx_to_item.len(), 3);\n+ assert_eq!(crate::ranking::ranked_items(&root.votes).len(), 3);\n }\n \n #[test]\ndiff --git a/server/src/storage_schema.rs b/server/src/storage_schema.rs\nindex 67c9f4ab2e1865f8da81b6735dd2a05b87e5e366..fe2671b876f3df77fdfd402dbc845ff1eb3512cd 100644\n--- a/server/src/storage_schema.rs\n+++ b/server/src/storage_schema.rs\n@@ -3,86 +3,53 @@\n //!\n //! Votes are stored as deduped `uuid_votes` entries plus an append-only\n //! `recent_votes` audit list. Edge weights for rank centrality are derived\n-//! from `uuid_votes` on read, not incrementally merged in RocksDB.\n+//! from `uuid_votes` on read, not stored in RocksDB.\n \n-use std::collections::{HashSet};\n+use std::collections::HashSet;\n \n use durable::{Batch, Db, Durable, Leaf, List, Map};\n \n use crate::{\n path_types::ItemId,\n- reducer::{EntityData, GroupState, NodeState, VoteData},\n+ reducer::{EntityData, NodeState, ScopeVotes, VoteData, UuidVoteKey, uuid_vote_key},\n storage_dto::{\n decode_entity_data, decode_vote, encode_entity_data, encode_vote, parse_stored_id,\n StoredEntityDataV1, StoredVoteV1,\n },\n };\n \n-/// `(actor_uuid, min_item_id, max_item_id)` — one vote slot per human per pair.\n-pub type UuidVoteKey = (String, String, String);\n-\n /// One node in the fractal tree, exploded into precisely-updatable collections.\n #[derive(Durable)]\n #[allow(dead_code)]\n pub struct NodeSchema {\n- /// Presence marker (a node \"exists\" once ensured/voted/imported).\n pub present: Leaf,\n- /// Domain-specific derived view (Reddit title/author/…); absent => None.\n pub data: Leaf,\n- /// Child ids (a set; value is always `true`).\n pub children: Map>,\n- /// Latest vote per actor per unordered pair; edges are derived from this on read.\n pub uuid_votes: Map>,\n- /// Recent votes, append-only oldest-first (cap applied on read).\n pub recent_votes: List>,\n- /// When ephemeral Reddit display content was last fetched (ms); absent after eviction.\n pub fetched_at: Leaf,\n }\n \n-/// The single database root: nodes, identity maps, view counts, and metadata.\n #[derive(Durable)]\n #[allow(dead_code)]\n pub struct Store {\n pub nodes: Map,\n- /// Global pseudonym → actor UUID (Sybil dedup anchor).\n pub pseudonyms: Map>,\n pub proj_meta: Map>,\n pub view_counts: Map>,\n pub view_meta: Map>,\n }\n \n-/// Max recent votes returned when loading a node (query-time cap only).\n pub const RECENT_VOTES_CAP: u64 = 200;\n \n fn id_key(id: &ItemId) -> String {\n id.as_str().to_string()\n }\n \n-fn pair_keys(a: &ItemId, b: &ItemId) -> (String, String) {\n- let ak = id_key(a);\n- let bk = id_key(b);\n- if ak <= bk {\n- (ak, bk)\n- } else {\n- (bk, ak)\n- }\n-}\n-\n-pub fn uuid_vote_key(actor_uuid: &str, a: &ItemId, b: &ItemId) -> UuidVoteKey {\n- let (lo, hi) = pair_keys(a, b);\n- (actor_uuid.to_string(), lo, hi)\n-}\n-\n-/// Path to a node by id.\n pub fn node(id: &ItemId) -> durable::Path {\n Store::root().nodes().key(&id_key(id))\n }\n \n-// ---------------------------------------------------------------------------\n-// Reconstruction (durable -> in-memory)\n-// ---------------------------------------------------------------------------\n-\n-/// Reconstruct a node's in-memory state, or `None` if the node does not exist.\n pub fn load_node_state(db: &Db, id: &ItemId) -> durable::Result> {\n let np = node(id);\n let present = np.present().get(db)?.unwrap_or(false);\n@@ -100,47 +67,39 @@ pub fn load_node_state(db: &Db, id: &ItemId) -> durable::Result) -> durable::Result {\n- let mut group = GroupState::new();\n+fn load_scope_votes(db: &Db, np: &durable::Path) -> durable::Result {\n+ let mut votes = ScopeVotes::default();\n \n for (key, stored) in np.uuid_votes().iter(db)? {\n- let (actor_uuid, _lo, _hi) = key;\n let vote = decode_vote(stored).map_err(durable::Error::Deserialize)?;\n- group.ingest_uuid_vote(vote, &actor_uuid);\n+ votes.uuid_votes.insert(key, vote);\n }\n \n let stored = np.recent_votes().iter(db)?;\n let cap = RECENT_VOTES_CAP as usize;\n let start = stored.len().saturating_sub(cap);\n- group.recent_votes = stored[start..]\n+ votes.recent_votes = stored[start..]\n .iter()\n .map(|s| decode_vote(s.clone()).map_err(durable::Error::Deserialize))\n .collect::, _>>()?;\n \n- Ok(group)\n+ Ok(votes)\n }\n \n fn parse_storage_id(s: &str) -> durable::Result {\n parse_stored_id(s).map_err(durable::Error::Deserialize)\n }\n \n-// ---------------------------------------------------------------------------\n-// Write helpers (event -> reified point updates on a batch)\n-// ---------------------------------------------------------------------------\n-\n-/// Wire a node and its ancestors into the tree exactly like\n-/// [`crate::reducer::GlobalTree::ensure_path`]: set presence and parent→child\n-/// links along the canonical breadcrumb path.\n pub fn ensure_path_writes(batch: &mut Batch, id: &ItemId) {\n let root = ItemId::root();\n batch.write(node(&root).present().set(&true));\n@@ -161,7 +120,6 @@ pub fn ensure_path_writes(batch: &mut Batch, id: &ItemId) {\n }\n }\n \n-/// Reified writes for a validated vote under `parent`.\n pub fn vote_writes(\n batch: &mut Batch,\n parent: &ItemId,\n@@ -182,14 +140,12 @@ pub fn vote_writes(\n Ok(())\n }\n \n-/// Reified writes for ephemeral Reddit display content (not event-logged).\n pub fn entity_content_writes(batch: &mut Batch, id: &ItemId, view: &EntityData, fetched_at: i64) {\n ensure_path_writes(batch, id);\n batch.write(node(id).data().set(&encode_entity_data(view)));\n batch.write(node(id).fetched_at().set(&fetched_at));\n }\n \n-/// Clear cached display content for one node (structure/votes are untouched).\n pub fn entity_content_clear_writes(batch: &mut Batch, id: &ItemId) {\n batch.write(node(id).data().delete());\n batch.write(node(id).fetched_at().delete());\n@@ -199,6 +155,7 @@ pub fn entity_content_clear_writes(batch: &mut Batch, id: &ItemId) {\n mod tests {\n use super::*;\n use crate::identity::{seed_default_pseudonym, DEFAULT_ACTOR_UUID, DEFAULT_PSEUDONYM};\n+ use crate::ranking::edge_weight_sum;\n \n fn sample_vote(ts: i64, a: &str, b: &str, l: i32, r: i32) -> VoteData {\n VoteData {\n@@ -213,7 +170,7 @@ mod tests {\n }\n \n #[test]\n- fn vote_roundtrip_reconstructs_group_state() {\n+ fn vote_roundtrip_reconstructs_ranking() {\n let dir = tempfile::tempdir().unwrap();\n let db = Db::open(dir.path()).unwrap();\n seed_default_pseudonym(&db).unwrap();\n@@ -225,11 +182,8 @@ mod tests {\n batch.commit().unwrap();\n \n let node_state = load_node_state(&db, &parent).unwrap().unwrap();\n- let g = &node_state.local_ranking;\n- assert_eq!(g.idx_to_item.len(), 2);\n- let edge_total: f64 = g.edges.values().sum();\n- assert_eq!(edge_total, 3.0);\n- assert_eq!(g.recent_votes.len(), 1);\n+ assert_eq!(edge_weight_sum(&node_state.votes), 3.0);\n+ assert_eq!(node_state.votes.recent_votes.len(), 1);\n assert!(node_state.children.contains(&ItemId::opaque(\"alpha\")));\n assert!(node_state.children.contains(&ItemId::opaque(\"beta\")));\n }\n@@ -263,10 +217,9 @@ mod tests {\n .unwrap();\n batch.commit().unwrap();\n \n- let g = &load_node_state(&db, &parent).unwrap().unwrap().local_ranking;\n- let edge_total: f64 = g.edges.values().sum();\n- assert_eq!(edge_total, 1.0);\n- assert_eq!(g.uuid_votes.len(), 1);\n+ let votes = &load_node_state(&db, &parent).unwrap().unwrap().votes;\n+ assert_eq!(edge_weight_sum(votes), 1.0);\n+ assert_eq!(votes.uuid_votes.len(), 1);\n }\n \n #[test]\n@@ -293,15 +246,8 @@ mod tests {\n );\n \n let node_state = load_node_state(&db, &parent).unwrap().unwrap();\n- assert_eq!(node_state.local_ranking.recent_votes.len(), RECENT_VOTES_CAP as usize);\n- assert_eq!(\n- node_state\n- .local_ranking\n- .recent_votes\n- .first()\n- .map(|v| v.ts),\n- Some(10)\n- );\n+ assert_eq!(node_state.votes.recent_votes.len(), RECENT_VOTES_CAP as usize);\n+ assert_eq!(node_state.votes.recent_votes.first().map(|v| v.ts), Some(10));\n }\n \n #[test]\ndiff --git a/server/tests/integration_ui.rs b/server/tests/integration_ui.rs\nindex cc7a16d756673b95ba336f2d6130eaf40908cc60..40e4cfe1eec36dad29a075fb01aefb4dffd856d0 100644\n--- a/server/tests/integration_ui.rs\n+++ b/server/tests/integration_ui.rs\n@@ -132,7 +132,7 @@ async fn post_ui_record_vote_morphs_ranking_and_persists() {\n let state = create_app_state(cfg).await;\n let tree = state.scope_tree(&ItemId::root()).unwrap();\n let root = tree.get(&ItemId::root()).expect(\"root node after replay\");\n- let ranked = sorter2_server::ranking::ranked_items(&root.local_ranking);\n+ let ranked = sorter2_server::ranking::ranked_items(&root.votes);\n assert_eq!(ranked.len(), 2);\n assert_eq!(ranked[0].item.as_str(), \"alpha\");\n }\n\n\nSide B — contributor: tommy-mor\nSide B — commit message:\n[239c074b] url schema stuff\n\nSide B — unified diff (full patch):\ndiff --git a/AGENTS.md b/AGENTS.md\nindex 426a88e7c1da54fe0a28c5c76fa4e1f1bc117fcf..e60b9ba6012593361ef10e8fdd9439cd9932e09b 100644\n--- a/AGENTS.md\n+++ b/AGENTS.md\n@@ -58,3 +58,4 @@ Use **tmux** for `cargo run --package sorter2-server` (dev server). Rebuild afte\n \n - First `cargo test` / `cargo build --release` is slow; Clojure smoke test always does a release build.\n - `legacy/` and `ideas/` are not part of the workspace build.\n+- **ItemId** for web URLs is a canonical full URL (`https://reddit.com/r/rust`). Rules live in [`server/src/url_rules/`](server/src/url_rules/) (composable Rust, not a config DSL). After changing canonicalization rules, rebuild the projection: `cargo run --package sorter2-server -- replay-index`.\ndiff --git a/Cargo.lock b/Cargo.lock\nindex 0dd4fce5fb6400ae153cca4e3dbf5a5158e6d8b4..49a908ef935c430dbe63c6a28d8a24e38b489486 100644\n--- a/Cargo.lock\n+++ b/Cargo.lock\n@@ -1951,6 +1951,7 @@ dependencies = [\n \"tower-http 0.5.2\",\n \"tracing\",\n \"tracing-subscriber\",\n+ \"url\",\n \"urlencoding\",\n ]\n \ndiff --git a/REPLAY.sh b/REPLAY.sh\nnew file mode 100755\nindex 0000000000000000000000000000000000000000..f2dbd8aea60c02d2feef74805f7ef5c2b7022537\n--- /dev/null\n+++ b/REPLAY.sh\n@@ -0,0 +1,2 @@\n+cargo run --package sorter2-server -- replay-index\n+\ndiff --git a/server/Cargo.toml b/server/Cargo.toml\nindex 27f552c20b97ef28cdde4cb6b1a4980375135111..ad4912791aff59fb1d3293f66ad381ae618cd60b 100644\n--- a/server/Cargo.toml\n+++ b/server/Cargo.toml\n@@ -24,6 +24,7 @@ async-stream = \"0.3\"\n futures-util = { version = \"0.3\", default-features = false, features = [\"std\"] }\n rand = \"0.8\"\n urlencoding = \"2\"\n+url = \"2\"\n durable = { path = \"../durable\" }\n \n [dev-dependencies]\ndiff --git a/server/src/entity_store.rs b/server/src/entity_store.rs\nindex d5d17c3676e4a8ddec998e9f5a9dbafe9c2d9d0e..d29f39aecca6f12cdcf263cf77c3654eb4ee6cfa 100644\n--- a/server/src/entity_store.rs\n+++ b/server/src/entity_store.rs\n@@ -124,7 +124,7 @@ mod tests {\n fn round_trip_payload() {\n let tmp = tempfile::tempdir().unwrap();\n let store = EntityStore::open(tmp.path()).unwrap();\n- let id = ItemId::parse(\"reddit.com/r/rust\").unwrap();\n+ let id = ItemId::from_url(\"https://reddit.com/r/rust\").unwrap();\n let payload = json!({\"kind\": \"t5\", \"data\": {\"display_name\": \"rust\"}});\n \n store.put(&id, &payload).unwrap();\ndiff --git a/server/src/event_log.rs b/server/src/event_log.rs\nindex 36f5b406084065b608735987cdb483c236e03081..2c9290b6fdbf2c2ad1c0f1ffd7374b2d9cc97f36 100644\n--- a/server/src/event_log.rs\n+++ b/server/src/event_log.rs\n@@ -199,7 +199,7 @@ mod tests {\n log.append(&sample_record(\n 1,\n Event::NodeEnsured {\n- id: \"reddit.com/r/rust\".into(),\n+ id: \"https://reddit.com/r/rust\".into(),\n },\n ))\n .await\n@@ -237,7 +237,7 @@ mod tests {\n let path = tmp.path().join(\"events.jsonl\");\n let log = EventLog::new(&path);\n let event = Event::NodeEnsured {\n- id: \"reddit.com/r/rust\".into(),\n+ id: \"https://reddit.com/r/rust\".into(),\n };\n log.append(&sample_record(1, event)).await.unwrap();\n \n@@ -255,7 +255,7 @@ mod tests {\n let path = tmp.path().join(\"events.jsonl\");\n std::fs::write(\n &path,\n- r#\"{\"type\":\"node_ensured\",\"id\":\"reddit.com/r/rust\"}\n+ r#\"{\"type\":\"node_ensured\",\"id\":\"https://reddit.com/r/rust\"}\n {\"schema\":1,\"seq\":1,\"ts\":1,\"event\":{\"type\":\"vote_recorded\",\"ts\":1,\"a\":\"a\",\"b\":\"b\",\"ratio_left\":2,\"ratio_right\":1,\"scope\":\"\"}}\n \"#,\n )\n@@ -295,7 +295,7 @@ mod tests {\n log.append(&sample_record(\n 1,\n Event::NodeEnsured {\n- id: \"reddit.com/r/rust\".into(),\n+ id: \"https://reddit.com/r/rust\".into(),\n },\n ))\n .await\n@@ -303,7 +303,7 @@ mod tests {\n log.append(&sample_record(\n 3,\n Event::NodeEnsured {\n- id: \"reddit.com/r/python\".into(),\n+ id: \"https://reddit.com/r/python\".into(),\n },\n ))\n .await\ndiff --git a/server/src/journal.rs b/server/src/journal.rs\nindex 521a108019de1ea870d14c4fafbfe572c20ce0de..50bc89f976edb82b7b0e49e954a8eccbbe82bf87 100644\n--- a/server/src/journal.rs\n+++ b/server/src/journal.rs\n@@ -141,10 +141,10 @@ mod tests {\n let j2 = journal.clone();\n let (r1, r2) = tokio::join!(\n j1.append(Event::NodeEnsured {\n- id: \"reddit.com/r/rust\".into(),\n+ id: \"https://reddit.com/r/rust\".into(),\n }),\n j2.append(Event::NodeEnsured {\n- id: \"reddit.com/r/python\".into(),\n+ id: \"https://reddit.com/r/python\".into(),\n }),\n );\n r1.unwrap();\n@@ -153,10 +153,10 @@ mod tests {\n assert_eq!(projection_store.last_applied_event_count().unwrap(), 2);\n let tree = projection_store.load_tree().unwrap();\n assert!(tree\n- .get(&ItemId::parse(\"reddit.com/r/rust\").unwrap())\n+ .get(&ItemId::parse(\"https://reddit.com/r/rust\").unwrap())\n .is_some());\n assert!(tree\n- .get(&ItemId::parse(\"reddit.com/r/python\").unwrap())\n+ .get(&ItemId::parse(\"https://reddit.com/r/python\").unwrap())\n .is_some());\n }\n \n@@ -170,7 +170,7 @@ mod tests {\n 1,\n 1,\n Event::NodeEnsured {\n- id: \"reddit.com/r/rust\".into(),\n+ id: \"https://reddit.com/r/rust\".into(),\n },\n ))\n .await\n@@ -186,7 +186,7 @@ mod tests {\n 1,\n 1,\n Event::NodeEnsured {\n- id: \"reddit.com/r/rust\".into(),\n+ id: \"https://reddit.com/r/rust\".into(),\n },\n )],\n )\n@@ -202,7 +202,7 @@ mod tests {\n );\n journal\n .append(Event::NodeEnsured {\n- id: \"reddit.com/r/python\".into(),\n+ id: \"https://reddit.com/r/python\".into(),\n })\n .await\n .unwrap();\n@@ -227,13 +227,13 @@ mod tests {\n journal\n .append_many(vec![\n Event::NodeEnsured {\n- id: \"reddit.com/r/rust\".into(),\n+ id: \"https://reddit.com/r/rust\".into(),\n },\n Event::NodeEnsured {\n- id: \"reddit.com/r/python\".into(),\n+ id: \"https://reddit.com/r/python\".into(),\n },\n Event::NodeEnsured {\n- id: \"reddit.com/r/clojure\".into(),\n+ id: \"https://reddit.com/r/clojure\".into(),\n },\n ])\n .await\n@@ -245,7 +245,7 @@ mod tests {\n assert_eq!(projection_store.last_applied_event_count().unwrap(), 3);\n let tree = projection_store.load_tree().unwrap();\n assert!(tree\n- .get(&ItemId::parse(\"reddit.com/r/clojure\").unwrap())\n+ .get(&ItemId::parse(\"https://reddit.com/r/clojure\").unwrap())\n .is_some());\n }\n }\ndiff --git a/server/src/lib.rs b/server/src/lib.rs\nindex 9bd5f76fd1406b9b1be4c272f4ba8647edde2678..5c02c8e704e4664453bad75d819df8a067668176 100644\n--- a/server/src/lib.rs\n+++ b/server/src/lib.rs\n@@ -9,6 +9,7 @@ pub mod journal;\n pub mod pair;\n pub mod parser;\n pub mod path_types;\n+pub mod url_rules;\n pub mod projection_apply;\n pub mod projection_store;\n pub mod ranking;\ndiff --git a/server/src/pair.rs b/server/src/pair.rs\nindex 43f780ba6ea6ce1cdc2e1f4cbb252ba8a10684b9..815a97b80e3e9f348e0937a4f147f2862018edb0 100644\n--- a/server/src/pair.rs\n+++ b/server/src/pair.rs\n@@ -381,42 +381,42 @@ mod tests {\n \n #[test]\n fn suggest_prefers_unvoted_pair() {\n- let parent = ItemId::parse(\"reddit.com/r/rust\").unwrap();\n+ let parent = ItemId::parse(\"https://reddit.com/r/rust\").unwrap();\n let mut tree = seed_children(\n &parent,\n &[\n- \"reddit.com/r/rust/a\",\n- \"reddit.com/r/rust/b\",\n- \"reddit.com/r/rust/c\",\n+ \"https://reddit.com/r/rust/a\",\n+ \"https://reddit.com/r/rust/b\",\n+ \"https://reddit.com/r/rust/c\",\n ],\n );\n let vote =\n- VoteData::from_recorded(1, \"reddit.com/r/rust/a\", \"reddit.com/r/rust/b\", 2, 1).unwrap();\n+ VoteData::from_recorded(1, \"https://reddit.com/r/rust/a\", \"https://reddit.com/r/rust/b\", 2, 1).unwrap();\n tree.apply_vote(&parent, vote);\n let group = tree.get(&parent).unwrap().local_ranking.clone();\n let pool = children_of(&tree, &parent);\n let (l, r) = suggest_next_pair_in_pool(&group, &pool, None).unwrap();\n- let voted_ab = (l.as_str() == \"reddit.com/r/rust/a\" && r.as_str() == \"reddit.com/r/rust/b\")\n- || (l.as_str() == \"reddit.com/r/rust/b\" && r.as_str() == \"reddit.com/r/rust/a\");\n+ let voted_ab = (l.as_str() == \"https://reddit.com/r/rust/a\" && r.as_str() == \"https://reddit.com/r/rust/b\")\n+ || (l.as_str() == \"https://reddit.com/r/rust/b\" && r.as_str() == \"https://reddit.com/r/rust/a\");\n assert!(!voted_ab);\n }\n \n #[test]\n fn suggest_bridges_separate_components() {\n- let parent = ItemId::parse(\"reddit.com/r/rust\").unwrap();\n+ let parent = ItemId::parse(\"https://reddit.com/r/rust\").unwrap();\n let mut tree = seed_children(\n &parent,\n &[\n- \"reddit.com/r/rust/a\",\n- \"reddit.com/r/rust/b\",\n- \"reddit.com/r/rust/c\",\n- \"reddit.com/r/rust/d\",\n+ \"https://reddit.com/r/rust/a\",\n+ \"https://reddit.com/r/rust/b\",\n+ \"https://reddit.com/r/rust/c\",\n+ \"https://reddit.com/r/rust/d\",\n ],\n );\n let ab =\n- VoteData::from_recorded(1, \"reddit.com/r/rust/a\", \"reddit.com/r/rust/b\", 2, 1).unwrap();\n+ VoteData::from_recorded(1, \"https://reddit.com/r/rust/a\", \"https://reddit.com/r/rust/b\", 2, 1).unwrap();\n let cd =\n- VoteData::from_recorded(2, \"reddit.com/r/rust/c\", \"reddit.com/r/rust/d\", 2, 1).unwrap();\n+ VoteData::from_recorded(2, \"https://reddit.com/r/rust/c\", \"https://reddit.com/r/rust/d\", 2, 1).unwrap();\n tree.apply_vote(&parent, ab);\n tree.apply_vote(&parent, cd);\n let group = tree.get(&parent).unwrap().local_ranking.clone();\n@@ -424,37 +424,37 @@ mod tests {\n let pair = suggest_next_pair_in_pool(&group, &pool, None).unwrap();\n let chosen = pair_set(&pair);\n let from_ab =\n- chosen.contains(\"reddit.com/r/rust/a\") || chosen.contains(\"reddit.com/r/rust/b\");\n+ chosen.contains(\"https://reddit.com/r/rust/a\") || chosen.contains(\"https://reddit.com/r/rust/b\");\n let from_cd =\n- chosen.contains(\"reddit.com/r/rust/c\") || chosen.contains(\"reddit.com/r/rust/d\");\n+ chosen.contains(\"https://reddit.com/r/rust/c\") || chosen.contains(\"https://reddit.com/r/rust/d\");\n assert!(from_ab && from_cd, \"expected bridge pair, got {:?}\", chosen);\n }\n \n #[test]\n fn suggest_prefers_attach_over_isolate_pair_among_many_unranked() {\n- let parent = ItemId::parse(\"reddit.com/r/rust\").unwrap();\n+ let parent = ItemId::parse(\"https://reddit.com/r/rust\").unwrap();\n let mut tree = seed_children(\n &parent,\n &[\n- \"reddit.com/r/rust/a\",\n- \"reddit.com/r/rust/b\",\n- \"reddit.com/r/rust/c\",\n- \"reddit.com/r/rust/d\",\n- \"reddit.com/r/rust/e\",\n+ \"https://reddit.com/r/rust/a\",\n+ \"https://reddit.com/r/rust/b\",\n+ \"https://reddit.com/r/rust/c\",\n+ \"https://reddit.com/r/rust/d\",\n+ \"https://reddit.com/r/rust/e\",\n ],\n );\n let ab =\n- VoteData::from_recorded(1, \"reddit.com/r/rust/a\", \"reddit.com/r/rust/b\", 2, 1).unwrap();\n+ VoteData::from_recorded(1, \"https://reddit.com/r/rust/a\", \"https://reddit.com/r/rust/b\", 2, 1).unwrap();\n tree.apply_vote(&parent, ab);\n let group = tree.get(&parent).unwrap().local_ranking.clone();\n let pool = children_of(&tree, &parent);\n let pair = suggest_next_pair_in_pool(&group, &pool, None).unwrap();\n let chosen = pair_set(&pair);\n let from_ab =\n- chosen.contains(\"reddit.com/r/rust/a\") || chosen.contains(\"reddit.com/r/rust/b\");\n- let from_cde = chosen.contains(\"reddit.com/r/rust/c\")\n- || chosen.contains(\"reddit.com/r/rust/d\")\n- || chosen.contains(\"reddit.com/r/rust/e\");\n+ chosen.contains(\"https://reddit.com/r/rust/a\") || chosen.contains(\"https://reddit.com/r/rust/b\");\n+ let from_cde = chosen.contains(\"https://reddit.com/r/rust/c\")\n+ || chosen.contains(\"https://reddit.com/r/rust/d\")\n+ || chosen.contains(\"https://reddit.com/r/rust/e\");\n assert!(\n from_ab && from_cde,\n \"expected ranked+unranked attach, got {:?}\",\n@@ -464,40 +464,40 @@ mod tests {\n \n #[test]\n fn suggest_connects_isolate_to_existing_component() {\n- let parent = ItemId::parse(\"reddit.com/r/rust\").unwrap();\n+ let parent = ItemId::parse(\"https://reddit.com/r/rust\").unwrap();\n let mut tree = seed_children(\n &parent,\n &[\n- \"reddit.com/r/rust/a\",\n- \"reddit.com/r/rust/b\",\n- \"reddit.com/r/rust/c\",\n+ \"https://reddit.com/r/rust/a\",\n+ \"https://reddit.com/r/rust/b\",\n+ \"https://reddit.com/r/rust/c\",\n ],\n );\n let ab =\n- VoteData::from_recorded(1, \"reddit.com/r/rust/a\", \"reddit.com/r/rust/b\", 2, 1).unwrap();\n+ VoteData::from_recorded(1, \"https://reddit.com/r/rust/a\", \"https://reddit.com/r/rust/b\", 2, 1).unwrap();\n tree.apply_vote(&parent, ab);\n let group = tree.get(&parent).unwrap().local_ranking.clone();\n let pool = children_of(&tree, &parent);\n let pair = suggest_next_pair_in_pool(&group, &pool, None).unwrap();\n let chosen = pair_set(&pair);\n- assert!(chosen.contains(\"reddit.com/r/rust/c\"));\n- assert!(chosen.contains(\"reddit.com/r/rust/a\") || chosen.contains(\"reddit.com/r/rust/b\"));\n+ assert!(chosen.contains(\"https://reddit.com/r/rust/c\"));\n+ assert!(chosen.contains(\"https://reddit.com/r/rust/a\") || chosen.contains(\"https://reddit.com/r/rust/b\"));\n }\n \n #[test]\n fn suggest_zips_adjacent_ranks_when_tree_complete() {\n- let parent = ItemId::parse(\"reddit.com/r/rust\").unwrap();\n+ let parent = ItemId::parse(\"https://reddit.com/r/rust\").unwrap();\n let mut tree = seed_children(\n &parent,\n &[\n- \"reddit.com/r/rust/a\",\n- \"reddit.com/r/rust/b\",\n- \"reddit.com/r/rust/c\",\n+ \"https://reddit.com/r/rust/a\",\n+ \"https://reddit.com/r/rust/b\",\n+ \"https://reddit.com/r/rust/c\",\n ],\n );\n for (a, b, l, r) in [\n- (\"reddit.com/r/rust/a\", \"reddit.com/r/rust/b\", 3, 1),\n- (\"reddit.com/r/rust/a\", \"reddit.com/r/rust/c\", 2, 1),\n+ (\"https://reddit.com/r/rust/a\", \"https://reddit.com/r/rust/b\", 3, 1),\n+ (\"https://reddit.com/r/rust/a\", \"https://reddit.com/r/rust/c\", 2, 1),\n ] {\n let v = VoteData::from_recorded(1, a, b, l, r).unwrap();\n tree.apply_vote(&parent, v);\n@@ -506,26 +506,26 @@ mod tests {\n let pool = children_of(&tree, &parent);\n let pair = suggest_next_pair_in_pool(&group, &pool, None).unwrap();\n let chosen = pair_set(&pair);\n- assert!(chosen.contains(\"reddit.com/r/rust/b\"));\n- assert!(chosen.contains(\"reddit.com/r/rust/c\"));\n+ assert!(chosen.contains(\"https://reddit.com/r/rust/b\"));\n+ assert!(chosen.contains(\"https://reddit.com/r/rust/c\"));\n }\n \n #[test]\n fn suggest_zip_prefers_1v2_before_2v3_when_both_unvoted() {\n- let parent = ItemId::parse(\"reddit.com/r/rust\").unwrap();\n+ let parent = ItemId::parse(\"https://reddit.com/r/rust\").unwrap();\n let mut tree = seed_children(\n &parent,\n &[\n- \"reddit.com/r/rust/a\",\n- \"reddit.com/r/rust/b\",\n- \"reddit.com/r/rust/c\",\n- \"reddit.com/r/rust/d\",\n+ \"https://reddit.com/r/rust/a\",\n+ \"https://reddit.com/r/rust/b\",\n+ \"https://reddit.com/r/rust/c\",\n+ \"https://reddit.com/r/rust/d\",\n ],\n );\n for (a, b, l, r) in [\n- (\"reddit.com/r/rust/c\", \"reddit.com/r/rust/d\", 3, 1),\n- (\"reddit.com/r/rust/b\", \"reddit.com/r/rust/c\", 2, 1),\n- (\"reddit.com/r/rust/a\", \"reddit.com/r/rust/c\", 2, 1),\n+ (\"https://reddit.com/r/rust/c\", \"https://reddit.com/r/rust/d\", 3, 1),\n+ (\"https://reddit.com/r/rust/b\", \"https://reddit.com/r/rust/c\", 2, 1),\n+ (\"https://reddit.com/r/rust/a\", \"https://reddit.com/r/rust/c\", 2, 1),\n ] {\n let v = VoteData::from_recorded(1, a, b, l, r).unwrap();\n tree.apply_vote(&parent, v);\n@@ -534,16 +534,16 @@ mod tests {\n let pool = children_of(&tree, &parent);\n let pair = suggest_next_pair_in_pool(&group, &pool, None).unwrap();\n let chosen = pair_set(&pair);\n- assert!(chosen.contains(\"reddit.com/r/rust/a\"));\n- assert!(chosen.contains(\"reddit.com/r/rust/b\"));\n+ assert!(chosen.contains(\"https://reddit.com/r/rust/a\"));\n+ assert!(chosen.contains(\"https://reddit.com/r/rust/b\"));\n }\n \n #[test]\n fn resolve_pair_picks_from_pool() {\n- let parent = ItemId::parse(\"reddit.com/r/rust\").unwrap();\n- let tree = seed_children(&parent, &[\"reddit.com/r/rust/a\", \"reddit.com/r/rust/b\"]);\n+ let parent = ItemId::parse(\"https://reddit.com/r/rust\").unwrap();\n+ let tree = seed_children(&parent, &[\"https://reddit.com/r/rust/a\", \"https://reddit.com/r/rust/b\"]);\n let pair = resolve_pair(&tree, &parent, None, None).unwrap();\n- let pool: HashSet<_> = [\"reddit.com/r/rust/a\", \"reddit.com/r/rust/b\"]\n+ let pool: HashSet<_> = [\"https://reddit.com/r/rust/a\", \"https://reddit.com/r/rust/b\"]\n .into_iter()\n .collect();\n assert!(pool.contains(pair.0.as_str()));\ndiff --git a/server/src/parser.rs b/server/src/parser.rs\nindex 9df2dcc9313f7fe250ce3b6aa167f6ec5d57951f..b2a963dd6cab415576c8d3a9a241966758565bb8 100644\n--- a/server/src/parser.rs\n+++ b/server/src/parser.rs\n@@ -23,7 +23,7 @@ mod tests {\n fn parses_short_path() {\n assert_eq!(\n parse_reddit_url(\"r/rust\").unwrap().as_str(),\n- \"reddit.com/r/rust\"\n+ \"https://reddit.com/r/rust\"\n );\n }\n \n@@ -33,7 +33,7 @@ mod tests {\n parse_reddit_url(\"https://www.reddit.com/r/programming/hot\")\n .unwrap()\n .as_str(),\n- \"reddit.com/r/programming\"\n+ \"https://reddit.com/r/programming\"\n );\n }\n \n@@ -43,7 +43,10 @@ mod tests {\n \"https://old.reddit.com/r/AmItheAsshole/comments/1trnvdl/aita_for_cancelling/\",\n )\n .unwrap();\n- assert_eq!(id.as_str(), \"reddit.com/r/amitheasshole/comments/1trnvdl\");\n+ assert_eq!(\n+ id.as_str(),\n+ \"https://reddit.com/r/amitheasshole/comments/1trnvdl\"\n+ );\n }\n \n #[test]\ndiff --git a/server/src/path_types.rs b/server/src/path_types.rs\nindex fafd924452f6fd85e7a5b27ed2653a19581e6e56..71ffc01f35c5589686ff05dae3b5610fa01f30ce 100644\n--- a/server/src/path_types.rs\n+++ b/server/src/path_types.rs\n@@ -1,13 +1,14 @@\n use serde::{Deserialize, Serialize};\n use std::fmt;\n \n-/// Canonical hierarchical identity for any URL/path in the fractal tree.\n+use crate::url_rules::{looks_like_url, navigable_breadcrumbs, parent_url, resolve_canonical};\n+\n+/// Canonical identity: a real URL (with scheme) or an opaque non-URL key.\n #[derive(Debug, Clone, Hash, PartialEq, Eq, PartialOrd, Ord, Serialize, Deserialize, Default)]\n pub struct ItemId(String);\n \n impl ItemId {\n- /// Parse an already-canonical path (no URL normalization). Empty string is invalid here;\n- /// use [`Self::root`] for the tree root.\n+ /// Parse an already-canonical id (no normalization). Empty string is invalid; use [`Self::root`].\n pub fn parse(s: &str) -> Option {\n let t = s.trim();\n if t.is_empty() {\n@@ -16,12 +17,12 @@ impl ItemId {\n Some(Self(t.to_string()))\n }\n \n- /// Build an opaque item key (legacy demo votes, non-URL items).\n+ /// Build an opaque item key (demo votes, non-URL items).\n pub fn opaque(s: impl Into) -> Self {\n Self(s.into())\n }\n \n- /// Root of the internet tree (empty path).\n+ /// Root of the internet tree.\n pub fn root() -> Self {\n Self(String::new())\n }\n@@ -34,23 +35,18 @@ impl ItemId {\n &self.0\n }\n \n- /// Creates a canonical ID from a raw URL or path. Normalizes domains and\n- /// trims tracking query params.\n+ /// Canonical URL from a raw pasted or fetched URL.\n pub fn from_url(raw_url: &str) -> Option {\n- Self::canonicalize(raw_url).map(Self)\n+ resolve_canonical(raw_url).map(Self)\n }\n \n- /// Normalize strings from forms, events, and Reddit imports into the same\n- /// stored id shape (e.g. drop post title slug after comment id).\n+ /// Normalize strings from forms, events, and imports into canonical identity.\n pub fn from_storage(s: &str) -> Option {\n let t = s.trim();\n if t.is_empty() {\n return None;\n }\n- if t.contains(\"://\") || t.starts_with(\"r/\") {\n- return Self::from_url(t).or_else(|| Self::parse(t));\n- }\n- if t.starts_with(\"reddit.com/\") && t.contains(\"/comments/\") {\n+ if looks_like_url(t) {\n return Self::from_url(t).or_else(|| Self::parse(t));\n }\n Self::parse(t).or_else(|| Self::from_url(t))\n@@ -62,35 +58,52 @@ impl ItemId {\n if s.is_empty() {\n return Self::root();\n }\n- Self(format!(\"reddit.com/r/{s}\"))\n+ if looks_like_url(s) || s.contains('/') {\n+ Self::from_storage(s).unwrap_or_else(|| Self::opaque(s))\n+ } else {\n+ Self(format!(\"https://reddit.com/r/{s}\"))\n+ }\n }\n \n- /// Extract the parent, e.g. `reddit.com/r/aww/comments/1trnvdl` →\n- /// `reddit.com/r/aww`.\n+ /// Immediate parent scope in the tree.\n pub fn parent(&self) -> Option {\n- if self.0.is_empty() {\n+ if self.is_root() {\n return None;\n }\n-\n+ if looks_like_url(self.0.as_str()) {\n+ return parent_url(self.0.as_str()).map(Self);\n+ }\n let parts: Vec<&str> = self.0.trim_end_matches('/').split('/').collect();\n if parts.len() <= 1 {\n return None;\n }\n-\n- if self.0.contains(\"/comments/\") {\n- return Some(Self(parts[..parts.len().saturating_sub(2)].join(\"/\")));\n- }\n-\n Some(Self(parts[..parts.len() - 1].join(\"/\")))\n }\n \n pub fn segments(&self) -> Vec<&str> {\n+ if self.is_root() {\n+ return vec![];\n+ }\n+ if let Some(rest) = self.0.strip_prefix(\"https://\") {\n+ return rest.split('/').filter(|s| !s.is_empty()).collect();\n+ }\n+ if let Some(rest) = self.0.strip_prefix(\"http://\") {\n+ return rest.split('/').filter(|s| !s.is_empty()).collect();\n+ }\n self.0.split('/').filter(|s| !s.is_empty()).collect()\n }\n \n- /// Cumulative paths for breadcrumb rendering, e.g.\n- /// `reddit.com/r/movies` → `[\"reddit.com\", \"reddit.com/r\", \"reddit.com/r/movies\"]`.\n+ /// Cumulative navigable paths for breadcrumbs and tree wiring (includes self).\n pub fn breadcrumb_paths(&self) -> Vec {\n+ if self.is_root() {\n+ return vec![];\n+ }\n+ if looks_like_url(self.0.as_str()) {\n+ return navigable_breadcrumbs(self.0.as_str())\n+ .into_iter()\n+ .map(ItemId)\n+ .collect();\n+ }\n let segs = self.segments();\n let mut paths = Vec::with_capacity(segs.len());\n let mut current = String::new();\n@@ -111,13 +124,13 @@ impl ItemId {\n if self.is_root() {\n return String::new();\n }\n- if self.as_str().contains(\"://\") {\n- return self.as_str().to_string();\n+ if self.0.contains(\"://\") {\n+ return self.0.clone();\n }\n if self.segments().first().is_some_and(|s| s.contains('.')) {\n- format!(\"https://{}\", self.as_str())\n+ format!(\"https://{}\", self.0)\n } else {\n- self.as_str().to_string()\n+ self.0.clone()\n }\n }\n \n@@ -144,70 +157,6 @@ impl ItemId {\n pub fn from_browse_uri(path: &str) -> Option {\n path.strip_prefix(\"/~/\").map(ItemId::from_browse_tail)\n }\n-\n- fn canonicalize(raw: &str) -> Option {\n- let s = raw.trim();\n- if s.is_empty() {\n- return None;\n- }\n-\n- let owned = if let Some(rest) = s.strip_prefix(\"r/\") {\n- format!(\"reddit.com/r/{rest}\")\n- } else if let Some(rest) = s.strip_prefix(\"/r/\") {\n- format!(\"reddit.com/r/{rest}\")\n- } else {\n- s.to_string()\n- };\n-\n- let (host_path, _query) = split_query(&owned);\n- let host_path = host_path.trim_end_matches('/');\n-\n- let path = if host_path.contains(\"://\") {\n- parse_url_host_path(host_path)?\n- } else if host_path.starts_with(\"reddit.com\") || host_path.starts_with(\"www.reddit.com\") {\n- normalize_reddit_host_path(host_path)\n- } else if host_path.contains('/') {\n- host_path.to_string()\n- } else {\n- return None;\n- };\n-\n- Some(normalize_reddit_path(&path))\n- }\n-}\n-\n-fn split_query(s: &str) -> (&str, Option<&str>) {\n- if let Some((path, q)) = s.split_once('?') {\n- (path, Some(q))\n- } else {\n- (s, None)\n- }\n-}\n-\n-fn parse_url_host_path(url: &str) -> Option {\n- let rest = url\n- .strip_prefix(\"https://\")\n- .or_else(|| url.strip_prefix(\"http://\"))\n- .unwrap_or(url);\n- let (host, path) = rest.split_once('/').unwrap_or((rest, \"\"));\n- let host = normalize_host(host);\n- if path.is_empty() {\n- Some(host)\n- } else {\n- Some(format!(\"{host}/{path}\"))\n- }\n-}\n-\n-fn normalize_host(host: &str) -> String {\n- let h = host\n- .strip_prefix(\"www.\")\n- .unwrap_or(host)\n- .to_ascii_lowercase();\n- if h == \"old.reddit.com\" || h == \"new.reddit.com\" || h == \"reddit.com\" {\n- \"reddit.com\".to_string()\n- } else {\n- h\n- }\n }\n \n fn normalize_browse_tail(tail: &str) -> String {\n@@ -215,7 +164,6 @@ fn normalize_browse_tail(tail: &str) -> String {\n if t.is_empty() {\n return String::new();\n }\n- // Some HTTP stacks collapse `https://` → `https:/` inside a path segment.\n if t.starts_with(\"https:/\") && !t.starts_with(\"https://\") {\n return format!(\"https://{}\", &t[7..]);\n }\n@@ -225,33 +173,6 @@ fn normalize_browse_tail(tail: &str) -> String {\n t.to_string()\n }\n \n-fn normalize_reddit_host_path(s: &str) -> String {\n- let (host, path) = s.split_once('/').unwrap_or((s, \"\"));\n- let host = normalize_host(host);\n- if path.is_empty() {\n- host\n- } else {\n- format!(\"{host}/{path}\")\n- }\n-}\n-\n-/// Lowercase subreddit segment, drop listing suffixes, drop title slug after post id.\n-fn normalize_reddit_path(path: &str) -> String {\n- let mut parts: Vec = path.split('/').map(str::to_string).collect();\n- if parts.len() >= 3 && parts[1] == \"r\" {\n- parts[2] = parts[2].to_ascii_lowercase();\n- }\n- if let Some(i) = parts.iter().position(|p| p == \"comments\") {\n- if parts.len() > i + 2 {\n- parts.truncate(i + 2);\n- }\n- } else if parts.len() > 3 && parts.get(1).map(|s| s.as_str()) == Some(\"r\") {\n- // reddit.com/r/{sub}/hot → reddit.com/r/{sub}\n- parts.truncate(3);\n- }\n- parts.join(\"/\")\n-}\n-\n impl fmt::Display for ItemId {\n fn fmt(&self, f: &mut fmt::Formatter<'_>) -> fmt::Result {\n f.write_str(&self.0)\n@@ -268,43 +189,59 @@ mod tests {\n \"https://old.reddit.com/r/AmItheAsshole/comments/1trnvdl/aita_for_cancelling/\",\n )\n .unwrap();\n- assert_eq!(id.as_str(), \"reddit.com/r/amitheasshole/comments/1trnvdl\");\n+ assert_eq!(\n+ id.as_str(),\n+ \"https://reddit.com/r/amitheasshole/comments/1trnvdl\"\n+ );\n }\n \n #[test]\n fn from_url_strips_query() {\n let id = ItemId::from_url(\"https://www.reddit.com/r/rust/?sort=top\").unwrap();\n- assert_eq!(id.as_str(), \"reddit.com/r/rust\");\n+ assert_eq!(id.as_str(), \"https://reddit.com/r/rust\");\n }\n \n #[test]\n fn from_url_short_path() {\n assert_eq!(\n ItemId::from_url(\"r/rust\").unwrap().as_str(),\n- \"reddit.com/r/rust\"\n+ \"https://reddit.com/r/rust\"\n );\n }\n \n #[test]\n fn parent_of_post_is_subreddit() {\n- let id = ItemId::parse(\"reddit.com/r/aww/comments/1trnvdl\").unwrap();\n- assert_eq!(id.parent().unwrap().as_str(), \"reddit.com/r/aww\");\n+ let id = ItemId::from_url(\"https://reddit.com/r/aww/comments/1trnvdl\").unwrap();\n+ assert_eq!(id.parent().unwrap().as_str(), \"https://reddit.com/r/aww\");\n }\n \n #[test]\n fn parent_of_subreddit_is_r_segment() {\n- let id = ItemId::parse(\"reddit.com/r/movies\").unwrap();\n- assert_eq!(id.parent().unwrap().as_str(), \"reddit.com/r\");\n+ let id = ItemId::from_url(\"https://reddit.com/r/movies\").unwrap();\n+ assert_eq!(id.parent().unwrap().as_str(), \"https://reddit.com/r\");\n+ }\n+\n+ #[test]\n+ fn breadcrumb_paths_skip_phantom_comments() {\n+ let id = ItemId::from_url(\"https://reddit.com/r/aww/comments/1trnvdl\").unwrap();\n+ let crumbs = id.breadcrumb_paths();\n+ let paths: Vec<_> = crumbs.iter().map(|p| p.as_str()).collect();\n+ assert!(!paths.iter().any(|p| p.ends_with(\"/comments\")));\n+ assert!(paths.contains(&\"https://reddit.com/r/aww\"));\n }\n \n #[test]\n- fn breadcrumb_paths() {\n- let id = ItemId::parse(\"reddit.com/r/movies\").unwrap();\n+ fn breadcrumb_paths_subreddit() {\n+ let id = ItemId::from_url(\"https://reddit.com/r/movies\").unwrap();\n let crumbs = id.breadcrumb_paths();\n let paths: Vec<_> = crumbs.iter().map(|p| p.as_str()).collect();\n assert_eq!(\n paths,\n- vec![\"reddit.com\", \"reddit.com/r\", \"reddit.com/r/movies\"]\n+ vec![\n+ \"https://reddit.com\",\n+ \"https://reddit.com/r\",\n+ \"https://reddit.com/r/movies\"\n+ ]\n );\n }\n \n@@ -312,33 +249,33 @@ mod tests {\n fn legacy_scope_maps_to_reddit_sub() {\n assert_eq!(\n ItemId::from_legacy_scope(\"rust\").as_str(),\n- \"reddit.com/r/rust\"\n+ \"https://reddit.com/r/rust\"\n );\n assert!(ItemId::from_legacy_scope(\"\").is_root());\n }\n \n #[test]\n- fn browse_href_wraps_canonical_path() {\n- let id = ItemId::parse(\"reddit.com/r/rust\").unwrap();\n+ fn browse_href_wraps_canonical_url() {\n+ let id = ItemId::from_url(\"https://reddit.com/r/rust\").unwrap();\n assert_eq!(id.browse_href(), \"/~/https://reddit.com/r/rust\");\n }\n \n #[test]\n fn from_browse_tail_parses_full_url() {\n let id = ItemId::from_browse_tail(\"https://reddit.com/r/AmITheAsshole\");\n- assert_eq!(id.as_str(), \"reddit.com/r/amitheasshole\");\n+ assert_eq!(id.as_str(), \"https://reddit.com/r/amitheasshole\");\n }\n \n #[test]\n fn from_storage_strips_post_title_slug() {\n let id =\n ItemId::from_storage(\"reddit.com/r/rust/comments/aaa/announcing_rust_199\").unwrap();\n- assert_eq!(id.as_str(), \"reddit.com/r/rust/comments/aaa\");\n+ assert_eq!(id.as_str(), \"https://reddit.com/r/rust/comments/aaa\");\n }\n \n #[test]\n fn from_browse_uri_strips_prefix() {\n let id = ItemId::from_browse_uri(\"/~/https://reddit.com/r/rust\").unwrap();\n- assert_eq!(id.as_str(), \"reddit.com/r/rust\");\n+ assert_eq!(id.as_str(), \"https://reddit.com/r/rust\");\n }\n }\ndiff --git a/server/src/projection_apply.rs b/server/src/projection_apply.rs\nindex ebe122e417bda1d9369a53443de93d28213c5a0d..5644557a41b3e9497c7421b444155ae629fa79f1 100644\n--- a/server/src/projection_apply.rs\n+++ b/server/src/projection_apply.rs\n@@ -19,13 +19,21 @@ use crate::{\n storage_schema::{ensure_path_writes, entity_view_writes, vote_writes},\n };\n \n-/// Legacy-compatible scope parsing for persisted vote events.\n+fn parse_event_id(id: &str) -> Result {\n+ ItemId::from_storage(id)\n+ .or_else(|| ItemId::parse(id))\n+ .ok_or_else(|| EventLogError::Apply(format!(\"invalid id: {id}\")))\n+}\n+\n+/// Scope key from a vote event (canonicalized at apply time).\n fn parent_from_event_scope(scope: &str) -> ItemId {\n- if scope.contains('/') {\n- ItemId::parse(scope).unwrap_or_else(|| ItemId::from_legacy_scope(scope))\n- } else {\n- ItemId::from_legacy_scope(scope)\n+ let s = scope.trim();\n+ if s.is_empty() {\n+ return ItemId::root();\n }\n+ ItemId::from_storage(s)\n+ .or_else(|| ItemId::parse(s))\n+ .unwrap_or_else(|| ItemId::from_legacy_scope(s))\n }\n \n pub fn apply_records(\n@@ -68,15 +76,11 @@ pub fn apply_records(\n vote_parents.insert(parent);\n }\n Event::NodeEnsured { id } => {\n- let parsed = ItemId::parse(id)\n- .or_else(|| ItemId::from_url(id))\n- .ok_or_else(|| EventLogError::Apply(format!(\"invalid node id: {id}\")))?;\n+ let parsed = parse_event_id(id)?;\n ensure_path_writes(&mut batch, &parsed);\n }\n Event::EntityImported { id, payload, .. } => {\n- let parsed = ItemId::parse(id)\n- .or_else(|| ItemId::from_url(id))\n- .ok_or_else(|| EventLogError::Apply(format!(\"invalid entity id: {id}\")))?;\n+ let parsed = parse_event_id(id)?;\n let view = entity_view_from_payload(&parsed, payload);\n entity_view_writes(&mut batch, &parsed, view.as_ref());\n entity_store\n@@ -92,7 +96,6 @@ pub fn apply_records(\n .commit_with(durable::Durability::DisableWal)\n .map_err(|e| EventLogError::Apply(e.to_string()))?;\n \n- // Cap recent-vote windows (idempotent, blind; not part of the cursor batch).\n for parent in vote_parents {\n projection_store\n .trim_recent_votes(&parent)\ndiff --git a/server/src/reddit.rs b/server/src/reddit.rs\nindex 72caf7c33b9dd44ea15b62b59e91227cf96a3431..20b7f9e3f8be39268a1767d09f5cf81eaa6ae0df 100644\n--- a/server/src/reddit.rs\n+++ b/server/src/reddit.rs\n@@ -183,7 +183,7 @@ pub fn entity_view_from_payload(\n id: &ItemId,\n payload: &Value,\n ) -> Option {\n- if id.as_str().starts_with(\"reddit.com\") {\n+ if id.as_str().contains(\"reddit.com\") {\n return parse_reddit_view(id, payload);\n }\n None\n@@ -495,41 +495,59 @@ fn rate_limit_reset_secs(resp: &reqwest::Response) -> u64 {\n .unwrap_or(5)\n }\n \n+fn reddit_path_segments(id: &ItemId) -> Option> {\n+ let s = id.as_str();\n+ let rest = s\n+ .strip_prefix(\"https://reddit.com/\")\n+ .or_else(|| s.strip_prefix(\"http://reddit.com/\"))\n+ .or_else(|| s.strip_prefix(\"reddit.com/\"))?;\n+ let segments: Vec = rest\n+ .split('/')\n+ .filter(|p| !p.is_empty())\n+ .map(str::to_string)\n+ .collect();\n+ Some(segments)\n+}\n+\n pub fn map_item_to_reddit_api(id: &ItemId, api_base: &str) -> String {\n- let path = id.as_str();\n- if !path.starts_with(\"reddit.com/\") && path != \"reddit.com\" {\n- return String::new();\n- }\n+ let segments = match reddit_path_segments(id) {\n+ Some(s) => s,\n+ None if matches!(\n+ id.as_str(),\n+ \"https://reddit.com\" | \"http://reddit.com\" | \"reddit.com\"\n+ ) =>\n+ {\n+ return String::new();\n+ }\n+ None => return String::new(),\n+ };\n \n let base = api_base.trim_end_matches('/');\n \n- let segments: Vec<&str> = path.split('/').collect();\n-\n- if let Some(i) = segments.iter().position(|&p| p == \"comments\") {\n+ if let Some(i) = segments.iter().position(|p| p == \"comments\") {\n if segments.len() > i + 1 {\n- let api_path = segments[1..=i + 1].join(\"/\");\n+ let api_path = segments[..=i + 1].join(\"/\");\n return format!(\"{base}/{api_path}.json?raw_json=1\");\n }\n }\n \n- if segments.len() == 3 && segments[1] == \"r\" {\n- return format!(\"{base}/r/{}/about.json?raw_json=1\", segments[2]);\n+ if segments.len() == 2 && segments[0] == \"r\" {\n+ return format!(\"{base}/r/{}/about.json?raw_json=1\", segments[1]);\n }\n \n String::new()\n }\n \n /// Listing URL for a node's children. Currently only subreddits\n-/// (`reddit.com/r/` → `/r/.json`) expose a child listing.\n+/// (`https://reddit.com/r/` → `/r/.json`) expose a child listing.\n pub fn map_children_url(id: &ItemId, api_base: &str) -> String {\n- let path = id.as_str();\n- if !path.starts_with(\"reddit.com/\") {\n- return String::new();\n- }\n+ let segments = match reddit_path_segments(id) {\n+ Some(s) => s,\n+ None => return String::new(),\n+ };\n let base = api_base.trim_end_matches('/');\n- let segments: Vec<&str> = path.split('/').collect();\n- if segments.len() == 3 && segments[1] == \"r\" {\n- return format!(\"{base}/r/{}.json?raw_json=1&limit=25\", segments[2]);\n+ if segments.len() == 2 && segments[0] == \"r\" {\n+ return format!(\"{base}/r/{}.json?raw_json=1&limit=25\", segments[1]);\n }\n String::new()\n }\n@@ -548,8 +566,8 @@ fn parse_children(_parent: &ItemId, payload: &Value) -> Vec<(ItemId, Value)> {\n Some(p) if !p.is_empty() => p,\n _ => continue,\n };\n- let path = format!(\"reddit.com{}\", permalink.trim_end_matches('/'));\n- if let Some(id) = ItemId::from_storage(&path) {\n+ let raw = format!(\"https://reddit.com{}\", permalink.trim_end_matches('/'));\n+ if let Some(id) = ItemId::from_url(&raw) {\n out.push((id, child.clone()));\n }\n }\n@@ -683,7 +701,7 @@ mod tests {\n \n #[test]\n fn map_subreddit_about_url() {\n- let id = ItemId::parse(\"reddit.com/r/rust\").unwrap();\n+ let id = ItemId::from_url(\"https://reddit.com/r/rust\").unwrap();\n assert_eq!(\n map_item_to_reddit_api(&id, \"https://www.reddit.com\"),\n \"https://www.reddit.com/r/rust/about.json?raw_json=1\"\n@@ -699,7 +717,8 @@ mod tests {\n let json = include_str!(\"../../test/fixtures/reddit/r_rust_about.json\");\n let v: Value = serde_json::from_str(json).unwrap();\n let entity =\n- entity_view_from_payload(&ItemId::parse(\"reddit.com/r/rust\").unwrap(), &v).unwrap();\n+ entity_view_from_payload(&ItemId::from_url(\"https://reddit.com/r/rust\").unwrap(), &v)\n+ .unwrap();\n assert_eq!(entity.title, \"The Rust Programming Language\");\n }\n \n@@ -707,7 +726,8 @@ mod tests {\n fn parse_post_listing_extracts_thumb_and_full_preview() {\n let json = include_str!(\"../../test/fixtures/reddit/post_preview.json\");\n let v: Value = serde_json::from_str(json).unwrap();\n- let id = ItemId::parse(\"reddit.com/r/nsfw/comments/1tpy6a1/angel_eyes\").unwrap();\n+ let id =\n+ ItemId::from_url(\"https://reddit.com/r/nsfw/comments/1tpy6a1/angel_eyes\").unwrap();\n let entity = entity_view_from_payload(&id, &v).unwrap();\n assert_eq!(entity.title, \"Angel Eyes\");\n assert!(entity.thumb_url.as_ref().unwrap().contains(\"width=140\"));\ndiff --git a/server/src/reducer.rs b/server/src/reducer.rs\nindex 6578f64a41726845517cdbf59a359c69e0aa56db..5179ddeca7a7cb0fb92dfc4aa9d5a80bd9125611 100644\n--- a/server/src/reducer.rs\n+++ b/server/src/reducer.rs\n@@ -248,16 +248,18 @@ mod from_recorded_tests {\n #[test]\n fn ensure_path_wires_children() {\n let mut tree = GlobalTree::new();\n- let id = ItemId::parse(\"reddit.com/r/rust\").unwrap();\n+ let id = ItemId::from_url(\"https://reddit.com/r/rust\").unwrap();\n tree.ensure_path(&id);\n let root = tree.get(&ItemId::root()).unwrap();\n assert!(root\n .children\n- .contains(&ItemId::parse(\"reddit.com\").unwrap()));\n- let reddit = tree.get(&ItemId::parse(\"reddit.com\").unwrap()).unwrap();\n+ .contains(&ItemId::from_url(\"https://reddit.com\").unwrap()));\n+ let reddit = tree\n+ .get(&ItemId::from_url(\"https://reddit.com\").unwrap())\n+ .unwrap();\n assert!(reddit\n .children\n- .contains(&ItemId::parse(\"reddit.com/r\").unwrap()));\n+ .contains(&ItemId::from_url(\"https://reddit.com/r\").unwrap()));\n let sub = tree.get(&id).unwrap();\n assert_eq!(sub.id, id);\n }\ndiff --git a/server/src/render/reddit.rs b/server/src/render/reddit.rs\nindex 7f840aa33b734a31d8cf3341a0581c8bcb9bbcf3..595e202436040b0bfc419e68f083f94757ba5d0c 100644\n--- a/server/src/render/reddit.rs\n+++ b/server/src/render/reddit.rs\n@@ -9,7 +9,7 @@ use crate::{\n };\n \n pub fn is_reddit_post(id: &ItemId) -> bool {\n- id.as_str().starts_with(\"reddit.com/\") && id.as_str().contains(\"/comments/\")\n+ id.as_str().contains(\"reddit.com/\") && id.as_str().contains(\"/comments/\")\n }\n \n /// Post detail card (inside [`crate::fetch::html::entity_panel`]).\ndiff --git a/server/src/state.rs b/server/src/state.rs\nindex 78126f08d90f8069a586279d79258c27a9f9f7a4..513b329ef45fc332e63b3f8ed8498a1f59feb07c 100644\n--- a/server/src/state.rs\n+++ b/server/src/state.rs\n@@ -217,15 +217,21 @@ impl AppState {\n ratio_right: i32,\n ) -> Result<(), String> {\n let ts = crate::html::now_ms();\n- let vote = VoteData::from_recorded(ts, a, b, ratio_left, ratio_right)\n- .ok_or_else(|| \"invalid vote: need two distinct non-empty items\".to_string())?;\n+ let a_raw = a.trim();\n+ let b_raw = b.trim();\n+ if a_raw.is_empty() || b_raw.is_empty() || a_raw == b_raw {\n+ return Err(\"invalid vote: need two distinct non-empty items\".to_string());\n+ }\n+ // Validate items canonicalize (or are opaque keys) before append.\n+ let _ = VoteData::from_recorded(ts, a_raw, b_raw, ratio_left, ratio_right)\n+ .ok_or_else(|| \"invalid vote: need two distinct parseable items\".to_string())?;\n \n let event = Event::VoteRecorded {\n ts,\n- a: vote.a.as_str().to_string(),\n- b: vote.b.as_str().to_string(),\n- ratio_left: vote.ratio_left,\n- ratio_right: vote.ratio_right,\n+ a: a_raw.to_string(),\n+ b: b_raw.to_string(),\n+ ratio_left,\n+ ratio_right,\n scope: parent.as_str().to_string(),\n };\n \n@@ -253,7 +259,7 @@ mod tests {\n let log = EventLog::new(log_path.to_string_lossy().into_owned());\n let payload = json!({\"kind\":\"t5\",\"data\":{\"title\":\"Rust\",\"display_name\":\"rust\"}});\n let event = Event::EntityImported {\n- id: \"reddit.com/r/rust\".into(),\n+ id: \"https://reddit.com/r/rust\".into(),\n ts: 1,\n payload: payload.clone(),\n };\n@@ -266,14 +272,14 @@ mod tests {\n .await\n .unwrap();\n let tree = projection_store\n- .scope_tree(&ItemId::parse(\"reddit.com/r/rust\").unwrap())\n+ .scope_tree(&ItemId::parse(\"https://reddit.com/r/rust\").unwrap())\n .unwrap();\n let node = tree\n- .get(&ItemId::parse(\"reddit.com/r/rust\").unwrap())\n+ .get(&ItemId::parse(\"https://reddit.com/r/rust\").unwrap())\n .unwrap();\n assert_eq!(node.data.as_ref().unwrap().title, \"Rust\");\n let stored = entity_store\n- .get(&ItemId::parse(\"reddit.com/r/rust\").unwrap())\n+ .get(&ItemId::parse(\"https://reddit.com/r/rust\").unwrap())\n .unwrap()\n .unwrap();\n assert_eq!(stored[\"data\"][\"display_name\"], \"rust\");\n@@ -289,13 +295,13 @@ mod tests {\n event_record(\n 1,\n Event::NodeEnsured {\n- id: \"reddit.com/r/rust\".into(),\n+ id: \"https://reddit.com/r/rust\".into(),\n },\n ),\n event_record(\n 2,\n Event::EntityImported {\n- id: \"reddit.com/r/rust\".into(),\n+ id: \"https://reddit.com/r/rust\".into(),\n ts: 2,\n payload: payload.clone(),\n },\n@@ -325,7 +331,7 @@ mod tests {\n &[event_record(\n 1,\n Event::NodeEnsured {\n- id: \"reddit.com/r/stale\".into(),\n+ id: \"https://reddit.com/r/stale\".into(),\n },\n )],\n )\n@@ -352,11 +358,11 @@ mod tests {\n let root = tree.get(&ItemId::root()).unwrap();\n assert!(root.children.contains(&ItemId::parse(\"alpha\").unwrap()));\n assert!(projection_store\n- .load_node(&ItemId::parse(\"reddit.com/r/stale\").unwrap())\n+ .load_node(&ItemId::parse(\"https://reddit.com/r/stale\").unwrap())\n .unwrap()\n .is_none());\n let stored = entity_store\n- .get(&ItemId::parse(\"reddit.com/r/rust\").unwrap())\n+ .get(&ItemId::parse(\"https://reddit.com/r/rust\").unwrap())\n .unwrap()\n .unwrap();\n assert_eq!(stored[\"data\"][\"display_name\"], \"rust\");\n@@ -370,7 +376,7 @@ mod tests {\n log.append(&event_record(\n 1,\n Event::NodeEnsured {\n- id: \"reddit.com/r/rust\".into(),\n+ id: \"https://reddit.com/r/rust\".into(),\n },\n ))\n .await\n@@ -387,7 +393,7 @@ mod tests {\n &[event_record(\n 2,\n Event::NodeEnsured {\n- id: \"reddit.com/r/rust\".into(),\n+ id: \"https://reddit.com/r/rust\".into(),\n },\n )],\n )\n@@ -454,7 +460,7 @@ mod tests {\n port: 0,\n })\n .await;\n- let id = ItemId::parse(\"reddit.com/r/rust\").unwrap();\n+ let id = ItemId::parse(\"https://reddit.com/r/rust\").unwrap();\n \n state.ensure_node(&id).await.unwrap();\n \n@@ -465,11 +471,11 @@ mod tests {\n let projected = state.projection_store.load_tree().unwrap();\n assert!(projected.get(&id).is_some());\n let reddit = projected\n- .get(&ItemId::parse(\"reddit.com\").unwrap())\n+ .get(&ItemId::from_url(\"https://reddit.com\").unwrap())\n .unwrap();\n assert!(reddit\n .children\n- .contains(&ItemId::parse(\"reddit.com/r\").unwrap()));\n+ .contains(&ItemId::from_url(\"https://reddit.com/r\").unwrap()));\n }\n \n #[tokio::test]\n@@ -510,7 +516,7 @@ mod tests {\n log.append(&event_record(\n 1,\n Event::NodeEnsured {\n- id: \"reddit.com/r/rust\".into(),\n+ id: \"https://reddit.com/r/rust\".into(),\n },\n ))\n .await\n@@ -518,7 +524,7 @@ mod tests {\n log.append(&event_record(\n 2,\n Event::NodeEnsured {\n- id: \"reddit.com/r/python\".into(),\n+ id: \"https://reddit.com/r/python\".into(),\n },\n ))\n .await\n@@ -544,13 +550,13 @@ mod tests {\n 2\n );\n let tree = second\n- .scope_tree(&ItemId::parse(\"reddit.com/r/rust\").unwrap())\n+ .scope_tree(&ItemId::parse(\"https://reddit.com/r/rust\").unwrap())\n .unwrap();\n assert!(tree\n- .get(&ItemId::parse(\"reddit.com/r/rust\").unwrap())\n+ .get(&ItemId::parse(\"https://reddit.com/r/rust\").unwrap())\n .is_some());\n assert!(tree\n- .get(&ItemId::parse(\"reddit.com/r/python\").unwrap())\n+ .get(&ItemId::parse(\"https://reddit.com/r/python\").unwrap())\n .is_none());\n }\n \n@@ -611,7 +617,7 @@ mod tests {\n #[test]\n fn parse_item_param_from_url() {\n let id = parse_item_param(\"https://reddit.com/r/rust\");\n- assert_eq!(id.as_str(), \"reddit.com/r/rust\");\n+ assert_eq!(id.as_str(), \"https://reddit.com/r/rust\");\n }\n \n #[test]\ndiff --git a/server/src/url_rules/engine.rs b/server/src/url_rules/engine.rs\nnew file mode 100644\nindex 0000000000000000000000000000000000000000..e29b6b48c08deb7bffe031b1e542b1e25a7bef15\n--- /dev/null\n+++ b/server/src/url_rules/engine.rs\n@@ -0,0 +1,187 @@\n+//! Composable URL normalization primitives.\n+\n+use std::collections::HashMap;\n+\n+use url::Url;\n+\n+/// Mutable URL view used by rule combinators before serializing to a canonical string.\n+#[derive(Debug, Clone)]\n+pub struct ParsedUrl {\n+ pub scheme: String,\n+ pub host: String,\n+ pub path_segments: Vec,\n+ pub query: HashMap,\n+ pub fragment: Option,\n+}\n+\n+impl ParsedUrl {\n+ pub fn parse(raw: &str) -> Option {\n+ let trimmed = raw.trim();\n+ if trimmed.is_empty() {\n+ return None;\n+ }\n+\n+ let with_scheme = if trimmed.contains(\"://\") {\n+ trimmed.to_string()\n+ } else if trimmed.starts_with(\"r/\") || trimmed.starts_with(\"/r/\") {\n+ let rest = trimmed.trim_start_matches('/').trim_start_matches(\"r/\");\n+ format!(\"https://reddit.com/r/{rest}\")\n+ } else if trimmed.contains('.') && !trimmed.starts_with('/') {\n+ format!(\"https://{trimmed}\")\n+ } else {\n+ trimmed.to_string()\n+ };\n+\n+ let url = Url::parse(&with_scheme).ok()?;\n+ let host = url.host_str()?.to_string();\n+ let path_segments: Vec = url\n+ .path_segments()\n+ .map(|segs| segs.filter(|s| !s.is_empty()).map(str::to_string).collect())\n+ .unwrap_or_default();\n+\n+ let mut query = HashMap::new();\n+ for (k, v) in url.query_pairs() {\n+ query.insert(k.into_owned(), v.into_owned());\n+ }\n+\n+ Some(Self {\n+ scheme: url.scheme().to_string(),\n+ path_segments,\n+ query,\n+ fragment: url.fragment().map(str::to_string),\n+ host,\n+ })\n+ }\n+\n+ pub fn with_path_segments(&self, segments: &[String]) -> Self {\n+ let mut u = self.clone();\n+ u.path_segments = segments.to_vec();\n+ u\n+ }\n+\n+ pub fn to_url(&self) -> Option {\n+ let mut url = if self.path_segments.is_empty() {\n+ Url::parse(&format!(\"{}://{}\", self.scheme, self.host)).ok()?\n+ } else {\n+ let path = format!(\"/{}\", self.path_segments.join(\"/\"));\n+ Url::parse(&format!(\"{}://{}{}\", self.scheme, self.host, path)).ok()?\n+ };\n+ if !self.query.is_empty() {\n+ let mut pairs: Vec<_> = self.query.iter().collect();\n+ pairs.sort_by(|a, b| a.0.cmp(b.0));\n+ url.query_pairs_mut().clear();\n+ for (k, v) in pairs {\n+ url.query_pairs_mut().append_pair(k, v);\n+ }\n+ }\n+ if let Some(ref frag) = self.fragment {\n+ url.set_fragment(Some(frag));\n+ }\n+ Some(url)\n+ }\n+\n+ pub fn canonical_string(&self) -> Option {\n+ let url = self.to_url()?;\n+ let mut s = url.to_string();\n+ if self.path_segments.is_empty() {\n+ s = s.trim_end_matches('/').to_string();\n+ }\n+ Some(s)\n+ }\n+}\n+\n+pub fn force_https(u: &mut ParsedUrl) {\n+ if u.scheme == \"http\" {\n+ u.scheme = \"https\".to_string();\n+ }\n+}\n+\n+pub fn drop_fragment(u: &mut ParsedUrl) {\n+ u.fragment = None;\n+}\n+\n+pub fn strip_www(u: &mut ParsedUrl) {\n+ if u.host.starts_with(\"www.\") {\n+ u.host = u.host[4..].to_string();\n+ }\n+}\n+\n+pub fn lowercase_host(u: &mut ParsedUrl) {\n+ u.host = u.host.to_ascii_lowercase();\n+}\n+\n+pub fn lowercase_path(u: &mut ParsedUrl) {\n+ for seg in &mut u.path_segments {\n+ *seg = seg.to_ascii_lowercase();\n+ }\n+}\n+\n+pub fn clear_query(u: &mut ParsedUrl) {\n+ u.query.clear();\n+}\n+\n+pub fn keep_only_query(u: &mut ParsedUrl, keys: &[&str]) {\n+ u.query\n+ .retain(|k, _| keys.iter().any(|want| want == &k.as_str()));\n+}\n+\n+pub fn strip_tracking_params(u: &mut ParsedUrl) {\n+ u.query.retain(|k, _| {\n+ let lower = k.to_ascii_lowercase();\n+ !(lower.starts_with(\"utm_\")\n+ || matches!(\n+ lower.as_str(),\n+ \"fbclid\" | \"gclid\" | \"ref\" | \"ref_src\" | \"ref_source\" | \"mc_cid\" | \"mc_eid\"\n+ ))\n+ });\n+}\n+\n+pub fn truncate_after_segment(u: &mut ParsedUrl, name: &str, keep: usize) {\n+ if let Some(i) = u.path_segments.iter().position(|s| s == name) {\n+ let end = (i + 1 + keep).min(u.path_segments.len());\n+ u.path_segments.truncate(end);\n+ }\n+}\n+\n+pub fn drop_listing_suffix(u: &mut ParsedUrl, suffixes: &[&str]) {\n+ if u.path_segments.len() >= 3 && u.path_segments.first().map(String::as_str) == Some(\"r\") {\n+ if let Some(last) = u.path_segments.last() {\n+ if suffixes.iter().any(|s| *s == last.as_str()) {\n+ u.path_segments.pop();\n+ }\n+ }\n+ }\n+}\n+\n+pub fn normalize_reddit_host(u: &mut ParsedUrl) {\n+ if matches!(\n+ u.host.as_str(),\n+ \"old.reddit.com\" | \"new.reddit.com\" | \"www.reddit.com\"\n+ ) {\n+ u.host = \"reddit.com\".to_string();\n+ }\n+}\n+\n+pub fn rewrite_youtu_be(u: &mut ParsedUrl) {\n+ if u.host == \"youtu.be\" && u.path_segments.len() == 1 {\n+ let id = u.path_segments[0].clone();\n+ u.host = \"youtube.com\".to_string();\n+ u.path_segments = vec![\"watch\".to_string()];\n+ u.query.insert(\"v\".to_string(), id);\n+ }\n+}\n+\n+pub fn rewrite_youtube_shorts(u: &mut ParsedUrl) {\n+ if u.host == \"youtube.com\" && u.path_segments.first().map(String::as_str) == Some(\"shorts\") {\n+ if let Some(id) = u.path_segments.get(1).cloned() {\n+ u.path_segments = vec![\"watch\".to_string()];\n+ u.query.insert(\"v\".to_string(), id);\n+ }\n+ }\n+}\n+\n+pub fn normalize_youtube_host(u: &mut ParsedUrl) {\n+ if matches!(u.host.as_str(), \"m.youtube.com\" | \"www.youtube.com\") {\n+ u.host = \"youtube.com\".to_string();\n+ }\n+}\ndiff --git a/server/src/url_rules/mod.rs b/server/src/url_rules/mod.rs\nnew file mode 100644\nindex 0000000000000000000000000000000000000000..03d53bd3e82d704a01ba3fd8dd02b7d31422c0de\n--- /dev/null\n+++ b/server/src/url_rules/mod.rs\n@@ -0,0 +1,13 @@\n+//! URL canonicalization and hierarchy rules for [`crate::path_types::ItemId`].\n+\n+mod engine;\n+mod registry;\n+\n+pub use registry::{\n+ canonicalize_raw, looks_like_url, navigable_breadcrumbs, parent_url, resolve_id, CanonicalResult,\n+};\n+\n+/// Resolve raw input to canonical URL.\n+pub fn resolve_canonical(raw: &str) -> Option {\n+ canonicalize_raw(raw.trim()).map(|r| r.canonical)\n+}\ndiff --git a/server/src/url_rules/registry.rs b/server/src/url_rules/registry.rs\nnew file mode 100644\nindex 0000000000000000000000000000000000000000..14514e9af8385fb2b9b2f35eb9ee14d453d4b97c\n--- /dev/null\n+++ b/server/src/url_rules/registry.rs\n@@ -0,0 +1,235 @@\n+//! Per-domain canonicalization and hierarchy rules.\n+\n+use std::collections::HashSet;\n+\n+use super::engine::{\n+ clear_query, drop_fragment, drop_listing_suffix, force_https, keep_only_query, lowercase_host,\n+ lowercase_path, normalize_reddit_host, normalize_youtube_host, rewrite_youtu_be,\n+ rewrite_youtube_shorts, strip_tracking_params, strip_www, truncate_after_segment, ParsedUrl,\n+};\n+\n+/// Result of canonicalizing a raw URL string.\n+#[derive(Debug, Clone, PartialEq, Eq)]\n+pub struct CanonicalResult {\n+ pub canonical: String,\n+ /// When the input normalizes to a different string, the original is an alias.\n+ pub alias_of: Option,\n+}\n+\n+fn apply_global(u: &mut ParsedUrl) {\n+ force_https(u);\n+ drop_fragment(u);\n+ strip_www(u);\n+ lowercase_host(u);\n+ strip_tracking_params(u);\n+}\n+\n+fn normalize_reddit(u: &mut ParsedUrl) {\n+ normalize_reddit_host(u);\n+ lowercase_path(u);\n+ truncate_after_segment(u, \"comments\", 1);\n+ drop_listing_suffix(u, &[\"hot\", \"top\", \"new\", \"rising\", \"controversial\"]);\n+ clear_query(u);\n+}\n+\n+fn normalize_youtube(u: &mut ParsedUrl) {\n+ rewrite_youtu_be(u);\n+ normalize_youtube_host(u);\n+ rewrite_youtube_shorts(u);\n+ keep_only_query(u, &[\"v\", \"list\"]);\n+}\n+\n+fn normalize_default(_u: &mut ParsedUrl) {\n+ // Global rules only.\n+}\n+\n+fn domain_key(host: &str) -> &'static str {\n+ if host == \"reddit.com\" || host.ends_with(\".reddit.com\") {\n+ \"reddit.com\"\n+ } else if host == \"youtube.com\" || host == \"youtu.be\" {\n+ \"youtube.com\"\n+ } else {\n+ \"default\"\n+ }\n+}\n+\n+fn normalize_for_host(u: &mut ParsedUrl) {\n+ apply_global(u);\n+ match domain_key(&u.host) {\n+ \"reddit.com\" => normalize_reddit(u),\n+ \"youtube.com\" => normalize_youtube(u),\n+ _ => normalize_default(u),\n+ }\n+}\n+\n+/// Structural path segments that must not become standalone tree nodes when more path follows.\n+fn structural_trailing(host: &str) -> &'static [&'static str] {\n+ match domain_key(host) {\n+ \"reddit.com\" => &[\"comments\"],\n+ _ => &[],\n+ }\n+}\n+\n+/// Canonicalize a raw URL. Returns `None` if the input is not URL-like.\n+pub fn canonicalize_raw(raw: &str) -> Option {\n+ let trimmed = raw.trim();\n+ if trimmed.is_empty() {\n+ return None;\n+ }\n+ let mut u = ParsedUrl::parse(trimmed)?;\n+ let input_snapshot = u.canonical_string()?;\n+ normalize_for_host(&mut u);\n+ let canonical = u.canonical_string()?;\n+ let alias_of = if input_snapshot != canonical {\n+ Some(trimmed.to_string())\n+ } else {\n+ None\n+ };\n+ Some(CanonicalResult {\n+ canonical,\n+ alias_of,\n+ })\n+}\n+\n+/// Resolve a stored or event id string to its canonical URL identity.\n+pub fn resolve_id(raw: &str) -> Option {\n+ canonicalize_raw(raw).map(|r| r.canonical)\n+}\n+\n+/// Navigable ancestor URLs from domain root up to and including `canonical` (full URLs).\n+pub fn navigable_breadcrumbs(canonical: &str) -> Vec {\n+ let Some(u) = ParsedUrl::parse(canonical) else {\n+ return vec![canonical.to_string()];\n+ };\n+ let structural: HashSet<&str> = structural_trailing(&u.host).iter().copied().collect();\n+ let n = u.path_segments.len();\n+ let mut out = Vec::new();\n+\n+ // Domain root (no path segments).\n+ if let Some(base) = u.with_path_segments(&[]).canonical_string() {\n+ out.push(base);\n+ }\n+\n+ for i in 0..n {\n+ let segs: Vec = u.path_segments[..=i].to_vec();\n+ let is_last = i == n - 1;\n+ let seg = u.path_segments[i].as_str();\n+ if structural.contains(seg) && !is_last {\n+ continue;\n+ }\n+ if let Some(url) = u.with_path_segments(&segs).canonical_string() {\n+ if out.last() != Some(&url) {\n+ out.push(url);\n+ }\n+ }\n+ }\n+ out\n+}\n+\n+/// Immediate parent scope URL, or `None` for tree root / opaque single-segment ids.\n+pub fn parent_url(canonical: &str) -> Option {\n+ let crumbs = navigable_breadcrumbs(canonical);\n+ if crumbs.len() <= 1 {\n+ None\n+ } else {\n+ crumbs.get(crumbs.len() - 2).cloned()\n+ }\n+}\n+\n+/// True when `raw` looks like a URL (has scheme or host-like shape).\n+pub fn looks_like_url(raw: &str) -> bool {\n+ let t = raw.trim();\n+ t.contains(\"://\")\n+ || t.starts_with(\"r/\")\n+ || t.starts_with(\"/r/\")\n+ || (t.contains('.') && t.contains('/'))\n+ || t.starts_with(\"reddit.com\")\n+ || t.starts_with(\"www.\")\n+ || t.starts_with(\"youtu.be/\")\n+}\n+\n+#[cfg(test)]\n+mod tests {\n+ use super::*;\n+\n+ #[test]\n+ fn reddit_post_drops_slug_and_normalizes_host() {\n+ let r = canonicalize_raw(\n+ \"https://old.reddit.com/r/AmItheAsshole/comments/1trnvdl/aita_for_cancelling/\",\n+ )\n+ .unwrap();\n+ assert_eq!(\n+ r.canonical,\n+ \"https://reddit.com/r/amitheasshole/comments/1trnvdl\"\n+ );\n+ }\n+\n+ #[test]\n+ fn reddit_strips_query_and_listing() {\n+ assert_eq!(\n+ canonicalize_raw(\"https://www.reddit.com/r/rust/?sort=top\")\n+ .unwrap()\n+ .canonical,\n+ \"https://reddit.com/r/rust\"\n+ );\n+ assert_eq!(\n+ canonicalize_raw(\"https://www.reddit.com/r/programming/hot\")\n+ .unwrap()\n+ .canonical,\n+ \"https://reddit.com/r/programming\"\n+ );\n+ }\n+\n+ #[test]\n+ fn reddit_short_path() {\n+ assert_eq!(\n+ canonicalize_raw(\"r/rust\").unwrap().canonical,\n+ \"https://reddit.com/r/rust\"\n+ );\n+ }\n+\n+ #[test]\n+ fn reddit_breadcrumbs_skip_phantom_comments() {\n+ let post = \"https://reddit.com/r/aww/comments/1trnvdl\";\n+ let crumbs = navigable_breadcrumbs(post);\n+ assert!(!crumbs.iter().any(|c| c.ends_with(\"/comments\")));\n+ assert_eq!(\n+ crumbs.last().map(String::as_str),\n+ Some(post)\n+ );\n+ assert!(crumbs.contains(&\"https://reddit.com/r/aww\".to_string()));\n+ }\n+\n+ #[test]\n+ fn reddit_parent_of_post_is_subreddit() {\n+ assert_eq!(\n+ parent_url(\"https://reddit.com/r/aww/comments/1trnvdl\").as_deref(),\n+ Some(\"https://reddit.com/r/aww\")\n+ );\n+ }\n+\n+ #[test]\n+ fn youtube_youtu_be_and_watch_same_canonical() {\n+ let a = canonicalize_raw(\"https://youtu.be/dQw4w9WgXcQ\").unwrap().canonical;\n+ let b = canonicalize_raw(\"https://www.youtube.com/watch?v=dQw4w9WgXcQ&t=10\").unwrap();\n+ assert_eq!(a, b.canonical);\n+ assert_eq!(a, \"https://youtube.com/watch?v=dQw4w9WgXcQ\");\n+ }\n+\n+ #[test]\n+ fn legacy_schemeless_upgrades() {\n+ assert_eq!(\n+ canonicalize_raw(\"reddit.com/r/rust/comments/aaa/announcing_rust_199\")\n+ .unwrap()\n+ .canonical,\n+ \"https://reddit.com/r/rust/comments/aaa\"\n+ );\n+ }\n+\n+ #[test]\n+ fn alias_recorded_when_input_differs() {\n+ let r = canonicalize_raw(\"https://youtu.be/abc123\").unwrap();\n+ assert_eq!(r.canonical, \"https://youtube.com/watch?v=abc123\");\n+ assert!(r.alias_of.is_some());\n+ }\n+}\n","role":"user"}],"model":"openai/gpt-chat-latest"}