{"messages":[{"content":"You are a constitutional council ranking individual git commits for ownership allocation.\n\nCompare these two commits. Decide which contributed more lasting value to the project.\n\nJudge substance, not spectacle:\n- Prefer correct, lasting design and real bugfixes over churn, formatting, renames, or generated noise.\n- Prefer clarity and necessity over sheer line count. A small precise change can beat a large diffuse one.\n- Do not favor a side merely because its patch is longer or noisier.\n- Weight what the change does for the project, not the contributor's name.\n\nReturn ONLY a JSON object: {\"winner\": \"A\" or \"B\", \"ratio\": \"N:M\", \"explanation\": \"...\"}\nThe explanation must cite concrete differences in the patches (1-3 sentences).\n\nSide A — contributor: tommy-mor\nSide A — commit message:\n[52f5c51c] Add Reddit OAuth linking and make UUID the only account identity.\n\nOAuth providers only attach to a session UUID (first link creates the\nprincipal); linked providers stay private on the account page.\n\nCo-authored-by: Cursor \n\nSide A — unified diff (full patch):\ndiff --git a/AGENTS.md b/AGENTS.md\nindex 6e0fd8ebb65d665c9c1438e3275971d62b98fd95..e9cc3173dbeb21ad0fc090ca7b407b027c7820a9 100644\n--- a/AGENTS.md\n+++ b/AGENTS.md\n@@ -35,8 +35,11 @@ Environment variables (defaults in `server/src/state.rs`):\n - `SORTER2_DATA_DIR` — default `./data` (created on startup)\n - `SORTER2_EVENT_LOG` — default `{data_dir}/events.jsonl`\n - `SORTER2_BASE_URL` — public origin (also drives Secure cookies when `https://`)\n-- `GITHUB_CLIENT_ID` / `GITHUB_CLIENT_SECRET` — GitHub OAuth (optional; login disabled if unset)\n-- `SORTER2_ALLOW_MOCK_OAUTH=1` — allow `mock_user` on `/auth/github` (tests only)\n+- `GITHUB_CLIENT_ID` / `GITHUB_CLIENT_SECRET` — GitHub OAuth linking (optional)\n+- `REDDIT_CLIENT_ID` / `REDDIT_CLIENT_SECRET` (or `REDDIT_APP_*`) — Reddit API import + OAuth linking (optional)\n+- `SORTER2_ALLOW_MOCK_OAUTH=1` — allow `mock_user` on `/auth/github` and `/auth/reddit` (tests only)\n+\n+Identity: UUID is canonical. OAuth providers only *link* to a UUID (first link creates the principal). Linked providers are private to the account owner.\n \n Health check: `GET /healthz` → `ok`.\n \ndiff --git a/server/src/auth/mod.rs b/server/src/auth/mod.rs\nindex 5906f93b13853421e96a3c37bc9d8202a47842bf..c706ae8045a811e5941f5f6c72da88f42a403a82 100644\n--- a/server/src/auth/mod.rs\n+++ b/server/src/auth/mod.rs\n@@ -1,4 +1,8 @@\n-//! GitHub OAuth login, session cookies, and vote actor resolution.\n+//! OAuth linking, session cookies, and vote actor resolution.\n+//!\n+//! Canonical identity is a UUID. OAuth providers only *link* to that UUID\n+//! (first link creates the principal; later links attach while logged in).\n+//! Which providers are linked is private to the account owner.\n \n pub mod config;\n pub mod identity;\n@@ -22,7 +26,9 @@ use crate::{\n form_template::template_json_compact,\n html::layout,\n state::AppState,\n- storage_schema::{oauth_link_owner, pseudonym_owner, Store, StoreFields},\n+ storage_schema::{\n+ linked_providers_for_uuid, oauth_link_owner, pseudonym_owner, Store, StoreFields,\n+ },\n ui_action::UI_RPC_FIELD,\n };\n \n@@ -53,10 +59,12 @@ fn new_actor_uuid() -> String {\n pub struct LoginQuery {\n #[serde(default)]\n pub return_to: Option,\n+ #[serde(default)]\n+ pub error: Option,\n }\n \n #[derive(Debug, Deserialize)]\n-pub struct GitHubStartQuery {\n+pub struct OAuthStartQuery {\n #[serde(default)]\n pub return_to: Option,\n #[serde(default)]\n@@ -72,15 +80,22 @@ fn return_from_query_or_jar(jar: &CookieJar, query: Option<&str>) -> String {\n .unwrap_or_else(|| \"/\".to_string())\n }\n \n-fn oauth_providers(base_url: &str, return_to: &str) -> Vec<(&'static str, String)> {\n+/// Available OAuth link targets: `(provider_key, label, start_href)`.\n+fn oauth_providers(base_url: &str, return_to: &str) -> Vec<(&'static str, &'static str, String)> {\n let mut out = Vec::new();\n+ let enc = urlencoding::encode(return_to);\n if oauth::GitHubConfig::from_env(base_url).is_some() {\n out.push((\n- \"GitHub\",\n- format!(\n- \"/auth/github?return_to={}\",\n- urlencoding::encode(return_to)\n- ),\n+ \"github\",\n+ oauth::provider_label(\"github\"),\n+ format!(\"/auth/github?return_to={enc}\"),\n+ ));\n+ }\n+ if oauth::RedditConfig::from_env(base_url).is_some() {\n+ out.push((\n+ \"reddit\",\n+ oauth::provider_label(\"reddit\"),\n+ format!(\"/auth/reddit?return_to={enc}\"),\n ));\n }\n out\n@@ -125,23 +140,41 @@ fn alias_claim_forms(return_to: &str, submit_label: &str) -> Result Markup {\n+fn login_error_message(code: Option<&str>) -> Option<&'static str> {\n+ match code {\n+ Some(\"oauth_taken\") => {\n+ Some(\"that OAuth account is already linked to a different sorter2 account\")\n+ }\n+ Some(\"oauth_failed\") => Some(\"OAuth failed — try again\"),\n+ _ => None,\n+ }\n+}\n+\n+fn signed_out_body(\n+ providers: &[(&str, &str, String)],\n+ error: Option<&str>,\n+) -> Markup {\n html! {\n main class=\"panel login-page\" {\n section class=\"login-section\" {\n h1 { \"sign in\" }\n- p class=\"muted\" { \"link an account to vote under a lasting alias\" }\n+ p class=\"muted\" {\n+ \"link an OAuth account to create your identity, then claim an alias to vote\"\n+ }\n+ @if let Some(msg) = login_error_message(error) {\n+ p class=\"alias-bad\" data-testid=\"login-error\" { (msg) }\n+ }\n @if providers.is_empty() {\n p class=\"muted\" {\n- \"OAuth is not configured. Set GITHUB_CLIENT_ID and GITHUB_CLIENT_SECRET.\"\n+ \"OAuth is not configured. Set GitHub and/or Reddit client credentials.\"\n }\n } @else {\n ul class=\"oauth-provider-list\" {\n- @for (name, href) in providers {\n+ @for (key, label, href) in providers {\n li {\n a href=(href) class=\"btn-primary oauth-provider\"\n- data-testid=(format!(\"oauth-{}\", name.to_lowercase())) {\n- (format!(\"Continue with {name}\"))\n+ data-testid=(format!(\"oauth-{key}\")) {\n+ (format!(\"Link {label}\"))\n }\n }\n }\n@@ -156,7 +189,10 @@ fn signed_out_body(providers: &[(&str, String)]) -> Markup {\n fn account_body(\n actor: &session::SessionActor,\n aliases: &[String],\n- providers: &[(&str, String)],\n+ // Provider keys already linked to this UUID (private).\n+ linked: &[String],\n+ // Providers available to link: not yet attached.\n+ unlinkable: &[(&str, &str, String)],\n claim_forms: Markup,\n ) -> Markup {\n let current = actor.pseudonym.trim();\n@@ -212,16 +248,29 @@ fn account_body(\n (claim_forms)\n }\n \n- @if !providers.is_empty() {\n- section class=\"login-section\" {\n- h2 { \"linked sign-in\" }\n- p class=\"muted small\" { \"sign in again with the same provider to return to this account\" }\n+ section class=\"login-section\" {\n+ h2 { \"linked sign-in\" }\n+ p class=\"muted small\" {\n+ \"private to you — linking more providers raises trust weight without publishing which accounts you use\"\n+ }\n+ @if linked.is_empty() {\n+ p class=\"muted\" data-testid=\"linked-providers-empty\" { \"none yet\" }\n+ } @else {\n+ ul class=\"linked-provider-list\" data-testid=\"linked-providers\" {\n+ @for key in linked {\n+ li data-testid=(format!(\"linked-{key}\")) {\n+ (oauth::provider_label(key))\n+ }\n+ }\n+ }\n+ }\n+ @if !unlinkable.is_empty() {\n ul class=\"oauth-provider-list\" {\n- @for (name, href) in providers {\n+ @for (key, label, href) in unlinkable {\n li {\n a href=(href) class=\"btn-secondary oauth-provider\"\n- data-testid=(format!(\"oauth-relink-{}\", name.to_lowercase())) {\n- (format!(\"Re-link {name}\"))\n+ data-testid=(format!(\"oauth-link-{key}\")) {\n+ (format!(\"Link {label}\"))\n }\n }\n }\n@@ -243,12 +292,21 @@ fn account_body(\n fn login_body(\n session: Option<&session::SessionActor>,\n aliases: &[String],\n- providers: &[(&str, String)],\n+ linked: &[String],\n+ providers: &[(&str, &str, String)],\n claim_forms: Option,\n+ error: Option<&str>,\n ) -> Markup {\n match (session, claim_forms) {\n- (Some(actor), Some(forms)) => account_body(actor, aliases, providers, forms),\n- _ => signed_out_body(providers),\n+ (Some(actor), Some(forms)) => {\n+ let unlinkable: Vec<_> = providers\n+ .iter()\n+ .filter(|(key, _, _)| !linked.iter().any(|p| p == key))\n+ .cloned()\n+ .collect();\n+ account_body(actor, aliases, linked, &unlinkable, forms)\n+ }\n+ _ => signed_out_body(providers, error),\n }\n }\n \n@@ -268,6 +326,10 @@ pub async fn login_page(\n .as_ref()\n .map(|s| alias_list(db, &s.uuid))\n .unwrap_or_default();\n+ let linked = session\n+ .as_ref()\n+ .map(|s| linked_providers_for_uuid(db, &s.uuid).unwrap_or_default())\n+ .unwrap_or_default();\n let providers = oauth_providers(&base_url_from_env(state.cfg.port), &return_to);\n \n let claim_forms = if session.is_some() {\n@@ -282,7 +344,14 @@ pub async fn login_page(\n } else {\n \"login · sorter2\"\n },\n- login_body(session.as_ref(), &aliases, &providers, claim_forms),\n+ login_body(\n+ session.as_ref(),\n+ &aliases,\n+ &linked,\n+ &providers,\n+ claim_forms,\n+ query.error.as_deref(),\n+ ),\n state.views.get_views(\"/login\"),\n session\n .as_ref()\n@@ -302,7 +371,6 @@ pub async fn alias_page(\n let db = state.projection_store.db();\n let session = session::load_valid_session(db, &session_id).ok_or(StatusCode::UNAUTHORIZED)?;\n if session::session_has_pseudonym(&session) {\n- // Already onboarded — manage aliases on the account page.\n return Ok(Redirect::to(\"/login\").into_response());\n }\n \n@@ -331,7 +399,7 @@ pub async fn alias_page(\n pub async fn github_start(\n State(state): State,\n jar: CookieJar,\n- Query(query): Query,\n+ Query(query): Query,\n ) -> Result {\n let cfg = oauth::GitHubConfig::from_env(&base_url_from_env(state.cfg.port))\n .ok_or(StatusCode::SERVICE_UNAVAILABLE)?;\n@@ -342,7 +410,28 @@ pub async fn github_start(\n } else {\n None\n };\n- let url = oauth::authorize_url(&cfg, &state_token, mock_user);\n+ let url = oauth::github_authorize_url(&cfg, &state_token, mock_user);\n+ let jar = jar\n+ .add(session::oauth_state_cookie_value(&state_token))\n+ .add(session::auth_return_cookie_value(&return_to));\n+ Ok((jar, Redirect::temporary(&url)).into_response())\n+}\n+\n+pub async fn reddit_start(\n+ State(state): State,\n+ jar: CookieJar,\n+ Query(query): Query,\n+) -> Result {\n+ let cfg = oauth::RedditConfig::from_env(&base_url_from_env(state.cfg.port))\n+ .ok_or(StatusCode::SERVICE_UNAVAILABLE)?;\n+ let return_to = return_from_query_or_jar(&jar, query.return_to.as_deref());\n+ let state_token = session::new_oauth_state();\n+ let mock_user = if config::mock_oauth_allowed() {\n+ query.mock_user.as_deref()\n+ } else {\n+ None\n+ };\n+ let url = oauth::reddit_authorize_url(&cfg, &state_token, mock_user);\n let jar = jar\n .add(session::oauth_state_cookie_value(&state_token))\n .add(session::auth_return_cookie_value(&return_to));\n@@ -355,6 +444,13 @@ pub struct OAuthCallbackQuery {\n pub state: String,\n }\n \n+/// Link `provider:provider_id` to a UUID.\n+///\n+/// - Logged in + new provider → attach to session UUID\n+/// - Logged in + already ours → no-op\n+/// - Logged in + owned by someone else → conflict\n+/// - Logged out + known link → resume that UUID\n+/// - Logged out + unknown → create principal + first link\n async fn finish_oauth_login(\n state: &AppState,\n jar: CookieJar,\n@@ -364,11 +460,41 @@ async fn finish_oauth_login(\n let db = state.projection_store.db();\n let return_to = return_from_query_or_jar(&jar, None);\n \n- let uuid = match oauth_link_owner(db, provider, &provider_id)\n- .map_err(|_| StatusCode::INTERNAL_SERVER_ERROR)?\n- {\n- Some(existing) => existing,\n- None => {\n+ let existing_owner = oauth_link_owner(db, provider, &provider_id)\n+ .map_err(|_| StatusCode::INTERNAL_SERVER_ERROR)?;\n+\n+ let session_uuid = session::session_id_from_jar(&jar)\n+ .as_deref()\n+ .and_then(|id| session::load_valid_session(db, id))\n+ .map(|s| s.uuid);\n+ let linking_while_logged_in = session_uuid.is_some();\n+\n+ let uuid = match (session_uuid, existing_owner) {\n+ (Some(session_uuid), Some(owner)) if owner == session_uuid => session_uuid,\n+ (Some(_), Some(_)) => {\n+ return Ok((\n+ jar.add(session::clear_oauth_state_cookie()),\n+ \"/login?error=oauth_taken\".into(),\n+ ));\n+ }\n+ (Some(session_uuid), None) => {\n+ let ts = now_ms();\n+ state\n+ .append_identity_events(vec![Event::OauthLinked {\n+ uuid: session_uuid.clone(),\n+ provider: provider.to_string(),\n+ provider_id,\n+ ts,\n+ }])\n+ .await\n+ .map_err(|e| {\n+ tracing::warn!(err = %e, \"oauth link append failed\");\n+ StatusCode::INTERNAL_SERVER_ERROR\n+ })?;\n+ session_uuid\n+ }\n+ (None, Some(owner)) => owner,\n+ (None, None) => {\n let uuid = new_actor_uuid();\n let ts = now_ms();\n state\n@@ -409,6 +535,9 @@ async fn finish_oauth_login(\n \"/login/alias?return_to={}\",\n urlencoding::encode(&return_to)\n )\n+ } else if linking_while_logged_in {\n+ // Additional link while already in an account → stay on account page.\n+ \"/login\".to_string()\n } else {\n return_to\n };\n@@ -434,22 +563,57 @@ pub async fn github_callback(\n .build()\n .map_err(|_| StatusCode::INTERNAL_SERVER_ERROR)?;\n \n- let token = oauth::exchange_code(&client, &cfg, &query.code)\n+ let token = oauth::github_exchange_code(&client, &cfg, &query.code)\n .await\n .map_err(|e| {\n tracing::warn!(err = %e, \"github oauth token exchange failed\");\n StatusCode::BAD_GATEWAY\n })?;\n- let user = oauth::fetch_user(&client, &cfg.api_base, &token)\n+ let user = oauth::github_fetch_user(&client, &cfg.api_base, &token)\n .await\n .map_err(|e| {\n tracing::warn!(err = %e, \"github user fetch failed\");\n StatusCode::BAD_GATEWAY\n })?;\n \n- let provider = \"github\";\n- let provider_id = oauth::provider_id(&user);\n- let (jar, dest) = finish_oauth_login(&state, jar, provider, provider_id).await?;\n+ let (jar, dest) =\n+ finish_oauth_login(&state, jar, \"github\", oauth::github_provider_id(&user)).await?;\n+ Ok((jar, Redirect::to(&dest)).into_response())\n+}\n+\n+pub async fn reddit_callback(\n+ State(state): State,\n+ jar: CookieJar,\n+ Query(query): Query,\n+) -> Result {\n+ let cfg = oauth::RedditConfig::from_env(&base_url_from_env(state.cfg.port))\n+ .ok_or(StatusCode::SERVICE_UNAVAILABLE)?;\n+\n+ let expected_state = session::oauth_state_from_jar(&jar).ok_or(StatusCode::BAD_REQUEST)?;\n+ if expected_state != query.state {\n+ return Err(StatusCode::BAD_REQUEST);\n+ }\n+\n+ let client = Client::builder()\n+ .timeout(std::time::Duration::from_secs(15))\n+ .build()\n+ .map_err(|_| StatusCode::INTERNAL_SERVER_ERROR)?;\n+\n+ let token = oauth::reddit_exchange_code(&client, &cfg, &query.code)\n+ .await\n+ .map_err(|e| {\n+ tracing::warn!(err = %e, \"reddit oauth token exchange failed\");\n+ StatusCode::BAD_GATEWAY\n+ })?;\n+ let user = oauth::reddit_fetch_user(&client, &cfg, &token)\n+ .await\n+ .map_err(|e| {\n+ tracing::warn!(err = %e, \"reddit user fetch failed\");\n+ StatusCode::BAD_GATEWAY\n+ })?;\n+\n+ let (jar, dest) =\n+ finish_oauth_login(&state, jar, \"reddit\", oauth::reddit_provider_id(&user)).await?;\n Ok((jar, Redirect::to(&dest)).into_response())\n }\n \ndiff --git a/server/src/auth/oauth.rs b/server/src/auth/oauth.rs\nindex b80078fee0c5acd905b9125d29454e46c4e0d066..369b1527d9032cf312a07819279e0f988ef4a36e 100644\n--- a/server/src/auth/oauth.rs\n+++ b/server/src/auth/oauth.rs\n@@ -1,8 +1,15 @@\n-//! GitHub OAuth (raw reqwest, same style as reddit.rs).\n+//! OAuth providers (GitHub + Reddit). Provider accounts only *link* to a UUID;\n+//! the UUID is the canonical identity. Which providers are linked is private.\n \n use reqwest::Client;\n use serde::Deserialize;\n \n+use crate::reddit::{\n+ default_user_agent, reddit_oauth_api_base, reddit_oauth_token_base,\n+};\n+\n+// ── GitHub ──────────────────────────────────────────────────────────────────\n+\n #[derive(Debug, Clone)]\n pub struct GitHubConfig {\n pub client_id: String,\n@@ -40,7 +47,7 @@ impl GitHubConfig {\n }\n \n #[derive(Debug, Deserialize)]\n-struct TokenResponse {\n+struct GitHubTokenResponse {\n access_token: String,\n }\n \n@@ -50,7 +57,7 @@ pub struct GitHubUser {\n pub login: String,\n }\n \n-pub fn authorize_url(cfg: &GitHubConfig, state: &str, mock_user: Option<&str>) -> String {\n+pub fn github_authorize_url(cfg: &GitHubConfig, state: &str, mock_user: Option<&str>) -> String {\n let mut url = format!(\n \"{}/login/oauth/authorize?client_id={}&redirect_uri={}&scope=read:user&state={}\",\n cfg.oauth_base.trim_end_matches('/'),\n@@ -65,7 +72,7 @@ pub fn authorize_url(cfg: &GitHubConfig, state: &str, mock_user: Option<&str>) -\n url\n }\n \n-pub async fn exchange_code(\n+pub async fn github_exchange_code(\n client: &Client,\n cfg: &GitHubConfig,\n code: &str,\n@@ -90,14 +97,14 @@ pub async fn exchange_code(\n return Err(format!(\"github token HTTP {}\", resp.status()));\n }\n \n- let body: TokenResponse = resp\n+ let body: GitHubTokenResponse = resp\n .json()\n .await\n .map_err(|e| format!(\"github token parse failed: {e}\"))?;\n Ok(body.access_token)\n }\n \n-pub async fn fetch_user(\n+pub async fn github_fetch_user(\n client: &Client,\n api_base: &str,\n access_token: &str,\n@@ -120,10 +127,149 @@ pub async fn fetch_user(\n .map_err(|e| format!(\"github user parse failed: {e}\"))\n }\n \n-pub fn provider_id(user: &GitHubUser) -> String {\n+pub fn github_provider_id(user: &GitHubUser) -> String {\n user.id.to_string()\n }\n \n+// ── Reddit ──────────────────────────────────────────────────────────────────\n+\n+#[derive(Debug, Clone)]\n+pub struct RedditConfig {\n+ pub client_id: String,\n+ pub client_secret: String,\n+ pub redirect_uri: String,\n+ /// Host for `/api/v1/authorize` (www.reddit.com in production).\n+ pub authorize_base: String,\n+ /// Host for `POST /api/v1/access_token`.\n+ pub token_base: String,\n+ /// Host for bearer `GET /api/v1/me` (oauth.reddit.com).\n+ pub api_base: String,\n+ pub user_agent: String,\n+}\n+\n+/// Authorize page base; defaults to the same host as token POSTs.\n+pub fn reddit_authorize_base() -> String {\n+ std::env::var(\"REDDIT_OAUTH_AUTHORIZE_BASE\")\n+ .or_else(|_| std::env::var(\"REDDIT_OAUTH_BASE\"))\n+ .unwrap_or_else(|_| \"https://www.reddit.com\".into())\n+}\n+\n+impl RedditConfig {\n+ pub fn from_env(base_url: &str) -> Option {\n+ let client_id = std::env::var(\"REDDIT_CLIENT_ID\")\n+ .or_else(|_| std::env::var(\"REDDIT_APP_ID\"))\n+ .ok()?;\n+ let client_secret = std::env::var(\"REDDIT_CLIENT_SECRET\")\n+ .or_else(|_| std::env::var(\"REDDIT_APP_SECRET\"))\n+ .ok()?;\n+ if client_id.is_empty() || client_secret.is_empty() {\n+ return None;\n+ }\n+ let base = base_url.trim_end_matches('/');\n+ Some(Self {\n+ client_id,\n+ client_secret,\n+ redirect_uri: format!(\"{base}/auth/reddit/callback\"),\n+ authorize_base: reddit_authorize_base(),\n+ token_base: reddit_oauth_token_base(),\n+ api_base: reddit_oauth_api_base(),\n+ user_agent: default_user_agent(),\n+ })\n+ }\n+}\n+\n+#[derive(Debug, Deserialize)]\n+struct RedditTokenResponse {\n+ access_token: String,\n+}\n+\n+#[derive(Debug, Deserialize)]\n+pub struct RedditUser {\n+ /// Stable id (`t2_…`); never use `name` as identity.\n+ pub id: String,\n+ pub name: String,\n+}\n+\n+pub fn reddit_authorize_url(cfg: &RedditConfig, state: &str, mock_user: Option<&str>) -> String {\n+ let mut url = format!(\n+ \"{}/api/v1/authorize?client_id={}&response_type=code&state={}&redirect_uri={}&duration=temporary&scope=identity\",\n+ cfg.authorize_base.trim_end_matches('/'),\n+ urlencoding::encode(&cfg.client_id),\n+ urlencoding::encode(state),\n+ urlencoding::encode(&cfg.redirect_uri),\n+ );\n+ if let Some(user) = mock_user {\n+ url.push_str(\"&mock_user=\");\n+ url.push_str(&urlencoding::encode(user));\n+ }\n+ url\n+}\n+\n+pub async fn reddit_exchange_code(\n+ client: &Client,\n+ cfg: &RedditConfig,\n+ code: &str,\n+) -> Result {\n+ let resp = client\n+ .post(format!(\n+ \"{}/api/v1/access_token\",\n+ cfg.token_base.trim_end_matches('/')\n+ ))\n+ .header(\"User-Agent\", &cfg.user_agent)\n+ .basic_auth(&cfg.client_id, Some(&cfg.client_secret))\n+ .form(&[\n+ (\"grant_type\", \"authorization_code\"),\n+ (\"code\", code),\n+ (\"redirect_uri\", cfg.redirect_uri.as_str()),\n+ ])\n+ .send()\n+ .await\n+ .map_err(|e| format!(\"reddit token request failed: {e}\"))?;\n+\n+ if !resp.status().is_success() {\n+ let status = resp.status();\n+ let body = resp.text().await.unwrap_or_default();\n+ return Err(format!(\"reddit token HTTP {status}: {body}\"));\n+ }\n+\n+ let body: RedditTokenResponse = resp\n+ .json()\n+ .await\n+ .map_err(|e| format!(\"reddit token parse failed: {e}\"))?;\n+ Ok(body.access_token)\n+}\n+\n+pub async fn reddit_fetch_user(\n+ client: &Client,\n+ cfg: &RedditConfig,\n+ access_token: &str,\n+) -> Result {\n+ let resp = client\n+ .get(format!(\n+ \"{}/api/v1/me\",\n+ cfg.api_base.trim_end_matches('/')\n+ ))\n+ .header(\"User-Agent\", &cfg.user_agent)\n+ .bearer_auth(access_token)\n+ .send()\n+ .await\n+ .map_err(|e| format!(\"reddit user request failed: {e}\"))?;\n+\n+ if !resp.status().is_success() {\n+ return Err(format!(\"reddit user HTTP {}\", resp.status()));\n+ }\n+\n+ resp.json()\n+ .await\n+ .map_err(|e| format!(\"reddit user parse failed: {e}\"))\n+}\n+\n+pub fn reddit_provider_id(user: &RedditUser) -> String {\n+ user.id.clone()\n+}\n+\n+// ── Shared helpers ──────────────────────────────────────────────────────────\n+\n pub fn validate_pseudonym(raw: &str) -> Result {\n let trimmed = raw.trim();\n if trimmed.is_empty() {\n@@ -144,3 +290,12 @@ pub fn validate_pseudonym(raw: &str) -> Result {\n pub fn sanitize_pseudonym(login: &str) -> String {\n validate_pseudonym(login).unwrap_or_else(|_| \"user\".to_string())\n }\n+\n+/// Display name for a provider key (`github` → `GitHub`). Never show provider ids.\n+pub fn provider_label(provider: &str) -> &'static str {\n+ match provider {\n+ \"github\" => \"GitHub\",\n+ \"reddit\" => \"Reddit\",\n+ _ => \"OAuth\",\n+ }\n+}\ndiff --git a/server/src/lib.rs b/server/src/lib.rs\nindex 84f2565b105fb302241b949af64bd5e49916eab2..0d948af1457504fdbd34d0b14261f65ac58da0ec 100644\n--- a/server/src/lib.rs\n+++ b/server/src/lib.rs\n@@ -47,6 +47,8 @@ pub fn create_app(state: AppState) -> Router {\n .route(\"/login/alias\", get(crate::auth::alias_page))\n .route(\"/auth/github\", get(crate::auth::github_start))\n .route(\"/auth/github/callback\", get(crate::auth::github_callback))\n+ .route(\"/auth/reddit\", get(crate::auth::reddit_start))\n+ .route(\"/auth/reddit/callback\", get(crate::auth::reddit_callback))\n .route(\"/auth/logout\", post(crate::auth::logout))\n .route(\"/auth/switch\", post(crate::auth::switch_pseudonym))\n .route(\"/ui\", post(crate::api::ui_html::post_ui_html))\ndiff --git a/server/src/projection_apply.rs b/server/src/projection_apply.rs\nindex 4fb4b48ee0a53b7f673fae0c9731eed5acc33332..f50458c2ff3c447a3cfd28adb298e6883a2da4e9 100644\n--- a/server/src/projection_apply.rs\n+++ b/server/src/projection_apply.rs\n@@ -4,6 +4,8 @@\n //! child links, recent-vote appends) plus a cursor advance, all committed in\n //! one atomic `DisableWal` batch.\n \n+use std::collections::HashMap;\n+\n use crate::{\n event_log::EventLogError,\n events::{Event, EventRecord},\n@@ -44,6 +46,8 @@ pub fn apply_records(\n let db = projection_store.db();\n let mut batch = db.batch();\n let mut last_seq = 0u64;\n+ // Weight reads must see earlier writes in this same batch.\n+ let mut pending_weights: HashMap = HashMap::new();\n \n for record in records {\n match &record.event {\n@@ -85,6 +89,7 @@ pub fn apply_records(\n ensure_path_writes(&mut batch, &parsed);\n }\n Event::PrincipalCreated { uuid, .. } => {\n+ pending_weights.insert(uuid.clone(), BASE_TRUST_WEIGHT);\n batch.write(\n Store::root()\n .user_weights()\n@@ -112,17 +117,25 @@ pub fn apply_records(\n }\n } else {\n batch.write(Store::root().oauth_links().key(&link_key).set(uuid));\n- let current = Store::root()\n- .user_weights()\n- .key(&uuid.clone())\n- .get(db)\n- .map_err(|e| EventLogError::Apply(e.to_string()))?\n+ let current = pending_weights\n+ .get(uuid)\n+ .copied()\n+ .or_else(|| {\n+ Store::root()\n+ .user_weights()\n+ .key(&uuid.clone())\n+ .get(db)\n+ .ok()\n+ .flatten()\n+ })\n .unwrap_or(BASE_TRUST_WEIGHT);\n+ let next = trust_weight_after_link(current);\n+ pending_weights.insert(uuid.clone(), next);\n batch.write(\n Store::root()\n .user_weights()\n .key(&uuid.clone())\n- .set(&trust_weight_after_link(current)),\n+ .set(&next),\n );\n }\n }\n@@ -205,6 +218,15 @@ mod tests {\n ),\n record(\n 3,\n+ Event::OauthLinked {\n+ uuid: uuid.into(),\n+ provider: \"reddit\".into(),\n+ provider_id: \"t2_abc\".into(),\n+ ts,\n+ },\n+ ),\n+ record(\n+ 4,\n Event::PseudonymClaimed {\n uuid: uuid.into(),\n pseudonym: \"octocat\".into(),\n@@ -219,8 +241,12 @@ mod tests {\n oauth_link_owner(store.db(), \"github\", \"42\").unwrap(),\n Some(uuid.to_string())\n );\n+ assert_eq!(\n+ crate::storage_schema::linked_providers_for_uuid(store.db(), uuid).unwrap(),\n+ vec![\"github\".to_string(), \"reddit\".to_string()]\n+ );\n assert_eq!(resolve_actor_uuid(store.db(), \"octocat\").unwrap(), uuid);\n- assert_eq!(user_trust_weight(store.db(), uuid).unwrap(), 1.5);\n+ assert_eq!(user_trust_weight(store.db(), uuid).unwrap(), 2.0);\n let aliases = Store::root()\n .user_pseudonyms()\n .key(&uuid.to_string())\ndiff --git a/server/src/storage_schema.rs b/server/src/storage_schema.rs\nindex b942810afd96d3bf01b7765718303a39be4ef8d2..dac6f8e6080e3f5683c24dbb8861f5a981d456c4 100644\n--- a/server/src/storage_schema.rs\n+++ b/server/src/storage_schema.rs\n@@ -103,6 +103,25 @@ pub fn oauth_link_owner(db: &Db, provider: &str, provider_id: &str) -> durable::\n .get(db)\n }\n \n+/// Provider names linked to a UUID (`github`, `reddit`, …). Private — for the\n+/// account owner's page only; never expose which providers are linked publicly.\n+pub fn linked_providers_for_uuid(db: &Db, uuid: &str) -> durable::Result> {\n+ let mut providers = Vec::new();\n+ for (key, owner) in Store::root().oauth_links().iter(db)? {\n+ if owner != uuid {\n+ continue;\n+ }\n+ let Some((provider, _)) = key.split_once(':') else {\n+ continue;\n+ };\n+ if !providers.iter().any(|p| p == provider) {\n+ providers.push(provider.to_string());\n+ }\n+ }\n+ providers.sort();\n+ Ok(providers)\n+}\n+\n pub const RECENT_VOTES_CAP: u64 = 200;\n \n fn id_key(id: &ItemId) -> String {\ndiff --git a/test/support/harness.clj b/test/support/harness.clj\nindex 4505ece5aa193e826ca61c52f1467d252080d66b..741024aab1d14269e225791189633287980ae2e4 100644\n--- a/test/support/harness.clj\n+++ b/test/support/harness.clj\n@@ -48,12 +48,15 @@\n \"GITHUB_CLIENT_SECRET\" \"test-secret\"\n \"GITHUB_OAUTH_BASE\" (str \"http://127.0.0.1:\" oauth-port)\n \"GITHUB_API_BASE\" (str \"http://127.0.0.1:\" oauth-port)\n+ ;; Reddit import fixtures + Reddit OAuth on reddit-port.\n \"REDDIT_API_BASE\" (str \"http://127.0.0.1:\" reddit-port)\n+ \"REDDIT_CLIENT_ID\" \"test-reddit\"\n+ \"REDDIT_CLIENT_SECRET\" \"test-reddit-secret\"\n \"REDDIT_OAUTH_BASE\" (str \"http://127.0.0.1:\" reddit-port)\n- \"REDDIT_CLIENT_ID\" \"\"\n- \"REDDIT_CLIENT_SECRET\" \"\"\n- \"REDDIT_APP_ID\" \"\"\n- \"REDDIT_APP_SECRET\" \"\"}))\n+ \"REDDIT_OAUTH_AUTHORIZE_BASE\" (str \"http://127.0.0.1:\" reddit-port)\n+ \"REDDIT_OAUTH_TOKEN_BASE\" (str \"http://127.0.0.1:\" reddit-port)\n+ \"REDDIT_OAUTH_API_BASE\" (str \"http://127.0.0.1:\" reddit-port)\n+ \"REDDIT_USER_AGENT\" \"web:sorter2-test:v0 (by /u/test)\"}))\n \n (defn with-auth-servers\n \"Start mock Reddit + mock OAuth + release sorter2-server.\ndiff --git a/test/support/mock_oauth.clj b/test/support/mock_oauth.clj\nindex 909d7a7be8b159ea54a122d69c46af3db3318118..5ba7e9be3cf6d2226648e9609a09ed45f306930f 100644\n--- a/test/support/mock_oauth.clj\n+++ b/test/support/mock_oauth.clj\n@@ -1,5 +1,5 @@\n (ns test.support.mock-oauth\n- \"In-process HTTP stub for GitHub OAuth (authorize, token, /user).\"\n+ \"In-process HTTP stub for GitHub + Reddit OAuth (authorize, token, user).\"\n (:require [clojure.string :as str])\n (:import [com.sun.net.httpserver HttpServer HttpHandler HttpExchange]\n [java.net InetSocketAddress URLDecoder]))\n@@ -12,11 +12,14 @@\n (URLDecoder/decode (or v \"\") \"UTF-8\"))))\n (str/split query #\"&\"))))\n \n-(defn- parse-mock-user [raw]\n+(defn- parse-mock-user\n+ \"GitHub-style `id:login` (numeric id). Reddit-style `t2_xxx:name`.\"\n+ [raw]\n (let [s (or raw \"1002:newbie\")\n [id login] (str/split s #\":\" 2)]\n- {:id (Long/parseLong id)\n- :login (or login \"newbie\")}))\n+ {:id id\n+ :login (or login \"newbie\")\n+ :numeric? (re-matches #\"\\d+\" id)}))\n \n (defn- send-json [^HttpExchange ex status body]\n (let [bytes (.getBytes body \"UTF-8\")]\n@@ -31,9 +34,10 @@\n (.sendResponseHeaders ex 302 -1)\n (.close (.getResponseBody ex)))\n \n-(defn- read-form-code [^HttpExchange ex]\n+(defn- read-form [^HttpExchange ex]\n (let [body (slurp (.getInputStream ex))]\n- (query-param body \"code\")))\n+ {:code (query-param body \"code\")\n+ :grant (query-param body \"grant_type\")}))\n \n (defn- bearer-token [^HttpExchange ex]\n (some-> (.getRequestHeaders ex)\n@@ -44,8 +48,18 @@\n (when (str/starts-with? token \"mock:\")\n (parse-mock-user (subs token 5))))\n \n+(defn- authorize-redirect [exchange query]\n+ (let [redirect-uri (query-param query \"redirect_uri\")\n+ state (query-param query \"state\")\n+ mock-user (query-param query \"mock_user\")\n+ user (parse-mock-user mock-user)\n+ code (str \"mock:\" (:id user) \":\" (:login user))\n+ loc (str redirect-uri \"?code=\" (java.net.URLEncoder/encode code \"UTF-8\")\n+ \"&state=\" (java.net.URLEncoder/encode state \"UTF-8\"))]\n+ (send-redirect exchange loc)))\n+\n (defn start-mock-oauth\n- \"Start mock GitHub OAuth on `port`. Returns a zero-arg `stop` function.\"\n+ \"Start mock GitHub + Reddit OAuth on `port`. Returns a zero-arg `stop` function.\"\n [port]\n (let [server (HttpServer/create (InetSocketAddress. \"127.0.0.1\" port) 0)\n handler\n@@ -53,28 +67,45 @@\n (handle [^HttpExchange exchange]\n (let [uri (.getRequestURI exchange)\n path (.getPath uri)\n- query (.getQuery uri)]\n+ query (.getQuery uri)\n+ method (.getRequestMethod exchange)]\n (cond\n+ ;; GitHub authorize\n (str/ends-with? path \"/login/oauth/authorize\")\n- (let [redirect-uri (query-param query \"redirect_uri\")\n- state (query-param query \"state\")\n- mock-user (query-param query \"mock_user\")\n- user (parse-mock-user mock-user)\n- code (str \"mock:\" (:id user) \":\" (:login user))\n- loc (str redirect-uri \"?code=\" (java.net.URLEncoder/encode code \"UTF-8\")\n- \"&state=\" (java.net.URLEncoder/encode state \"UTF-8\"))]\n- (send-redirect exchange loc))\n+ (authorize-redirect exchange query)\n+\n+ ;; Reddit authorize\n+ (str/ends-with? path \"/api/v1/authorize\")\n+ (authorize-redirect exchange query)\n \n- (str/ends-with? path \"/login/oauth/access_token\")\n- (let [code (or (read-form-code exchange) \"mock:1002:newbie\")]\n+ ;; GitHub token\n+ (and (= method \"POST\") (str/ends-with? path \"/login/oauth/access_token\"))\n+ (let [code (or (:code (read-form exchange)) \"mock:1002:newbie\")]\n (send-json exchange 200 (str \"{\\\"access_token\\\":\\\"\" code \"\\\",\\\"token_type\\\":\\\"bearer\\\"}\")))\n \n+ ;; Reddit token (client_credentials for import + authorization_code for login)\n+ (and (= method \"POST\") (str/ends-with? path \"/api/v1/access_token\"))\n+ (let [form (read-form exchange)\n+ grant (or (:grant form) \"\")\n+ code (or (:code form) \"mock:t2_test:redditor\")]\n+ (if (= grant \"client_credentials\")\n+ (send-json exchange 200 \"{\\\"access_token\\\":\\\"app-token\\\",\\\"token_type\\\":\\\"bearer\\\",\\\"expires_in\\\":3600}\")\n+ (send-json exchange 200 (str \"{\\\"access_token\\\":\\\"\" code \"\\\",\\\"token_type\\\":\\\"bearer\\\",\\\"expires_in\\\":3600}\"))))\n+\n+ ;; GitHub user\n (= path \"/user\")\n (let [token (bearer-token exchange)\n- user (or (parse-token-user token) {:id 1002 :login \"newbie\"})]\n+ user (or (parse-token-user token) {:id \"1002\" :login \"newbie\" :numeric? true})]\n (send-json exchange 200\n (str \"{\\\"id\\\":\" (:id user) \",\\\"login\\\":\\\"\" (:login user) \"\\\"}\")))\n \n+ ;; Reddit /api/v1/me\n+ (str/ends-with? path \"/api/v1/me\")\n+ (let [token (bearer-token exchange)\n+ user (or (parse-token-user token) {:id \"t2_test\" :login \"redditor\"})]\n+ (send-json exchange 200\n+ (str \"{\\\"id\\\":\\\"\" (:id user) \"\\\",\\\"name\\\":\\\"\" (:login user) \"\\\"}\")))\n+\n :else\n (send-json exchange 404 \"{\\\"error\\\":\\\"not found\\\"}\")))))]\n (.createContext server \"/\" handler)\ndiff --git a/test/support/mock_reddit.clj b/test/support/mock_reddit.clj\nindex 5efa92db3e1f79b8f423a2f1adcbda959123c1ad..a630cf0938722193e9af88382d60e777ff371be4 100644\n--- a/test/support/mock_reddit.clj\n+++ b/test/support/mock_reddit.clj\n@@ -1,14 +1,56 @@\n (ns test.support.mock-reddit\n- \"In-process HTTP stub for Reddit API fixtures (`test/fixtures/reddit/`).\"\n+ \"In-process HTTP stub for Reddit API fixtures + OAuth login endpoints.\"\n (:require [clojure.java.io :as io]\n [clojure.string :as str])\n (:import [com.sun.net.httpserver HttpServer HttpHandler HttpExchange]\n- [java.net InetSocketAddress]))\n+ [java.net InetSocketAddress URLDecoder]))\n \n (defn fixtures-dir\n ([] (fixtures-dir (System/getProperty \"user.dir\")))\n ([root] (str root \"/test/fixtures/reddit\")))\n \n+(defn- query-param [query key]\n+ (when query\n+ (some (fn [pair]\n+ (let [[k v] (str/split pair \"=\" 2)]\n+ (when (= k key)\n+ (URLDecoder/decode (or v \"\") \"UTF-8\"))))\n+ (str/split query #\"&\"))))\n+\n+(defn- parse-mock-user [raw]\n+ (let [s (or raw \"t2_test:redditor\")\n+ [id login] (str/split s #\":\" 2)]\n+ {:id id :login (or login \"redditor\")}))\n+\n+(defn- send-bytes [^HttpExchange ex status ^bytes body content-type]\n+ (.set (.getResponseHeaders ex) \"Content-Type\" content-type)\n+ (.sendResponseHeaders ex status (alength body))\n+ (doto (.getResponseBody ex)\n+ (.write body)\n+ (.close)))\n+\n+(defn- send-json [^HttpExchange ex status body]\n+ (send-bytes ex status (.getBytes body \"UTF-8\") \"application/json\"))\n+\n+(defn- send-redirect [^HttpExchange ex location]\n+ (.set (.getResponseHeaders ex) \"Location\" location)\n+ (.sendResponseHeaders ex 302 -1)\n+ (.close (.getResponseBody ex)))\n+\n+(defn- read-form [^HttpExchange ex]\n+ (let [body (slurp (.getInputStream ex))]\n+ {:code (query-param body \"code\")\n+ :grant (query-param body \"grant_type\")}))\n+\n+(defn- bearer-token [^HttpExchange ex]\n+ (some-> (.getRequestHeaders ex)\n+ (.getFirst \"Authorization\")\n+ (str/replace #\"^[Bb]earer \" \"\")))\n+\n+(defn- parse-token-user [token]\n+ (when (str/starts-with? token \"mock:\")\n+ (parse-mock-user (subs token 5))))\n+\n (defn start-mock-reddit\n \"Start a mock Reddit API on `port`. Returns a zero-arg `stop` function.\"\n ([port] (start-mock-reddit port (fixtures-dir)))\n@@ -19,15 +61,38 @@\n handler\n (proxy [HttpHandler] []\n (handle [^HttpExchange exchange]\n- ;; `/r//about.json` → subreddit entity; `/r/.json` → listing.\n- (let [path (.getPath (.getRequestURI exchange))\n- body (if (str/includes? path \"/about\")\n- about\n- listing)]\n- (.sendResponseHeaders exchange 200 (alength body))\n- (let [out (.getResponseBody exchange)]\n- (.write out body)\n- (.close out)))))]\n+ (let [uri (.getRequestURI exchange)\n+ path (.getPath uri)\n+ query (.getQuery uri)\n+ method (.getRequestMethod exchange)]\n+ (cond\n+ (str/ends-with? path \"/api/v1/authorize\")\n+ (let [redirect-uri (query-param query \"redirect_uri\")\n+ state (query-param query \"state\")\n+ user (parse-mock-user (query-param query \"mock_user\"))\n+ code (str \"mock:\" (:id user) \":\" (:login user))\n+ loc (str redirect-uri \"?code=\" (java.net.URLEncoder/encode code \"UTF-8\")\n+ \"&state=\" (java.net.URLEncoder/encode state \"UTF-8\"))]\n+ (send-redirect exchange loc))\n+\n+ (and (= method \"POST\") (str/ends-with? path \"/api/v1/access_token\"))\n+ (let [form (read-form exchange)\n+ grant (or (:grant form) \"\")\n+ code (or (:code form) \"mock:t2_test:redditor\")]\n+ (if (= grant \"client_credentials\")\n+ (send-json exchange 200 \"{\\\"access_token\\\":\\\"app-token\\\",\\\"token_type\\\":\\\"bearer\\\",\\\"expires_in\\\":3600}\")\n+ (send-json exchange 200 (str \"{\\\"access_token\\\":\\\"\" code \"\\\",\\\"token_type\\\":\\\"bearer\\\",\\\"expires_in\\\":3600}\"))))\n+\n+ (str/ends-with? path \"/api/v1/me\")\n+ (let [user (or (parse-token-user (bearer-token exchange))\n+ {:id \"t2_test\" :login \"redditor\"})]\n+ (send-json exchange 200\n+ (str \"{\\\"id\\\":\\\"\" (:id user) \"\\\",\\\"name\\\":\\\"\" (:login user) \"\\\"}\")))\n+\n+ ;; `/r//about.json` → subreddit entity; `/r/.json` → listing.\n+ :else\n+ (let [body (if (str/includes? path \"/about\") about listing)]\n+ (send-bytes exchange 200 body \"application/json\"))))))]\n (.createContext server \"/\" handler)\n (.setExecutor server nil)\n (.start server)\n\n\nSide B — contributor: tommy-mor\nSide B — commit message:\n[239c074b] url schema stuff\n\nSide B — unified diff (full patch):\ndiff --git a/AGENTS.md b/AGENTS.md\nindex 426a88e7c1da54fe0a28c5c76fa4e1f1bc117fcf..e60b9ba6012593361ef10e8fdd9439cd9932e09b 100644\n--- a/AGENTS.md\n+++ b/AGENTS.md\n@@ -58,3 +58,4 @@ Use **tmux** for `cargo run --package sorter2-server` (dev server). Rebuild afte\n \n - First `cargo test` / `cargo build --release` is slow; Clojure smoke test always does a release build.\n - `legacy/` and `ideas/` are not part of the workspace build.\n+- **ItemId** for web URLs is a canonical full URL (`https://reddit.com/r/rust`). Rules live in [`server/src/url_rules/`](server/src/url_rules/) (composable Rust, not a config DSL). After changing canonicalization rules, rebuild the projection: `cargo run --package sorter2-server -- replay-index`.\ndiff --git a/Cargo.lock b/Cargo.lock\nindex 0dd4fce5fb6400ae153cca4e3dbf5a5158e6d8b4..49a908ef935c430dbe63c6a28d8a24e38b489486 100644\n--- a/Cargo.lock\n+++ b/Cargo.lock\n@@ -1951,6 +1951,7 @@ dependencies = [\n \"tower-http 0.5.2\",\n \"tracing\",\n \"tracing-subscriber\",\n+ \"url\",\n \"urlencoding\",\n ]\n \ndiff --git a/REPLAY.sh b/REPLAY.sh\nnew file mode 100755\nindex 0000000000000000000000000000000000000000..f2dbd8aea60c02d2feef74805f7ef5c2b7022537\n--- /dev/null\n+++ b/REPLAY.sh\n@@ -0,0 +1,2 @@\n+cargo run --package sorter2-server -- replay-index\n+\ndiff --git a/server/Cargo.toml b/server/Cargo.toml\nindex 27f552c20b97ef28cdde4cb6b1a4980375135111..ad4912791aff59fb1d3293f66ad381ae618cd60b 100644\n--- a/server/Cargo.toml\n+++ b/server/Cargo.toml\n@@ -24,6 +24,7 @@ async-stream = \"0.3\"\n futures-util = { version = \"0.3\", default-features = false, features = [\"std\"] }\n rand = \"0.8\"\n urlencoding = \"2\"\n+url = \"2\"\n durable = { path = \"../durable\" }\n \n [dev-dependencies]\ndiff --git a/server/src/entity_store.rs b/server/src/entity_store.rs\nindex d5d17c3676e4a8ddec998e9f5a9dbafe9c2d9d0e..d29f39aecca6f12cdcf263cf77c3654eb4ee6cfa 100644\n--- a/server/src/entity_store.rs\n+++ b/server/src/entity_store.rs\n@@ -124,7 +124,7 @@ mod tests {\n fn round_trip_payload() {\n let tmp = tempfile::tempdir().unwrap();\n let store = EntityStore::open(tmp.path()).unwrap();\n- let id = ItemId::parse(\"reddit.com/r/rust\").unwrap();\n+ let id = ItemId::from_url(\"https://reddit.com/r/rust\").unwrap();\n let payload = json!({\"kind\": \"t5\", \"data\": {\"display_name\": \"rust\"}});\n \n store.put(&id, &payload).unwrap();\ndiff --git a/server/src/event_log.rs b/server/src/event_log.rs\nindex 36f5b406084065b608735987cdb483c236e03081..2c9290b6fdbf2c2ad1c0f1ffd7374b2d9cc97f36 100644\n--- a/server/src/event_log.rs\n+++ b/server/src/event_log.rs\n@@ -199,7 +199,7 @@ mod tests {\n log.append(&sample_record(\n 1,\n Event::NodeEnsured {\n- id: \"reddit.com/r/rust\".into(),\n+ id: \"https://reddit.com/r/rust\".into(),\n },\n ))\n .await\n@@ -237,7 +237,7 @@ mod tests {\n let path = tmp.path().join(\"events.jsonl\");\n let log = EventLog::new(&path);\n let event = Event::NodeEnsured {\n- id: \"reddit.com/r/rust\".into(),\n+ id: \"https://reddit.com/r/rust\".into(),\n };\n log.append(&sample_record(1, event)).await.unwrap();\n \n@@ -255,7 +255,7 @@ mod tests {\n let path = tmp.path().join(\"events.jsonl\");\n std::fs::write(\n &path,\n- r#\"{\"type\":\"node_ensured\",\"id\":\"reddit.com/r/rust\"}\n+ r#\"{\"type\":\"node_ensured\",\"id\":\"https://reddit.com/r/rust\"}\n {\"schema\":1,\"seq\":1,\"ts\":1,\"event\":{\"type\":\"vote_recorded\",\"ts\":1,\"a\":\"a\",\"b\":\"b\",\"ratio_left\":2,\"ratio_right\":1,\"scope\":\"\"}}\n \"#,\n )\n@@ -295,7 +295,7 @@ mod tests {\n log.append(&sample_record(\n 1,\n Event::NodeEnsured {\n- id: \"reddit.com/r/rust\".into(),\n+ id: \"https://reddit.com/r/rust\".into(),\n },\n ))\n .await\n@@ -303,7 +303,7 @@ mod tests {\n log.append(&sample_record(\n 3,\n Event::NodeEnsured {\n- id: \"reddit.com/r/python\".into(),\n+ id: \"https://reddit.com/r/python\".into(),\n },\n ))\n .await\ndiff --git a/server/src/journal.rs b/server/src/journal.rs\nindex 521a108019de1ea870d14c4fafbfe572c20ce0de..50bc89f976edb82b7b0e49e954a8eccbbe82bf87 100644\n--- a/server/src/journal.rs\n+++ b/server/src/journal.rs\n@@ -141,10 +141,10 @@ mod tests {\n let j2 = journal.clone();\n let (r1, r2) = tokio::join!(\n j1.append(Event::NodeEnsured {\n- id: \"reddit.com/r/rust\".into(),\n+ id: \"https://reddit.com/r/rust\".into(),\n }),\n j2.append(Event::NodeEnsured {\n- id: \"reddit.com/r/python\".into(),\n+ id: \"https://reddit.com/r/python\".into(),\n }),\n );\n r1.unwrap();\n@@ -153,10 +153,10 @@ mod tests {\n assert_eq!(projection_store.last_applied_event_count().unwrap(), 2);\n let tree = projection_store.load_tree().unwrap();\n assert!(tree\n- .get(&ItemId::parse(\"reddit.com/r/rust\").unwrap())\n+ .get(&ItemId::parse(\"https://reddit.com/r/rust\").unwrap())\n .is_some());\n assert!(tree\n- .get(&ItemId::parse(\"reddit.com/r/python\").unwrap())\n+ .get(&ItemId::parse(\"https://reddit.com/r/python\").unwrap())\n .is_some());\n }\n \n@@ -170,7 +170,7 @@ mod tests {\n 1,\n 1,\n Event::NodeEnsured {\n- id: \"reddit.com/r/rust\".into(),\n+ id: \"https://reddit.com/r/rust\".into(),\n },\n ))\n .await\n@@ -186,7 +186,7 @@ mod tests {\n 1,\n 1,\n Event::NodeEnsured {\n- id: \"reddit.com/r/rust\".into(),\n+ id: \"https://reddit.com/r/rust\".into(),\n },\n )],\n )\n@@ -202,7 +202,7 @@ mod tests {\n );\n journal\n .append(Event::NodeEnsured {\n- id: \"reddit.com/r/python\".into(),\n+ id: \"https://reddit.com/r/python\".into(),\n })\n .await\n .unwrap();\n@@ -227,13 +227,13 @@ mod tests {\n journal\n .append_many(vec![\n Event::NodeEnsured {\n- id: \"reddit.com/r/rust\".into(),\n+ id: \"https://reddit.com/r/rust\".into(),\n },\n Event::NodeEnsured {\n- id: \"reddit.com/r/python\".into(),\n+ id: \"https://reddit.com/r/python\".into(),\n },\n Event::NodeEnsured {\n- id: \"reddit.com/r/clojure\".into(),\n+ id: \"https://reddit.com/r/clojure\".into(),\n },\n ])\n .await\n@@ -245,7 +245,7 @@ mod tests {\n assert_eq!(projection_store.last_applied_event_count().unwrap(), 3);\n let tree = projection_store.load_tree().unwrap();\n assert!(tree\n- .get(&ItemId::parse(\"reddit.com/r/clojure\").unwrap())\n+ .get(&ItemId::parse(\"https://reddit.com/r/clojure\").unwrap())\n .is_some());\n }\n }\ndiff --git a/server/src/lib.rs b/server/src/lib.rs\nindex 9bd5f76fd1406b9b1be4c272f4ba8647edde2678..5c02c8e704e4664453bad75d819df8a067668176 100644\n--- a/server/src/lib.rs\n+++ b/server/src/lib.rs\n@@ -9,6 +9,7 @@ pub mod journal;\n pub mod pair;\n pub mod parser;\n pub mod path_types;\n+pub mod url_rules;\n pub mod projection_apply;\n pub mod projection_store;\n pub mod ranking;\ndiff --git a/server/src/pair.rs b/server/src/pair.rs\nindex 43f780ba6ea6ce1cdc2e1f4cbb252ba8a10684b9..815a97b80e3e9f348e0937a4f147f2862018edb0 100644\n--- a/server/src/pair.rs\n+++ b/server/src/pair.rs\n@@ -381,42 +381,42 @@ mod tests {\n \n #[test]\n fn suggest_prefers_unvoted_pair() {\n- let parent = ItemId::parse(\"reddit.com/r/rust\").unwrap();\n+ let parent = ItemId::parse(\"https://reddit.com/r/rust\").unwrap();\n let mut tree = seed_children(\n &parent,\n &[\n- \"reddit.com/r/rust/a\",\n- \"reddit.com/r/rust/b\",\n- \"reddit.com/r/rust/c\",\n+ \"https://reddit.com/r/rust/a\",\n+ \"https://reddit.com/r/rust/b\",\n+ \"https://reddit.com/r/rust/c\",\n ],\n );\n let vote =\n- VoteData::from_recorded(1, \"reddit.com/r/rust/a\", \"reddit.com/r/rust/b\", 2, 1).unwrap();\n+ VoteData::from_recorded(1, \"https://reddit.com/r/rust/a\", \"https://reddit.com/r/rust/b\", 2, 1).unwrap();\n tree.apply_vote(&parent, vote);\n let group = tree.get(&parent).unwrap().local_ranking.clone();\n let pool = children_of(&tree, &parent);\n let (l, r) = suggest_next_pair_in_pool(&group, &pool, None).unwrap();\n- let voted_ab = (l.as_str() == \"reddit.com/r/rust/a\" && r.as_str() == \"reddit.com/r/rust/b\")\n- || (l.as_str() == \"reddit.com/r/rust/b\" && r.as_str() == \"reddit.com/r/rust/a\");\n+ let voted_ab = (l.as_str() == \"https://reddit.com/r/rust/a\" && r.as_str() == \"https://reddit.com/r/rust/b\")\n+ || (l.as_str() == \"https://reddit.com/r/rust/b\" && r.as_str() == \"https://reddit.com/r/rust/a\");\n assert!(!voted_ab);\n }\n \n #[test]\n fn suggest_bridges_separate_components() {\n- let parent = ItemId::parse(\"reddit.com/r/rust\").unwrap();\n+ let parent = ItemId::parse(\"https://reddit.com/r/rust\").unwrap();\n let mut tree = seed_children(\n &parent,\n &[\n- \"reddit.com/r/rust/a\",\n- \"reddit.com/r/rust/b\",\n- \"reddit.com/r/rust/c\",\n- \"reddit.com/r/rust/d\",\n+ \"https://reddit.com/r/rust/a\",\n+ \"https://reddit.com/r/rust/b\",\n+ \"https://reddit.com/r/rust/c\",\n+ \"https://reddit.com/r/rust/d\",\n ],\n );\n let ab =\n- VoteData::from_recorded(1, \"reddit.com/r/rust/a\", \"reddit.com/r/rust/b\", 2, 1).unwrap();\n+ VoteData::from_recorded(1, \"https://reddit.com/r/rust/a\", \"https://reddit.com/r/rust/b\", 2, 1).unwrap();\n let cd =\n- VoteData::from_recorded(2, \"reddit.com/r/rust/c\", \"reddit.com/r/rust/d\", 2, 1).unwrap();\n+ VoteData::from_recorded(2, \"https://reddit.com/r/rust/c\", \"https://reddit.com/r/rust/d\", 2, 1).unwrap();\n tree.apply_vote(&parent, ab);\n tree.apply_vote(&parent, cd);\n let group = tree.get(&parent).unwrap().local_ranking.clone();\n@@ -424,37 +424,37 @@ mod tests {\n let pair = suggest_next_pair_in_pool(&group, &pool, None).unwrap();\n let chosen = pair_set(&pair);\n let from_ab =\n- chosen.contains(\"reddit.com/r/rust/a\") || chosen.contains(\"reddit.com/r/rust/b\");\n+ chosen.contains(\"https://reddit.com/r/rust/a\") || chosen.contains(\"https://reddit.com/r/rust/b\");\n let from_cd =\n- chosen.contains(\"reddit.com/r/rust/c\") || chosen.contains(\"reddit.com/r/rust/d\");\n+ chosen.contains(\"https://reddit.com/r/rust/c\") || chosen.contains(\"https://reddit.com/r/rust/d\");\n assert!(from_ab && from_cd, \"expected bridge pair, got {:?}\", chosen);\n }\n \n #[test]\n fn suggest_prefers_attach_over_isolate_pair_among_many_unranked() {\n- let parent = ItemId::parse(\"reddit.com/r/rust\").unwrap();\n+ let parent = ItemId::parse(\"https://reddit.com/r/rust\").unwrap();\n let mut tree = seed_children(\n &parent,\n &[\n- \"reddit.com/r/rust/a\",\n- \"reddit.com/r/rust/b\",\n- \"reddit.com/r/rust/c\",\n- \"reddit.com/r/rust/d\",\n- \"reddit.com/r/rust/e\",\n+ \"https://reddit.com/r/rust/a\",\n+ \"https://reddit.com/r/rust/b\",\n+ \"https://reddit.com/r/rust/c\",\n+ \"https://reddit.com/r/rust/d\",\n+ \"https://reddit.com/r/rust/e\",\n ],\n );\n let ab =\n- VoteData::from_recorded(1, \"reddit.com/r/rust/a\", \"reddit.com/r/rust/b\", 2, 1).unwrap();\n+ VoteData::from_recorded(1, \"https://reddit.com/r/rust/a\", \"https://reddit.com/r/rust/b\", 2, 1).unwrap();\n tree.apply_vote(&parent, ab);\n let group = tree.get(&parent).unwrap().local_ranking.clone();\n let pool = children_of(&tree, &parent);\n let pair = suggest_next_pair_in_pool(&group, &pool, None).unwrap();\n let chosen = pair_set(&pair);\n let from_ab =\n- chosen.contains(\"reddit.com/r/rust/a\") || chosen.contains(\"reddit.com/r/rust/b\");\n- let from_cde = chosen.contains(\"reddit.com/r/rust/c\")\n- || chosen.contains(\"reddit.com/r/rust/d\")\n- || chosen.contains(\"reddit.com/r/rust/e\");\n+ chosen.contains(\"https://reddit.com/r/rust/a\") || chosen.contains(\"https://reddit.com/r/rust/b\");\n+ let from_cde = chosen.contains(\"https://reddit.com/r/rust/c\")\n+ || chosen.contains(\"https://reddit.com/r/rust/d\")\n+ || chosen.contains(\"https://reddit.com/r/rust/e\");\n assert!(\n from_ab && from_cde,\n \"expected ranked+unranked attach, got {:?}\",\n@@ -464,40 +464,40 @@ mod tests {\n \n #[test]\n fn suggest_connects_isolate_to_existing_component() {\n- let parent = ItemId::parse(\"reddit.com/r/rust\").unwrap();\n+ let parent = ItemId::parse(\"https://reddit.com/r/rust\").unwrap();\n let mut tree = seed_children(\n &parent,\n &[\n- \"reddit.com/r/rust/a\",\n- \"reddit.com/r/rust/b\",\n- \"reddit.com/r/rust/c\",\n+ \"https://reddit.com/r/rust/a\",\n+ \"https://reddit.com/r/rust/b\",\n+ \"https://reddit.com/r/rust/c\",\n ],\n );\n let ab =\n- VoteData::from_recorded(1, \"reddit.com/r/rust/a\", \"reddit.com/r/rust/b\", 2, 1).unwrap();\n+ VoteData::from_recorded(1, \"https://reddit.com/r/rust/a\", \"https://reddit.com/r/rust/b\", 2, 1).unwrap();\n tree.apply_vote(&parent, ab);\n let group = tree.get(&parent).unwrap().local_ranking.clone();\n let pool = children_of(&tree, &parent);\n let pair = suggest_next_pair_in_pool(&group, &pool, None).unwrap();\n let chosen = pair_set(&pair);\n- assert!(chosen.contains(\"reddit.com/r/rust/c\"));\n- assert!(chosen.contains(\"reddit.com/r/rust/a\") || chosen.contains(\"reddit.com/r/rust/b\"));\n+ assert!(chosen.contains(\"https://reddit.com/r/rust/c\"));\n+ assert!(chosen.contains(\"https://reddit.com/r/rust/a\") || chosen.contains(\"https://reddit.com/r/rust/b\"));\n }\n \n #[test]\n fn suggest_zips_adjacent_ranks_when_tree_complete() {\n- let parent = ItemId::parse(\"reddit.com/r/rust\").unwrap();\n+ let parent = ItemId::parse(\"https://reddit.com/r/rust\").unwrap();\n let mut tree = seed_children(\n &parent,\n &[\n- \"reddit.com/r/rust/a\",\n- \"reddit.com/r/rust/b\",\n- \"reddit.com/r/rust/c\",\n+ \"https://reddit.com/r/rust/a\",\n+ \"https://reddit.com/r/rust/b\",\n+ \"https://reddit.com/r/rust/c\",\n ],\n );\n for (a, b, l, r) in [\n- (\"reddit.com/r/rust/a\", \"reddit.com/r/rust/b\", 3, 1),\n- (\"reddit.com/r/rust/a\", \"reddit.com/r/rust/c\", 2, 1),\n+ (\"https://reddit.com/r/rust/a\", \"https://reddit.com/r/rust/b\", 3, 1),\n+ (\"https://reddit.com/r/rust/a\", \"https://reddit.com/r/rust/c\", 2, 1),\n ] {\n let v = VoteData::from_recorded(1, a, b, l, r).unwrap();\n tree.apply_vote(&parent, v);\n@@ -506,26 +506,26 @@ mod tests {\n let pool = children_of(&tree, &parent);\n let pair = suggest_next_pair_in_pool(&group, &pool, None).unwrap();\n let chosen = pair_set(&pair);\n- assert!(chosen.contains(\"reddit.com/r/rust/b\"));\n- assert!(chosen.contains(\"reddit.com/r/rust/c\"));\n+ assert!(chosen.contains(\"https://reddit.com/r/rust/b\"));\n+ assert!(chosen.contains(\"https://reddit.com/r/rust/c\"));\n }\n \n #[test]\n fn suggest_zip_prefers_1v2_before_2v3_when_both_unvoted() {\n- let parent = ItemId::parse(\"reddit.com/r/rust\").unwrap();\n+ let parent = ItemId::parse(\"https://reddit.com/r/rust\").unwrap();\n let mut tree = seed_children(\n &parent,\n &[\n- \"reddit.com/r/rust/a\",\n- \"reddit.com/r/rust/b\",\n- \"reddit.com/r/rust/c\",\n- \"reddit.com/r/rust/d\",\n+ \"https://reddit.com/r/rust/a\",\n+ \"https://reddit.com/r/rust/b\",\n+ \"https://reddit.com/r/rust/c\",\n+ \"https://reddit.com/r/rust/d\",\n ],\n );\n for (a, b, l, r) in [\n- (\"reddit.com/r/rust/c\", \"reddit.com/r/rust/d\", 3, 1),\n- (\"reddit.com/r/rust/b\", \"reddit.com/r/rust/c\", 2, 1),\n- (\"reddit.com/r/rust/a\", \"reddit.com/r/rust/c\", 2, 1),\n+ (\"https://reddit.com/r/rust/c\", \"https://reddit.com/r/rust/d\", 3, 1),\n+ (\"https://reddit.com/r/rust/b\", \"https://reddit.com/r/rust/c\", 2, 1),\n+ (\"https://reddit.com/r/rust/a\", \"https://reddit.com/r/rust/c\", 2, 1),\n ] {\n let v = VoteData::from_recorded(1, a, b, l, r).unwrap();\n tree.apply_vote(&parent, v);\n@@ -534,16 +534,16 @@ mod tests {\n let pool = children_of(&tree, &parent);\n let pair = suggest_next_pair_in_pool(&group, &pool, None).unwrap();\n let chosen = pair_set(&pair);\n- assert!(chosen.contains(\"reddit.com/r/rust/a\"));\n- assert!(chosen.contains(\"reddit.com/r/rust/b\"));\n+ assert!(chosen.contains(\"https://reddit.com/r/rust/a\"));\n+ assert!(chosen.contains(\"https://reddit.com/r/rust/b\"));\n }\n \n #[test]\n fn resolve_pair_picks_from_pool() {\n- let parent = ItemId::parse(\"reddit.com/r/rust\").unwrap();\n- let tree = seed_children(&parent, &[\"reddit.com/r/rust/a\", \"reddit.com/r/rust/b\"]);\n+ let parent = ItemId::parse(\"https://reddit.com/r/rust\").unwrap();\n+ let tree = seed_children(&parent, &[\"https://reddit.com/r/rust/a\", \"https://reddit.com/r/rust/b\"]);\n let pair = resolve_pair(&tree, &parent, None, None).unwrap();\n- let pool: HashSet<_> = [\"reddit.com/r/rust/a\", \"reddit.com/r/rust/b\"]\n+ let pool: HashSet<_> = [\"https://reddit.com/r/rust/a\", \"https://reddit.com/r/rust/b\"]\n .into_iter()\n .collect();\n assert!(pool.contains(pair.0.as_str()));\ndiff --git a/server/src/parser.rs b/server/src/parser.rs\nindex 9df2dcc9313f7fe250ce3b6aa167f6ec5d57951f..b2a963dd6cab415576c8d3a9a241966758565bb8 100644\n--- a/server/src/parser.rs\n+++ b/server/src/parser.rs\n@@ -23,7 +23,7 @@ mod tests {\n fn parses_short_path() {\n assert_eq!(\n parse_reddit_url(\"r/rust\").unwrap().as_str(),\n- \"reddit.com/r/rust\"\n+ \"https://reddit.com/r/rust\"\n );\n }\n \n@@ -33,7 +33,7 @@ mod tests {\n parse_reddit_url(\"https://www.reddit.com/r/programming/hot\")\n .unwrap()\n .as_str(),\n- \"reddit.com/r/programming\"\n+ \"https://reddit.com/r/programming\"\n );\n }\n \n@@ -43,7 +43,10 @@ mod tests {\n \"https://old.reddit.com/r/AmItheAsshole/comments/1trnvdl/aita_for_cancelling/\",\n )\n .unwrap();\n- assert_eq!(id.as_str(), \"reddit.com/r/amitheasshole/comments/1trnvdl\");\n+ assert_eq!(\n+ id.as_str(),\n+ \"https://reddit.com/r/amitheasshole/comments/1trnvdl\"\n+ );\n }\n \n #[test]\ndiff --git a/server/src/path_types.rs b/server/src/path_types.rs\nindex fafd924452f6fd85e7a5b27ed2653a19581e6e56..71ffc01f35c5589686ff05dae3b5610fa01f30ce 100644\n--- a/server/src/path_types.rs\n+++ b/server/src/path_types.rs\n@@ -1,13 +1,14 @@\n use serde::{Deserialize, Serialize};\n use std::fmt;\n \n-/// Canonical hierarchical identity for any URL/path in the fractal tree.\n+use crate::url_rules::{looks_like_url, navigable_breadcrumbs, parent_url, resolve_canonical};\n+\n+/// Canonical identity: a real URL (with scheme) or an opaque non-URL key.\n #[derive(Debug, Clone, Hash, PartialEq, Eq, PartialOrd, Ord, Serialize, Deserialize, Default)]\n pub struct ItemId(String);\n \n impl ItemId {\n- /// Parse an already-canonical path (no URL normalization). Empty string is invalid here;\n- /// use [`Self::root`] for the tree root.\n+ /// Parse an already-canonical id (no normalization). Empty string is invalid; use [`Self::root`].\n pub fn parse(s: &str) -> Option {\n let t = s.trim();\n if t.is_empty() {\n@@ -16,12 +17,12 @@ impl ItemId {\n Some(Self(t.to_string()))\n }\n \n- /// Build an opaque item key (legacy demo votes, non-URL items).\n+ /// Build an opaque item key (demo votes, non-URL items).\n pub fn opaque(s: impl Into) -> Self {\n Self(s.into())\n }\n \n- /// Root of the internet tree (empty path).\n+ /// Root of the internet tree.\n pub fn root() -> Self {\n Self(String::new())\n }\n@@ -34,23 +35,18 @@ impl ItemId {\n &self.0\n }\n \n- /// Creates a canonical ID from a raw URL or path. Normalizes domains and\n- /// trims tracking query params.\n+ /// Canonical URL from a raw pasted or fetched URL.\n pub fn from_url(raw_url: &str) -> Option {\n- Self::canonicalize(raw_url).map(Self)\n+ resolve_canonical(raw_url).map(Self)\n }\n \n- /// Normalize strings from forms, events, and Reddit imports into the same\n- /// stored id shape (e.g. drop post title slug after comment id).\n+ /// Normalize strings from forms, events, and imports into canonical identity.\n pub fn from_storage(s: &str) -> Option {\n let t = s.trim();\n if t.is_empty() {\n return None;\n }\n- if t.contains(\"://\") || t.starts_with(\"r/\") {\n- return Self::from_url(t).or_else(|| Self::parse(t));\n- }\n- if t.starts_with(\"reddit.com/\") && t.contains(\"/comments/\") {\n+ if looks_like_url(t) {\n return Self::from_url(t).or_else(|| Self::parse(t));\n }\n Self::parse(t).or_else(|| Self::from_url(t))\n@@ -62,35 +58,52 @@ impl ItemId {\n if s.is_empty() {\n return Self::root();\n }\n- Self(format!(\"reddit.com/r/{s}\"))\n+ if looks_like_url(s) || s.contains('/') {\n+ Self::from_storage(s).unwrap_or_else(|| Self::opaque(s))\n+ } else {\n+ Self(format!(\"https://reddit.com/r/{s}\"))\n+ }\n }\n \n- /// Extract the parent, e.g. `reddit.com/r/aww/comments/1trnvdl` →\n- /// `reddit.com/r/aww`.\n+ /// Immediate parent scope in the tree.\n pub fn parent(&self) -> Option {\n- if self.0.is_empty() {\n+ if self.is_root() {\n return None;\n }\n-\n+ if looks_like_url(self.0.as_str()) {\n+ return parent_url(self.0.as_str()).map(Self);\n+ }\n let parts: Vec<&str> = self.0.trim_end_matches('/').split('/').collect();\n if parts.len() <= 1 {\n return None;\n }\n-\n- if self.0.contains(\"/comments/\") {\n- return Some(Self(parts[..parts.len().saturating_sub(2)].join(\"/\")));\n- }\n-\n Some(Self(parts[..parts.len() - 1].join(\"/\")))\n }\n \n pub fn segments(&self) -> Vec<&str> {\n+ if self.is_root() {\n+ return vec![];\n+ }\n+ if let Some(rest) = self.0.strip_prefix(\"https://\") {\n+ return rest.split('/').filter(|s| !s.is_empty()).collect();\n+ }\n+ if let Some(rest) = self.0.strip_prefix(\"http://\") {\n+ return rest.split('/').filter(|s| !s.is_empty()).collect();\n+ }\n self.0.split('/').filter(|s| !s.is_empty()).collect()\n }\n \n- /// Cumulative paths for breadcrumb rendering, e.g.\n- /// `reddit.com/r/movies` → `[\"reddit.com\", \"reddit.com/r\", \"reddit.com/r/movies\"]`.\n+ /// Cumulative navigable paths for breadcrumbs and tree wiring (includes self).\n pub fn breadcrumb_paths(&self) -> Vec {\n+ if self.is_root() {\n+ return vec![];\n+ }\n+ if looks_like_url(self.0.as_str()) {\n+ return navigable_breadcrumbs(self.0.as_str())\n+ .into_iter()\n+ .map(ItemId)\n+ .collect();\n+ }\n let segs = self.segments();\n let mut paths = Vec::with_capacity(segs.len());\n let mut current = String::new();\n@@ -111,13 +124,13 @@ impl ItemId {\n if self.is_root() {\n return String::new();\n }\n- if self.as_str().contains(\"://\") {\n- return self.as_str().to_string();\n+ if self.0.contains(\"://\") {\n+ return self.0.clone();\n }\n if self.segments().first().is_some_and(|s| s.contains('.')) {\n- format!(\"https://{}\", self.as_str())\n+ format!(\"https://{}\", self.0)\n } else {\n- self.as_str().to_string()\n+ self.0.clone()\n }\n }\n \n@@ -144,70 +157,6 @@ impl ItemId {\n pub fn from_browse_uri(path: &str) -> Option {\n path.strip_prefix(\"/~/\").map(ItemId::from_browse_tail)\n }\n-\n- fn canonicalize(raw: &str) -> Option {\n- let s = raw.trim();\n- if s.is_empty() {\n- return None;\n- }\n-\n- let owned = if let Some(rest) = s.strip_prefix(\"r/\") {\n- format!(\"reddit.com/r/{rest}\")\n- } else if let Some(rest) = s.strip_prefix(\"/r/\") {\n- format!(\"reddit.com/r/{rest}\")\n- } else {\n- s.to_string()\n- };\n-\n- let (host_path, _query) = split_query(&owned);\n- let host_path = host_path.trim_end_matches('/');\n-\n- let path = if host_path.contains(\"://\") {\n- parse_url_host_path(host_path)?\n- } else if host_path.starts_with(\"reddit.com\") || host_path.starts_with(\"www.reddit.com\") {\n- normalize_reddit_host_path(host_path)\n- } else if host_path.contains('/') {\n- host_path.to_string()\n- } else {\n- return None;\n- };\n-\n- Some(normalize_reddit_path(&path))\n- }\n-}\n-\n-fn split_query(s: &str) -> (&str, Option<&str>) {\n- if let Some((path, q)) = s.split_once('?') {\n- (path, Some(q))\n- } else {\n- (s, None)\n- }\n-}\n-\n-fn parse_url_host_path(url: &str) -> Option {\n- let rest = url\n- .strip_prefix(\"https://\")\n- .or_else(|| url.strip_prefix(\"http://\"))\n- .unwrap_or(url);\n- let (host, path) = rest.split_once('/').unwrap_or((rest, \"\"));\n- let host = normalize_host(host);\n- if path.is_empty() {\n- Some(host)\n- } else {\n- Some(format!(\"{host}/{path}\"))\n- }\n-}\n-\n-fn normalize_host(host: &str) -> String {\n- let h = host\n- .strip_prefix(\"www.\")\n- .unwrap_or(host)\n- .to_ascii_lowercase();\n- if h == \"old.reddit.com\" || h == \"new.reddit.com\" || h == \"reddit.com\" {\n- \"reddit.com\".to_string()\n- } else {\n- h\n- }\n }\n \n fn normalize_browse_tail(tail: &str) -> String {\n@@ -215,7 +164,6 @@ fn normalize_browse_tail(tail: &str) -> String {\n if t.is_empty() {\n return String::new();\n }\n- // Some HTTP stacks collapse `https://` → `https:/` inside a path segment.\n if t.starts_with(\"https:/\") && !t.starts_with(\"https://\") {\n return format!(\"https://{}\", &t[7..]);\n }\n@@ -225,33 +173,6 @@ fn normalize_browse_tail(tail: &str) -> String {\n t.to_string()\n }\n \n-fn normalize_reddit_host_path(s: &str) -> String {\n- let (host, path) = s.split_once('/').unwrap_or((s, \"\"));\n- let host = normalize_host(host);\n- if path.is_empty() {\n- host\n- } else {\n- format!(\"{host}/{path}\")\n- }\n-}\n-\n-/// Lowercase subreddit segment, drop listing suffixes, drop title slug after post id.\n-fn normalize_reddit_path(path: &str) -> String {\n- let mut parts: Vec = path.split('/').map(str::to_string).collect();\n- if parts.len() >= 3 && parts[1] == \"r\" {\n- parts[2] = parts[2].to_ascii_lowercase();\n- }\n- if let Some(i) = parts.iter().position(|p| p == \"comments\") {\n- if parts.len() > i + 2 {\n- parts.truncate(i + 2);\n- }\n- } else if parts.len() > 3 && parts.get(1).map(|s| s.as_str()) == Some(\"r\") {\n- // reddit.com/r/{sub}/hot → reddit.com/r/{sub}\n- parts.truncate(3);\n- }\n- parts.join(\"/\")\n-}\n-\n impl fmt::Display for ItemId {\n fn fmt(&self, f: &mut fmt::Formatter<'_>) -> fmt::Result {\n f.write_str(&self.0)\n@@ -268,43 +189,59 @@ mod tests {\n \"https://old.reddit.com/r/AmItheAsshole/comments/1trnvdl/aita_for_cancelling/\",\n )\n .unwrap();\n- assert_eq!(id.as_str(), \"reddit.com/r/amitheasshole/comments/1trnvdl\");\n+ assert_eq!(\n+ id.as_str(),\n+ \"https://reddit.com/r/amitheasshole/comments/1trnvdl\"\n+ );\n }\n \n #[test]\n fn from_url_strips_query() {\n let id = ItemId::from_url(\"https://www.reddit.com/r/rust/?sort=top\").unwrap();\n- assert_eq!(id.as_str(), \"reddit.com/r/rust\");\n+ assert_eq!(id.as_str(), \"https://reddit.com/r/rust\");\n }\n \n #[test]\n fn from_url_short_path() {\n assert_eq!(\n ItemId::from_url(\"r/rust\").unwrap().as_str(),\n- \"reddit.com/r/rust\"\n+ \"https://reddit.com/r/rust\"\n );\n }\n \n #[test]\n fn parent_of_post_is_subreddit() {\n- let id = ItemId::parse(\"reddit.com/r/aww/comments/1trnvdl\").unwrap();\n- assert_eq!(id.parent().unwrap().as_str(), \"reddit.com/r/aww\");\n+ let id = ItemId::from_url(\"https://reddit.com/r/aww/comments/1trnvdl\").unwrap();\n+ assert_eq!(id.parent().unwrap().as_str(), \"https://reddit.com/r/aww\");\n }\n \n #[test]\n fn parent_of_subreddit_is_r_segment() {\n- let id = ItemId::parse(\"reddit.com/r/movies\").unwrap();\n- assert_eq!(id.parent().unwrap().as_str(), \"reddit.com/r\");\n+ let id = ItemId::from_url(\"https://reddit.com/r/movies\").unwrap();\n+ assert_eq!(id.parent().unwrap().as_str(), \"https://reddit.com/r\");\n+ }\n+\n+ #[test]\n+ fn breadcrumb_paths_skip_phantom_comments() {\n+ let id = ItemId::from_url(\"https://reddit.com/r/aww/comments/1trnvdl\").unwrap();\n+ let crumbs = id.breadcrumb_paths();\n+ let paths: Vec<_> = crumbs.iter().map(|p| p.as_str()).collect();\n+ assert!(!paths.iter().any(|p| p.ends_with(\"/comments\")));\n+ assert!(paths.contains(&\"https://reddit.com/r/aww\"));\n }\n \n #[test]\n- fn breadcrumb_paths() {\n- let id = ItemId::parse(\"reddit.com/r/movies\").unwrap();\n+ fn breadcrumb_paths_subreddit() {\n+ let id = ItemId::from_url(\"https://reddit.com/r/movies\").unwrap();\n let crumbs = id.breadcrumb_paths();\n let paths: Vec<_> = crumbs.iter().map(|p| p.as_str()).collect();\n assert_eq!(\n paths,\n- vec![\"reddit.com\", \"reddit.com/r\", \"reddit.com/r/movies\"]\n+ vec![\n+ \"https://reddit.com\",\n+ \"https://reddit.com/r\",\n+ \"https://reddit.com/r/movies\"\n+ ]\n );\n }\n \n@@ -312,33 +249,33 @@ mod tests {\n fn legacy_scope_maps_to_reddit_sub() {\n assert_eq!(\n ItemId::from_legacy_scope(\"rust\").as_str(),\n- \"reddit.com/r/rust\"\n+ \"https://reddit.com/r/rust\"\n );\n assert!(ItemId::from_legacy_scope(\"\").is_root());\n }\n \n #[test]\n- fn browse_href_wraps_canonical_path() {\n- let id = ItemId::parse(\"reddit.com/r/rust\").unwrap();\n+ fn browse_href_wraps_canonical_url() {\n+ let id = ItemId::from_url(\"https://reddit.com/r/rust\").unwrap();\n assert_eq!(id.browse_href(), \"/~/https://reddit.com/r/rust\");\n }\n \n #[test]\n fn from_browse_tail_parses_full_url() {\n let id = ItemId::from_browse_tail(\"https://reddit.com/r/AmITheAsshole\");\n- assert_eq!(id.as_str(), \"reddit.com/r/amitheasshole\");\n+ assert_eq!(id.as_str(), \"https://reddit.com/r/amitheasshole\");\n }\n \n #[test]\n fn from_storage_strips_post_title_slug() {\n let id =\n ItemId::from_storage(\"reddit.com/r/rust/comments/aaa/announcing_rust_199\").unwrap();\n- assert_eq!(id.as_str(), \"reddit.com/r/rust/comments/aaa\");\n+ assert_eq!(id.as_str(), \"https://reddit.com/r/rust/comments/aaa\");\n }\n \n #[test]\n fn from_browse_uri_strips_prefix() {\n let id = ItemId::from_browse_uri(\"/~/https://reddit.com/r/rust\").unwrap();\n- assert_eq!(id.as_str(), \"reddit.com/r/rust\");\n+ assert_eq!(id.as_str(), \"https://reddit.com/r/rust\");\n }\n }\ndiff --git a/server/src/projection_apply.rs b/server/src/projection_apply.rs\nindex ebe122e417bda1d9369a53443de93d28213c5a0d..5644557a41b3e9497c7421b444155ae629fa79f1 100644\n--- a/server/src/projection_apply.rs\n+++ b/server/src/projection_apply.rs\n@@ -19,13 +19,21 @@ use crate::{\n storage_schema::{ensure_path_writes, entity_view_writes, vote_writes},\n };\n \n-/// Legacy-compatible scope parsing for persisted vote events.\n+fn parse_event_id(id: &str) -> Result {\n+ ItemId::from_storage(id)\n+ .or_else(|| ItemId::parse(id))\n+ .ok_or_else(|| EventLogError::Apply(format!(\"invalid id: {id}\")))\n+}\n+\n+/// Scope key from a vote event (canonicalized at apply time).\n fn parent_from_event_scope(scope: &str) -> ItemId {\n- if scope.contains('/') {\n- ItemId::parse(scope).unwrap_or_else(|| ItemId::from_legacy_scope(scope))\n- } else {\n- ItemId::from_legacy_scope(scope)\n+ let s = scope.trim();\n+ if s.is_empty() {\n+ return ItemId::root();\n }\n+ ItemId::from_storage(s)\n+ .or_else(|| ItemId::parse(s))\n+ .unwrap_or_else(|| ItemId::from_legacy_scope(s))\n }\n \n pub fn apply_records(\n@@ -68,15 +76,11 @@ pub fn apply_records(\n vote_parents.insert(parent);\n }\n Event::NodeEnsured { id } => {\n- let parsed = ItemId::parse(id)\n- .or_else(|| ItemId::from_url(id))\n- .ok_or_else(|| EventLogError::Apply(format!(\"invalid node id: {id}\")))?;\n+ let parsed = parse_event_id(id)?;\n ensure_path_writes(&mut batch, &parsed);\n }\n Event::EntityImported { id, payload, .. } => {\n- let parsed = ItemId::parse(id)\n- .or_else(|| ItemId::from_url(id))\n- .ok_or_else(|| EventLogError::Apply(format!(\"invalid entity id: {id}\")))?;\n+ let parsed = parse_event_id(id)?;\n let view = entity_view_from_payload(&parsed, payload);\n entity_view_writes(&mut batch, &parsed, view.as_ref());\n entity_store\n@@ -92,7 +96,6 @@ pub fn apply_records(\n .commit_with(durable::Durability::DisableWal)\n .map_err(|e| EventLogError::Apply(e.to_string()))?;\n \n- // Cap recent-vote windows (idempotent, blind; not part of the cursor batch).\n for parent in vote_parents {\n projection_store\n .trim_recent_votes(&parent)\ndiff --git a/server/src/reddit.rs b/server/src/reddit.rs\nindex 72caf7c33b9dd44ea15b62b59e91227cf96a3431..20b7f9e3f8be39268a1767d09f5cf81eaa6ae0df 100644\n--- a/server/src/reddit.rs\n+++ b/server/src/reddit.rs\n@@ -183,7 +183,7 @@ pub fn entity_view_from_payload(\n id: &ItemId,\n payload: &Value,\n ) -> Option {\n- if id.as_str().starts_with(\"reddit.com\") {\n+ if id.as_str().contains(\"reddit.com\") {\n return parse_reddit_view(id, payload);\n }\n None\n@@ -495,41 +495,59 @@ fn rate_limit_reset_secs(resp: &reqwest::Response) -> u64 {\n .unwrap_or(5)\n }\n \n+fn reddit_path_segments(id: &ItemId) -> Option> {\n+ let s = id.as_str();\n+ let rest = s\n+ .strip_prefix(\"https://reddit.com/\")\n+ .or_else(|| s.strip_prefix(\"http://reddit.com/\"))\n+ .or_else(|| s.strip_prefix(\"reddit.com/\"))?;\n+ let segments: Vec = rest\n+ .split('/')\n+ .filter(|p| !p.is_empty())\n+ .map(str::to_string)\n+ .collect();\n+ Some(segments)\n+}\n+\n pub fn map_item_to_reddit_api(id: &ItemId, api_base: &str) -> String {\n- let path = id.as_str();\n- if !path.starts_with(\"reddit.com/\") && path != \"reddit.com\" {\n- return String::new();\n- }\n+ let segments = match reddit_path_segments(id) {\n+ Some(s) => s,\n+ None if matches!(\n+ id.as_str(),\n+ \"https://reddit.com\" | \"http://reddit.com\" | \"reddit.com\"\n+ ) =>\n+ {\n+ return String::new();\n+ }\n+ None => return String::new(),\n+ };\n \n let base = api_base.trim_end_matches('/');\n \n- let segments: Vec<&str> = path.split('/').collect();\n-\n- if let Some(i) = segments.iter().position(|&p| p == \"comments\") {\n+ if let Some(i) = segments.iter().position(|p| p == \"comments\") {\n if segments.len() > i + 1 {\n- let api_path = segments[1..=i + 1].join(\"/\");\n+ let api_path = segments[..=i + 1].join(\"/\");\n return format!(\"{base}/{api_path}.json?raw_json=1\");\n }\n }\n \n- if segments.len() == 3 && segments[1] == \"r\" {\n- return format!(\"{base}/r/{}/about.json?raw_json=1\", segments[2]);\n+ if segments.len() == 2 && segments[0] == \"r\" {\n+ return format!(\"{base}/r/{}/about.json?raw_json=1\", segments[1]);\n }\n \n String::new()\n }\n \n /// Listing URL for a node's children. Currently only subreddits\n-/// (`reddit.com/r/` → `/r/.json`) expose a child listing.\n+/// (`https://reddit.com/r/` → `/r/.json`) expose a child listing.\n pub fn map_children_url(id: &ItemId, api_base: &str) -> String {\n- let path = id.as_str();\n- if !path.starts_with(\"reddit.com/\") {\n- return String::new();\n- }\n+ let segments = match reddit_path_segments(id) {\n+ Some(s) => s,\n+ None => return String::new(),\n+ };\n let base = api_base.trim_end_matches('/');\n- let segments: Vec<&str> = path.split('/').collect();\n- if segments.len() == 3 && segments[1] == \"r\" {\n- return format!(\"{base}/r/{}.json?raw_json=1&limit=25\", segments[2]);\n+ if segments.len() == 2 && segments[0] == \"r\" {\n+ return format!(\"{base}/r/{}.json?raw_json=1&limit=25\", segments[1]);\n }\n String::new()\n }\n@@ -548,8 +566,8 @@ fn parse_children(_parent: &ItemId, payload: &Value) -> Vec<(ItemId, Value)> {\n Some(p) if !p.is_empty() => p,\n _ => continue,\n };\n- let path = format!(\"reddit.com{}\", permalink.trim_end_matches('/'));\n- if let Some(id) = ItemId::from_storage(&path) {\n+ let raw = format!(\"https://reddit.com{}\", permalink.trim_end_matches('/'));\n+ if let Some(id) = ItemId::from_url(&raw) {\n out.push((id, child.clone()));\n }\n }\n@@ -683,7 +701,7 @@ mod tests {\n \n #[test]\n fn map_subreddit_about_url() {\n- let id = ItemId::parse(\"reddit.com/r/rust\").unwrap();\n+ let id = ItemId::from_url(\"https://reddit.com/r/rust\").unwrap();\n assert_eq!(\n map_item_to_reddit_api(&id, \"https://www.reddit.com\"),\n \"https://www.reddit.com/r/rust/about.json?raw_json=1\"\n@@ -699,7 +717,8 @@ mod tests {\n let json = include_str!(\"../../test/fixtures/reddit/r_rust_about.json\");\n let v: Value = serde_json::from_str(json).unwrap();\n let entity =\n- entity_view_from_payload(&ItemId::parse(\"reddit.com/r/rust\").unwrap(), &v).unwrap();\n+ entity_view_from_payload(&ItemId::from_url(\"https://reddit.com/r/rust\").unwrap(), &v)\n+ .unwrap();\n assert_eq!(entity.title, \"The Rust Programming Language\");\n }\n \n@@ -707,7 +726,8 @@ mod tests {\n fn parse_post_listing_extracts_thumb_and_full_preview() {\n let json = include_str!(\"../../test/fixtures/reddit/post_preview.json\");\n let v: Value = serde_json::from_str(json).unwrap();\n- let id = ItemId::parse(\"reddit.com/r/nsfw/comments/1tpy6a1/angel_eyes\").unwrap();\n+ let id =\n+ ItemId::from_url(\"https://reddit.com/r/nsfw/comments/1tpy6a1/angel_eyes\").unwrap();\n let entity = entity_view_from_payload(&id, &v).unwrap();\n assert_eq!(entity.title, \"Angel Eyes\");\n assert!(entity.thumb_url.as_ref().unwrap().contains(\"width=140\"));\ndiff --git a/server/src/reducer.rs b/server/src/reducer.rs\nindex 6578f64a41726845517cdbf59a359c69e0aa56db..5179ddeca7a7cb0fb92dfc4aa9d5a80bd9125611 100644\n--- a/server/src/reducer.rs\n+++ b/server/src/reducer.rs\n@@ -248,16 +248,18 @@ mod from_recorded_tests {\n #[test]\n fn ensure_path_wires_children() {\n let mut tree = GlobalTree::new();\n- let id = ItemId::parse(\"reddit.com/r/rust\").unwrap();\n+ let id = ItemId::from_url(\"https://reddit.com/r/rust\").unwrap();\n tree.ensure_path(&id);\n let root = tree.get(&ItemId::root()).unwrap();\n assert!(root\n .children\n- .contains(&ItemId::parse(\"reddit.com\").unwrap()));\n- let reddit = tree.get(&ItemId::parse(\"reddit.com\").unwrap()).unwrap();\n+ .contains(&ItemId::from_url(\"https://reddit.com\").unwrap()));\n+ let reddit = tree\n+ .get(&ItemId::from_url(\"https://reddit.com\").unwrap())\n+ .unwrap();\n assert!(reddit\n .children\n- .contains(&ItemId::parse(\"reddit.com/r\").unwrap()));\n+ .contains(&ItemId::from_url(\"https://reddit.com/r\").unwrap()));\n let sub = tree.get(&id).unwrap();\n assert_eq!(sub.id, id);\n }\ndiff --git a/server/src/render/reddit.rs b/server/src/render/reddit.rs\nindex 7f840aa33b734a31d8cf3341a0581c8bcb9bbcf3..595e202436040b0bfc419e68f083f94757ba5d0c 100644\n--- a/server/src/render/reddit.rs\n+++ b/server/src/render/reddit.rs\n@@ -9,7 +9,7 @@ use crate::{\n };\n \n pub fn is_reddit_post(id: &ItemId) -> bool {\n- id.as_str().starts_with(\"reddit.com/\") && id.as_str().contains(\"/comments/\")\n+ id.as_str().contains(\"reddit.com/\") && id.as_str().contains(\"/comments/\")\n }\n \n /// Post detail card (inside [`crate::fetch::html::entity_panel`]).\ndiff --git a/server/src/state.rs b/server/src/state.rs\nindex 78126f08d90f8069a586279d79258c27a9f9f7a4..513b329ef45fc332e63b3f8ed8498a1f59feb07c 100644\n--- a/server/src/state.rs\n+++ b/server/src/state.rs\n@@ -217,15 +217,21 @@ impl AppState {\n ratio_right: i32,\n ) -> Result<(), String> {\n let ts = crate::html::now_ms();\n- let vote = VoteData::from_recorded(ts, a, b, ratio_left, ratio_right)\n- .ok_or_else(|| \"invalid vote: need two distinct non-empty items\".to_string())?;\n+ let a_raw = a.trim();\n+ let b_raw = b.trim();\n+ if a_raw.is_empty() || b_raw.is_empty() || a_raw == b_raw {\n+ return Err(\"invalid vote: need two distinct non-empty items\".to_string());\n+ }\n+ // Validate items canonicalize (or are opaque keys) before append.\n+ let _ = VoteData::from_recorded(ts, a_raw, b_raw, ratio_left, ratio_right)\n+ .ok_or_else(|| \"invalid vote: need two distinct parseable items\".to_string())?;\n \n let event = Event::VoteRecorded {\n ts,\n- a: vote.a.as_str().to_string(),\n- b: vote.b.as_str().to_string(),\n- ratio_left: vote.ratio_left,\n- ratio_right: vote.ratio_right,\n+ a: a_raw.to_string(),\n+ b: b_raw.to_string(),\n+ ratio_left,\n+ ratio_right,\n scope: parent.as_str().to_string(),\n };\n \n@@ -253,7 +259,7 @@ mod tests {\n let log = EventLog::new(log_path.to_string_lossy().into_owned());\n let payload = json!({\"kind\":\"t5\",\"data\":{\"title\":\"Rust\",\"display_name\":\"rust\"}});\n let event = Event::EntityImported {\n- id: \"reddit.com/r/rust\".into(),\n+ id: \"https://reddit.com/r/rust\".into(),\n ts: 1,\n payload: payload.clone(),\n };\n@@ -266,14 +272,14 @@ mod tests {\n .await\n .unwrap();\n let tree = projection_store\n- .scope_tree(&ItemId::parse(\"reddit.com/r/rust\").unwrap())\n+ .scope_tree(&ItemId::parse(\"https://reddit.com/r/rust\").unwrap())\n .unwrap();\n let node = tree\n- .get(&ItemId::parse(\"reddit.com/r/rust\").unwrap())\n+ .get(&ItemId::parse(\"https://reddit.com/r/rust\").unwrap())\n .unwrap();\n assert_eq!(node.data.as_ref().unwrap().title, \"Rust\");\n let stored = entity_store\n- .get(&ItemId::parse(\"reddit.com/r/rust\").unwrap())\n+ .get(&ItemId::parse(\"https://reddit.com/r/rust\").unwrap())\n .unwrap()\n .unwrap();\n assert_eq!(stored[\"data\"][\"display_name\"], \"rust\");\n@@ -289,13 +295,13 @@ mod tests {\n event_record(\n 1,\n Event::NodeEnsured {\n- id: \"reddit.com/r/rust\".into(),\n+ id: \"https://reddit.com/r/rust\".into(),\n },\n ),\n event_record(\n 2,\n Event::EntityImported {\n- id: \"reddit.com/r/rust\".into(),\n+ id: \"https://reddit.com/r/rust\".into(),\n ts: 2,\n payload: payload.clone(),\n },\n@@ -325,7 +331,7 @@ mod tests {\n &[event_record(\n 1,\n Event::NodeEnsured {\n- id: \"reddit.com/r/stale\".into(),\n+ id: \"https://reddit.com/r/stale\".into(),\n },\n )],\n )\n@@ -352,11 +358,11 @@ mod tests {\n let root = tree.get(&ItemId::root()).unwrap();\n assert!(root.children.contains(&ItemId::parse(\"alpha\").unwrap()));\n assert!(projection_store\n- .load_node(&ItemId::parse(\"reddit.com/r/stale\").unwrap())\n+ .load_node(&ItemId::parse(\"https://reddit.com/r/stale\").unwrap())\n .unwrap()\n .is_none());\n let stored = entity_store\n- .get(&ItemId::parse(\"reddit.com/r/rust\").unwrap())\n+ .get(&ItemId::parse(\"https://reddit.com/r/rust\").unwrap())\n .unwrap()\n .unwrap();\n assert_eq!(stored[\"data\"][\"display_name\"], \"rust\");\n@@ -370,7 +376,7 @@ mod tests {\n log.append(&event_record(\n 1,\n Event::NodeEnsured {\n- id: \"reddit.com/r/rust\".into(),\n+ id: \"https://reddit.com/r/rust\".into(),\n },\n ))\n .await\n@@ -387,7 +393,7 @@ mod tests {\n &[event_record(\n 2,\n Event::NodeEnsured {\n- id: \"reddit.com/r/rust\".into(),\n+ id: \"https://reddit.com/r/rust\".into(),\n },\n )],\n )\n@@ -454,7 +460,7 @@ mod tests {\n port: 0,\n })\n .await;\n- let id = ItemId::parse(\"reddit.com/r/rust\").unwrap();\n+ let id = ItemId::parse(\"https://reddit.com/r/rust\").unwrap();\n \n state.ensure_node(&id).await.unwrap();\n \n@@ -465,11 +471,11 @@ mod tests {\n let projected = state.projection_store.load_tree().unwrap();\n assert!(projected.get(&id).is_some());\n let reddit = projected\n- .get(&ItemId::parse(\"reddit.com\").unwrap())\n+ .get(&ItemId::from_url(\"https://reddit.com\").unwrap())\n .unwrap();\n assert!(reddit\n .children\n- .contains(&ItemId::parse(\"reddit.com/r\").unwrap()));\n+ .contains(&ItemId::from_url(\"https://reddit.com/r\").unwrap()));\n }\n \n #[tokio::test]\n@@ -510,7 +516,7 @@ mod tests {\n log.append(&event_record(\n 1,\n Event::NodeEnsured {\n- id: \"reddit.com/r/rust\".into(),\n+ id: \"https://reddit.com/r/rust\".into(),\n },\n ))\n .await\n@@ -518,7 +524,7 @@ mod tests {\n log.append(&event_record(\n 2,\n Event::NodeEnsured {\n- id: \"reddit.com/r/python\".into(),\n+ id: \"https://reddit.com/r/python\".into(),\n },\n ))\n .await\n@@ -544,13 +550,13 @@ mod tests {\n 2\n );\n let tree = second\n- .scope_tree(&ItemId::parse(\"reddit.com/r/rust\").unwrap())\n+ .scope_tree(&ItemId::parse(\"https://reddit.com/r/rust\").unwrap())\n .unwrap();\n assert!(tree\n- .get(&ItemId::parse(\"reddit.com/r/rust\").unwrap())\n+ .get(&ItemId::parse(\"https://reddit.com/r/rust\").unwrap())\n .is_some());\n assert!(tree\n- .get(&ItemId::parse(\"reddit.com/r/python\").unwrap())\n+ .get(&ItemId::parse(\"https://reddit.com/r/python\").unwrap())\n .is_none());\n }\n \n@@ -611,7 +617,7 @@ mod tests {\n #[test]\n fn parse_item_param_from_url() {\n let id = parse_item_param(\"https://reddit.com/r/rust\");\n- assert_eq!(id.as_str(), \"reddit.com/r/rust\");\n+ assert_eq!(id.as_str(), \"https://reddit.com/r/rust\");\n }\n \n #[test]\ndiff --git a/server/src/url_rules/engine.rs b/server/src/url_rules/engine.rs\nnew file mode 100644\nindex 0000000000000000000000000000000000000000..e29b6b48c08deb7bffe031b1e542b1e25a7bef15\n--- /dev/null\n+++ b/server/src/url_rules/engine.rs\n@@ -0,0 +1,187 @@\n+//! Composable URL normalization primitives.\n+\n+use std::collections::HashMap;\n+\n+use url::Url;\n+\n+/// Mutable URL view used by rule combinators before serializing to a canonical string.\n+#[derive(Debug, Clone)]\n+pub struct ParsedUrl {\n+ pub scheme: String,\n+ pub host: String,\n+ pub path_segments: Vec,\n+ pub query: HashMap,\n+ pub fragment: Option,\n+}\n+\n+impl ParsedUrl {\n+ pub fn parse(raw: &str) -> Option {\n+ let trimmed = raw.trim();\n+ if trimmed.is_empty() {\n+ return None;\n+ }\n+\n+ let with_scheme = if trimmed.contains(\"://\") {\n+ trimmed.to_string()\n+ } else if trimmed.starts_with(\"r/\") || trimmed.starts_with(\"/r/\") {\n+ let rest = trimmed.trim_start_matches('/').trim_start_matches(\"r/\");\n+ format!(\"https://reddit.com/r/{rest}\")\n+ } else if trimmed.contains('.') && !trimmed.starts_with('/') {\n+ format!(\"https://{trimmed}\")\n+ } else {\n+ trimmed.to_string()\n+ };\n+\n+ let url = Url::parse(&with_scheme).ok()?;\n+ let host = url.host_str()?.to_string();\n+ let path_segments: Vec = url\n+ .path_segments()\n+ .map(|segs| segs.filter(|s| !s.is_empty()).map(str::to_string).collect())\n+ .unwrap_or_default();\n+\n+ let mut query = HashMap::new();\n+ for (k, v) in url.query_pairs() {\n+ query.insert(k.into_owned(), v.into_owned());\n+ }\n+\n+ Some(Self {\n+ scheme: url.scheme().to_string(),\n+ path_segments,\n+ query,\n+ fragment: url.fragment().map(str::to_string),\n+ host,\n+ })\n+ }\n+\n+ pub fn with_path_segments(&self, segments: &[String]) -> Self {\n+ let mut u = self.clone();\n+ u.path_segments = segments.to_vec();\n+ u\n+ }\n+\n+ pub fn to_url(&self) -> Option {\n+ let mut url = if self.path_segments.is_empty() {\n+ Url::parse(&format!(\"{}://{}\", self.scheme, self.host)).ok()?\n+ } else {\n+ let path = format!(\"/{}\", self.path_segments.join(\"/\"));\n+ Url::parse(&format!(\"{}://{}{}\", self.scheme, self.host, path)).ok()?\n+ };\n+ if !self.query.is_empty() {\n+ let mut pairs: Vec<_> = self.query.iter().collect();\n+ pairs.sort_by(|a, b| a.0.cmp(b.0));\n+ url.query_pairs_mut().clear();\n+ for (k, v) in pairs {\n+ url.query_pairs_mut().append_pair(k, v);\n+ }\n+ }\n+ if let Some(ref frag) = self.fragment {\n+ url.set_fragment(Some(frag));\n+ }\n+ Some(url)\n+ }\n+\n+ pub fn canonical_string(&self) -> Option {\n+ let url = self.to_url()?;\n+ let mut s = url.to_string();\n+ if self.path_segments.is_empty() {\n+ s = s.trim_end_matches('/').to_string();\n+ }\n+ Some(s)\n+ }\n+}\n+\n+pub fn force_https(u: &mut ParsedUrl) {\n+ if u.scheme == \"http\" {\n+ u.scheme = \"https\".to_string();\n+ }\n+}\n+\n+pub fn drop_fragment(u: &mut ParsedUrl) {\n+ u.fragment = None;\n+}\n+\n+pub fn strip_www(u: &mut ParsedUrl) {\n+ if u.host.starts_with(\"www.\") {\n+ u.host = u.host[4..].to_string();\n+ }\n+}\n+\n+pub fn lowercase_host(u: &mut ParsedUrl) {\n+ u.host = u.host.to_ascii_lowercase();\n+}\n+\n+pub fn lowercase_path(u: &mut ParsedUrl) {\n+ for seg in &mut u.path_segments {\n+ *seg = seg.to_ascii_lowercase();\n+ }\n+}\n+\n+pub fn clear_query(u: &mut ParsedUrl) {\n+ u.query.clear();\n+}\n+\n+pub fn keep_only_query(u: &mut ParsedUrl, keys: &[&str]) {\n+ u.query\n+ .retain(|k, _| keys.iter().any(|want| want == &k.as_str()));\n+}\n+\n+pub fn strip_tracking_params(u: &mut ParsedUrl) {\n+ u.query.retain(|k, _| {\n+ let lower = k.to_ascii_lowercase();\n+ !(lower.starts_with(\"utm_\")\n+ || matches!(\n+ lower.as_str(),\n+ \"fbclid\" | \"gclid\" | \"ref\" | \"ref_src\" | \"ref_source\" | \"mc_cid\" | \"mc_eid\"\n+ ))\n+ });\n+}\n+\n+pub fn truncate_after_segment(u: &mut ParsedUrl, name: &str, keep: usize) {\n+ if let Some(i) = u.path_segments.iter().position(|s| s == name) {\n+ let end = (i + 1 + keep).min(u.path_segments.len());\n+ u.path_segments.truncate(end);\n+ }\n+}\n+\n+pub fn drop_listing_suffix(u: &mut ParsedUrl, suffixes: &[&str]) {\n+ if u.path_segments.len() >= 3 && u.path_segments.first().map(String::as_str) == Some(\"r\") {\n+ if let Some(last) = u.path_segments.last() {\n+ if suffixes.iter().any(|s| *s == last.as_str()) {\n+ u.path_segments.pop();\n+ }\n+ }\n+ }\n+}\n+\n+pub fn normalize_reddit_host(u: &mut ParsedUrl) {\n+ if matches!(\n+ u.host.as_str(),\n+ \"old.reddit.com\" | \"new.reddit.com\" | \"www.reddit.com\"\n+ ) {\n+ u.host = \"reddit.com\".to_string();\n+ }\n+}\n+\n+pub fn rewrite_youtu_be(u: &mut ParsedUrl) {\n+ if u.host == \"youtu.be\" && u.path_segments.len() == 1 {\n+ let id = u.path_segments[0].clone();\n+ u.host = \"youtube.com\".to_string();\n+ u.path_segments = vec![\"watch\".to_string()];\n+ u.query.insert(\"v\".to_string(), id);\n+ }\n+}\n+\n+pub fn rewrite_youtube_shorts(u: &mut ParsedUrl) {\n+ if u.host == \"youtube.com\" && u.path_segments.first().map(String::as_str) == Some(\"shorts\") {\n+ if let Some(id) = u.path_segments.get(1).cloned() {\n+ u.path_segments = vec![\"watch\".to_string()];\n+ u.query.insert(\"v\".to_string(), id);\n+ }\n+ }\n+}\n+\n+pub fn normalize_youtube_host(u: &mut ParsedUrl) {\n+ if matches!(u.host.as_str(), \"m.youtube.com\" | \"www.youtube.com\") {\n+ u.host = \"youtube.com\".to_string();\n+ }\n+}\ndiff --git a/server/src/url_rules/mod.rs b/server/src/url_rules/mod.rs\nnew file mode 100644\nindex 0000000000000000000000000000000000000000..03d53bd3e82d704a01ba3fd8dd02b7d31422c0de\n--- /dev/null\n+++ b/server/src/url_rules/mod.rs\n@@ -0,0 +1,13 @@\n+//! URL canonicalization and hierarchy rules for [`crate::path_types::ItemId`].\n+\n+mod engine;\n+mod registry;\n+\n+pub use registry::{\n+ canonicalize_raw, looks_like_url, navigable_breadcrumbs, parent_url, resolve_id, CanonicalResult,\n+};\n+\n+/// Resolve raw input to canonical URL.\n+pub fn resolve_canonical(raw: &str) -> Option {\n+ canonicalize_raw(raw.trim()).map(|r| r.canonical)\n+}\ndiff --git a/server/src/url_rules/registry.rs b/server/src/url_rules/registry.rs\nnew file mode 100644\nindex 0000000000000000000000000000000000000000..14514e9af8385fb2b9b2f35eb9ee14d453d4b97c\n--- /dev/null\n+++ b/server/src/url_rules/registry.rs\n@@ -0,0 +1,235 @@\n+//! Per-domain canonicalization and hierarchy rules.\n+\n+use std::collections::HashSet;\n+\n+use super::engine::{\n+ clear_query, drop_fragment, drop_listing_suffix, force_https, keep_only_query, lowercase_host,\n+ lowercase_path, normalize_reddit_host, normalize_youtube_host, rewrite_youtu_be,\n+ rewrite_youtube_shorts, strip_tracking_params, strip_www, truncate_after_segment, ParsedUrl,\n+};\n+\n+/// Result of canonicalizing a raw URL string.\n+#[derive(Debug, Clone, PartialEq, Eq)]\n+pub struct CanonicalResult {\n+ pub canonical: String,\n+ /// When the input normalizes to a different string, the original is an alias.\n+ pub alias_of: Option,\n+}\n+\n+fn apply_global(u: &mut ParsedUrl) {\n+ force_https(u);\n+ drop_fragment(u);\n+ strip_www(u);\n+ lowercase_host(u);\n+ strip_tracking_params(u);\n+}\n+\n+fn normalize_reddit(u: &mut ParsedUrl) {\n+ normalize_reddit_host(u);\n+ lowercase_path(u);\n+ truncate_after_segment(u, \"comments\", 1);\n+ drop_listing_suffix(u, &[\"hot\", \"top\", \"new\", \"rising\", \"controversial\"]);\n+ clear_query(u);\n+}\n+\n+fn normalize_youtube(u: &mut ParsedUrl) {\n+ rewrite_youtu_be(u);\n+ normalize_youtube_host(u);\n+ rewrite_youtube_shorts(u);\n+ keep_only_query(u, &[\"v\", \"list\"]);\n+}\n+\n+fn normalize_default(_u: &mut ParsedUrl) {\n+ // Global rules only.\n+}\n+\n+fn domain_key(host: &str) -> &'static str {\n+ if host == \"reddit.com\" || host.ends_with(\".reddit.com\") {\n+ \"reddit.com\"\n+ } else if host == \"youtube.com\" || host == \"youtu.be\" {\n+ \"youtube.com\"\n+ } else {\n+ \"default\"\n+ }\n+}\n+\n+fn normalize_for_host(u: &mut ParsedUrl) {\n+ apply_global(u);\n+ match domain_key(&u.host) {\n+ \"reddit.com\" => normalize_reddit(u),\n+ \"youtube.com\" => normalize_youtube(u),\n+ _ => normalize_default(u),\n+ }\n+}\n+\n+/// Structural path segments that must not become standalone tree nodes when more path follows.\n+fn structural_trailing(host: &str) -> &'static [&'static str] {\n+ match domain_key(host) {\n+ \"reddit.com\" => &[\"comments\"],\n+ _ => &[],\n+ }\n+}\n+\n+/// Canonicalize a raw URL. Returns `None` if the input is not URL-like.\n+pub fn canonicalize_raw(raw: &str) -> Option {\n+ let trimmed = raw.trim();\n+ if trimmed.is_empty() {\n+ return None;\n+ }\n+ let mut u = ParsedUrl::parse(trimmed)?;\n+ let input_snapshot = u.canonical_string()?;\n+ normalize_for_host(&mut u);\n+ let canonical = u.canonical_string()?;\n+ let alias_of = if input_snapshot != canonical {\n+ Some(trimmed.to_string())\n+ } else {\n+ None\n+ };\n+ Some(CanonicalResult {\n+ canonical,\n+ alias_of,\n+ })\n+}\n+\n+/// Resolve a stored or event id string to its canonical URL identity.\n+pub fn resolve_id(raw: &str) -> Option {\n+ canonicalize_raw(raw).map(|r| r.canonical)\n+}\n+\n+/// Navigable ancestor URLs from domain root up to and including `canonical` (full URLs).\n+pub fn navigable_breadcrumbs(canonical: &str) -> Vec {\n+ let Some(u) = ParsedUrl::parse(canonical) else {\n+ return vec![canonical.to_string()];\n+ };\n+ let structural: HashSet<&str> = structural_trailing(&u.host).iter().copied().collect();\n+ let n = u.path_segments.len();\n+ let mut out = Vec::new();\n+\n+ // Domain root (no path segments).\n+ if let Some(base) = u.with_path_segments(&[]).canonical_string() {\n+ out.push(base);\n+ }\n+\n+ for i in 0..n {\n+ let segs: Vec = u.path_segments[..=i].to_vec();\n+ let is_last = i == n - 1;\n+ let seg = u.path_segments[i].as_str();\n+ if structural.contains(seg) && !is_last {\n+ continue;\n+ }\n+ if let Some(url) = u.with_path_segments(&segs).canonical_string() {\n+ if out.last() != Some(&url) {\n+ out.push(url);\n+ }\n+ }\n+ }\n+ out\n+}\n+\n+/// Immediate parent scope URL, or `None` for tree root / opaque single-segment ids.\n+pub fn parent_url(canonical: &str) -> Option {\n+ let crumbs = navigable_breadcrumbs(canonical);\n+ if crumbs.len() <= 1 {\n+ None\n+ } else {\n+ crumbs.get(crumbs.len() - 2).cloned()\n+ }\n+}\n+\n+/// True when `raw` looks like a URL (has scheme or host-like shape).\n+pub fn looks_like_url(raw: &str) -> bool {\n+ let t = raw.trim();\n+ t.contains(\"://\")\n+ || t.starts_with(\"r/\")\n+ || t.starts_with(\"/r/\")\n+ || (t.contains('.') && t.contains('/'))\n+ || t.starts_with(\"reddit.com\")\n+ || t.starts_with(\"www.\")\n+ || t.starts_with(\"youtu.be/\")\n+}\n+\n+#[cfg(test)]\n+mod tests {\n+ use super::*;\n+\n+ #[test]\n+ fn reddit_post_drops_slug_and_normalizes_host() {\n+ let r = canonicalize_raw(\n+ \"https://old.reddit.com/r/AmItheAsshole/comments/1trnvdl/aita_for_cancelling/\",\n+ )\n+ .unwrap();\n+ assert_eq!(\n+ r.canonical,\n+ \"https://reddit.com/r/amitheasshole/comments/1trnvdl\"\n+ );\n+ }\n+\n+ #[test]\n+ fn reddit_strips_query_and_listing() {\n+ assert_eq!(\n+ canonicalize_raw(\"https://www.reddit.com/r/rust/?sort=top\")\n+ .unwrap()\n+ .canonical,\n+ \"https://reddit.com/r/rust\"\n+ );\n+ assert_eq!(\n+ canonicalize_raw(\"https://www.reddit.com/r/programming/hot\")\n+ .unwrap()\n+ .canonical,\n+ \"https://reddit.com/r/programming\"\n+ );\n+ }\n+\n+ #[test]\n+ fn reddit_short_path() {\n+ assert_eq!(\n+ canonicalize_raw(\"r/rust\").unwrap().canonical,\n+ \"https://reddit.com/r/rust\"\n+ );\n+ }\n+\n+ #[test]\n+ fn reddit_breadcrumbs_skip_phantom_comments() {\n+ let post = \"https://reddit.com/r/aww/comments/1trnvdl\";\n+ let crumbs = navigable_breadcrumbs(post);\n+ assert!(!crumbs.iter().any(|c| c.ends_with(\"/comments\")));\n+ assert_eq!(\n+ crumbs.last().map(String::as_str),\n+ Some(post)\n+ );\n+ assert!(crumbs.contains(&\"https://reddit.com/r/aww\".to_string()));\n+ }\n+\n+ #[test]\n+ fn reddit_parent_of_post_is_subreddit() {\n+ assert_eq!(\n+ parent_url(\"https://reddit.com/r/aww/comments/1trnvdl\").as_deref(),\n+ Some(\"https://reddit.com/r/aww\")\n+ );\n+ }\n+\n+ #[test]\n+ fn youtube_youtu_be_and_watch_same_canonical() {\n+ let a = canonicalize_raw(\"https://youtu.be/dQw4w9WgXcQ\").unwrap().canonical;\n+ let b = canonicalize_raw(\"https://www.youtube.com/watch?v=dQw4w9WgXcQ&t=10\").unwrap();\n+ assert_eq!(a, b.canonical);\n+ assert_eq!(a, \"https://youtube.com/watch?v=dQw4w9WgXcQ\");\n+ }\n+\n+ #[test]\n+ fn legacy_schemeless_upgrades() {\n+ assert_eq!(\n+ canonicalize_raw(\"reddit.com/r/rust/comments/aaa/announcing_rust_199\")\n+ .unwrap()\n+ .canonical,\n+ \"https://reddit.com/r/rust/comments/aaa\"\n+ );\n+ }\n+\n+ #[test]\n+ fn alias_recorded_when_input_differs() {\n+ let r = canonicalize_raw(\"https://youtu.be/abc123\").unwrap();\n+ assert_eq!(r.canonical, \"https://youtube.com/watch?v=abc123\");\n+ assert!(r.alias_of.is_some());\n+ }\n+}\n","role":"user"}],"model":"openai/gpt-chat-latest"}