From d56943d306dbc553fc235f54c0a9f746dd0839b8 Mon Sep 17 00:00:00 2001 From: erin2722 <16248113+erin2722@users.noreply.github.com> Date: Wed, 26 Aug 2026 11:14:16 +0000 Subject: [PATCH 1/4] chore: sync new models --- packages/proxy/schema/model_list.json | 40 ++++++++++++++------------- 1 file changed, 21 insertions(+), 19 deletions(-) diff --git a/packages/proxy/schema/model_list.json b/packages/proxy/schema/model_list.json index 080a909c..b9c72208 100644 --- a/packages/proxy/schema/model_list.json +++ b/packages/proxy/schema/model_list.json @@ -13470,8 +13470,9 @@ "meta-llama/llama-3.3-70b-instruct": { "format": "openai", "flavor": "chat", - "input_cost_per_mil_tokens": 0.1, - "output_cost_per_mil_tokens": 0.32, + "input_cost_per_mil_tokens": 0.71, + "output_cost_per_mil_tokens": 0.71, + "input_cache_read_cost_per_mil_tokens": 0.71, "displayName": "Meta: Llama 3.3 70B Instruct", "max_input_tokens": 131072, "max_output_tokens": 128000, @@ -13483,8 +13484,9 @@ "format": "openai", "flavor": "chat", "multimodal": true, - "input_cost_per_mil_tokens": 0.1, - "output_cost_per_mil_tokens": 0.3, + "input_cost_per_mil_tokens": 0.11, + "output_cost_per_mil_tokens": 0.34, + "input_cache_read_cost_per_mil_tokens": 0.055, "displayName": "Meta: Llama 4 Scout", "max_input_tokens": 1310720, "max_output_tokens": 16384, @@ -14105,9 +14107,9 @@ "deepseek/deepseek-v4-flash-0731": { "format": "openai", "flavor": "chat", - "input_cost_per_mil_tokens": 0.14, - "output_cost_per_mil_tokens": 0.28, - "input_cache_read_cost_per_mil_tokens": 0.028, + "input_cost_per_mil_tokens": 0.06, + "output_cost_per_mil_tokens": 0.12, + "input_cache_read_cost_per_mil_tokens": 0.012, "displayName": "DeepSeek: DeepSeek V4 Flash (0731)", "reasoning": true, "parent": "deepseek/deepseek-v4-flash", @@ -14229,9 +14231,9 @@ "deepseek/deepseek-v4-flash": { "format": "openai", "flavor": "chat", - "input_cost_per_mil_tokens": 0.0854, - "output_cost_per_mil_tokens": 0.1708, - "input_cache_read_cost_per_mil_tokens": 0.01708, + "input_cost_per_mil_tokens": 0.0826, + "output_cost_per_mil_tokens": 0.1652, + "input_cache_read_cost_per_mil_tokens": 0.01652, "displayName": "DeepSeek: DeepSeek V4 Flash", "reasoning": true, "max_input_tokens": 1048576, @@ -14243,9 +14245,9 @@ "deepseek/deepseek-v4-pro": { "format": "openai", "flavor": "chat", - "input_cost_per_mil_tokens": 0.579072, - "output_cost_per_mil_tokens": 1.158144, - "input_cache_read_cost_per_mil_tokens": 0.048256, + "input_cost_per_mil_tokens": 0.87, + "output_cost_per_mil_tokens": 1.74, + "input_cache_read_cost_per_mil_tokens": 0.0725, "displayName": "DeepSeek: DeepSeek V4 Pro", "reasoning": true, "max_input_tokens": 1048576, @@ -15728,8 +15730,8 @@ "format": "openai", "flavor": "chat", "multimodal": true, - "input_cost_per_mil_tokens": 0.8, - "output_cost_per_mil_tokens": 1, + "input_cost_per_mil_tokens": 0.25, + "output_cost_per_mil_tokens": 0.75, "input_cache_read_cost_per_mil_tokens": 0.4, "displayName": "Qwen: Qwen2.5 VL 72B Instruct", "max_input_tokens": 128000, @@ -16068,8 +16070,8 @@ "format": "openai", "flavor": "chat", "multimodal": true, - "input_cost_per_mil_tokens": 0.5, - "output_cost_per_mil_tokens": 3.6, + "input_cost_per_mil_tokens": 0.39, + "output_cost_per_mil_tokens": 2.34, "input_cache_read_cost_per_mil_tokens": 0.3, "displayName": "Qwen: Qwen3.5 397B A17B", "reasoning": true, @@ -16370,9 +16372,9 @@ "format": "openai", "flavor": "chat", "multimodal": true, - "input_cost_per_mil_tokens": 0.1, + "input_cost_per_mil_tokens": 0.09, "output_cost_per_mil_tokens": 0.34, - "input_cache_read_cost_per_mil_tokens": 0.1, + "input_cache_read_cost_per_mil_tokens": 0.05, "displayName": "Google: Gemma 4 31B IT", "reasoning": true, "max_input_tokens": 262144, From b6fbd0e597a5bf166271651525f52b11d2c4bba9 Mon Sep 17 00:00:00 2001 From: Erin McNulty Date: Wed, 26 Aug 2026 12:40:08 +0000 Subject: [PATCH 2/4] catalog: drop stale cache-read on qwen2.5-vl-72b-instruct MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit Qwen2.5 VL 72B Instruct's input dropped to $0.25/M but its input_cache_read_cost_per_mil_tokens stayed at the previous tariff's $0.40/M — making cached input cost more than ordinary input. OpenRouter no longer publishes a cache-read rate for this model, so remove the stale field rather than invent one (addresses codex P2). Co-Authored-By: Claude Opus 4.8 --- packages/proxy/schema/model_list.json | 1 - 1 file changed, 1 deletion(-) diff --git a/packages/proxy/schema/model_list.json b/packages/proxy/schema/model_list.json index b9c72208..e2d7078a 100644 --- a/packages/proxy/schema/model_list.json +++ b/packages/proxy/schema/model_list.json @@ -15732,7 +15732,6 @@ "multimodal": true, "input_cost_per_mil_tokens": 0.25, "output_cost_per_mil_tokens": 0.75, - "input_cache_read_cost_per_mil_tokens": 0.4, "displayName": "Qwen: Qwen2.5 VL 72B Instruct", "max_input_tokens": 128000, "max_output_tokens": 128000, From 408fbe91934a1829147301d7861066108ed6b60d Mon Sep 17 00:00:00 2001 From: erin2722 <16248113+erin2722@users.noreply.github.com> Date: Wed, 26 Aug 2026 22:10:06 +0000 Subject: [PATCH 3/4] chore: sync new models --- packages/proxy/schema/index.ts | 2 ++ packages/proxy/schema/model_list.json | 42 +++++++++++++++++++++++---- 2 files changed, 38 insertions(+), 6 deletions(-) diff --git a/packages/proxy/schema/index.ts b/packages/proxy/schema/index.ts index 7170dd79..01706b87 100644 --- a/packages/proxy/schema/index.ts +++ b/packages/proxy/schema/index.ts @@ -393,6 +393,8 @@ export const AvailableEndpointTypes: { [name: string]: ModelEndpointType[] } = { "mixtral-8x7b": ["lepton"], "wizardlm-2-7b": ["lepton"], "wizardlm-2-8x22b": ["lepton", "openrouter"], + "qwen/qwen3.8-flash": ["openrouter"], + "z-ai/glm-5.3-flash": ["openrouter"], "meta/muse-spark-1.2-contributor": ["openrouter"], "deepseek/deepseek-v4-flash-vision-exp": ["openrouter"], "tencent/hy-mt2-7b": ["openrouter"], diff --git a/packages/proxy/schema/model_list.json b/packages/proxy/schema/model_list.json index 04d22026..dbeb7582 100644 --- a/packages/proxy/schema/model_list.json +++ b/packages/proxy/schema/model_list.json @@ -14231,9 +14231,9 @@ "deepseek/deepseek-v4-flash": { "format": "openai", "flavor": "chat", - "input_cost_per_mil_tokens": 0.0826, - "output_cost_per_mil_tokens": 0.1652, - "input_cache_read_cost_per_mil_tokens": 0.01652, + "input_cost_per_mil_tokens": 0.07952, + "output_cost_per_mil_tokens": 0.15904, + "input_cache_read_cost_per_mil_tokens": 0.015904, "displayName": "DeepSeek: DeepSeek V4 Flash", "reasoning": true, "max_input_tokens": 1048576, @@ -14593,6 +14593,21 @@ "openrouter" ] }, + "z-ai/glm-5.3-flash": { + "format": "openai", + "flavor": "chat", + "multimodal": true, + "input_cost_per_mil_tokens": 0.075, + "output_cost_per_mil_tokens": 0.25, + "input_cache_read_cost_per_mil_tokens": 0.015, + "displayName": "Z.ai: GLM 5.3 Flash", + "reasoning": true, + "max_input_tokens": 1310720, + "max_output_tokens": 131072, + "available_providers": [ + "openrouter" + ] + }, "z-ai/glm-5.3": { "format": "openai", "flavor": "chat", @@ -14904,9 +14919,9 @@ "tencent/hy3": { "format": "openai", "flavor": "chat", - "input_cost_per_mil_tokens": 0.132, - "output_cost_per_mil_tokens": 0.528, - "input_cache_read_cost_per_mil_tokens": 0.033, + "input_cost_per_mil_tokens": 0.0825, + "output_cost_per_mil_tokens": 0.33, + "input_cache_read_cost_per_mil_tokens": 0.020625, "displayName": "Tencent: Hy3", "reasoning": true, "max_input_tokens": 262144, @@ -15633,6 +15648,21 @@ "openrouter" ] }, + "qwen/qwen3.8-flash": { + "format": "openai", + "flavor": "chat", + "multimodal": true, + "input_cost_per_mil_tokens": 0.16, + "output_cost_per_mil_tokens": 0.47, + "input_cache_read_cost_per_mil_tokens": 0.016, + "displayName": "Qwen: Qwen3.8 Flash", + "reasoning": true, + "max_input_tokens": 1000000, + "max_output_tokens": 131072, + "available_providers": [ + "openrouter" + ] + }, "qwen/qwen3.8-27b": { "format": "openai", "flavor": "chat", From b77ba00ca385c660d288e7c32120a0ebf789e128 Mon Sep 17 00:00:00 2001 From: Erin McNulty Date: Wed, 26 Aug 2026 22:22:29 +0000 Subject: [PATCH 4/4] catalog: add groq to qwen3.8-27b + add baseten GLM-5.3-Flash - qwen/qwen3.8-27b: union groq onto the existing (openrouter) entry and apply Groq's published metadata (input $0.8, output $4, cache-read $0.4, 131042 ctx, 16384 max output, multimodal, reasoning), matching the qwen3.6-27b groq+openrouter precedent (groq listed first). index.ts -> ["groq","openrouter"]. - zai-org/GLM-5.3-Flash: add the Baseten-served entry (baseten keys GLM models by their zai-org/ HF id, separate from the openrouter z-ai/ slug, same as GLM-5.2). Values from Baseten's /v1/models: input $0.15, output $0.5, cache-read $0.03, 1048576 ctx, 131072 max output, multimodal, reasoning. index.ts -> ["baseten"]. Both invoke 200 (streaming + non-streaming) through the gateway with real content. Co-Authored-By: Claude Opus 4.8 --- packages/proxy/schema/index.ts | 3 ++- packages/proxy/schema/model_list.json | 26 +++++++++++++++++++++----- 2 files changed, 23 insertions(+), 6 deletions(-) diff --git a/packages/proxy/schema/index.ts b/packages/proxy/schema/index.ts index 4b531fff..fe286f24 100644 --- a/packages/proxy/schema/index.ts +++ b/packages/proxy/schema/index.ts @@ -401,7 +401,7 @@ export const AvailableEndpointTypes: { [name: string]: ModelEndpointType[] } = { "tencent/hy-mt2-30b-a3b": ["openrouter"], "mistralai/ministral-8b": ["openrouter"], "z-ai/glm-5.3": ["openrouter"], - "qwen/qwen3.8-27b": ["openrouter"], + "qwen/qwen3.8-27b": ["groq", "openrouter"], "bytedance-seed/seed-2-1-turbo": ["openrouter"], "qwen/qwen3.8-2.4t-a95b": ["openrouter"], "bytedance-seed/seed-2.0-code": ["openrouter"], @@ -913,6 +913,7 @@ export const AvailableEndpointTypes: { [name: string]: ModelEndpointType[] } = { "zai-org/GLM-5.1": ["together"], "zai-org/GLM-5.2": ["baseten", "together"], "zai-org/GLM-5.2-Fast": ["baseten"], + "zai-org/GLM-5.3-Flash": ["baseten"], "MiniMaxAI/MiniMax-M2.7": ["together"], "MiniMaxAI/MiniMax-M3": ["together"], "mistral-medium-2508": ["mistral"], diff --git a/packages/proxy/schema/model_list.json b/packages/proxy/schema/model_list.json index e2d7078a..3ea95713 100644 --- a/packages/proxy/schema/model_list.json +++ b/packages/proxy/schema/model_list.json @@ -10900,6 +10900,21 @@ "baseten" ] }, + "zai-org/GLM-5.3-Flash": { + "format": "openai", + "flavor": "chat", + "multimodal": true, + "input_cost_per_mil_tokens": 0.15, + "output_cost_per_mil_tokens": 0.5, + "input_cache_read_cost_per_mil_tokens": 0.03, + "displayName": "GLM 5.3 Flash", + "reasoning": true, + "max_input_tokens": 1048576, + "max_output_tokens": 131072, + "available_providers": [ + "baseten" + ] + }, "zai-org/GLM-5.2": { "format": "openai", "flavor": "chat", @@ -15637,14 +15652,15 @@ "format": "openai", "flavor": "chat", "multimodal": true, - "input_cost_per_mil_tokens": 0.425, - "output_cost_per_mil_tokens": 2.55, - "input_cache_read_cost_per_mil_tokens": 0.085, + "input_cost_per_mil_tokens": 0.8, + "output_cost_per_mil_tokens": 4, + "input_cache_read_cost_per_mil_tokens": 0.4, "displayName": "Qwen: Qwen3.8 27B", "reasoning": true, - "max_input_tokens": 262144, - "max_output_tokens": 131072, + "max_input_tokens": 131042, + "max_output_tokens": 16384, "available_providers": [ + "groq", "openrouter" ] },