返回博客

#llm

7 篇相关文章

400 错误跨 3 个 key 各烧一遍 token?扒一下 llm-proxy 的错误分类和重试策略
产品文档

400 错误跨 3 个 key 各烧一遍 token?扒一下 llm-proxy 的错误分类和重试策略

同一份请求,3 个 API key 排队 400 失败 3 次才告诉你请求体有问题,白白消耗 3 份 token。429 限流时又密集轮询 3 个 key 把上游打爆。扒 model-router.service.ts:classifyError 把上游错误分成 9 类,bad_request 硬拦截不重试、rate_limit 走 1/2/4s 阶梯 + provider 停用 60s 起指数封顶 5 分钟,以及为什么 billing_error 要整组停用而不是只换一个 key。

2026年8月27日47 分钟
wuyin 异步任务 5 分钟超时是写死的吗?扒一下轮询循环里那 4 个真实差异
产品文档

wuyin 异步任务 5 分钟超时是写死的吗?扒一下轮询循环里那 4 个真实差异

提交返回的 task_id 拿不到图/视频,是 wuyin 没跑完还是代理提前放弃?源码逐行:同步轮询(图片)vs 异步分步(视频)的两套 client 模型、GET→POST 405 兜底、status 枚举没有常量、submit 阶段双鉴权。

2026年8月26日47 分钟
长推理跑 10 分钟就断?聊聊 LLM 流式代理里那条 15 秒一次的心跳
产品文档

长推理跑 10 分钟就断?聊聊 LLM 流式代理里那条 15 秒一次的心跳

为什么 agent 跑长任务会被 idle timeout 误杀?为什么日志里 'LLM idle timeout (120s): no response from model' 出现时上游其实没事?源码逐行:管道心跳、上下文自动截断、4xx 错误透传上游 body。

2026年8月24日45 分钟
多 key 多模型怎么优雅地轮流试:LLM 供应商故障转移是怎么实现的
产品文档

多 key 多模型怎么优雅地轮流试:LLM 供应商故障转移是怎么实现的

把同一个请求在 3 个 key 之间轮询、遇到特定错误跳过熔断、整组限流就停 30s——这套机制是 LLM 代理的「心脏」。源码解读 + 你自己的代理可以怎么照搬。

2026年8月23日32 分钟
大语言模型(LLM)工作原理——用人话版
AI基础入门

大语言模型(LLM)工作原理——用人话版

不用数学公式,用最通俗的比喻理解大语言模型。什么是 Token?模型为什么会产生幻觉?参数多意味着什么?读完你就懂了。

2026年5月29日21 分钟
📄
技术博客

什么是RAG?检索增强生成技术在企业AI中的完全解读

RAG(检索增强生成)是大模型在企业落地中最关键的技术架构之一。本文全面解读RAG的工作原理、与Fine-tuning的对比、企业落地三种架构模式,以及怡途产品中的RAG应用。

2026年5月28日12 分钟
大模型Token计费模式详解:按量付费vs订阅制如何选择
技术博客

大模型Token计费模式详解:按量付费vs订阅制如何选择

不同LLM提供商的Token计费方式差异很大,企业如何选择最经济的方案?本文深度对比各种计费模式。

2026年5月5日8 分钟