alitrack

他把17家大模型免费API缝成了一个端点

先算一笔账。

Google Gemini 有免费额度。Groq 有。Cerebras 有。Mistral 有。OpenRouter 有。GitHub Models 有。Cloudflare Workers AI 有。智谱有。NVIDIA 有。HuggingFace 有。还有 Kilo、Pollinations、LLM7、OVH——每一个,都在送免费的推理算力。

单独看,每个免费额度都是玩具。每天几千次请求,几百万 token,跑几个 prompt 就见底了。

但有人把账算了一遍:17 家加在一起,每月大约 17 亿 token。

一个叫 Tashfeen Ahmed 的开发者干了件事——他把这 17 家的免费 API 全部缝到了一个 OpenAI 兼容的端点后面。

项目叫 FreeLLMAPI。开源,MIT 协议。GitHub 地址:

github.com/tashfeenahmed/freellmapi

2 个月,14,000 Stars。40 个贡献者。311 次提交。还在以每天 ~165 star 的速度涨。


● ● ●

它干了什么

你在本地跑一个服务,把各家的 API Key 填进去。然后打开任何一个支持 OpenAI SDK 的应用,把 base_url 改成本地地址。完事。

from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:3001/v1",
    api_key="freellmapi-你的统一密钥",
)
resp = client.chat.completions.create(
    model="auto",  # 自动选最优
    messages=[{"role": "user", "content": "Hello"}],
)

请求发过去之后,代理做这么几件事:

选人。 按 Fallback Chain 优先级找第一个有健康 Key、且各项限额都没超的提供商。

兜底。 如果返回 429(限流)、5xx(挂了)或超时,自动跳到下一个提供商再试,最多 20 次。

记账。 每个 (平台, 模型, Key) 的 RPM、RPD、TPM、TPD 四个维度独立计数。谁的额度快用完了,路由器自动避开。

调用方不用管这些。响应头里有一行 X-Routed-Via: groq/llama-3.3-70b-versatile,告诉你这次谁接的单。

Image


● ● ●

17 家提供商,到底能跑什么模型

名单分两类。

需要注册拿 Key 的(13 家):

提供商代表模型
GoogleGemini 2.5 Flash, 3.x previews
GroqLlama 3.3, Llama 4, GPT-OSS, Qwen3
CerebrasQwen3 235B(速度快)
MistralLarge 3, Codestral, Devstral
OpenRouter21 个免费路由
GitHub ModelsGPT-4.1, GPT-4o(实验层)
CloudflareKimi K2, GLM-4.7, Granite 4
CohereCommand R+
智谱 Z.aiGLM-4.5, GLM-4.7 Flash
NVIDIA NIM多种开源模型
HuggingFaceDeepSeek V4, Kimi K2.6, Qwen3
Ollama CloudGLM-4.7, Kimi K2, Qwen3
OpenCode ZenDeepSeek V4 Flash

连注册都不用,匿名就能用的(5 家):

Kilo Gateway、Pollinations(GPT-OSS 20B)、LLM7、OVH AI Endpoints(Qwen3.5 397B)、AI Horde(社区 Llama/Gemma)。

外加一个自定义端点——把本地的 Ollama、LM Studio、vLLM 接进来,跟云端免费池一起用。


● ● ●

说实话:这些模型够不够用

怎么讲呢——够实验,不够生产。

天花板大概是 Llama 3.3 70B、Qwen3 Coder、Gemini 2.5 Pro、GPT-4o(GitHub Models 的实验层)。没有 Claude Opus 级别的前线模型。

而且免费额度的质量在一天中不是均匀的。最优质的模型最先耗尽。UTC 凌晨重置后满血复活,到 UTC 下午,路由器的选择范围就窄多了。

另外是 17 亿这个数字本身。这是理论最大值——17 家全部注册、全部配好 Key、且每天都跑满限额。实际操作中,注册 8-10 家主要提供商,稳定输出大概在每月 5-8 亿 token。


● ● ●

一些技术细节

黏性会话。 多轮对话里,同一个会话会锁定同一个模型 30 分钟。避免中途切换模型导致的幻觉激增。

Anthropic 兼容。 不仅支持 OpenAI 格式,还实现了 Anthropic Messages API。Claude Code 可以直连 FreeLLMAPI,把 claude-sonnet-4-20250514 映射到免费池里的模型。

加密存储。 所有上游 API Key 用 AES-256-GCM 加密后存 SQLite,只在请求时解密到内存。应用端只需要一个 freellmapi-xxx 的统一 Key——上游 Key 永远不暴露。

React 仪表盘。 管理 Key、调整 Fallback Chain 顺序、查看实时分析(延迟、token 消耗、成功率、各提供商细分)。暗色模式。支持 6 种语言,含简体中文。


● ● ●

部署体验

我在 WSL 里跑了一下。环境是 Node.js v24。

# 下载源码(GitHub 直连困难,走的 tarball)
tar xzf freellmapi.tar.gz && cd freellmapi
npm install
# 生成加密 Key
ENCRYPTION_KEY="$(node -e 'console.log(require("crypto").randomBytes(32).toString("hex"))')"
printf "ENCRYPTION_KEY=%s\nPORT=3001\n" "$ENCRYPTION_KEY" > .env
npm run dev

Vite 前端在 :5173,Express API 在 :3001。空闲内存 ~40MB。官方说法是树莓派也能跑。

推荐用 Docker 部署,仓库自带 docker-compose.yml,一行命令搞定。镜像发布在 GitHub Container Registry,支持 amd64 + arm64。


● ● ●

合规这件事

FreeLLMAPI 的 README 里有一份 2026 年 5 月更新的 ToS 审查表。结论是:

Groq、Cerebras、Mistral、OpenRouter 基本 OK,个人单用户代理不触及反条款。Google Gemini 在 2026 年收窄了使用范围,需谨慎。GitHub Models 和 NVIDIA NIM 明确标注"实验/评估用途"。Cohere 干脆建议别用——条款禁止个人/家用目的。

底线:每人每平台一个账号,不转售,不对外公开端点,不把免费额度当生产后端。这是个人实验工具。


● ● ●

为什么这件事有意思

技术本身不新鲜。代理路由、速率限流、故障转移——每一块都是成熟模式。

有意思的是这个想法本身:"每一个免费额度单独看都不够用,但加起来就够了。"

每个大模型实验室都在用免费额度拉新。单独看,确实只够塞牙缝。但 Tashfeen 算了一笔账——17 家的免费额度堆在一起,约等于一个中型团队的月消耗量。

然后他用一个周末做了 MVP,开源了。

然后社区涌进来了。40 个贡献者,包含 Anthropic 的 Claude(对,就是那个 AI,以贡献者身份出现在 commit 记录里)。311 次提交。版本号从零到 v0.4.1。

14,000 Star。

你说技术有多深?一般。但这个洞察——"你没注意到的东西,我注意到了,并且做成了一行命令就能部署的成品"——值 14,000 Star。


● ● ●

谁应该用

个人开发者做原型验证。学生跑实验。独立开发者做 side project 的推理后端。AI 工具链里的低成本 fallback 层。

不适合任何需要 SLA 的生产环境,或需要 Claude Opus / GPT-5 级推理准确率的场景。


仓库地址: github.com/tashfeenahmed/freellmapi

官网: freellmapi.co

许可协议: MIT