from openai import OpenAI
import os
client = OpenAI(
base_url=os.environ["FOURROUTER_BASE_URL"],
api_key=os.environ["FOURROUTER_API_KEY"]
)
models = client.models.list()4ROUTER / AI INFRASTRUCTURE
AI 基础设施, 围绕你的工作负载。
从多模型推理到训练调优,从 GPU 集群到私有化部署。用合适的模型、算力与部署方式,把 AI 带入你的业务。

THE PLATFORM
从一个端点开始。
保留熟悉的调用方式,把模型接入、路由决策和用量管理交给同一套平台。
请求路径示意
用量有据可查
请求与用量逐条记录,方便核对调用和费用。
访问集中管理
通过控制台管理账户与访问入口,按工作空间分配权限。
能力与服务
从推理到部署,覆盖你的工作。
直接接入平台,或与我们一起搭建专属基础设施。
INFERENCE
让模型服务于真实应用。
通过统一端点接入多模型推理,或在专有环境中部署模型服务。按任务需求配置模型、容量与调用边界。
推理服务详情 →统一模型接入
通过兼容接口连接多家供应商,减少应用侧的重复集成。
专有推理环境
根据模型、并发与数据要求,配置专属推理服务。

TRAINING & OPTIMISATION
让模型更适合你的任务。
面向具体任务开展模型微调、评测与算子优化。先明确质量与运行要求,再选择训练和调优路径。
训练与调优详情 →微调与评测
围绕业务数据与任务目标开展微调,以一致口径评估效果。
算子与运行性能
从模型执行到 kernel 实现,分析瓶颈并进行针对性优化。

你的环境,你的基础设施
基础设施,也可以由你掌握。
需要自有算力或明确的数据边界时,我们把工作延伸到集群和部署现场。
4ROUTER / 系统研究
把配置选择,放回系统原理。
理解算子、KV 状态与调度怎样共同决定一条推理路径。
在 Resources 中阅读系统笔记 ↗4ROUTER / ENGINEERING
基础设施内部。

系统
搭建推理集群
从独立 GPU 到协同工作的推理服务。

性能
优化推理路径
定位延迟、吞吐与资源占用之间的取舍。

弹性服务
把推理组织为弹性服务
从一个运行进程,到有明确边界的服务。

路由
路由引擎内部
沿着一次请求,理解候选选择与分发。

系统
跨 GPU 调度
把任务放到合适的资源上。

性能
理解 KV Cache
生成过程中的状态,如何占用与复用显存。

性能
理解连续批处理
请求持续到达时,如何安排生成工作。

弹性服务
设计冷启动路径
把服务从启动到可用的过程拆开。

弹性服务
随负载扩展
让容量变化与请求行为相匹配。

路由
当路由需要回退
把替代路径与失败边界说明白。

可观测性
跟踪一次完整请求
把接入、执行与结算放到同一条时间线上。

可靠性
隔离不同工作负载
分别处理资源、数据与故障的边界。
聊聊你的基础设施需求。
接入平台,或讨论模型、性能与部署方案。