wylon

模型服务概览

wylon 新云 Token 工厂 提供文本生成、图片生成和视频生成服务。 三类能力共用账户、API Key、用量与账单体系,并根据不同工作流提供实时、流式或异步任务接口。

bolt
无需管理基础设施。 你只需要发送请求并处理响应。 wylon 会在后台完成请求编排、弹性扩缩容和负载均衡,让团队把精力放在应用逻辑上。

能力与调用方式

前往控制台的模型广场 查看可用模型、能力与价格,并复制完整 API ID;也可通过 列出模型接口获取。

能力 调用方式 执行模式 计费单位
文本生成 OpenAI Chat Completions / Anthropic Messages 实时或流式 Token
图片生成 OpenAI Images / wylon 内容任务 同步或异步
视频生成 wylon 内容任务 异步 秒,具体价格受分辨率影响
批量推理 暂未上线 不可用 暂无批量价格

基础设施

文本、图片与视频模型统一运行在 wylon 自建的国产算力底座上。平台负责请求鉴权、模型调度、任务状态管理和生成结果交付。

文本推理优化

以下优化主要用于文本模型的 Token 生成链路,不代表图片或视频生成采用相同的参数和计量方式。

技术作用
KV 缓存复用前序 Token 的 key/value 张量,减少重复计算。
分页注意力将长序列切分为页,降低内存碎片带来的影响。
Flash Attention融合注意力内核与分块 Softmax,提升速度并降低显存占用。
量化通过 FP8 / INT4 权重压缩降低内存占用,并提升推理速度。
连续批处理在 Token 粒度合并进行中的请求,提高 GPU 利用率。
上下文缓存缓存重复前缀(如系统提示、长文档)的中间结果。
推测解码由小模型先预测多个 Token,再由大模型统一验证。

选择模型能力

根据要生成的内容进入对应指南,具体请求字段和响应结构以 API 手册为准。

沪ICP备2026010432号-1 沪公网安备31010402336632号