模型服务概览
wylon 新云 Token 工厂 提供文本生成、图片生成和视频生成服务。 三类能力共用账户、API Key、用量与账单体系,并根据不同工作流提供实时、流式或异步任务接口。
bolt
无需管理基础设施。
你只需要发送请求并处理响应。
wylon 会在后台完成请求编排、弹性扩缩容和负载均衡,让团队把精力放在应用逻辑上。
能力与调用方式
前往控制台的模型广场 查看可用模型、能力与价格,并复制完整 API ID;也可通过 列出模型接口获取。
| 能力 | 调用方式 | 执行模式 | 计费单位 |
|---|---|---|---|
| 文本生成 | OpenAI Chat Completions / Anthropic Messages | 实时或流式 | Token |
| 图片生成 | OpenAI Images / wylon 内容任务 | 同步或异步 | 张 |
| 视频生成 | wylon 内容任务 | 异步 | 秒,具体价格受分辨率影响 |
| 批量推理 | 暂未上线 | 不可用 | 暂无批量价格 |
基础设施
文本、图片与视频模型统一运行在 wylon 自建的国产算力底座上。平台负责请求鉴权、模型调度、任务状态管理和生成结果交付。
- 统一鉴权:同一把 API Key 可以调用账户已获授权的文本、图片和视频模型。
- 按能力调用:文本请求实时返回,图片可同步或异步生成,视频通过异步任务生成。
- 任务管理:异步生成需要保存任务 ID,并在成功后及时下载或转存结果。
文本推理优化
以下优化主要用于文本模型的 Token 生成链路,不代表图片或视频生成采用相同的参数和计量方式。
| 技术 | 作用 |
|---|---|
| KV 缓存 | 复用前序 Token 的 key/value 张量,减少重复计算。 |
| 分页注意力 | 将长序列切分为页,降低内存碎片带来的影响。 |
| Flash Attention | 融合注意力内核与分块 Softmax,提升速度并降低显存占用。 |
| 量化 | 通过 FP8 / INT4 权重压缩降低内存占用,并提升推理速度。 |
| 连续批处理 | 在 Token 粒度合并进行中的请求,提高 GPU 利用率。 |
| 上下文缓存 | 缓存重复前缀(如系统提示、长文档)的中间结果。 |
| 推测解码 | 由小模型先预测多个 Token,再由大模型统一验证。 |
选择模型能力
根据要生成的内容进入对应指南,具体请求字段和响应结构以 API 手册为准。