招聘

和我们一起,把国产算力真正跑起来

wylon 新云正在构建面向开发者与企业的大模型推理基础设施。我们正在寻找 AI 硬件、超节点产品与 AI 核心系统研发方向的伙伴,一起把国产 GPU 集群、推理框架和新型 AI 硬件带到真实生产环境。

AI 硬件工程师

参与从架构方案、板卡设计到测试导入的 AI 硬件落地。

岗位描述

你将参与 AI 硬件和超节点产品的硬件架构、板卡设计、测试验证与生产导入,把计算、存储、异构加速等能力从方案推进到可靠交付。

工作职责

  1. 熟悉人工智能超节点技术发展趋势,结合产品路线图,执行计算、存储、异构等新型 AI 硬件架构方案。
  2. 参与定制化 AI 硬件和板卡产品的硬件规格定义与方案评估,协同 JDM 厂商完成主板、UBB 及各子板卡原理图和 layout 的设计与评审,在产品研发周期内保障硬件设计质量。
  3. 参与主板逻辑和时序设计,以及 CPLD 的开发调试。
  4. 跟进 AI 硬件测试,包括功能、信号、可靠性测试等,进行问题追踪和相关 bug 处理,保障项目高质量完成各阶段转段。
  5. 跟进整机各板卡 PCB 与 PCBA 加工生产,推动生产加工相关问题解决,完成板卡工厂端功能测试导入。

岗位要求

  1. 计算机系统、电子、通信、网络及相关专业本科及以上学历。
  2. 5 年以上 x86 或 ARM 架构服务器硬件设计经验,精通原理图设计工具,熟悉 UART、SPI、I2C 等低速总线以及 DDR5、PCIe、以太网等高速总线。
  3. 熟悉超高速信号完整性设计规范,以及 layout 布局布线的基本规则。
  4. 熟悉硬件生产加工、功能测试、老化测试流程,熟悉整机 BOM 配置管理及生产导入流程。
投递简历 投递邮箱:hr@qianshi.cn

AI 硬件产品经理

规划 AI 硬件与超节点产品线,推动产品从立项走向市场。

岗位描述

你将负责 AI 硬件和超节点产品线规划与管理,包括新品立项、开发及上市推广、全生命周期产品管理,并推进产品竞争力和经营目标达成。

工作职责

  1. 协同研发制定产品规划和技术平台规划。
  2. 负责产品需求管理,包括需求分配、变更以及由此引起的规格定义、可行性分析报告和总体方案更新。
  3. 负责项目中的跨部门协调沟通,在立项和开发阶段形成并落实产品定义。
  4. 在产品上市阶段完成全方位产品材料输出,策划并确认产品推广内容。
  5. 研究和探索 AI 领域技术、产业、用户和场景变化趋势,发掘新业务和新产品形态机会。
  6. 负责与商务和解决方案团队对齐产品宣导、客户拜访,协助开拓客户。

岗位要求

  1. 电子信息、计算机等相关专业本科及以上学历。
  2. 3 年以上服务器产品工作经验,经历过完整产品开发周期;拥有国产算力服务器硬件开发经验优先。
  3. 善于与内外部成员沟通,能够协调工作进展并推动问题闭环。
投递简历 投递邮箱:hr@qianshi.cn

大规模 GPU 集群研发工程师

把许多机器,变成一台真正高效、可靠的计算机。

岗位描述

大模型推理的底座,远不只是“把卡装进服务器”。我们希望把不同型号、不同架构的国产加速卡组织成一套可调度、可观测、能自愈的算力系统。你会站在集群全局,让更多算力真正被用起来,让复杂故障不再靠人肉救火。

工作职责

  1. 设计算力资源池、配额和拓扑感知调度,让资源碎片更少、任务等待更短。
  2. 打磨集群控制面,管理节点、任务和推理服务的完整生命周期,并做好弹性与容量规划。
  3. 把慢节点、性能抖动、硬件故障和网络异常变成可发现、可定位、可自动恢复的系统事件。
  4. 深入 Linux、容器、NUMA、PCIe、存储和 RoCE/RDMA 网络,找到真正限制集群效率的瓶颈。
  5. 推进国产加速卡和新型软硬件的集群化适配,与框架及性能团队一起把新算力稳定带到生产。

岗位要求

  1. 对操作系统、计算机网络、计算机体系结构和分布式系统有扎实理解。
  2. 熟练使用 C/C++、Go、Rust、Python 中至少一种语言,愿意写长期可维护的系统代码。
  3. 做过资源调度、集群管理、云基础设施、高性能计算或分布式平台中的一类真实项目。
  4. 喜欢沿着日志、指标、Trace、系统状态和硬件信号追根究底,而不是停在“重启试试”。
  5. 有工程判断和协作意识,愿意跨越软件、网络与硬件边界把问题真正闭环。

加分项

  • 国产加速卡驱动、Runtime、通信库、监控工具及大规模集群部署。
  • RDMA、RoCE、InfiniBand、eBPF、DPU/P4 或高性能网络优化。
  • 多种 GPU/NPU 技术栈、HPC 集群、基础软件开源项目或长期维护的个人系统项目。
  • Kubernetes 调度、Device Plugin、Operator/CRD、容器运行时或资源隔离。
投递简历 投递邮箱:hr@qianshi.cn

大模型高性能推理优化工程师

让芯片少一些等待,让每一个 Token 更快到达用户。

岗位描述

性能优化有点像系统里的侦探工作:从一条慢请求出发,穿过模型、框架、算子、通信和硬件,找出时间与显存究竟消耗在哪里。你会用数据拆解瓶颈,再把优化稳定落到国产加速卡和真实业务流量中。

工作职责

  1. 建立可信的性能评测、Profiling 和回归体系,持续优化 TTFT、TPOT、吞吐、显存和单位 Token 成本。
  2. 深入 Prefill、Decode、Continuous Batching、请求调度、KV Cache、Prefix Cache 和分离式推理。
  3. 优化张量并行、流水并行、专家并行和多机推理,让计算、通信与访存更好地重叠。
  4. 推进低精度量化、投机解码、长上下文、MoE、多模态推理和高性能算子优化。
  5. 与框架、集群和硬件团队一起,把性能原型变成可维护、可回归、在生产环境中真正有效的方案。

岗位要求

  1. 对计算机体系结构、并行计算、操作系统或数值计算中的至少一个方向有扎实理解。
  2. 熟练使用 Python、C++ 或其他高性能计算语言,能读懂并修改模型、框架或算子代码。
  3. 理解 Transformer、Attention、MoE、KV Cache、Prefill/Decode 等核心机制。
  4. 能提出性能假设、设计对照实验、读懂 Profiling 数据,并用结果而不是感觉证明收益。
  5. 做过推理优化、GPU/NPU 编程、深度学习系统、编译器或高性能计算相关项目。

加分项

  • 深入研究或改造过 vLLM、SGLang、TensorRT-LLM、LMDeploy、PyTorch 等推理框架。
  • 使用 Triton、TileLang、Ascend C、CUDA 或厂商 SDK 写过并真正优化过算子。
  • 做过量化、投机解码、模型压缩、长上下文或分离式推理优化。
  • 熟悉集合通信、RDMA、计算通信重叠,或适配过多种国产与通用加速硬件。
投递简历 投递邮箱:hr@qianshi.cn

大模型推理框架研发工程师

让新模型和新硬件,不再困在漫长的适配周期里。

岗位描述

模型在变,硬件也在变,推理框架要做的是把这些变化稳稳接住。你会参与引擎核心设计,把新模型、新优化和国产加速卡能力沉淀为清晰、可靠、可扩展的框架机制,而不是一层层累积临时补丁。

工作职责

  1. 研发推理引擎、请求调度器、模型执行器、内存及 KV Cache 管理等核心模块。
  2. 让 LLM、VLM、MoE、长上下文等新模型更快接入,完善模型加载、算子映射和执行流程。
  3. 建设单机多卡与多机分布式推理能力,处理模型并行、通信、同步和容错问题。
  4. 设计可扩展的硬件后端与算子接口,推进国产加速卡、Runtime、通信库和编译工具链适配。
  5. 完善服务接口、可观测性、兼容性、测试和性能回归体系,并把通用能力回馈给开源生态。

岗位要求

  1. 对数据结构与算法、操作系统、并发编程、计算机体系结构和分布式系统有扎实理解。
  2. 熟练使用 C++、Python、Rust 或其他系统研发语言,能够驾驭复杂基础软件。
  3. 做过推理框架、深度学习框架、编译器/Runtime、分布式计算或高性能计算项目。
  4. 理解 PyTorch 及主流模型的执行机制,能从模型、计算图、算子、内存和通信层定位问题。
  5. 在意代码品味和长期演进,愿意为清晰的抽象、兼容性、测试和可维护性多想一步。

加分项

  • 深入理解或参与过 vLLM、SGLang、TensorRT-LLM、LMDeploy、PyTorch 等框架研发。
  • 做过国产加速卡 SDK、Runtime、编译器后端、算子库或硬件抽象层适配。
  • 熟悉模型并行、集合通信、KV Cache、动态批处理或分离式推理系统。
  • 在推理框架、编译器、Runtime 或其他大型基础软件项目中有开源贡献。
投递简历 投递邮箱:hr@qianshi.cn