Techub News 消息,GWDC 2026 Korea 于 2026 年 9 月 29 日至 30 日在韩国首尔 aT Center 举办。大会由 Web3Labs 主办,Techub News、HypaiLabs 与 TokenPost 联合主办。Managing Director of FuriosaAI Jung Young-beom 在大会次日的主题演讲中介绍,FuriosaAI 成立于 2017 年,至今推出两代芯片:第一代面向视觉 AI 应用;在 GPT-3 出现后,公司判断大语言模型将成为主流,于是采用 HBM3 内存设计了第二代芯片 RNGD,2024 年流片,今年 1 月起量产销售,由 TSMC 5 纳米工艺制造。
Jung Young-beom 表示,全球 token 用量正在急剧增长,过去一年增长了约 20 倍;过去的数据中心多为训练而建,未来将有更多面向推理的数据中心,到 2030 年全球新建数据中心将超过 100 吉瓦,其中约七成用于推理。按 Jung Young-beom 给出的规格,RNGD 算力为 512 TFLOPS,配备 48GB 内存,带宽 1.5TB/s,功耗 180 瓦。Jung Young-beom 称,对标的 NVIDIA 产品功耗约 600 瓦,RNGD 以不到三分之一的功耗实现相近性能;搭载 8 张 RNGD 的服务器整机功耗约 3 千瓦,对标系统约为 6.6 千瓦。
Jung Young-beom 介绍了两个运行案例:去年 OpenAI 在首尔设立办公室时,曾提前三周询问能否用 RNGD 运行其开源模型,团队在三周内完成演示;用 8 卡服务器运行 LG AI Research 的 EXAONE 4.0 32B 模型,在 512 个并发请求下最高约 12000 TPS。Jung Young-beom 称,在相同配置下,RNGD 可支持的并发用户数与对标 GPU 相近,按功耗折算的性能约为对方两倍。
谈及设计思路,Jung Young-beom 表示,GPU 支持通用并行计算,TPU 节能但只支持有限模型,FuriosaAI 处在两者之间:芯片专为推理设计,针对 AI 模型中占比最高的张量收缩运算优化,由编译器把用户模型映射到硬件上。Jung Young-beom 称,公司已公开面向张量收缩处理器的编程语言,计划进一步开放更底层的虚拟指令集;由于生态高度依赖 NVIDIA GPU,FuriosaAI 的 API 设计尽量不改变现有使用方式,兼容 OpenAI 风格的接口和 vLLM 的调用方式,原有程序只需修改一行代码即可在 NPU 上运行。Jung Young-beom 最后表示,目标是让更多人以更低的功耗和成本使用 AI。

如您认为本页面(或本平台)内容存在侵权或违规情形,请您在发现之日起尽快与我们联系,并提供:权利人姓名/名称及联系方式、被侵权作品名称及权属证明、具体侵权链接及情况说明。我们在核实后将及时处理相关内容。
联系方式:creator@techub.news
商务合作:contacting@techub.news
点击链接下载 Techub News App,获取最新讯息:
https://www.techub.news/download
(或扫描下方二维码下载)

本网站所提供的所有信息仅供参考之用。
本网站不保证信息的准确性、有效性、及时性和完整性。
任何依赖于本网站所提供信息的行为,均由用户自行承担风险。
Techub News 消息,GWDC 2026 Korea 于 2026 年 9 月 29 日至 30 日在韩国首尔 aT Center 举办。大会由 Web3Labs 主办,Techub News、HypaiLabs 与 TokenPost 联合主办。Managing Director of FuriosaAI Jung Young-beom 在大会次日的主题演讲中介绍,FuriosaAI 成立于 2017 年,至今推出两代芯片:第一代面向视觉 AI 应用;在 GPT-3 出现后,公司判断大语言模型将成为主流,于是采用 HBM3 内存设计了第二代芯片 RNGD,2024 年流片,今年 1 月起量产销售,由 TSMC 5 纳米工艺制造。
Jung Young-beom 表示,全球 token 用量正在急剧增长,过去一年增长了约 20 倍;过去的数据中心多为训练而建,未来将有更多面向推理的数据中心,到 2030 年全球新建数据中心将超过 100 吉瓦,其中约七成用于推理。按 Jung Young-beom 给出的规格,RNGD 算力为 512 TFLOPS,配备 48GB 内存,带宽 1.5TB/s,功耗 180 瓦。Jung Young-beom 称,对标的 NVIDIA 产品功耗约 600 瓦,RNGD 以不到三分之一的功耗实现相近性能;搭载 8 张 RNGD 的服务器整机功耗约 3 千瓦,对标系统约为 6.6 千瓦。
Jung Young-beom 介绍了两个运行案例:去年 OpenAI 在首尔设立办公室时,曾提前三周询问能否用 RNGD 运行其开源模型,团队在三周内完成演示;用 8 卡服务器运行 LG AI Research 的 EXAONE 4.0 32B 模型,在 512 个并发请求下最高约 12000 TPS。Jung Young-beom 称,在相同配置下,RNGD 可支持的并发用户数与对标 GPU 相近,按功耗折算的性能约为对方两倍。
谈及设计思路,Jung Young-beom 表示,GPU 支持通用并行计算,TPU 节能但只支持有限模型,FuriosaAI 处在两者之间:芯片专为推理设计,针对 AI 模型中占比最高的张量收缩运算优化,由编译器把用户模型映射到硬件上。Jung Young-beom 称,公司已公开面向张量收缩处理器的编程语言,计划进一步开放更底层的虚拟指令集;由于生态高度依赖 NVIDIA GPU,FuriosaAI 的 API 设计尽量不改变现有使用方式,兼容 OpenAI 风格的接口和 vLLM 的调用方式,原有程序只需修改一行代码即可在 NPU 上运行。Jung Young-beom 最后表示,目标是让更多人以更低的功耗和成本使用 AI。

如您认为本页面(或本平台)内容存在侵权或违规情形,请您在发现之日起尽快与我们联系,并提供:权利人姓名/名称及联系方式、被侵权作品名称及权属证明、具体侵权链接及情况说明。我们在核实后将及时处理相关内容。
联系方式:creator@techub.news
商务合作:contacting@techub.news
点击链接下载 Techub News App,获取最新讯息:
https://www.techub.news/download
(或扫描下方二维码下载)

本网站所提供的所有信息仅供参考之用。本网站不保证信息的准确性、有效性、及时性和完整性。任何依赖于本网站所提供信息的行为,均由用户自行承担风险。