
A.X K2 Raon-Speech 基于现有的 Raon-Speech 模型构建,融合了 Krafton 专有的语音编码器与音频编解码器,并依托 SK 电信的 A.X K2 打造紧凑型语言模型,实现了对语音的直接处理与生成。
该模型参数量达 210 亿。数据显示,其在韩国模型中排名第一,在参数量低于 300 亿的英语模型中位列第三。评估覆盖语音识别、合成、理解、口语问答、文本问答及工具使用六大领域,测试基准包含 LibriSpeech、KSponSpeech 和 VoiceBench 在内的 24 个韩语及 22 个英语数据集。
传统对话式音频系统通常采用 " 语音转文本 - 生成回复 - 文本转语音 " 的流程,易丢失情感、语调和语气等信息。A.X K2 Raon-Speech 旨在保留这些细微线索,生成更自然、拟人化的语音回复。
Krafton 计划将该技术应用于其 AI 驱动的协同可玩角色(NPC),以提升游戏过程中的对话自然度与响应能力。此次发布紧随今年 4 月 Krafton 旗下 Raon 品牌推出 Raon-Speech、Raon-SpeechChat、Raon-OpenTTS 和 Raon-VisionEncoder 四款开源模型之后。
Krafton 首席 AI 官李康宇表示,A.X K2 Raon-Speech 体现了公司对核心 AI 技术的持续优化,未来将继续推进基础模型发展,以创造全新的游戏体验。
【星途科讯 图文丨 Patrick 首发于 ZAKER 科技,转载请注明出处】