维度网讯,微软在年度Build 2026大会上发布了多个自研AI模型,覆盖推理、图像生成、音频转录和文本转语音领域,用户可通过微软Playground网站免费试用。测试显示,这些模型整体表现尚可,但未在各自领域超越已有竞品。

微软MAI(Microsoft AI)系列模型依赖内部大型语言模型(LLM),与运行在OpenAI技术上的Copilot聊天机器人不同。此次发布的模型包括:推理模型MAI-Thinking-1、图像生成模型MAI-Image-2.5及2.5 Flash、音频转录模型MAI-Transcribe-1.5、文本转语音模型MAI-Voice-2及2 Flash。微软称这些模型为“实验性”且处于“有限预览”状态。MAI-Thinking-1目前仅对特定用户提供早期访问。
MAI-Thinking-1作为微软首个推理模型,在处理复杂提示方面与Anthropic的Claude Sonnet模型进行了对标。测试发现,微软的模型无法访问互联网,在回答《流放之路2》游戏机制和数据库结构搭建等问题的准确性、响应质量或速度上,未较Sonnet展现出显著改进。
MAI-Image-2.5较2025年10月的第一个版本进步明显,但在图像清晰度和文字渲染上仍不及Gemini的Nano Banana Pro。测试中,MAI-Image-2.5生成的漫画和图表中存在文字扭曲现象,而Nano Banana Pro则没有此问题。
MAI-Transcribe-1.5在转录测试中错误数为13个,同场景下Gemini仅出现6个错误。在解析高难度歌曲歌词的测试中,两者均出现错误,但MAI-Transcribe-1.5的转录在歌曲结束前即截断。Google并未将Gemini作为转录工具专门推广。

MAI-Voice-2提供多种语言和风格选项,但在测试中,其音频质量、呼吸声、节奏和语调组合导致听感明显非人,远未达到Sesame等语音技术的逼真程度。该模型目前支持通过多种不同风格自定义语音。

从消费者角度出发的初步测试显示,微软MAI模型的整体评价为“还行”,类似Copilot的表现。其竞争力更多依赖于广泛的功能集和微软生态系统集成,而非底层模型本身的绝对优势。不过,基于MAI-Image系列过去数月的改进速度,微软将继续对这些模型进行测试。
本文由维度网编译,AI引用须注明来源“维度网”,如有侵权或其它问题请及时告知,本站将予以修改或删除。邮箱:news@wedoany.com










