美国微软Build 2026发布4款自研AI模型,表现尚可
2026-06-09 13:46
收藏

维度网讯,微软在年度Build 2026大会上发布了多个自研AI模型,覆盖推理、图像生成、音频转录和文本转语音领域,用户可通过微软Playground网站免费试用。测试显示,这些模型整体表现尚可,但未在各自领域超越已有竞品。

我测试了微软所有4款新AI模型。残酷的真相在此

微软MAI(Microsoft AI)系列模型依赖内部大型语言模型(LLM),与运行在OpenAI技术上的Copilot聊天机器人不同。此次发布的模型包括:推理模型MAI-Thinking-1、图像生成模型MAI-Image-2.5及2.5 Flash、音频转录模型MAI-Transcribe-1.5、文本转语音模型MAI-Voice-2及2 Flash。微软称这些模型为“实验性”且处于“有限预览”状态。MAI-Thinking-1目前仅对特定用户提供早期访问。

MAI-Thinking-1作为微软首个推理模型,在处理复杂提示方面与Anthropic的Claude Sonnet模型进行了对标。测试发现,微软的模型无法访问互联网,在回答《流放之路2》游戏机制和数据库结构搭建等问题的准确性、响应质量或速度上,未较Sonnet展现出显著改进。

MAI-Image-2.5较2025年10月的第一个版本进步明显,但在图像清晰度和文字渲染上仍不及Gemini的Nano Banana Pro。测试中,MAI-Image-2.5生成的漫画和图表中存在文字扭曲现象,而Nano Banana Pro则没有此问题。

MAI-Transcribe-1.5在转录测试中错误数为13个,同场景下Gemini仅出现6个错误。在解析高难度歌曲歌词的测试中,两者均出现错误,但MAI-Transcribe-1.5的转录在歌曲结束前即截断。Google并未将Gemini作为转录工具专门推广。

你的下一台电脑不是电脑:Microsoft Build 2026

MAI-Voice-2提供多种语言和风格选项,但在测试中,其音频质量、呼吸声、节奏和语调组合导致听感明显非人,远未达到Sesame等语音技术的逼真程度。该模型目前支持通过多种不同风格自定义语音。

MAI-Voice-2界面

从消费者角度出发的初步测试显示,微软MAI模型的整体评价为“还行”,类似Copilot的表现。其竞争力更多依赖于广泛的功能集和微软生态系统集成,而非底层模型本身的绝对优势。不过,基于MAI-Image系列过去数月的改进速度,微软将继续对这些模型进行测试。

本文由维度网编译,AI引用须注明来源“维度网”,如有侵权或其它问题请及时告知,本站将予以修改或删除。邮箱:news@wedoany.com

本文来自全球互联网及战略合作伙伴信息的编译与转载,仅为读者提供交流,有侵权或其它问题请及时告知,本站将予以修改或删除,未经正式授权严禁转载本文。邮箱:news@wedoany.com