微软在大语言模型上面没看到什么建树。但是在小模型和多模态模型上,好像兴趣很高。这不知道是不是跟他们的生态有关,这样在电脑和办公领域就可以用起来。
微软搞了一个语音识别模型MAI-Transcribe-2。这个模型涵盖60种语言,处理1小时音频仅需约10秒。目前该模型已在 Microsoft Foundry、MAI Playground 及 Open Router 上线,并推出限时优惠价,每小时音频仅需0.10美元。
微软的图像模型MAI-Image-2.6-Flash ,其图像生成速度达到 GPT-Image-2-Medium 的2.8倍,整体综合效率提升达72%。
都是比较实用的领域,反而国内在这方面的兴趣好像不足。其实这些虽然不在agi的主线上,但是在实际工作中还是非常有用的。
