微软365 Copilot Researcher深度研究智能体重大更新 GPT先起草 Claude后批判 引入Critique功能实现多模型协作 准确性完整性显著提升

导读目录
更新内容
根据 黄金形态通APP 报道,美国科技巨头微软(MSFT.US)周一推出一项针对365 Copilot深度研究智能体(Researcher)的重大更新。该更新允许用户在同一项复杂研究任务中同时调用OpenAI的GPT大模型和Anthropic旗下的Claude大模型,实现多模型协作以提升输出质量。
此次更新聚焦于Researcher代理,新增名为“Critique”(批判)的功能,旨在解决单一模型在深度研究中可能出现的准确性、完整性和引证问题。通过不同模型的分工协作,微软希望为企业用户提供更可靠的研究报告和决策支持。
Critique功能
在实际操作中,“Critique”功能采用清晰的流程分工:首先由OpenAI的GPT模型负责展开研究、收集资料并生成初稿;随后,Anthropic的Claude模型遵循严格的学术研究评审流程,对初稿进行全面审查,包括事实准确性、内容完整性以及引证质量。
Claude审查完成后,将生成最终优化报告并回复给用户。这一“生成+批判”的模式有效分离了内容创作与质量把关环节,避免了单一模型可能存在的幻觉或遗漏问题,显著提高了复杂研究任务的可靠度。
技术原理
微软此次更新体现了多模型智能(multi-model intelligence)的实际应用。Researcher代理不再局限于单一供应商模型,而是根据任务需求智能调用不同大模型的优势。GPT擅长快速生成丰富内容,而Claude在逻辑严谨性、批判性思考和细节审查方面表现出色,两者结合形成互补。
除了Critique功能外,更新还包括Council等多模型能力,允许模型并行工作并由第三方进行差异对比。该架构建立在微软与OpenAI、安卓ropic的深度合作基础上,同时严格遵守企业级安全、合规和数据隐私要求,确保所有输出均 grounding 于用户的企业上下文。
实测表现
根据微软内部测试,在DRACO基准测试(涵盖医学、法律、技术等10个领域的100项复杂研究任务)中,配备Critique功能的Copilot Researcher得分达到57.4分,较Claude Opus 4.6单独表现提升显著,超越了包括Perplexity Deep Research在内的其他顶级系统。
这一结果表明,多模型协作模式在深度研究场景下具有明显优势,尤其适合需要高准确性和严谨引证的企业级应用场景。目前该功能已向加入Microsoft Frontier早期访问计划的用户开放,需要Microsoft 365 Copilot订阅。
多维对比
以下表格对比了新旧Researcher代理及与其他AI研究工具的差异:
| 维度 | 旧版Researcher | 新版Critique模式 | 单一模型工具(如Perplexity) |
|---|---|---|---|
| 模型使用方式 | 单一GPT或Claude | GPT生成+Claude批判 | 单一模型独立完成 |
| 质量控制机制 | 依赖模型自身 | 明确分离生成与评审 | 无外部评审环节 |
| DRACO基准得分 | 较低 | 57.4分(领先) | 约42-50分区间 |
| 适用场景 | 一般研究 | 复杂、专业深度研究 | 快速查询为主 |
| 企业级优势 | 基本合规 | 更高准确性与可信度 | 数据隐私控制较弱 |
编辑总结
微软在365 Copilot Researcher中引入Critique功能,标志着企业AI工具从单一模型依赖向多模型智能协作的转变。这一更新通过GPT与Claude的优势互补,显著提升了复杂研究任务的准确性、完整性和可信度,有望加速Copilot在企业工作流中的深度应用。未来效果将取决于实际企业场景验证及模型持续迭代情况。
常见问题解答
问:微软365 Copilot Researcher的Critique功能具体工作流程是怎样的?
答:流程分为两步:首先由OpenAI的GPT模型进行研究、收集信息并生成初稿;然后Anthropic的Claude模型对初稿进行学术式评审,检查事实准确性、内容完整性以及引证质量,最后生成优化后的报告回复用户。这种分工有效提高了输出可靠性。问:为什么微软要让GPT和Claude两个竞争对手模型在同一任务中协作?
答:GPT擅长快速生成内容,而Claude在批判性思考、逻辑严谨性和细节审查方面优势明显。微软通过这一设计实现模型优势互补,避免单一模型的局限性,提升整体研究质量,同时体现其作为平台方中立整合多家前沿模型的能力。问:Critique功能在实际测试中表现如何?
答:在DRACO基准测试中,配备Critique的Copilot Researcher得分达57.4分,较Claude Opus 4.6单独使用提升显著,超越Perplexity Deep Research等领先系统约13.88%。这证明多模型协作在复杂研究任务中具有明显优势。问:普通企业用户如何访问这一新功能?
答:目前Critique功能面向加入Microsoft Frontier早期访问计划的用户开放。用户需拥有Microsoft 365 Copilot订阅,并在Copilot设置中选择Researcher代理并启用多模型模式。未来预计将逐步向更多用户推送。问:这一更新对微软Copilot生态和企业AI应用有何战略意义?
答:该更新强化了Copilot作为企业级AI平台的定位,展示了多模型智能的实际价值,有助于提升用户对Copilot的信任度和采用率。同时,它也为未来更多模型协作场景奠定基础,推动AI从辅助工具向可靠研究伙伴的转变。
微软收涨2.68% 将按季度披露Azure营收达294亿美元
微软收跌1.22%成交130亿WinUI完成开源迁移主线开发转至GitHub
微软收涨1.68%成交151亿 高管邮件回应数据中心能耗碳排放质疑
微软收涨0.90%成交93.82亿美元确认Windows11 26H2秋季发布
微软收跌0.47%成交88.21亿Meta成其最大AI客户之一年耗数亿美元
微软收跌3.04%成交141亿美元奥德赛计划债券拟上调至39亿
微软股价跌0.44%成交115.56亿美元 神秘Surface Phone原型机照片曝光
微软Maia 300将亮相,30万枚AI芯片订单浮出水面
微软收高2.54%成交175.6亿美元 海德拉巴启用印度最大数据中心巩固云地位
微软收涨4.93%成交321亿 机构上调目标价近三日累涨约25%
微软收涨3.02%延续暴涨势头 财报超预期资本支出显克制
微软收涨15.51%创18年最佳单日 云业务加速重塑AI投资叙事
微软暴涨15%市值增4500亿美元 标普500涨1.66%芯片股空头大回补
微软夜盘大涨逾8%财报超预期资本支出低于预期 Meta大跌逾7% AI投入焦虑拖累 Q3指引逊色
微软收涨0.54%成交113亿美元 自研AI模型取代第三方 大幅压缩成本重塑竞争力
微软成立Microsoft Frontier Company 投25亿美元派6000专家 企业AI转型进入成果交付时代
微软收涨1.62%成交159亿 重金25亿美元成立AI落地服务新实体
微软收涨3.02%成交180亿美元 Haleon扩大AI合作提振企业部署信心
微软股价涨5.71%成交690亿美元 大空头Burry买入长期看涨期权 Xbox主机再度提价
微软跌3.46% 成交229亿美元 Xbox主机全面提价 零部件成本压力凸显





