AI聊天机器人越聊越“笨”?可能真不是错觉_对话_模型_DeepSeek

不知道大家有没有这种感觉:和AI机器人短时间聊天的话还行,时间一长,就感觉对话开始变的前言不搭后语、逻辑不通。
其实这种感觉并不是错觉。
最近,微软发表的一项研究证实,即使是目前最先进的大语言模型,在多轮对话中的可靠性也会急剧下降。
研究人员对包括 GPT-4.1、Gemini 2.5 Pro、Claude 3.7 Sonnet、o3、DeepSeek R1 和 Llama 4 在内的 15 款顶尖模型进行了超过 20 万次模拟对话分析,揭示出一个被称为“迷失会话”的系统性缺陷。
数据显示,这些模型在单次提示任务中的成功率可达 90%,但当同样的任务被拆解成多轮自然对话后,成功率骤降至约 65%。
研究指出,模型的核心能力仅降低约 15%,但“不可靠性”却飙升 112%。
也就是说,AI 大模型仍然具备解决问题的能力,但在多轮对话中变得高度不稳定,难以持续跟踪上下文。
研究人员进一步分析了造成性能下降的行为机制。
首先是“过早生成”。模型在用户尚未完整说明需求前就尝试给出最终答案。一旦在早期回合中形成错误***设,模型后续便会在该错误的基础上继续推理,而不是随着新信息的加入进行修正,从而导致错误逐步放大。
其次是“答案膨胀”。在多轮对话中,模型的回复长度比单轮对话增加了 20% 至 300%。更长的回答往往包含更多***设与“幻觉”,这些内容随后被纳入对话的持续上下文,从而进一步影响后续推理的准确性。
令人意外的是,即使是配备了额外“思考词元”(thinking tokens)的新一代推理模型,如 OpenAI o3 和 DeepSeek R1,也未能显著改善在多轮对话中的表现。
研究人员指出,现有的基准测试主要基于理想的单轮场景,忽略了模型在真实世界中的行为。
因此,对于那些依赖 AI 构建复杂对话流程或智能体的开发者而言,这一结论意味着未来将要接受严峻挑战。
再来看看其他消息。
微软日前测试 Windows 11新版“画图”(Paint)应用,重点引入“自由旋转”功能。
根据微软官方描述,用户现在可以全方位角度调整形状、文本框以及任何活动的图像选区。用户选中对象后,其上方会出现一个“旋转手柄”,用户只需拖动该手柄即可向任意方向自由旋转对象,从而实现更自然的构图和布局。
除了直观的手动拖拽,微软还为需要高精度编辑的用户提供了解决方案。在“旋转”菜单下新增了“自定义旋转”选项,用户可以在此输入具体的角度数值,实现精确到 1 度的微调。返回搜狐,查看更多
-
{dede:pagebreak/}


网友评论:

- 手机厂商集体「换剧本」:华为装风扇、荣耀加机械臂,2026年新机卷疯了!_Ultra_Phone
- 导演贾樟柯发布Seedance2.0制作的短片,本人“出演”,谈AI是否会取代电影_***_第一财经_参考
- 为什么车企都想要变成 AI 公司?_特斯拉_自动_人工智能
- 100万颗卫星,撑起马斯克的AI太空基建梦_SpaceX_通信_轨道
- 狂砸4万亿!美国四巨头“流血”搞AI,苹果:溜了溜了_支出_总资本_Meta
- 用UWB技术实现精准定位,特斯拉CyberCab无线充电方案将落地_系统_车辆_信号
- 2025胡润中国500强发布:台积电蝉联第一,小米首次进入前十_企业_价值_行业
- 马斯克宣布有望10年内建首座“月球城市”:火星***“没熄火”,但“月球更快”_SpaceX_美国_目标
- 首个“逆转细胞衰老”人体试验获批,长寿科技迎来关键验证节点_患者_因子_体细胞
- 刚刚,又一位xAI华人离职!曾和马斯克并排坐发Grok 3_吴宇怀_团队_来源

- AI购物的第一次出圈,不在北上广_奶茶店_县城_活动
- 库克预告苹果将有前所未见的创新,你期待吗?_iPhone_AirTag_显示
- 助力构建新型电力系统 科技创新赋能光热发电发展_产业化_规模化_建设
- 小米汽车2026年1月交付量超过39000台_雷军_直播_参考
- AI的鬼把戏,冲着人类来的?_Agent_网站_帖子
- 直播带货不香了?大佬带头卖课,网友怒喊:这波割韭菜更狠_小雷_培训学校_赛道
- 组团上春晚、宇树和智元争第一,机器人的集体焦虑:量产和上市迎新一轮***_企业_松延_科技
- 150万个 AI 聚在一起骂人类,硅基生命觉醒了?_agent_吐槽_主人
- 把海外网友晃瞎的神秘大模型,还是中国制造。_智谱_世超_DeepSeek
- 小米史上最大电池手机!小米17 Max配备8000mAh电池_Pro_系列_机型


