2026年7月5日 的AI新闻

美团发布LongCat-2.0:首个在国产五万卡集群完成全流程训练的万亿参数模型
行业新闻

美团发布LongCat-2.0:首个在国产五万卡集群完成全流程训练的万亿参数模型

美团技术团队正式发布LongCat-2.0模型。该模型拥有1.6T总参数,是业界首个在五万卡国产算力集群上实现从零预训练到推理全流程闭环的万亿级模型。LongCat-2.0原生支持1M超长上下文,并针对Agentic Coding任务进行了深度优化,标志着国产算力在支撑超大规模模型研发方面取得了重大突破。

美团技术团队
ACL 2026美团论文精选:聚焦大模型评测与推理优化,引领生成式AI新范式
行业新闻

ACL 2026美团论文精选:聚焦大模型评测与推理优化,引领生成式AI新范式

美团技术团队在自然语言处理顶级会议ACL 2026中共有6篇论文被收录。研究涵盖了大模型能力评测、复杂流程推理、竞赛级数学思维优化、强化学习优化及生成式推荐等前沿领域。这些成果展示了美团在提升大模型逻辑推理能力及工业化应用方面的深度探索,为构建生成式AI新范式提供了重要技术支撑。

美团技术团队
美团技术团队ASX专场:聚焦大模型Agent与搜推前沿,6篇顶会论文深度解读
行业新闻

美团技术团队ASX专场:聚焦大模型Agent与搜推前沿,6篇顶会论文深度解读

美团业务研发平台搜推ASX团队近日分享了其在AI顶会(如ICLR、NeurIPS等)发表的最新研究成果。该团队专注于构建以大模型为基础的Agent技术体系,在后训练、强化学习及多模态理解等领域取得突破。本次分享精选了6篇高质量论文,旨在展示美团在Agentic System X方向的技术深耕与实践启发。

美团技术团队
美团LongCat发布General 365推理评测集:Gemini 3 Pro仅获62.8分,多数模型不及格
行业新闻

美团LongCat发布General 365推理评测集:Gemini 3 Pro仅获62.8分,多数模型不及格

美团LongCat团队正式发布General 365推理评测基准。在对26款主流大模型的实测中,目前顶尖的Gemini 3 Pro准确率仅为62.8%,而绝大多数模型得分未能达到60分的及格线。这一结果揭示了当前AI模型在复杂推理任务中面临的巨大挑战,General 365有望成为衡量模型推理能力的新标尺。

美团技术团队
美团LongCat-Video-Avatar 1.5正式开源:从高拟真迈向商业级数字人应用
开源项目

美团LongCat-Video-Avatar 1.5正式开源:从高拟真迈向商业级数字人应用

美团技术团队正式开源LongCat-Video-Avatar 1.5数字人视频模型。该版本在唇形同步、物理合理性、长视频稳定性、多人互动及推理效率等方面实现了全面提升。作为从SOTA研究向商业级应用跨越的重要里程碑,该模型旨在复杂商业场景中提供稳定、自然的高质量视频输出,推动数字人技术走向真实应用舞台。

美团技术团队
美团开源海报生成AIGC技术:构建“生成-编辑-评判”全链路闭环
开源项目

美团开源海报生成AIGC技术:构建“生成-编辑-评判”全链路闭环

美团智能创作团队近日公开了其在海报生成AIGC领域的最新技术成果。该技术体系通过构建“生成-编辑-评判”的完整技术闭环,解决了商业海报创作中的效率与质量平衡问题。目前,该方案已在美团外卖、品牌IP等核心业务场景中成功落地,并已面向全球开发者全部开源,旨在推动AI图像生成技术在本地生活服务领域的深度应用。

美团技术团队
美团技术团队入选 ICML 2026 学术论文精选:深耕机器学习前沿研究
行业新闻

美团技术团队入选 ICML 2026 学术论文精选:深耕机器学习前沿研究

本文聚焦美团技术团队在国际机器学习顶级会议 ICML 2026 上的学术表现。作为全球最具影响力的学术盛会之一,ICML 旨在探讨机器学习的关键挑战。美团技术团队通过展示具有重要理论价值与实际影响的研究成果,不仅体现了其在算法领域的深厚积淀,更通过前沿探索引领行业未来研究方向,推动机器学习技术的持续演进。

美团技术团队
LongCat 开源 VitaBench 2.0:定义长期动态智能体评测新标准
行业新闻

LongCat 开源 VitaBench 2.0:定义长期动态智能体评测新标准

美团技术团队旗下的 LongCat 正式开源 VitaBench 2.0,这是业界首个针对真实生活场景下长期动态用户建模的智能体评测基准。该基准旨在系统性评估大语言模型在长周期、真实且动态的互动过程中,所表现出的个性化服务能力与主动性,填补了智能体在复杂用户建模评估领域的空白。

美团技术团队
美团LongCat团队发布WBench:首个交互式视频世界模型多轮评测基准
开源项目

美团LongCat团队发布WBench:首个交互式视频世界模型多轮评测基准

美团LongCat团队正式提出并开源了WBench,这是全球首个针对交互式视频世界模型的系统性多轮评测基准。WBench被形象地比作一台“CT扫描仪”,旨在精准评估和定位世界模型在从传统的“被动观看”模式向“主动交互”模式转型过程中遇到的技术瓶颈与挑战。该基准的发布为行业提供了衡量世界模型边界的专业工具,助力开发者识别模型在交互能力上的具体短板。

美团技术团队
ACL 2026精选论文分享:美团履约团队展示大模型Agent前沿技术成果
行业新闻

ACL 2026精选论文分享:美团履约团队展示大模型Agent前沿技术成果

美团履约AI算法团队在ACL 2026期间分享了其在大模型Agent技术体系方面的最新研究成果。该团队聚焦于构建自进化的Agent运营系统,并在CPT、Post-training、Agentic RL及多模态理解等核心领域取得突破。本文深入解析美团如何通过AI赋能履约业务,并展示其在国际顶会发表的高质量科研成果。

美团技术团队
Meta发布Astryx:支持AI智能体协作的开源可定制设计系统
开源项目

Meta发布Astryx:支持AI智能体协作的开源可定制设计系统

Meta(Facebook)在GitHub上正式发布了开源项目Astryx。这是一个完全可定制的设计系统,其核心突破在于专为现代开发模式设计,支持人类开发者与AI智能体(Agents)协同工作。该系统的推出标志着UI设计工具开始向“人机协作”的智能化方向演进。

GitHub Trending
节省65% Token:GitHub热门项目Caveman让Claude Code像“原始人”一样高效对话
开源项目

节省65% Token:GitHub热门项目Caveman让Claude Code像“原始人”一样高效对话

开发者JuliusBrussee在GitHub上发布了名为“Caveman”的开源项目,这是一款专为Claude Code设计的技能工具。该项目通过引导AI模仿“原始人”的极简说话方式,剔除冗余的语法修饰和礼貌用语,宣称能够节省高达65%的Token消耗。这一创新尝试为开发者在处理大规模代码任务时提供了降低API成本、提升响应速度的新思路,迅速登上GitHub Trending榜单。

GitHub Trending
ChromeDevTools 发布 chrome-devtools-mcp:为编程智能体打造的浏览器调试工具
开源项目

ChromeDevTools 发布 chrome-devtools-mcp:为编程智能体打造的浏览器调试工具

ChromeDevTools 团队正式推出 chrome-devtools-mcp 项目,这是一款专门面向编程智能体(Programming Agents)设计的 Chrome 开发者工具接口。该项目通过模型上下文协议(MCP)实现,旨在让 AI 智能体能够更深度地接入和利用浏览器的调试功能,从而提升 AI 在网页开发与自动化任务中的表现。

GitHub Trending
GPT-5.5 Codex 推理令牌聚类现象或导致复杂任务性能下降
行业新闻

GPT-5.5 Codex 推理令牌聚类现象或导致复杂任务性能下降

开发者在 GitHub 上报告了 GPT-5.5 Codex 的一个潜在 Bug。研究发现,该模型在处理复杂任务时,推理令牌(reasoning tokens)的输出表现出明显的聚类特征,频繁集中在 516、1034 和 1552 等固定边界。这种现象与模型推理强度的下降以及错误率的升高高度相关,引发了社区对 GPT-5.5 推理机制稳定性的广泛讨论。

Hacker News
谷歌发布新广告:设想AI助力开国元勋撰写《独立宣言》
行业新闻

谷歌发布新广告:设想AI助力开国元勋撰写《独立宣言》

在《独立宣言》签署250周年之际,谷歌(Google)发布了一支全新广告,提出了一个极具创意的假设:如果当年的美国开国元勋们能够使用包含AI功能的Google Workspace,这份历史性文件的起草过程将会是怎样的?该广告旨在展示现代AI协作工具在处理复杂创作任务时的潜力。

TechCrunch AI
深度分析:为何更强大的AI模型在工具调用上表现更差?
行业新闻

深度分析:为何更强大的AI模型在工具调用上表现更差?

知名开发者Armin Ronacher近期发现,Anthropic最新的Claude模型(如Opus 4.8和Sonnet 5)在处理特定工具调用Schema时,表现竟然优于其旧版本。这些SOTA模型在调用Pi的编辑工具时,会自行发明不存在的字段,导致JSON Schema校验失败。这一现象揭示了大型语言模型在追求更高智能的过程中,可能在结构化指令遵循方面出现的“反向进化”问题。

Hacker News
Midjourney要求好莱坞制片厂披露AI使用细节:法律诉讼中的透明度反击
行业新闻

Midjourney要求好莱坞制片厂披露AI使用细节:法律诉讼中的透明度反击

在与三家好莱坞制片厂的持续法律纠纷中,AI图像生成平台Midjourney采取了关键行动。Midjourney正寻求强制这些制片厂披露其自身在业务中如何使用人工智能技术。这一举动标志着AI公司与传统内容创作者之间法律博弈的升级,旨在通过要求对方公开AI使用情况来应对当前的法律指控。

TechCrunch AI
Anna's Archive悬赏20万美元征集Google Books全量扫描数据,挑战数字版权边界
行业新闻

Anna's Archive悬赏20万美元征集Google Books全量扫描数据,挑战数字版权边界

影子图书馆Anna's Archive近日发布了一项高达20万美元的巨额悬赏,旨在获取Google Books或其他同等规模(如AI公司持有)的全量图书扫描数据。目前Google Books仅通过搜索结果展示片段,该项目寻求能够大规模提取这些隐藏数据的技术方案。组织者甚至向Google内部员工喊话,称其若能泄露数据将成为“传奇档案保管员”。此举反映了开源数字图书馆与商业巨头之间关于知识获取权的激烈博弈。

Hacker News
YouTube Studio AI 助手曝出存储型提示注入漏洞,创作者安全面临威胁
行业新闻

YouTube Studio AI 助手曝出存储型提示注入漏洞,创作者安全面临威胁

安全研究员 javoriuski 发现 YouTube Studio 的 AI 助手 “Ask Studio” 存在严重的存储型提示注入漏洞。攻击者可以通过在视频评论区植入特定指令,操纵 AI 生成的总结内容,甚至伪造 YouTube 官方通知。由于攻击者可以利用评论编辑功能隐藏恶意载荷,创作者在正常使用 AI 助手时极难察觉其输出已被篡改。

Hacker News
阿里巴巴据报禁止员工使用 Claude Code,将其列为高风险软件
行业新闻

阿里巴巴据报禁止员工使用 Claude Code,将其列为高风险软件

根据 TechCrunch 报道,阿里巴巴已正式将 Anthropic 开发的 AI 编程工具 Claude Code 列为“高风险软件”,并禁止内部员工使用。这一决策凸显了大型科技公司在引入生成式 AI 工具时,对代码安全、数据隐私及合规性的极度谨慎。此举可能对 AI 辅助开发工具在企业端的普及产生深远影响。

TechCrunch AI
Matic 扫地机器人将于9月涨价250美元,售价调至1495美元
行业新闻

Matic 扫地机器人将于9月涨价250美元,售价调至1495美元

知名扫地机器人品牌 Matic 宣布,其备受好评的扫地机器人产品将于 2026 年 9 月 9 日起正式涨价。此次价格上调幅度为 250 美元,产品售价将从目前的 1,245 美元提升至 1,495 美元。Matic 公司表示,此次调价反映了产品的相关价值。对于有意购买该产品的消费者而言,在涨价生效前下单将是更具性价比的选择。

The Verge