2026年7月7日 的AI新闻

ICML 2026 | 美团技术团队学术论文精选:聚焦机器学习前沿挑战
行业新闻

ICML 2026 | 美团技术团队学术论文精选:聚焦机器学习前沿挑战

本文介绍了美团技术团队在国际顶级学术会议ICML 2026上的学术论文精选。ICML作为机器学习领域最具影响力的会议之一,致力于探讨行业未来发展的关键挑战。美团通过展示具有重要理论价值和实际影响的前沿研究成果,旨在推动机器学习领域的技术进步,并引领未来的研究方向。

美团技术团队
LongCat 开源 VitaBench 2.0:定义长期动态智能体评测新标准
开源项目

LongCat 开源 VitaBench 2.0:定义长期动态智能体评测新标准

美团技术团队旗下的 LongCat 正式开源了 VitaBench 2.0。作为首个针对真实生活场景下长期动态用户建模的智能体评测基准,VitaBench 2.0 填补了行业空白。该基准旨在系统性地评估大语言模型在长期、真实且动态的互动过程中,所展现出的个性化服务能力与主动性表现,为智能体技术的发展提供了关键的度量工具。

美团技术团队
美团技术团队分享搜索推荐ASX专场顶会论文:深耕大模型Agent技术体系
行业新闻

美团技术团队分享搜索推荐ASX专场顶会论文:深耕大模型Agent技术体系

美团业务研发平台搜索推荐ASX团队近期公开了其在AI国际顶会的研究成果。该团队专注于构建以大模型为基础的Agent技术体系(Agentic System X),在后训练、强化学习及多模态理解等前沿方向取得突破,并在ICLR、NeurIPS等会议发表数十篇论文。本次分享精选了6篇核心论文,旨在展示美团在智能体技术领域的深厚积累。

美团技术团队
美团开源LongCat-Video-Avatar 1.5:从高拟真迈向商业级数字人应用新阶段
开源项目

美团开源LongCat-Video-Avatar 1.5:从高拟真迈向商业级数字人应用新阶段

美团技术团队正式开源LongCat-Video-Avatar 1.5,标志着数字人视频模型从学术研究向商业应用的重大跨越。该版本在唇形同步、物理合理性、长视频稳定性及多人互动等方面实现了全面突破。通过优化推理效率,LongCat-Video-Avatar 1.5能够在复杂商业场景下提供稳定、自然的高质量视频输出,为数字人技术的规模化落地提供了强有力的技术支撑。

美团技术团队
ACL 2026美团技术团队6篇入选论文深度解析:涵盖大模型评测与推理优化
行业新闻

ACL 2026美团技术团队6篇入选论文深度解析:涵盖大模型评测与推理优化

美团技术团队在ACL 2026国际顶级学术会议中表现出色,共有6篇论文被收录。这些研究成果深入探讨了大模型能力评测、复杂流程推理、竞赛级数学思维优化、强化学习优化及生成式推荐等核心领域。本文将对这些研究方向进行系统梳理,展示美团在自然语言处理前沿技术上的布局,以及其在构建生成式AI新范式方面的最新探索,体现了工业界在解决复杂算法问题上的深度思考。

美团技术团队
美团开源海报生成AIGC技术体系:构建“生成-编辑-评判”全链路闭环
开源项目

美团开源海报生成AIGC技术体系:构建“生成-编辑-评判”全链路闭环

美团智能创作团队近日发布并开源了其海报生成AIGC技术体系。该体系通过构建“生成-编辑-评判”的技术闭环,实现了从创意产出到质量把控的全流程自动化。目前,该技术已在美团外卖及品牌IP等多个实际业务场景中成功落地,旨在通过技术创新提升营销素材的生产效率与质量,并向行业贡献其技术积累。

美团技术团队
ACL 2026美团履约团队前沿技术专场:聚焦大模型Agent与自进化运营系统
行业新闻

ACL 2026美团履约团队前沿技术专场:聚焦大模型Agent与自进化运营系统

美团履约AI算法团队在ACL 2026期间分享了其在大模型Agent技术体系方面的最新研究成果。该团队致力于通过AI赋能美团履约业务,构建Agent自进化的运营系统。研究涵盖了大模型CPT、Post-training、Agentic RL及多模态理解等前沿领域,并在ACL、EMNLP等顶会发表多篇论文,展示了美团在提升履约效率与智能化水平方面的技术深耕。

美团技术团队
美团发布LongCat-2.0:首个在五万卡国产算力集群训练的万亿参数模型
行业新闻

美团发布LongCat-2.0:首个在五万卡国产算力集群训练的万亿参数模型

美团技术团队正式发布LongCat-2.0,这是业界首个在五万卡国产算力集群上完成全流程训练与推理的万亿参数模型。该模型总参数量达1.6T,原生支持1M超长上下文,专门针对Agentic Coding任务进行了架构优化,旨在实现更高效、更稳定的代码理解、生成与执行,标志着国产算力在大模型全流程应用上的重大突破。

美团技术团队
美团开源首个交互式视频世界模型评测基准WBench:精准定义AI交互边界
研究突破

美团开源首个交互式视频世界模型评测基准WBench:精准定义AI交互边界

美团LongCat团队正式发布并开源了WBench,这是全球首个针对交互式视频世界模型的系统性多轮评测基准。WBench被形象地比喻为“CT扫描仪”,旨在精准定位当前世界模型在从“被动观看”向“主动交互”转型过程中的技术瓶颈,为评估AI对物理世界的理解与交互能力提供了重要工具。

美团技术团队
美团LongCat发布General 365推理评测:Gemini 3 Pro仅获62.8分,多数模型不及格
行业新闻

美团LongCat发布General 365推理评测:Gemini 3 Pro仅获62.8分,多数模型不及格

美团LongCat团队正式发布General 365推理评测基准。通过对26款主流大模型的实测发现,当前顶尖模型在复杂推理任务上仍面临巨大挑战。其中,表现最佳的Gemini 3 Pro准确率仅为62.8%,而绝大多数受测模型得分均未达到60分的及格线。这一评测集的发布为AI推理能力树立了更严苛的新标尺,揭示了当前大模型在逻辑推理领域的真实水平。

美团技术团队
OpenAI 发布 codex-plugin-cc:在 Claude Code 中集成 Codex 实现代码审查与任务委派
开源项目

OpenAI 发布 codex-plugin-cc:在 Claude Code 中集成 Codex 实现代码审查与任务委派

OpenAI 近日在 GitHub 上发布了名为 codex-plugin-cc 的开源插件。该工具旨在将 OpenAI 的 Codex 模型能力引入 Anthropic 的 Claude Code 环境中。通过该插件,开发者可以直接在 Claude Code 内部利用 Codex 进行自动化的代码审查,或将特定的编程任务委派给 Codex 处理,为追求高效、简便开发流程的用户提供了跨平台的 AI 协作方案。

GitHub Trending
阿里巴巴开源 Page Agent:基于 JavaScript 的页面内 GUI 智能体,实现自然语言控制 Web 界面
开源项目

阿里巴巴开源 Page Agent:基于 JavaScript 的页面内 GUI 智能体,实现自然语言控制 Web 界面

阿里巴巴在 GitHub 上正式发布了开源项目 Page Agent。该项目定位为 JavaScript 页面内 GUI 智能体,核心功能是允许用户通过自然语言指令直接控制 Web 界面。作为一种创新的交互方式,Page Agent 旨在简化人机交互流程,将复杂的网页操作转化为直观的语言描述,标志着 Web 应用向智能化和自动化迈出了重要一步。

GitHub Trending
GitHub 热门项目 claude-skills 发布:集成 337 项技能,赋能 Claude Code 与主流编程智能体
开源项目

GitHub 热门项目 claude-skills 发布:集成 337 项技能,赋能 Claude Code 与主流编程智能体

开发者 alirezarezvani 在 GitHub 上发布了名为 claude-skills 的开源项目,该项目集成了 337 个针对 Claude Code 及其他智能体的技能、插件和自定义命令。该工具包不仅包含 30 多个智能体和 70 多个自定义命令,还实现了对 Codex、Gemini CLI、Cursor 等 8 个以上主流编程智能体的广泛兼容。其应用场景跨度极大,涵盖了工程、营销、产品、合规、高管咨询及业务运营等多个专业领域,为 AI 智能体的高度定制化提供了强大的资源库。

GitHub Trending
Meetily:基于Rust的隐私优先开源AI会议助手,实现100%本地化实时转录与摘要
开源项目

Meetily:基于Rust的隐私优先开源AI会议助手,实现100%本地化实时转录与摘要

Meetily是一款由Zackriya-Solutions开发的开源AI会议记录工具,在GitHub上引起广泛关注。该项目采用Rust语言构建,主打隐私保护与高性能,支持比同类产品快4倍的Parakeet/Whisper实时转录功能。通过集成Ollama,Meetily实现了100%的本地化数据处理,无需依赖云端即可完成发言人识别与会议摘要生成,为对数据安全性有极高要求的用户提供了理想的自托管解决方案。

GitHub Trending
Taste-Skill开源项目:赋予AI“良好品味”,彻底告别平庸废话
开源项目

Taste-Skill开源项目:赋予AI“良好品味”,彻底告别平庸废话

Taste-Skill是由开发者Leonxlnx在GitHub上推出的创新开源项目。该项目核心旨在赋予AI“良好的品味”,通过技术手段防止AI生成无聊、平庸且冗长的废话内容。作为GitHub Trending的热门项目,它针对当前大语言模型输出同质化、缺乏质感的问题提出了解决方案,致力于提升AI生成内容的独特性与价值感。

GitHub Trending
GitHub 热门项目泄露多款顶级 AI 模型系统提示词,涵盖 Claude 5 与 GPT 5.5
行业新闻

GitHub 热门项目泄露多款顶级 AI 模型系统提示词,涵盖 Claude 5 与 GPT 5.5

GitHub 开发者 asgeirtj 发布了一个名为 “system_prompts_leaks” 的热门仓库,汇总了包括 Anthropic Claude Fable 5、OpenAI ChatGPT 5.5、Google Gemini 3.5 及 xAI Grok 等在内的多家主流 AI 模型的系统提示词(System Prompts)。该项目不仅揭示了最新未发布或迭代模型的底层指令,还涵盖了 Cursor、Copilot 等开发工具的配置信息,并承诺保持定期更新。

GitHub Trending
herdr:GitHub 热门终端智能体复用器开源发布
开源项目

herdr:GitHub 热门终端智能体复用器开源发布

herdr 是一款在 GitHub Trending 榜单上备受关注的开源工具,由开发者 ogulcancelik 开发。该项目被定义为“存在于终端中的智能体复用器(agent multiplexer)”,旨在为开发者提供一种在命令行环境下高效管理和复用 AI 智能体的新方式。其极简的终端定位反映了 AI 工具向底层开发环境渗透的新趋势。

GitHub Trending
首个AI主导的勒索软件攻击曝光:技术执行虽由AI完成,但仍需人类“幕后操盘”
行业新闻

首个AI主导的勒索软件攻击曝光:技术执行虽由AI完成,但仍需人类“幕后操盘”

根据TechCrunch最新报道,全球首例由AI代理(AI Agent)执行技术环节的真实勒索软件攻击已被记录。尽管AI负责了攻击的具体技术执行,但调查显示,该过程并非完全自主。人类黑客在其中扮演了至关重要的角色,包括挑选攻击目标、搭建必要的基础设施以及提供窃取的登录凭据。这一发现打破了关于“全自动AI网络犯罪”已全面降临的传言,强调了现阶段AI在复杂网络攻击中仍需人类战略指导的现状。

TechCrunch AI
Reddit利用AI自动化系统遏制垃圾信息:Q1日均拦截2.5万条违规内容
行业新闻

Reddit利用AI自动化系统遏制垃圾信息:Q1日均拦截2.5万条违规内容

根据Tech in Asia报道,Reddit在2026年第一季度通过其自动化系统加强了内容治理,旨在遏制可能影响聊天机器人表现的恶意帖文。数据显示,该系统每日拦截的垃圾帖文和评论数量高达2.5万条。这一举措凸显了Reddit在AI时代维护平台数据纯净度、防止数据投毒及恶意干扰AI模型训练的重要战略意图。

Tech in Asia
AMD Ventures 投资日本自动驾驶初创公司 Turing:旨在实现 AI 训练硬件多元化与成本优化
投融资

AMD Ventures 投资日本自动驾驶初创公司 Turing:旨在实现 AI 训练硬件多元化与成本优化

AMD 旗下的风险投资部门 AMD Ventures 近日宣布投资日本自动驾驶初创公司 Turing。根据披露,Turing 目前已将其 10% 的 AI 训练任务转移至 AMD GPU 平台。此举的核心战略目标是通过引入多元化的硬件供应体系,有效降低计算成本并减少对单一供应商的依赖。这一合作标志着 AMD 在自动驾驶计算领域影响力的进一步扩大,也反映了 AI 企业在算力资源管理上的战略转型。

Tech in Asia
技术突破

Ternlight:仅7MB的浏览器端WASM嵌入模型,实现全本地CPU搜索

Ternlight是一款创新的轻量级嵌入模型,其引擎、权重和分词器总计仅为7MB。该模型利用WebAssembly (WASM)技术,能够直接在浏览器的本地CPU上运行,无需服务器支持。目前该技术已成功应用于React文档的全文搜索,展示了在边缘侧实现高效语义检索的可能性。

Hacker News
现实版“汤姆·里德尔日记”:开发者在reMarkable平板上重现哈利波特魔法
开源项目

现实版“汤姆·里德尔日记”:开发者在reMarkable平板上重现哈利波特魔法

开发者Maxime Rivest发布了名为“Riddle”的开源项目,成功将reMarkable Paper Pro电子纸平板转化为《哈利·波特》中著名的“汤姆·里德尔日记”。该项目利用e-ink屏幕特性,实现了手写文字被“吸收”后自动浮现回复的神奇效果。用户无需键盘或UI界面,仅通过手写笔即可与AI进行沉浸式交互。该项目目前仅支持特定型号及系统版本,且需在开发者模式下运行。

Hacker News
GLM 5.2 发布与 AI 利润率崩塌:大模型商业模式的转折点
行业新闻

GLM 5.2 发布与 AI 利润率崩塌:大模型商业模式的转折点

本文深入探讨了 AI 经济学中被低估的结构性转变。作者指出,市场此前对 DeepSeek 低训练成本的反应存在误读,真正的核心在于推理成本。目前,OpenAI 和 Anthropic 等前沿实验室通过极高的推理毛利率(约 90%)来摊销研发成本。然而,随着 Z.ai 推出的 GLM 5.2 这一性能足以媲美 Claude 3 Opus 的开源权重模型问世,这种高利润模式正面临崩塌风险,预示着 AI 行业将迎来利润率的剧烈收缩。

Hacker News
Vercel CEO Guillermo Rauch 论模型与智能体分离:生产环境下的性价比抉择
行业新闻

Vercel CEO Guillermo Rauch 论模型与智能体分离:生产环境下的性价比抉择

Vercel 首席执行官 Guillermo Rauch 在接受 TechCrunch 采访时,探讨了将 AI 模型与智能体(Agents)分离的必要性。他强调,在优化生产环境的应用时,开发者必须重点考量“性价比”(Price/Performance)。这一观点反映了当前 AI 行业从单纯追求模型能力转向追求实际工程化落地与成本控制的趋势。

TechCrunch AI
苹果发布iOS 27 Beta版:Siri支持自定义语速与情感表达力
产品发布

苹果发布iOS 27 Beta版:Siri支持自定义语速与情感表达力

苹果在最新的iOS 27 Beta版本中为Siri引入了重大更新,允许用户自定义语音助手的语速(Pace)和表达力(Expressivity)。这一改进是苹果利用生成式AI技术重塑Siri计划的关键组成部分,旨在提升语音交互的自然度与个性化体验,使其更符合用户的个人偏好。

TechCrunch AI
行业新闻

OpenWrt 官网部署 Anubis 防御系统:严厉打击 AI 激进爬虫行为

针对 AI 公司激进的数据抓取行为,OpenWrt 官网已部署名为 Anubis 的保护系统。该系统通过工作量证明(PoW)机制增加大规模抓取的成本,旨在解决因爬虫导致的服务器宕机问题。官方指出,AI 公司的行为已改变了网站托管的社交契约,迫使网站方采取技术手段保护资源。

Hacker News
奥特曼重申AI财富共享承诺:美国家庭或将获得OpenAI价值300美元的权益
行业新闻

奥特曼重申AI财富共享承诺:美国家庭或将获得OpenAI价值300美元的权益

OpenAI首席执行官萨姆·奥特曼(Sam Altman)关于“全民分享AI财富”的愿景再次引发关注。据《金融时报》最新报道,奥特曼正就一项计划进行讨论,旨在让每个美国家庭都能在OpenAI中拥有价值约300美元的股份或权益。该提议旨在应对AI技术普及可能带来的经济分配挑战,确保技术红利惠及普通大众。

MIT Technology Review - AI
Anthropic揭秘大模型内部“意识空间”:J-space如何让Claude实现沉默思考
研究突破

Anthropic揭秘大模型内部“意识空间”:J-space如何让Claude实现沉默思考

Anthropic的研究人员在Claude模型中发现了一个名为“J-space”的内部神经模式集合。这一发现类似于人类大脑中的“全局工作空间”,能够处理可被模型“有意识”访问的信息。与传统的显式“思维链”不同,J-space在模型内部静默运行,允许模型在不输出文字的情况下进行概念思考。这一机制并非人工设计,而是模型在训练过程中自发形成的,为AI可解释性研究提供了重大突破。

Hacker News
谷歌隐私设置重大变更:用户多媒体数据将用于AI模型训练
行业新闻

谷歌隐私设置重大变更:用户多媒体数据将用于AI模型训练

谷歌(Google)近期对其隐私设置进行了关键调整,允许公司存储并利用更多类型的用户数据来改进其人工智能模型。根据最新披露的信息,这些数据不仅限于文本,还扩展到了图像、文件以及音频和视频录音等多种媒体形式。这一变化意味着用户在谷歌平台上的日常活动数据可能被直接用于AI的进化。虽然谷歌提供了退出机制,但这一政策变动再次引发了公众对大型科技公司数据采集边界的广泛讨论。

TechCrunch AI
数据科学家角色大转型:从模型构建者向AI管理者演变
行业新闻

数据科学家角色大转型:从模型构建者向AI管理者演变

根据KDnuggets的最新报道,数据科学家的职业角色正在经历重大转变。其核心职责正从传统的“构建模型”转向“管理模型”。这一变化预示着AI从业者工作重心的结构性调整,强调了在当前技术环境下,对AI系统的持续管理与维护已成为职业发展的关键方向。

KDnuggets
智能眼镜的文化困境:从影视作品看AI可穿戴设备的监控与隐私挑战
行业新闻

智能眼镜的文化困境:从影视作品看AI可穿戴设备的监控与隐私挑战

本文深入探讨了智能眼镜在现实应用中所面临的文化阻碍。作者Victoria Song指出,好莱坞影视作品在设定大众对智能眼镜高期待的同时,也无意中揭示了其作为监控工具的负面属性。通过分析Netflix剧集《卧底老友记》(A Man on the Inside)中泰德·丹森的角色表现,文章阐述了智能眼镜如何引发社会对隐私和监控的深层忧虑,这已成为该类AI硬件普及的最大障碍。

The Verge