TEXTRADAR
覆盖窗口: (24h 滚动窗口 · 按你的浏览器时区显示)

2026-07-25 日报

前沿科技

1. SpaceXAI 发布 Grok 4.5,对标 Opus 级模型

SpaceXAI 推出 Grok 4.5,官方称是收购 Cursor 之后的首个 Opus 级模型——把标尺直接对准了同日发布的 Anthropic Claude Opus 5。两家前沿实验室在同一天各自亮出新旗舰,意味着模型迭代节奏被压缩到以周计,头部厂商谁都不敢让对手独享一代窗口。对下游开发者而言,编码类 agent 的底座模型选择重新洗牌;对算力方,则是又一批推理需求被立即拉满。

2. 英伟达等 20 余家机构联署捍卫开放权重模型

黄仁勋发出个人首条推文,联合英伟达、Meta、微软等 20 余家机构签署公开信,反对过度监管开放权重 AI 模型。这封信落在美方近期对开源模型安全性收紧的政策讨论背景下——既有商业动机(开放权重是这些公司对抗闭源前沿实验室的杠杆),也把"监管一刀切会拖慢美国 AI 生态"作为核心论点。信号在于头部硬件与平台厂商正集体为开源路线站台,与闭源阵营的分野更清晰。

信源 3:The Information / chaincatcher / Hacker News

3. Stripe 洽购模型聚合平台 OpenRouter

Stripe 正洽谈收购 AI 模型聚合平台 OpenRouter,有报道称金额最高可达 100 亿美元。OpenRouter 由 OpenSea 联合创始人 Alex Atallah 创办,做的是把各家大模型 API 汇总成统一入口。支付巨头把手伸向模型分发层,逻辑是 AI 调用正在变成一门"按次计费"的生意,谁掌握调用入口谁就掌握结算入口。

信源 4:36 氪 / chaincatcher / Hacker News / wublock123

4. Gemini 3.5 Flash 上线计算机操作能力

谷歌 DeepMind 为 Gemini 3.5 Flash 加入计算机操作(computer use)能力,让轻量级模型也能直接读屏、点击、填表完成任务。此前这类能力多绑在旗舰大模型上,成本高、延迟大;下放到 Flash 这一档,意味着 agent 自动化的单位成本被显著压低,更适合高频、批量的桌面任务场景。

5. 长鑫科技 7 月 27 日科创板上市,估值约 5800 亿元

国产存储芯片厂商长鑫科技将于 7 月 27 日登陆科创板,估值约 5800 亿元。产业链上下游的设备、材料、封测环节都被视为潜在受益方。在美方持续收紧对华先进芯片出口、中国全力追赶美国 AI 芯片的背景下,长鑫的上市既是一次大额融资,也是国产存储自主化进度的一个市场化注脚。

学术研究

1.AREX:面向深度研究的递归自我改进智能体

核心:把"发现答案难、验证答案易"的不对称性做成一套递归自我改进机制。

摘要:深度研究要求智能体找到同时满足多个约束的答案,而验证一个候选答案往往能拆成逐条约束的可行检查。AREX 据此在两个循环间交替:内层研究循环收集证据、构造临时答案,外层自我改进循环逐条审计答案、找出未解决的主张、再发起有针对性的补充研究。为在长周期里维持这种自我改进,AREX 学了一个自主的上下文更新工具,把不断增长的交互历史压缩成保留已验证证据和未决约束的紧凑状态,不依赖外部模型。训练走的是验证过的合成任务加高质量轨迹,经由智能体中期训练与长周期强化学习。

AI 摘要:(HF 未提供)

评析:思路值得关注的地方在于把"验证比发现容易"这一结构性不对称直接写进了智能体架构,而不是靠单纯拉长搜索时间来堆算力。自主的上下文压缩工具是长周期任务里的关键——它决定了智能体能不能在几十步之后还记得自己验证过什么、还差什么。局限也明显:训练依赖验证过的合成任务,真实开放域研究里"约束能否被逐条清晰拆解"本身就不总成立;115 的高热度更多反映方向对路,实际泛化能力要看它在非合成基准上的表现。

2.ReferTrack:先指认再跟踪的具身视觉跟踪

核心:把语言描述的目标先落到图像里的具体检测框,再解码跟踪路径,解决具身跟踪里推理与像素证据脱节的问题。

摘要:具身视觉跟踪要求移动智能体只靠机载视觉、持续跟随一个用自然语言描述的目标。现有 VLA 策略把目标识别和轨迹规划合到一起,但其思维链推理常在抽象空间潜变量里进行,难以监督、也与图像空间的显式检测弱对齐。ReferTrack 用"先指认再跟踪"范式:先从一组带索引的边界框里选出目标,再基于这个落在图像上的决策解码跟踪路点,并用滑动窗口队列保留历史选中框的几何特征。在 EVT-Bench 上,单目标、干扰、歧义三类跟踪的成功率分别为 89.4%、73.3%、74.1%,单视角性能达到甚至超过若干多相机基线。

AI 摘要:(HF 未提供)

评析:把"跟踪"从抽象空间潜变量拉回到显式边界框这一步,方向上是对的——可监督、可对齐、可调试,工程落地比端到端黑箱友好。单视角能在识别密集的任务上追平多相机基线是个有分量的结果。要留意的是,先选框再跟踪对上游检测的质量高度依赖,在检测框本身就漏或错的复杂真实场景里,误差会沿链条放大。

3.Visual Contrastive Self-Distillation:靠图像内容对比做自蒸馏

核心:不用外部教师、也不用特权信息,只靠"有图 vs 抹掉图"的对比信号来做在线自蒸馏。

摘要:在线自蒸馏(OPSD)的吸引力在于去掉了外部教师,但仍需要教师与学生之间的信息不对称,以保证自教师给出的学习信号强于学生。现有方法靠特权答案或视觉证据制造这种不对称。VCSD 提出把"图像内容移除"转化为自蒸馏信号:在学生生成的每个回答前缀处,EMA 教师在相同提示和前缀下产出两个下一 token 分布——一个基于原图,一个基于内容被抹除的对照——两者的 token 级对数概率差,凸显出那些因实例级视觉内容而被特别抬高的候选。用这个对比去锐化教师分布,再蒸馏给学生。在 ViRL39K 上,VCSD 在 Qwen3-VL 与 Qwen3.5 上稳定优于对应的 OPSD,例如 Qwen3-VL 2B 上七基准聚合从 62.27%提升到 67.04%。

AI 摘要:(HF 未提供)

评析:把信息不对称的来源从"特权数据"换成"输入条件本身",是个干净的简化——不需要标注答案、也不需要额外视觉证据,只靠原图与抹图的对照就能造出更强的教师信号,可复现性和适用面都更好。数字上对多模态推理有稳定增益。看点在于这个对比信号本质抓的是"哪些 token 真正依赖看图",对减轻多模态模型的语言先验偷懒可能有额外价值,不过论文给的还是基准聚合分,具体在哪类任务上收益最大需要更细的拆分。

4.K12-KGraph:对齐课程的知识图谱,测教育大模型的"课程认知"

核心:不只考做题,而是考模型是否理解课程知识的结构与呈现方式。

摘要:大模型越来越多用于 K12 教育,但现有基准主要考做题,而非考模型是否理解课程知识如何组织、如何被视觉化呈现——作者把后者称为"课程认知",涵盖先修链、概念分类、实验与概念的关联、教学排序和视觉落地。K12-KGraph 从人教版数理化生教材抽取,含九类节点、十四类关系;由此派生的 K12-Bench 是 23640 题的多选基准,含五类任务。结果显示 Gemini-3-Flash 仅 57%精确匹配、Gemma-4-31B-IT 为 46%,先修链和邻接关系两类最难。作者还构建了图引导的监督微调语料 K12-Train,在匹配的样本预算下优于八个主流指令微调语料的同等子集。

AI 摘要:(HF 未提供)

评析:这份工作的价值在于点出了教育类评测的一个盲区——会答高考题不等于理解知识体系的结构。先修链、概念邻接这类关系型任务连 Gemini-3-Flash 都只到 57%,说明现有模型的"课程认知"确实薄弱,这对做 AI 辅导产品是个务实的提醒。基于人教版教材构建,中文教育场景的贴合度是加分项。局限是知识图谱由教材抽取,覆盖范围和标注一致性会直接影响基准可信度,这类信息论文摘要没有充分交代。

5.Show, Don't Tell:用生成的像素而非文本评估空间认知

核心:让图像生成模型直接"画"出空间判断,而不是逼它输出坐标或文字,从而和文本 VLM 在同一任务语义下比较。

摘要:许多空间任务根植于连续视觉场景,位置、区域、路径用指、标、画来表达比报精确坐标或离散符号更自然。但现有空间推理基准通常要求坐标、选项或文本,对图像生成模型造成"答案接口不匹配"。作者提出 ProVisE,一个与基准无关的框架,从图像生成模型中引出受协议约束的视觉答案,并解析成与原有指标兼容的结构化预测;还含一个能为新基准构建并校验任务协议的 Agentic 构建器。配套的 SpatialGen-Bench 有 470 个样本,覆盖 14 类空间子任务、四个能力层级。论文在统一设定下评估了文本输出 VLM 与图像生成模型。

AI 摘要:(HF 未提供)

评析:问题提得好——图像生成模型明明能在像素里直接外化空间判断,却被迫用文本接口应试,这本身就是评测方法的错配。ProVisE 把生成的视觉答案解析回结构化预测,让两类模型能在同一任务语义下对比,方法论上是一次有意义的补齐。470 个样本的诊断基准规模偏小,更适合定位能力短板而非下最终结论;这类"用生成评判理解"的思路能否推广到更复杂的空间任务,还需要更大规模验证。

6.腾讯 WorkBuddy Bench:抗污染任务构造的多域编码智能体基准

核心:每个任务都从真实提交或业务场景反向改写成口语化请求,让题面无法靠搜索原始 issue 找到答案。

摘要:WorkBuddy Bench 是覆盖代码、Web、办公、安全四个工作域的编码智能体评估套件。核心是一套统一评估框架,任务不改编公开 issue 文本,而是从真实的 commit、pull request 或业务场景反向工程,再改写成简短、口语化、带角色扮演的请求,使题面无法通过搜索底层 issue/PR/commit 复原。抗污染依靠这种构造方式加数据集版本管理,而非保密——任务目录、环境镜像、评估框架、测试与参考解全部开放。四个子集分别探测仓库级工程、前端开发、办公业务流、红蓝对抗安全,统一在两个智能体框架(CodeBuddy Code 与 Claude Code)上运行。

AI 摘要:(HF 未提供)

评析:抗污染是编码智能体评测里越来越突出的痛点,靠"反向改写成口语请求"来切断题面与公开代码线索的关联,比单纯保密更可持续,也更接近真实工单的表达方式。四域覆盖加全开放的做法便于第三方审计复现。要留意的是,全量开放本身也意味着一旦进入训练语料就有被记住的风险,抗污染最终还得靠版本迭代维持——这是所有开放基准的共同宿命,不是这一份的独有问题。

国际新闻

1. 美伊冲突进入第十三夜,海湾国家罕见参战

美军对伊朗的空袭已连续第十三夜,特朗普正权衡一场"史无前例的更大规模打击",同时向德黑兰和红海的胡塞武装发出警告。真正标志升级的是巴林和科威特战机对伊朗发动的报复性打击——这两个海湾国家罕见亲自下场,冲突不再只是美伊双边,开始向区域多方蔓延。与此同时,五角大楼公布的阵亡将士名单悄悄删去了最近四人,伤亡透明度开始被外界质疑。更让人警惕的一点,是美方情报评估认为伊朗新领导人比前任更倾向于推进核武器——军事冲突与核扩散风险,就这样被直接绑在了一起。

德黑兰拒绝了伊拉克总理转交的美方停火提案,英国则在伊朗以"美国帮凶"相威胁后表态"已做好自卫准备"。直接相关方已从美伊两国扩展到整个海湾——巴林、科威特下场,英国被点名,红海航运再度承压。这条链条最先传导到的是油价:本周 WTI 累涨 9.3%、布伦特累涨 9.7%,战事一旦持续,能源通胀就会回灌到美联储 7 月 28 日决议的考量里。另一条更慢但更结构性的线在核扩散——若伊朗新领导层确实转向研制核武,美沙核协议中的浓缩条款,乃至整个中东的核门槛,都会被重新定价。

接下来一周看三个触发点:特朗普是否落实"更大规模打击"、更多海湾国家是否军事跟进、以及 7 月 28 日 FOMC 是否因油价压力调整措辞。

[#deepdive-candidate]

信源 5:Guardian / Al Jazeera / NYT / CNBC / WSJ

2. 特朗普对约 60 国关税 7 月 24 日正式生效

特朗普以"强迫劳动"进口为由,对约 60 个经济体加征的新一轮双位数关税已于 7 月 24 日正式生效,涉及国家实际达 80 多个,涵盖英国、欧盟等主要伙伴。多国批评这一理由缺乏正当性,指白宫是拿强迫劳动指控给保护主义打掩护。较昨日"即将落地",今日是关税墙真正砌上的第一天——各国的反制清单和世贸层面的申诉会在未来数周陆续浮现,全球贸易的摩擦成本开始进入实际结算。

信源 4:BBC / Bloomberg / Al Jazeera / DW 中文

3. 美情报评估称伊朗新领导人更倾向研制核武

美方情报评估认为,伊朗新领导人相比前任更愿意推进核武器计划。这一判断出现在战事第十三夜的节点上,把军事冲突与核门槛问题叠加:一旦德黑兰的战略意图确实转向拥核,美方"以打促谈"的逻辑基础会被动摇,区域内其他国家的核对冲动机也会被激活。这也直接牵动近期美沙核协议里争议最大的浓缩条款——中东核平衡正被重新审视。

4. 中国推动巴基斯坦斡旋、促美伊重启谈判

在美军导弹自南向北袭击伊朗之际,中国正推动巴基斯坦出面斡旋、促成美伊重启谈判。这是战事以来中国角色的一次显性前移:不直接下场,而是借巴基斯坦这一与伊朗接壤、又与美方有沟通渠道的第三方递话。对北京而言,霍尔木兹海峡的能源通道安全是核心关切,稳住局势符合其利益;对谈判前景而言,多一条非西方的斡旋管道,未必能立刻促成停火,但给了德黑兰一个不必只面对华盛顿的台阶。

5. 日本通胀回升,日央行维持加息路径

日本通胀数据回升,使日本央行维持加息路径的预期得到支撑。在美欧利率高企、美债收益率本周上行 14 个基点的大背景下,日央行若继续收紧,日元套息交易的成本会抬升,可能牵动全球资金再配置。这是当前被伊朗战事和美国关税盖过、但对跨市场流动性影响不小的一条线。

美股

1. 特斯拉遭遇多年来最差单日,单周跌约 18%

特斯拉股价单日双位数暴跌,创下多年来最差表现,全周累计跌约 18%。同期 SpaceX 也在星舰试飞前走弱,构成马斯克"糟糕的一周"。市场对特斯拉的担忧集中在销量与利润端的双重压力,而 SpaceX 的回落则叠加了星舰这次高关注度试飞的不确定性。两家关联公司同步承压,也放大了市场对马斯克商业版图整体估值的重新审视。

信源 3:CNBC / Guardian / Seeking Alpha

2. 科技七巨头续跌,AI 开支恐慌发酵

科技七巨头本周市值再蒸发近 8000 亿美元,比特币守住 6.5 万美元。抛售的核心不是业绩,而是市场开始紧盯这些公司失控的 AI 资本支出——华尔街担心巨额投入短期看不到回报。具体的资金压力已经显形:贝莱德为 Meta 的数据中心启动了 123 亿美元的债券发行,而 Meta 在这笔融资中面临更高的借贷成本;穆迪则警告"前所未有"的 AI 支出正威胁亚马逊、Meta、Alphabet 的信用质量。翻译一下:AI 军备竞赛的账单开始压到资产负债表上,市场从"看好叙事"切换到"追问回报"。

信源 4:Bloomberg / FT / WSJ / wublock123

3. 英特尔二季度增 25%但盘后涨幅蒸发

英特尔二季度营收同比增长 25%至 161.3 亿美元,创十五年来最快增速,调整后每股收益 0.42 美元超预期,AI 需求是主要推力。但延续昨日盘后大涨 12%的行情,这波 15%的涨幅在隔夜迅速蒸发,抹去数十亿美元市值。市场的态度很清楚:单季超预期不足以扭转对英特尔长期竞争力的怀疑,公司同时给出的三季度指引与偏高的全年资本支出,反而让投资者重新聚焦其烧钱与追赶的现实。

信源 3:36 氪 / Seeking Alpha / MarketWatch

4. 谷歌二季度营收增 24%,一年净增 1.18 万人

Alphabet 二季度营收同比增长 24%,且一年内净增员工 11830 人、二季度单季增超 4000 人,与行业普遍裁员形成对照。营收保持双位数增长说明搜索与云业务的基本盘稳固,而逆势扩招则透露出谷歌在 AI 竞赛里选择继续加注人力。不过华尔街近期对其传递的信号偏谨慎——在整个科技板块被"AI 开支回报"质疑笼罩时,增长本身已不足以让市场买单。

5. 宁德时代上半年营收增 54.8%,拟回购最高 400 亿元

宁德时代 2026 年上半年营业收入 2769.17 亿元,同比增长 54.80%,并宣布拟以 200 亿至 400 亿元回购股份。在大众等海外车企因中国市场竞争利润暴跌的同时,宁德时代的高增长凸显出中国动力电池龙头的定价权与规模优势。大额回购既是对自身现金流的信心表达,也是在为股价托底。

WEB3

1. BitMEX 关停当日遭集体诉讼,Arthur Hayes 陷欺诈指控

延续昨日 BitMEX 永久关停,交易所在宣布关停当日即遭集体诉讼,原告要求索赔 622.66 枚比特币。与此同时,联合创始人 Arthur Hayes 等人被指控通过所谓"内幕交易台"实施欺诈。永续合约的开创者以这种方式落幕,留下的是用户资产追索和创始团队法律风险的双重烂摊子——一个时代的收尾并不体面。

信源 2:wublock123 / The Block

2. Drift 协议遭黑客攻击,2.3 万枚 ETH 经 Tornado Cash 洗白

Drift 协议攻击者单日向 Tornado Cash 转入 2.3 万枚以太坊,价值约 4440 万美元。混币器 Tornado Cash 再次成为链上被盗资金的洗白通道,追回难度极大。这也是本周继此前跨链桥被盗之后又一起大额安全事件,DeFi 协议的资金安全仍是机构入场前绕不开的顾虑。

信源 2:chaincatcher / wublock123

3. 摩根士丹利以太坊信托获 SEC 生效,持仓 BTC 突破 6000 枚

摩根士丹利的以太坊信托注册声明获美国证监会(SEC)生效,拟以代码 MSSE 在纽约证交所 Arca 平台上市。与此同时,该行再次增持 57 枚比特币,总持仓首次突破 6000 枚。传统投行一边推进合规的以太坊产品、一边直接增持比特币,双线并进,反映出主流金融机构对加密资产配置的态度正从试探转向实质建仓。

信源 2:wublock123 / chaincatcher

4. 彭博:《GENIUS 法案》被指塞入利好 Tether 条款

彭博社报道,美国官员被指在《GENIUS 法案》(美国稳定币监管法案)制定过程中,推动了有利于 Tether 的条款。稳定币立法的具体条文向头部发行方倾斜,会直接影响市场竞争格局——若 Tether 在合规框架里获得先发优势,其他稳定币发行方的追赶空间将被压缩。立法的技术细节,往往比法案标题更能决定谁受益。

5. 阿根廷拟放宽监管,允许共同基金投资比特币

阿根廷计划放宽资本市场监管,允许共同基金投资比特币及其他加密资产。作为长期受高通胀困扰的经济体,阿根廷放开机构资金进入加密市场的通道,既是给本国投资者多一条抗通胀配置路径,也延续了该国近年对加密资产相对开放的政策取向。

其他重大新闻

1. 防务科技公司 Anduril 拟以千亿美元估值融资

美国防务科技公司 Anduril 正洽谈以 1000 亿美元估值进行新一轮融资。眼下军费上行,防务承包商普遍积累了创纪录的在手订单,Anduril 这类以软件和自主系统切入国防的新锐公司估值随之被快速推高,反映出资本对"科技化国防"赛道的持续加注。

2. 安联 20.9 亿美元收购汇丰新加坡保险业务

德国安联集团将以 20.9 亿美元收购汇丰旗下的新加坡保险业务。此举是安联在亚洲保险市场扩张的一步,也符合汇丰近年聚焦核心银行业务、剥离非核心资产的战略。跨境保险资产的易主,反映出欧洲金融巨头对亚洲财富管理市场增长的看好。

3. 智元机器人启动赴港上市流程

国内具身智能公司智元已启动赴港上市流程。在人形机器人赛道估值高企、资本密集涌入之际,智元寻求登陆港股,既是为持续的研发和量产储备弹药,也标志着这一赛道从一级市场融资向公开市场募资的过渡。港股能否给具身智能一个理想定价,将是后续观察点。

4. 欧盟初步认定 TikTok 未保护未成年人,或面临巨额罚款

欧盟委员会初步认定 TikTok 未能确保未成年人账户安全,可能面临巨额罚款。这延续了欧盟以《数字服务法》为抓手、密集审查大型平台合规的监管态势。对 TikTok 而言,未成年人保护是其在欧洲最敏感的合规议题之一,一旦罚单落地,示范效应会波及其他社交平台。

5. 工行落地首笔"数币达"数字人民币跨境支付

中国工商银行在"数币达"平台落地全国首笔中新(中国—新加坡)数字人民币跨境支付,金额近千万元。这是数字人民币在真实跨境贸易结算场景中的一次落地,验证了其在跨境支付中降低成本、提升效率的潜力,也是人民币国际化借道数字货币的一个具体推进。

跨资产快照(2026-07-25)