infinitum 资讯聚合

重置筛选
infinitum 资讯聚合
infinitum 资讯聚合
清华姚班陈立杰回应称 AI 进展不可思议

OpenAI 研究员、清华姚班毕业生、加州大学伯克利分校 EECS 助理教授陈立杰公开回应称,自己曾预测 AI 可能在 2027 年发表数学顶级论文、2028 年前后解决千禧年大奖问题,而现实进展远超预期,感叹"这是一个非常不可思议的时代"。陈立杰负责 OpenAI 大模型数学推理研究,其评价凸显 AI 数学能力发展速度引发学术界高度关注。

infinitum 资讯聚合
infinitum 资讯聚合
OpenAI 多智能体系统完成欧拉方程正则性反例证明

OpenAI 内部多智能体系统此前已完成欧拉方程正则性问题的反例证明。约 100 个 AI Agent 协作运行 50 小时后获得结果,并完成 Lean 形式化验证。该工作为团队继续攻克纳维尔斯托克斯存在性与光滑性问题提供了关键线索与思路基础,也是整个千禧年难题攻关链中的重要前置成果。

infinitum 资讯聚合
infinitum 资讯聚合
Buckmaster 团队公开相关突破并质疑 OpenAI 研究过程

纽约大学柯朗所流体力学专家 Tristan Buckmaster 公开声明,他与 Levent Alpöge 此前已利用 Claude、OpenAI Codex 等模型在多个流体力学开放问题上取得突破,包括带光滑外力的不可压缩多孔介质方程、Boussinesq 方程及三维不可压缩 Euler 方程有限时间爆破解答,关键突破于 8 月 15 日获得并完成 Lean 验证。Buckmaster 认为 OpenAI 最初对研究过程的描述不完整,并质疑 OpenAI 是否接触过其在 Codex 中的研究资料。

infinitum 资讯聚合
infinitum 资讯聚合
5分钟烧掉1000块!Agent token成本如何治理

作者分享了一次 Agent 产品体验中的成本事故:用户只输入几十个 token,使用 GPT-5.6 Sol 让 Agent 分析如何做 DSH 插件,不到 5 分钟花费约 1000 元。排查发现 Agent 在后台启动了 12 个 subagent、反复检索并携带上下文,且缓存完全未命中(cacheReadTokens 始终为 0)。文章由此提出一个被忽略的产品命题:当 Agent 获得自主执行能力时,也同时获得消费用户预算的能力,消费授权应与执行授权一样成为一等公民。作者梳理出一个完整的 Agent 成本闭环框架,包含六个环节:事前控制(用户设定单次任务上限)、提前感知(任务开始前给出费用区间和风险)、过程可见(展示已用金额、运行 Agent 数量、当前阶段和预估)、主动告警(监控预估与实际偏差、Cache 命中率等异常信号)、随时可控(用户可暂停、停止、缩小范围或追加预算)、账单可解释(结束后给出清晰的成本小票,说明花费分布和偏差原因)。文章强调好的 Agent 产品需要建立与自主权相匹配的成本边界,把成本控制当作用户信任协议和权限设计。

infinitum 资讯聚合
infinitum 资讯聚合
今天,我们不想只聊超级个体,还想聊人人可及

腾讯研究院发起「AI & Society 大哉问」系列直播活动,联合WorkBuddy、腾讯基金会、腾讯学堂、清华大学可持续社会价值研究院和益盒Charity Box,围绕AI普惠议题展开八场跨界对话。内容指出,全球15-64岁人口中仅17.8%使用过生成式AI,多数人被技术进步甩在身后。当下AI讨论过度聚焦增长与超级个体,忽略了教育公平、医患沟通、科技适老等日常真问题。研究院从"科技向善"出发,提出"让人放心,把人放大"的AI观,强调技术普惠的最后一公里需要回到具体现场,由各行业实践者与研究者共同回应。活动议题覆盖教育普惠、医疗可及性、就业、创业生态与多元包容,邀请AI创业者、医生、教育学者、心理学专家与公益人参与讨论。

infinitum 资讯聚合
infinitum 资讯聚合
刚刚,谷歌DeepMind破解人类生命天书!90亿种基因突变全部算穿

谷歌DeepMind正式发布AlphaGenome Atlas,这是一个覆盖全基因组的可搜索AI预测数据库,首次将人类基因组中约90亿种潜在单碱基突变全部计算一遍,并针对每种突变输出约27000项预测指标,覆盖基因表达、RNA剪接、染色质可及性及DNA三维构象等维度,预测总量超240万亿个、体量约1PB,是AlphaFold数据库的30倍。Atlas将模型推理时间285年压缩为静态检索表,配合AlphaMissense提炼的统一AVI评分,覆盖98%非编码区"暗物质",并提供透明归因拆解和高频DNA模式词汇表。研究人员无需本地算力或代码,打开浏览器即可查询。该工具已在罕见病诊断和大规模人群队列分析中取得实效,例如Broad研究所利用AVI评分确诊一例癫痫性脑病患儿,将DNM1内含子内G→A变异锁定为首要致病位点;埃克塞特大学对5.4万名英国生物样本库参与者的分析多检出22%非编码关联,并缩小BMI遗传区域范围。Atlas已接入网页门户、API及Google Antigravity智能体平台,DeepMind称这标志着生命科学从"读懂生命"迈入"预测生命"。

莫崇宇
莫崇宇
GPT Images 2.5 突发上线!网友的「灵魂画作」一个比一个离谱

OpenAI 突发上线新一代图像生成模型 ChatGPT Images 2.5,重点提升图片细节质量、生成速度、编辑精度以及多轮修改一致性,新增 Sketch 手绘参考、创作模板、图片评论编辑等功能。新模型对"修改"理解能力显著增强,可在不改变主体、构图和风格的前提下精准调整产品、背景、文字等单元素。OpenAI 透露 ChatGPT Images 及 API GPT Image 系列每周生成图片超 30 亿张,并同步推出 GPT Image 2.5 Flare 与 Sunburst 两款 API 模型,前者延迟较 GPT Image 2 降低 50%。Images 2.5 已面向 ChatGPT、ChatGPT Work 和 Codex 用户开放,覆盖桌面、移动及网页端。文章通过人像保持、影视角色合成、递归画面、《黑神话》《三国演义》连环画等实测,展示其在复杂提示词、参考图保持及编辑流程上的进步,同时也指出噪点等细节仍有不足。

infinitum 资讯聚合
infinitum 资讯聚合
揭开多智能体决策的隐形不公,结果指标相同也未必可靠 | EMNLP'26

本文报道EMNLP 2026主会论文SCOPED-Hiring,提出面向LLM多智能体招聘系统的过程感知公平性诊断框架。研究指出,即使不同群体的最终录用率相近,决策过程中仍可能存在轨迹不公平,包括职业空窗触发额外怀疑、代理线索影响能力判断、身份线索导致不均等调查与审查。框架包含结果、反事实、过程、路径、动态、设计六个诊断视角,在GPT、Gemini、Qwen上记录31.1万条决策轨迹进行验证,结果显示过程感知风险显著高于结果导向风险。基于诊断定位的风险源,研究团队设计可触发的Fair Skills干预机制,在受控实验中使总分层公平负担降低72.3%,最终录用率仅变化1.86个百分点,输出有效率保持在99.7%以上,为多智能体高风险AI部署提供可落地的过程公平审计工具。

infinitum 资讯聚合
infinitum 资讯聚合
中国首个!清华「龙虾老师」登上联合国讲台,GitHub暴涨3万星

2025年9月8日,清华大学教育学院张羽教授与助理教授于济凡在巴黎联合国教科文组织总部完成90分钟AI教育实战展示,这是中国AI教育智能体团队首次登上联合国讲台。团队带来的开源项目OpenMAIC(被称"教育龙虾")于2025年3月开源,30天斩获GitHub 1.6万星,8月28日v1.0版本发布后Star数突破3.3万。新版本采用Agent驱动模式,以"Agent=Model+Harness"理念实现课程级规划,能将一本书或前沿报告一键生成完整互动课程,内置数十种教学法Skill支持热插拔,并支持名师课堂复刻与老PPT智能改造。平台已覆盖清华13个院系50多门课程,国内外多所中小学及154个国家和地区用户使用,累计消耗883B Token。团队同时推出OpenMAIC Arena评测体系,旨在建立AI教学能力的公开评价标准。

北鸮
北鸮
我一定会回来……吗?小手用户与 iPhone 17 Pro Max 的一年

作者是手小的数码爱好者,此前主力机为 iPhone 13 mini,2025 年 10 月购入橙色 iPhone 17 Pro Max 并使用一年。文章回顾了这款大屏旗舰带来的体验变化:续航大幅提升,日常电量稳定在 65% 左右,告别移动电源;长焦镜头与计算摄影让他拍摄鸟类等题材更加顺手;6.9 英寸屏幕配合 ProMotion 高刷让日常操作丝滑,iPad 使用率显著下降;12GB RAM 让他终于能流畅运行 Project Indigo 等专业相机 App。同时,大尺寸与 233g 重量也带来单手握持困难、易砸脸、误触相机控制按钮、横屏遮挡扬声器等问题,并促使他购入大量配件。作者最终认为,这台机器作为综合设备几无短板,自身用得开心却并不喜欢,梦想中仍是一台能单手握持同时拥有大屏幕的小尺寸旗舰,并期待未来类似形态的出现。

加载更多资讯