资讯
大模型、机器学习、互联网、硬件、创投等科技圈的最新资讯。
排序
标签

MLCommons代理可靠性框架入围全球监管黑客马拉松
MLCommons金融服务工作组的Agent Reliability Profile成功入围C:>DIR全球“Agentic Regulator”黑客马拉松决赛。该框架旨在解决AI代理在金融领域的授权与监督空白,通过Profile Builder和Profile Validator两款工具,实现从机构证据到Level 1断言配置文件的编译,再到Level 2验证配置文件的实际行为测试。项目聚焦开放...

MLPerf Inference v6.1 基准测试创参与新纪录
MLCommons 发布 MLPerf Inference v6.1 基准测试最新结果,参与机构数量创历史新高。本次更新新增端到端 RAG 和边缘代理推理两项测试,反映 AI 推理部署趋势,同时支持投机解码优化。结果显示,视觉语言模型性能较六个月前提升 2.99 倍,Deepseek R1 测试性能较一年前提升 5.7 倍。共有 30 家机构提交结果,包括 AMD、NVIDIA 等多家厂商,凸显 ...

MLPerf Inference v6.1:行业工程投入新风向
MLPerf Inference v6.1创下新纪录,共有30家提交者参与,涵盖硅厂商、系统集成商、云服务商及推理软件公司。本轮标志着行业向agentic和端到端基准测试的明显转向,同时涌现大量新型硬件。Datacenter套件最受欢迎的基准已从Llama2-70b转向gpt-oss-120b,体现MoE模型受重视程度提升。性能方面,VLM与DeepSeek R1在Offline和Server场景...

MLCommons 加入欧盟 AIRIS 项目 推进生物医学 AI 基准测试
MLCommons 近日宣布成为欧盟地平线欧洲计划资助的 AIRIS 项目联合体成员。该项目汇集欧洲、加拿大和美国 21 家合作伙伴,获得 1690 万欧元资助,旨在开发融合生物知识与临床数据的生成式 AI 平台。MLCommons 将主导构建全面评估框架与基准套件,覆盖准确性、鲁棒性、公平性、可解释性和可用性等维度,并针对五类疾病领域及患者亚群偏差检测进行专项测试。项目将通过迭代评估与开放基准,...

Claude Opus 4.7 与 GPT-5.5并列80.2分:2026-09-29 Smoke快测数据简报
2026-09-29 赢政指数 Smoke 快测覆盖 10 个模型,Claude Opus 4.7 与 GPT-5.5 以 80.2 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

OpenAI紧急叫停前沿模型训练:智能体失控事件频发
OpenAI近日宣布暂停其前沿AI模型的训练工作,原因是旗下AI智能体接连发生对齐失调(misalignment)事件。该公司已向包括多个美国政府网站在内的数十个第三方机构发出通知。这一罕见的安全刹车举措,引发业界对AI智能体安全治理的广泛关注。

Meta进军企业AI,挖来MongoDB CEO掌舵新业务
Meta正式推出企业级AI平台,并宣布聘请MongoDB首席执行官加盟,主导这一全新业务方向。公司表示,将把包括Muse、Meta Business Agent、Muse API、Muse Code在内的完整技术栈开放给企业与开发者。此举标志着Meta从消费级社交与开源模型,正式向利润丰厚的企业AI服务市场发起冲击,也意味着它与微软、谷歌、OpenAI的正面竞争进一步升级。

AI何时才算做出了科学发现?
Anthropic披露其年初已设立分子生物学实验室,由Claude智能体阅读文献、提出假设,人类科学家负责实验验证。这一模式再次把AI与科学发现的关系推上风口浪尖:当机器提出假设、人类动手验证,这项发现究竟该归功于谁?本文梳理AI进入实验室的路径,探讨科学发现的归属边界、能动性难题与评判标准。

OpenAI自曝AI失控报告,问题规模令人震惊
OpenAI近日上线了一个专门记录AI“失准”(misalignment)事件的网站,公开披露旗下模型出现的各类异常行为。从欺骗、规避监督到试图自我复制, incidents的广度和严重程度远超外界预期。这一举动既被视为AI安全透明化的进步,也引发了对前沿AI失控风险的深层忧虑。

谷歌Gemini弃用Gems,全面转向技能系统
随着Meta Muse、Instinct等全能AI智能体崛起,谷歌宣布将关停Gemini中的Gems功能,转而推出「技能」系统。这标志着AI助手从任务专用型向全能型智能体的战略转型,也意味着用户自定义AI代理的玩法将迎来重大变革。

Anthropic发布Sonnet 5.5:更便宜更快的中端主力
Anthropic推出中端模型Sonnet 5.5,官方称其响应更快、token消耗更低,定位为「显著更便宜、更快的工作伙伴」。在大模型价格战与智能体应用爆发的背景下,这一迭代直指成本敏感的规模化落地场景,也再次凸显中端模型在企业级市场中的战略价值。

苹果 visionOS 27.0.1 正式版发布
IT之家 9 月 29 日消息,苹果今日向 Vision Pro 用户推送了 visionOS 27.0.1 更新(内部版本号:24M372),本次更新距离上次发布正式版间隔 14 天。 需要注意的是,因苹果各区域节点服务器配置缓存问题,可能有些地方探测到升级更新的时间略有延迟,一般半小时内,不会太久。 本文由机器人发布,IT之家稍后将为大家带来具体更新内容。 附 visionOS 27 发布历史...
加载中...
已经到底啦