Gemini 3.7 Flash 在 DeepSWE 基准测试中得分 65.5%,成本减半
Gemini 3.7 Flash 在 DeepSWE 基准测试中得分达到 65.5%,较前代 3.6 Flash 版本提升 18.8%,且单任务成本降低超过一半。这一成绩显示了该模型在软件工程及多步推理场景下的显著性价比优势,为开发者在实际应用中提供了更高效、低成本的代码生成选择。

Gemini 3.7 Flash 在 DeepSWE 基准测试中得分达到 65.5%,较前代 3.6 Flash 版本提升 18.8%,且单任务成本降低超过一半。这一成绩显示了该模型在软件工程及多步推理场景下的显著性价比优势,为开发者在实际应用中提供了更高效、低成本的代码生成选择。

Novig首席执行官在接受采访时透露,公司在转型为预测市场运营的首周内,就遭遇了四起独立的诉讼。这反映出预测市场等新兴金融模式在实际落地时面临的严峻监管挑战与法律风险,早期运营阶段的合规压力显著,可能影响其后续业务开展。
AI初创公司在训练自有模型时正面临算力获取的进退两难困境。The Information记者指出,初创公司未来的算力需求高度依赖于早期实验的结果,但如果没有初始算力支持,这些早期实验根本无法开展。这反映了当前AI创业生态中算力资源分配的结构性矛盾,对早期团队的融资能力和战略规划提出了更高要求。

纽约居民 Andrew Parsons 将古董电视机和收音机巧妙改造成豪华的动物公寓。这一创意不仅赋予了复古电子设备新的生命,也为宠物提供了独特的居住空间,属于趣味性的生活方式报道。

《经济学人》报道了一项关于赤足鞋潜在益处的小型研究,结果显示,连续六个月穿着赤足鞋可使脚趾肌肉力量显著增加57%。这一发现为赤足鞋在增强足部肌肉和稳定性方面提供了初步的数据支持。不过,由于该研究样本量有限,其实际广泛适用性和长期效果仍需更多大规模研究来进一步验证。
多名现任及前 OpenAI 员工匿名向《连线》杂志透露,为快速推出新 AI 模型和产品所带来的竞争压力,已导致员工难以充分优先处理安全性、保障和对齐问题。这一爆料进一步凸显了头部 AI 企业在商业竞争与模型安全之间的内部矛盾,可能引发外界对其未来产品安全标准的持续关注。
WIRED 转发了记者 Sophie Kleeman 的推文,后者高度评价了 Max Zeff 关于 OpenAI 内部安全文化的最新报道。该内容主要表达了对相关新闻工作质量的认可与推荐,未在推文中披露具体的调查细节或事实增量。对于关注 AI 行业动态的受众而言,此推文仅作为相关深度报道的导读与引荐,缺乏直接的决策价值。

Anthropic 在 Claude 的 iOS 应用程序中新增了“使用额度”部分,并正在开发允许用户添加个人资料图片的功能。这一常规界面更新有助于用户更直观地管理订阅额度并提升个性化体验,但对核心模型能力无实质影响。

Parasma 创始人兼 CEO vytalow 近日表示,利用人类脑细胞进行计算在能效上可能远超现有的硅基芯片。他指出,无论硅芯片如何优化,人类大脑在功耗、样本效率和持续学习方面始终具有显著优势。该观点反映了前沿生物计算领域对突破传统算力瓶颈的探索与预期,但目前仍处于理论与早期实验阶段。

Astranis 推出专为地球同步轨道及更高轨道设计的太空态势感知与机动性解决方案 Perceptor。该方案基于其成熟的 MicroGEO 平台打造,旨在为操作员提供高轨道太空监视能力,以应对日益复杂的卫星接近、检查与干扰等潜在威胁。此举显示出 Astranis 正将其小型卫星平台技术拓展至太空安全与监视领域,为高轨道资产保护提供新的商业化选项。
