MIT、斯坦福等14所机构发起公共人工智能观察站
来自MIT、斯坦福及另外12所学术机构的研究人员宣布发起公共人工智能观察站,用于测量人们在真实环境中如何使用人工智能助手。该项目将为观察人工智能助手的实际使用方式提供公共研究基础设施,推动相关研究从个案分析转向更系统的行为测量。
簇级候选:8 个已有簇, 共 11 条代表。
来自MIT、斯坦福及另外12所学术机构的研究人员宣布发起公共人工智能观察站,用于测量人们在真实环境中如何使用人工智能助手。该项目将为观察人工智能助手的实际使用方式提供公共研究基础设施,推动相关研究从个案分析转向更系统的行为测量。
下线会立即隐藏 Defomo 内容,并联动撤回 Elys 全部 Feed、详情和分享入口;恢复不会补推历史 Feed。 本操作覆盖整个事件簇及未来新成员。
来自MIT、斯坦福及另外12所学术机构的研究人员宣布发起公共人工智能观察站,用于测量人们在真实环境中如何使用人工智能助手。该项目将为观察人工智能助手的实际使用方式提供公共研究基础设施,推动相关研究从个案分析转向更系统的行为测量。
簇级候选:8 个已有簇, 共 11 条代表。
转发内容对一项旨在了解人们实际如何使用人工智能的研究工作表示欢迎,称这一问题既具挑战性又十分重要,并强调同时做到规模化、严谨性和细节周全需要投入大量努力。该内容主要表达对相关研究方向及其工作方法的肯定,未在直接转发文字中披露具体成果或实施进展。
麻省理工学院、斯坦福大学及另外12所学术机构的研究人员宣布启动公共人工智能观测站,建设公开基础设施,实地测量人们在现实环境中如何使用人工智能助手。项目将帮助研究者更具体地理解人工智能的实际使用方式,并关注社会互动如何受到不同平台的影响。
研究者宣布公共人工智能观测站上线,这是一个基于24,521条用户同意对话、覆盖52个模型的独立公开测量工具,由安卡·罗伊尔和沙恩·雷德福带队,联合多所高校研究者开展。该项目为观察人工智能助手在真实场景中的使用方式提供了公开数据基础,有助于补充单纯依赖模型评测的认知。
MIT、斯坦福等机构研究者发起 AI Observatory,汇总 WildChat、ShareGPT、LMSYS、Grok 等数据源,以 145 个维度分析超过 2.3 万条真实对话和约 8.5 万轮交互。项目称 47.9% 的对话与工作无关,并已公开 Dashboard、数据和分析代码,后续还计划用真实使用数据检验 Benchmark 任务与现实需求的匹配度。
一篇论文比较了Grok、ShareGPT与AI Archive的用户请求特征:Grok的信息检索占67.1%,新闻与时事占38.5%,商业与社会类占64.5%,样本中错误信息或失实陈述占15.2%,高于其他主要数据源约4.2%至10.2%。作者认为差异可能与公开社交媒体环境有关,但不能证明由模型本身导致。研究提示,产品入口和使用场景会显著塑造聊天机器人的实际用途。