返回簇列表
传闻簇行为开启Mongo 实时数据

MIT、斯坦福等14所机构发起公共人工智能观察站

来自MIT、斯坦福及另外12所学术机构的研究人员宣布发起公共人工智能观察站,用于测量人们在真实环境中如何使用人工智能助手。该项目将为观察人工智能助手的实际使用方式提供公共研究基础设施,推动相关研究从个案分析转向更系统的行为测量。

成员
6
换头
2
最近活动
08/19 09:26:58
CONTENT GOVERNANCE

内容治理

在线

下线会立即隐藏 Defomo 内容,并联动撤回 Elys 全部 Feed、详情和分享入口;恢复不会补推历史 Feed。 本操作覆盖整个事件簇及未来新成员。

MEMBERS

簇内帖子

按进入簇的先后排序 · duplicate 不隐藏
#1
当前簇头 · 第 1、3 任独立事件二手报道

MIT、斯坦福等14所机构发起公共人工智能观察站

来自MIT、斯坦福及另外12所学术机构的研究人员宣布发起公共人工智能观察站,用于测量人们在真实环境中如何使用人工智能助手。该项目将为观察人工智能助手的实际使用方式提供公共研究基础设施,推动相关研究从个案分析转向更系统的行为测量。

Niloofar ✈️ icml来源权威 4 级(1 级最高)发布于 08/19 02:18:19原帖 内容详情
去重判断LLM 复核 · 独立事件

簇级候选:8 个已有簇, 共 11 条代表

在 CozeLoop 查看判断
最终结果已修正为“独立事件”,以当前持久化状态为准。
#2
重复折叠二手报道

转发内容称理解人们如何使用人工智能既重要又具挑战

转发内容对一项旨在了解人们实际如何使用人工智能的研究工作表示欢迎,称这一问题既具挑战性又十分重要,并强调同时做到规模化、严谨性和细节周全需要投入大量努力。该内容主要表达对相关研究方向及其工作方法的肯定,未在直接转发文字中披露具体成果或实施进展。

Niloofar ✈️ icml来源权威 4 级(1 级最高)发布于 08/19 04:31:22原帖 内容详情
去重判断LLM 复核 · 重复折叠

簇级候选:8 个已有簇, 共 9 条代表

归并到 MIT、斯坦福等14所机构发起公共人工智能观察站

在 CozeLoop 查看判断
#3
重复折叠二手报道

多所高校研究人员启动公共人工智能观测站

麻省理工学院、斯坦福大学及另外12所学术机构的研究人员宣布启动公共人工智能观测站,建设公开基础设施,实地测量人们在现实环境中如何使用人工智能助手。项目将帮助研究者更具体地理解人工智能的实际使用方式,并关注社会互动如何受到不同平台的影响。

Sara Hooker来源权威 3 级(1 级最高)发布于 08/19 06:20:31原帖 内容详情
去重判断LLM 复核 · 重复折叠

簇级候选:6 个已有簇, 共 6 条代表

归并到 MIT、斯坦福等14所机构发起公共人工智能观察站

在 CozeLoop 查看判断
#4
2 任簇头重复折叠二手报道

公共人工智能观测站上线,基于2.45万条对话追踪真实使用

研究者宣布公共人工智能观测站上线,这是一个基于24,521条用户同意对话、覆盖52个模型的独立公开测量工具,由安卡·罗伊尔和沙恩·雷德福带队,联合多所高校研究者开展。该项目为观察人工智能助手在真实场景中的使用方式提供了公开数据基础,有助于补充单纯依赖模型评测的认知。

Sara Hooker来源权威 3 级(1 级最高)发布于 08/19 06:59:35原帖 内容详情
去重判断LLM 复核 · 事件更新

簇级候选:8 个已有簇, 共 8 条代表

判断锚点 MIT、斯坦福等14所机构发起公共人工智能观察站

在 CozeLoop 查看判断
最终结果已修正为“重复折叠”,以当前持久化状态为准。
#5
重复折叠二手报道

AI Observatory 汇总真实对话数据,观察人类如何使用 AI

MIT、斯坦福等机构研究者发起 AI Observatory,汇总 WildChat、ShareGPT、LMSYS、Grok 等数据源,以 145 个维度分析超过 2.3 万条真实对话和约 8.5 万轮交互。项目称 47.9% 的对话与工作无关,并已公开 Dashboard、数据和分析代码,后续还计划用真实使用数据检验 Benchmark 任务与现实需求的匹配度。

Max For AI来源权威 4 级(1 级最高)发布于 08/19 08:47:44原帖 内容详情
去重判断LLM 复核 · 重复折叠

簇级候选:8 个已有簇, 共 9 条代表

归并到 MIT、斯坦福等14所机构发起公共人工智能观察站

在 CozeLoop 查看判断
#6
重复折叠二手报道

研究称Grok用户请求更偏信息检索与新闻时事

一篇论文比较了Grok、ShareGPT与AI Archive的用户请求特征:Grok的信息检索占67.1%,新闻与时事占38.5%,商业与社会类占64.5%,样本中错误信息或失实陈述占15.2%,高于其他主要数据源约4.2%至10.2%。作者认为差异可能与公开社交媒体环境有关,但不能证明由模型本身导致。研究提示,产品入口和使用场景会显著塑造聊天机器人的实际用途。

Max For AI来源权威 4 级(1 级最高)发布于 08/19 08:50:55原帖 内容详情
去重判断LLM 复核 · 重复折叠

簇级候选:7 个已有簇, 共 8 条代表

归并到 MIT、斯坦福等14所机构发起公共人工智能观察站

在 CozeLoop 查看判断