言出法随:社会科学研究中的 AI 智能体

Say It, Get It Done: AI Agents in Social Science Research

沈明宏 · 上海纽约大学 博士后

第15届 · 应用社会科学研究方法研修班
《数据分析专题》系列讲座

2026 年 7 月 22 日

开场

先问一个问题

你的研究,有多少时间花在文献、
归档、制表、作图、撰写等“体力劳动”上?

所有需要重复的劳动,都是体力劳动。

AI 简史

Claude Code 发展史

METR 研究:AI 可处理任务时长 ≈ 每 7 个月翻倍,2025 初 1 小时 → 2026 末 8 小时

Anthropic 内部实验

Automated Weak-to-Strong Researcher (AAR):Anthropic 让 Claude Opus 4.6 自主提出假设、设计实验、迭代解决一个真实的 AI 研究问题。(2026年4月)

人类研究员

Anthropic 两位作者

  • 调优 4 种代表性方法
  • 用时 7 天
  • 最佳 PGR = 0.23

Agent 团队

9 个 Opus 4.6 并行

  • 自主提出 / 设计 / 迭代
  • 用时 5 天
  • PGR = 0.97(1.0 为上限)

累计约 800 小时、约 $18,000 算力,AI 在真实 AI 研究任务上显著超过模型公司自家研究员的人类基线。

这是一个关于效率的故事

180 天 传统研究

60 天 借助 Chatbot

20 天 借助 AI Agents

参考框架:一位教授完成一项高质量研究,同期可并行推进 2–3 个项目。

一项研究的周期越长,往往智能体越重要。

不用再往上爬了

智能体需要电脑技术,但它将革命性地杀死电脑技术。

认识 Agent

AI 概念门类

🏢 AI 公司

OpenAI
Anthropic
Google
DeepSeek
Moonshot

💬 聊天机器人

ChatGPT
Claude
Gemini
DeepSeek
Kimi

🔧 AI 应用

NotebookLM
Gamma
Elicit
Consensus
Notion AI

💻 IDE

VS Code
Cursor
Windsurf
Antigravity
Trae

🤖 终端智能体

Claude Code
Codex
ZCode
Kimi Code
Qwen Code

⚙️ 智能体内部

Memory
Skill
Agent
Hook
MCP

今日聚焦:终端智能体,当前最强的 AI 门类,右侧的智能体内部概念是它们强大的秘密。

动手玩:Transformer 内部怎么运转?

Georgia Tech Polo Club · Transformer Explainer(需联网)· 打不开就直接访问:https://poloclub.github.io/transformer-explainer/

预训练 vs 后训练

基座模型 · 只会续写

Base Model
>

对话模型 · 懂得回答

Chat Model
>

Ouyang et al. (2022). InstructGPT, NeurIPS · DeepSeek-AI (2025). DeepSeek-R1 · Raschka (2024). New LLM Pre-training and Post-training Paradigms

终端:和整个电脑“打字聊天”

Stata 命令窗口

输入命令 → 操作数据

Stata/MP · Command
.
.
.

终端(Terminal)

输入命令 → 操作整台电脑

pwd 我在哪 · ls 有什么 · cd 去哪里

Terminal
~ $
~/research $
~/research $
~/research/data $

上面是 Mac/Linux 的命令;Windows PowerShell 里几乎一样(lscd 通用)。

CLI 工具 = 命令 + 参数,回车就干活

大多数工具没有图形界面,只提供一个命令名

git · 代码文件的“后悔药”

Terminal
~/research $
~/research $
~/research $
~/research $
~/research $

stata · 在终端跑 do-file,不用打开软件

Terminal
~/research $
~/research $
~/research $

stata 命令需提前加入 PATH(自行配置一次即可)

你以后要用的 AI 工具,也是这样一个命令名。

Claude Code 也只是终端里的一个程序

Terminal
~/research $
✻ Welcome to Claude Code · Opus 4.7
>
⏺ 我先看看数据里有哪些变量…
⏺ Bash(stata -b do check_vars.do)
⏺ 找到 income、urban、age、edu 等变量,写脚本并运行…
⏺ Write(analysis.do) → Bash(stata -b do analysis.do)
⏺ 城镇家庭年均收入 8.2 万 vs 农村 3.1 万,回归表已写入 results.md
>
⏺ Write(plot.do) → Bash(stata -b do plot.do)
⏺ 图已保存为 income_by_urban.png(城乡差异 p < 0.001)

只不过下命令用的是口语

界面为示意,实际版本略有出入 · Codex、Kimi Code、ZCode 等同理:codexkimi 各是一个命令名

Agent 的特点

全局视野

同时看到脚本、数据、文稿,不再粘贴片段

自动排错、端到端执行

直接修改 bug,全程无需操作

不只是回答问题,而是真正完成工作。 自动化体力劳动,把时间交给脑力劳动

Agent 怎么检索知识?

Agent 不会一次性加载一棵树,它只会摘几片叶子。

紫色 = 加载,灰色 = 跳过。Agent 只把相关的知识放进“工作记忆”,大幅节省上下文空间。

Agent 工作方式

言出法随

言出法随:文献回顾

你说:

整理上海弄堂社区的文献。

Agent 做的事情:

  1. 读取文献 PDF 文件夹
  2. 识别研究设计类型
  3. 提取核心发现与数据来源
  4. 按主题与年份排序
  5. 生成文献矩阵表格
  6. 撰写文献综述

输出:

  • 文献梳理(Excel 表格)
  • 参考文献列表
  • 每篇论文的核心发现(详细 Word 文档)
  • 文献分类概要(简明 Word 文档)
  • 文献综述初稿

时间:< 5 分钟

言出法随:数据分析

你说:

报告统计年鉴数据每个年份和省份的缺失情况。

Agent 做的事情:

  1. 读取你的数据文件
  2. 识别省份和年份变量
  3. 计算每个分组的缺失率
  4. 写代码,制作图表
  5. 生成汇总图表
  6. 整理成 quarto
  7. 导出为 Word, PDF 和 HTML

输出:

  • 代码
  • 图表文件
  • Word 文档
  • PDF
  • HTML 网页

时间:< 10 分钟

言出法随:你来试

选一个研究任务,点「让 Agent 试试」,看它如何规划。(本地模拟,无需联网。)

任务

    言出法随:学术汇报

    你说:

    做一套15页的幻灯片。

    Agent 做的事情:

    1. 读取论文草稿,理解核心论点与结构
    2. 读取文献综述表格和摘要
    3. 读取数据分析图表与回归结果
    4. 设计幻灯片结构与叙事逻辑
    5. Typst 编写幻灯片代码
    6. 编译生成 PDF

    输出:

    • Typst 源文件(可继续编辑)
    • 编译好的 PDF 幻灯片
    • 每页的演讲者注释
    • 演讲稿初稿

    时间:< 15 分钟

    言出法随:论文润色

    你说: 按照 ASR 标准润色论文。

    5 类审查员并行运行: 期刊格式 · 论文结构 · 语法 · 文献引用 · 图表

    输出: 修改后论文 + 每轮修改日志
    时间:< 30 分钟

    加速与赋能

    陈老师三天写好 CSR

    场景一:加速,经验丰富的学者 + Agent = 三天完成一篇关于上海社区治理CSR 实证论文。

    陈老师的条件

    • 上海大学优秀青年教师
    • 深耕社区研究
    • 研究数据和资料
    • 熟练使用智能体
    • 三天时间

    Agent 的三个角色

    • Day 1:数据分析师
    • Day 2:文献助理
    • Day 3:论文写手

    三天的分工

    ① Day 1 · 数据分析

    Agent 承担数据分析师角色。

    • 清理数据 ← 清洗、纠错、补缺
    • 分析数据 ← 描述统计、回归等
    • 生成报告 ← 表格、图、文字解读

    ② Day 2 · 文献综述

    Agent 承担文献助理角色。

    • 搜索相关文献 ← 标题和 DOI
    • 批量下载 PDF ← 可找淘宝协助
    • 整理综述 ← 报告、文献综述

    ③ Day 3 · 论文初稿

    Agent 承担论文写手角色。

    • 提取核心论点 ← 文献综述精华
    • 提取核心结果 ← 数据分析精华
    • 生成完整初稿 ← 按 CSR 结构

    陈老师审阅结果,驾驭方向(harness),而 Agent 承担全部执行工作。

    高中生写 ASR 引言

    场景二:赋能,一个电脑技术高超、不擅英文的理科生,也能写出 ASR 水平的引言。

    理论上,学术写作的节奏、语气、文风、气质,都可以从现有论文中学习。

    传统路径

    读研究生 → 大量阅读 → 摸索写作风格 → 数年后上手

    Agent 路径

    下载论文 → 让 Agent 学习风格 → 生成候选 → 合成最优版本

    三个阶段:学习 · 执行 · 指导

    ① 学习

    人定方向,Agent 建立知识基础。

    • 收集语料 ← 下载 ASR 100+ 篇近年论文
    • 确定主题 ← 例:“美国教育不平等的百年演变”
    • 风格建模 ← Agent 提取写作节奏与论证逻辑

    ② 执行

    批量生成 · 筛选 · 合成最优引言。

    • 批量生成 ← 以每篇论文为模板,生成 100 版引言
    • 评审筛选 ← 另一个 Agent 挑出 20 份最强候选
    • 合成终稿 ← 最后的 Agent 压缩为一篇最终引言

    ③ 指导

    AI 变成导师:解释“为什么这么写”。

    • 逐句讲解 ← 用中文讲解终稿每段的写作策略
    • 语言教学 ← 标注关键英文术语与句式
    • 路线指引 ← 个性化学习清单与推荐阅读

    最终成果:没有社会学训练的学生,也能理解“这个引言好在哪”。

    两种理想类型

    维度 加速 赋能
    使用人 导师(expert) 学生(novice)
    Agent 角色 干活的学生 干活的导师
    核心机制 委托重复劳动 学习,执行,指导
    人的贡献 方向把控 + 质量把控 方向把控
    Agent 的贡献 木牛流马 神来之笔
    最理想产出 三天完成论文 ASR 的引言

    导师省时间,学生学知识。
    或许未来,导师和学生的社会角色都将弱化。

    能力与边界

    Agent 擅长什么?

    能力区域 表现 具体任务
    计算与代码 文件归纳、数据清洗、变量构建、回归实现、结果复现、图表生成
    结构化知识 文献初筛、资料整理、编码本生成、摘要、发现、方法节与附录初稿
    研究设计与框架搭建 可协助细化研究问题、提出论文结构与识别策略,但仍需研究者把关
    理论提炼与学术贡献 可辅助总结潜在贡献、比较定位与发现逻辑漏洞,但不能替代领域专家判断
    调查、访谈与田野 科研人员到现场,提供情绪价值

    个人版Wikipedia

    让智能体持续完善你的知识库,越用越聪明。
    详见:karpathy/llm-wiki

    科研四象限

    未来需要的四种资本

    核心

    ① 社会互动

    政治资本 + 社会资本

    核心

    ② 数据资料

    物质资本

    必须有

    ③ 学科前沿

    文化资本

    必须有

    ④ 驾驭智能体

    使用思路

    历史的镜子

    从“汽车产业”到“汽车社会”:城市空间、婚姻家庭、汽车文化、地缘政治等。(吕鹏,2026年6月8日)

    AI 暴露 ≠ 失业风险

    具身手艺与现场依赖是新时代的重要技能。(上科大 CEISD 等,2026年7月21日)

    技能的迁徙

    从手写到脑机

    手写

    提笔忘字

    打字

    键盘 / 拼音

    语音

    语音输入

    脑机接口

    读取脑信号

    同一件事,四种输入方式。
    这些技能,正在被淘汰吗?

    为什么我们还要看人下棋?

    国际象棋引擎早已远超人类(1997 年深蓝;2017 年后 AlphaZero、Stockfish 全面碾压)。可 2020 年以来,人类棋赛的观众与棋手数量反而暴涨

    机器明明更强,我们为什么还要看人下棋?

    我们看的是“不确定”

    体育与竞技的魅力,在于结果未知。一场注定“完美取胜”的比赛,没有人想看。

    我们认同的是“会输的人”

    人会失误、会紧张、会勇敢。机器没有“会输”的可能,也就无从认同。

    体育、艺术、竞技,是我们观看“人在压力下如何成为人”的舞台。
    难度与失误不是缺陷,而是人性显形的方式。

    技术不删除技能,而是让它迁徙

    技能变化 人的变化 AI 时代的含义 例子
    弱化 退出日常使用,或作为特长 基本被 AI 取代 珠心算、计算尺、硬笔书法、荒野求生
    共存 长期并存,各司其职 AI 创造新的形式,真人仍有价值 田径、舞蹈、演唱会、包饺子
    提升(加速 / 赋能) 高手变快,新手变强 门槛骤降、操作外包,人类驾驭大方向 翻译、围棋、摄影、设计、写代码、做研究
    新生 新技术催生新需求 AI 创造新的工作和职业 司机、打字员、AI 训练

    收割机

    收割机的故事

    1956 年,黑龙江。你在生产队割麦子,一把镰刀,每天割一亩多地。

    这天,邻村的国营农场开来一台机器,苏联援建的“斯大林-6”型联合收割机,轰鸣着推过麦地,一天轻松收割四百亩

    村里人围着看了半天。
    有人说:“这玩意儿太贵,咱用不起。”
    有人说:“机器哪有手稳,割坏了谁负责?”
    也有人只是沉默,攥紧了手里的镰刀。

    收割机 = AI 智能体  镰刀 = 传统方法  粮食 = 你的研究

    五种抵抗情绪

    ① “我不需要收割机”

    觉得 AI 影响不到自己的领域。

    但每个学科都有体力劳动。

    ② “收割机太贵了”

    镰刀便宜,够用就行。

    但时间成本才是最大的成本。

    ③ “我学不会收割机”

    对新技术的畏难情绪,宁愿用镰刀。

    但学习曲线在快速变平。

    ④ “割坏了谁负责”

    AI 用错了会制造错误:幻觉、数据泄露、逻辑漏洞。

    合理警惕,但解法是学会驾驶,不是砸掉机器。

    ⑤ “地主用上收割机,我们没活路了”

    担心 AI 加剧不平等。

    合理关切,但不用 ≠ 不受影响。

    三种过度乐观

    有了收割机不等于丰收:

    你得先有田

    首先要有研究课题和数据。

    你得知道四季节律

    研究判断力不可外包。
    何时探索、何时收敛,需要你来决定。

    每家人的田都不一样

    你的数据、方法、写作风格都是独特的。
    需要根据自己的研究定制 Agent 配置。

    AutoResearch:研究流程中的五级自主性

    来源:Tie et al. 工作论文 · arXiv:2605.23204

    上手指南

    使用智能体

    第一层:系统配置

    安装工具,准备环境。

    • 安装 Git(勾选“Add to PATH”)
    • 安装 VS Code(勾选“Add to PATH”)
    • 在 VS Code 安装 Codex 扩展

    一次性工作。约 20 分钟。

    第二层:任务配置

    告诉 Agent 如何思考你的研究

    • 如何设计研究问题
    • 如何处理文献综述
    • 如何构建变量
    • 使用哪些方法
    • 图表格式
    • 写作风格

    一次性投资,每个项目受益。

    效率复利:一次配置,长期受益

    核心原则:

    任何重复性任务,只需要解释一次。
    任何相似的配置,只需要设计一次。

    例子 1

    一旦配置好“如何处理 CFPS 调查数据”,每个新项目都自动继承这套知识。

    例子 2

    一旦写好“文献回顾的框架参考 [某篇论文]”,Agent 在每次分析中都会遵循这个规范。

    第一个项目最难配置,之后每个项目都更轻松。
    这是复利,不是线性积累。

    项目配置实例

    一个 CLAUDE.md 配置文件的核心内容:

    # 研究项目配置
    
    ## 数据处理规范
    - 始终使用 Stata 进行数据清洗
    - 变量构建参考:@Zhang-Miao-2025.pdf 的编码方案
    
    ## 输出格式
    - 回归表格:使用 esttab
    - 图表:白色背景,7×5 英寸
    - 引用格式:American Sociological Review 规范
    ## 项目文件结构
    data/raw/     ← 原始数据(只读)
    data/clean/   ← 清洗后数据
    do-file/      ← 分析脚本
    output/       ← 图表和结果

    大任务拆成小任务

    当 AI 做得不令人满意,往往意味着:任务太大了,需要拆分。

    驾驭智能体

    路有弯道,直线冲刺只会翻车。

    社科危机

    工具越强,越要守住研究者的判断:

    数据源头的污染

    Nature 报道(2026):

    • 问卷中 高达 45% 的回答疑似 LLM 生成

    个人更强,集体更窄

    Nature 研究还发现:

    • 集体话题多样性 下降 4.6%
    • 注意力向少数“明星问题”集中

    避免“直线冲刺”:选好目的地,打开导航,安全驾驶。

    Hao et al. (2026). Nature. · Adam, D. (2026, June 2). Nature.

    Agent 工作流程

    Agent 的母语:纯文本

    Agent 只能读写文本,文件格式决定了兼容性。

    天然适配 ✓

    Agent 直接读写,无需转换:

    • .do / .R / .py –分析脚本
    • .md / .qmd / .tex –写作和幻灯片
    • .csv / .json –数据
    • .bib –文献
    • Git 仓库、配置文件

    需要桥接 ⚠

    其它格式,Agent 需要桥接、解析或转换后处理:

    • Word .docx
    • PowerPoint .pptx
    • Excel .xlsx
    • PDF
    • .dta / .rds 等结构化数据

    Word 文档处理流程

    原始 Word → Markdown → Agent 编辑 → Markdown → Word,但环不闭合

    ✓ 保留

    正文内容、标题层级、表格、引用、列表

    ✗ 丢失

    修订模式、批注、自定义样式、字体、页眉页脚

    原则: 在纯文本中工作,最后一步才转换格式。 接受格式漂移,把心思留给内容

    更优雅的方案:直接编辑 XML

    .docxXML 的 ZIP,用 docx skill 直接改 XML,环闭合

    项目 Markdown 路线 XML 路线
    内容(正文、表格、标题、引用) ✗ 丢失 ✓ 保留
    格式(样式、字体、页眉页脚) ✗ 丢失 ✓ 保留
    修订模式与批注 ✗ 丢失 ✓ 保留

    工具选择

    选哪个工具?

    维度 QoderWork ZCode Kimi Code Codex
    提供商 阿里巴巴 Z.ai(智谱) Moonshot OpenAI
    核心模型 内置多家 GLM-5.2 K2.7 Code(256K 上下文) GPT / Codex
    界面 桌面应用 桌面代理式开发环境 终端 CLI + IDE 终端 + 手机
    网络 国内直连 国内直连 国内直连 需稳定外网
    最强项 Office 文件、免编程 项目式代理开发 大代码库、长上下文 全平台、手机、免费层

    四款工具的操作逻辑完全一样: 用自然语言提问,换工具不影响你已学到的技能。前三款国内直连,Codex 需外网。

    Work agent 和 Code agent 有何不同?

    同一内核,两种形态。都能跑代码、处理本地文件、联网搜索、执行多步骤任务。

    Code 类 · 编程深度

    • 代码库级理解:读整个项目,懂架构与依赖
    • 直接改代码:编辑文件、跑 shell、运行测试
    • Subagent 并行:coder / explore / plan 分工
    • 视频生成代码:上传 Demo,直接实现
    • MCP 配置:接入外部工具与数据源

    Work 类 · 办公自动化

    • Office 任务:产出 PPT / Excel / Word
    • Cron 定时任务:每日简报、定期数据处理
    • WebBridge:像人一样浏览网页
    • 金融数据源:A 股 / 港股 / 美股实时数据
    • 低门槛:面向普通白领,更容易上手

    写代码、做研究 用 Code;处理文档、出报表 用 Work。

    哪款适合你?

    回答前两个必选问题,实时得到适合你的工具推荐与备选。

    1. 主要任务?
    2. 支付和网络?
    3. 偏好界面?(可选)
    回答上面的问题,看看哪款更适合你。

    问题与讨论

    The AI is fast. You are the one who knows what matters.

    谢谢!

    沈明宏
    ms14464@nyu.edu

    课件资料:
    https://www.socimh.com/slides.html
    上机资料:
    socimh.com/cc-guide/

    附录

    Agent 的局限

    知识截止日期

    它接触不到最新最前沿的知识:刚发表的论文、最新动态,Agent 可能不知道。

    应对: 你来提供最新文献,Agent 来整合。

    上下文窗口限制

    上下文有限,没办法处理非常宏观的知识结构,也难以一次性处理超大型数据集。

    应对: 分块处理,模块化配置。

    Agent 不是专业素养的替代品。 它是你的执行层,你仍然是研究的主人。

    当张雪峰变成 Skill

    张雪峰的认知操作系统

    五大心智模型

    • 选择 > 努力
    • 社会筛子论
    • 就业倒推法
    • 阶层现实主义
    • 争议即传播

    数据基础

    • 5 本著作
    • 15+ 篇权威媒体采访
    • 30+ 条一手语录
    • 8 条决策启发式
    • 完整人生时间线

    在未来,智能体对白领职业意味着什么?

    取决于:

    1. 这个职业里,有多少工作可以被 AI 加速或赋能?

    2. 这个职业的业务范围可以拓展吗?还是只能内卷?

    3. 这个职业的从业门槛怎么样?

    为什么默认推荐国内工具

    没有稳定可用的境外网络

    需要线路稳定、干净、用的人少,且支持终端代理模式(TUN 模式)。追求稳定,推荐配置静态 IP

    没有可用的境外支付渠道

    订阅需要境外银行卡,或通过 App Store(外区)、Google Play 等渠道付费(有溢价)。

    没有可用的境外账号

    部分境外服务(OpenAI / Anthropic 等)需要境外手机号,乃至于国外的护照/身份证 + 人脸认证。

    淘宝和第三方平台有大量中转站提供账号和订阅服务,但价格和安全性参差不齐,需谨慎选择。

    AI 让科学变窄?

    Nature 计量研究:用 ML 分类器扫 4100 万+ 篇论文(1980–2025,六大学科),筛出 31 万篇明显使用 AI 的论文——一笔双面账:

    个人层面的账:赢

    • 用 AI 的科学家:发文 3×、被引近 5×
    • 初级科学家更少离开学界、更快成为 PI

    集体层面的账:输

    • 话题覆盖面 窄 4.6%
    • 论文间互引与建构 下降 22%——都在绕 AlphaFold 式“明星研究”公转

    “我们像群居动物。”(Evans)——会用 AI 是个人的护城河;但所有人都爬同一座山,大片领域就无人探索。

    Evans & Xu 团队(Nature)· Science News 报道:Zhao, C. (2026-01-22). Science 391(6783). DOI: 10.1126/science.aef6710

    学界实证:不只是直觉

    大规模实证给出了相同方向的答案

    个人层面 · 谁用谁领先

    用 AI 的研究者

    • 发文量 约 3 倍
    • 被引 约 4.8 倍
    • 41.3M 篇论文的全样本证据

    同一研究也发现集体话题多样性下降 4.6%

    谁受益最大 · 新手

    生成式 AI 辅助知识工作

    • 平均 +14% 生产力
    • 新手、弱技能者 +30–35%
    • 5,172 名客服的随机实验

    越不熟练,增益越大,正是“赋能”的硬证据

    Hao et al. (2026). Nature. · Brynjolfsson, Li & Raymond (2025). Quarterly Journal of Economics.