OutEye 2.0

话语研究,
从采集到分析
完整工具链

面向话语研究者的全栈协作平台。多源语料采集、AI 辅助编码、双人一致性校验、深度统计分析。

6
主流媒体源
4
数据采集渠道
12
研究辅助工具
OutSight 话语研究平台

传统话语研究依赖手动采集人工编码,效率低下、难以保证系统性,团队协作缺少统一框架。

4
数据源自动融合,无需手动切换
5
正文提取策略逐级回退,确保成功率
3
阶段校验保障数据质量
实时
Cohen's Kappa 一致性系数计算

从采集到分析,
全流程覆盖

四大核心模块,支撑话语研究的完整生命周期

多源融合自动采集

整合 RSS、NewsAPI、GDELT 和搜索引擎四大数据源,覆盖 BBC、Guardian、NYT、WSJ、Economist、Reuters 六家主流媒体。智能去重、时间过滤、付费墙检测。

RSS NewsAPI GDELT 智能去重
多源语料采集

AI 驱动的编码辅助

基于大语言模型的预读分析流水线,自动提取摘要、情感倾向、话语框架、关键术语、叙事结构。为编码者提供结构化参考。

自动摘要 框架提取 叙事分析

团队协作与一致性校验

支持任务分配、单人编码、双人编码等多种工作模式。内置 Cohen's Kappa 系数计算,实时评估编码者间一致性。

双人编码 Kappa 系数 分歧仲裁

深度统计与语言学分析

框架分布饼图、时间线图、媒体热力图等可视化分析。内置词频统计、N-gram 分析、搭配分析、KWIC 检索、文体统计,满足话语研究量化需求。

数据可视化 词频分析 搭配分析 KWIC 检索
4
数据源融合
5
正文提取策略
10
数据库表
12
研究辅助工具

工程化设计,支撑研究可靠性

从架构到细节,为学术严谨性提供技术保障

五级提取回退

Readability, JSON-LD, Firecrawl, Jina AI, Archive.today 逐级回退,确保正文提取成功率

熔断器机制

RSS 源连续失败 5 次自动跳过,防止无效请求,保障系统稳定性

三阶段插入守卫

时间过滤 + URL 标准化 + SHA-256 去重,三阶段校验确保数据质量

Repository 模式

数据访问层抽象,Client 注入实现跨环境复用,隔离厂商锁定风险

让话语研究更系统、更高效

OutSight 专为话语研究者打造,从语料采集到统计分析,提供完整的工具链支持。