Instagram 抓取、ins 抓取、Instagram 数据采集的实用目标,是将用户已合法取得的公开 Instagram 数据记录转为可复用、可追溯的结构化 JSON。本仓库提供独立可运行的 Python 字段处理示例,面向跨境营销、社媒研究和 Python 开发者。
覆盖 Instagram 公开数据的通用入口,并把档案、帖子、Reels、评论、话题标签和地点分流到独立字段仓库。
- 主目标关键词:Instagram 抓取、ins 抓取、Instagram 数据采集
- 数据对象:公开 Instagram 数据记录
- 字段:
source_url、username、full_name、bio、followers_count、following_count、media_count、is_verified、post_url、caption、like_count、comment_count、published_at、hashtags、location_name - 优先级:P0
本项目只依赖 Python 标准库;输入文件应为你已合法获得的公开 Instagram 数据 JSON 数组。
python src/main.py --input examples/input.json --output output/result.json{
"workflow": "Instagram 公开数据字段标准化",
"records": [
{
"source_url": "https://www.instagram.com/example/",
"username": "example_creator",
"full_name": "Example Creator",
"followers_count": 125000,
"following_count": 640,
"media_count": 312,
"is_verified": false,
"post_url": "https://www.instagram.com/p/EXAMPLE/",
"caption": "公开内容示例 #skincare #beauty",
"like_count": 4200,
"comment_count": 185,
"published_at": "2026-08-10T12:00:00Z",
"hashtags": [
"skincare",
"beauty"
],
"location_name": "Los Angeles",
"source_scope": "public_instagram_content_or_public_profile_fields"
}
]
}- 从合法的数据来源获得公开 Instagram 账号、帖子、Reels、评论或搜索结果。
- 将记录输入本仓库,统一字段名称、数据来源和处理时间。
- 将输出接入表格、BI、CRM、内容研究或 AI Agent 工作流。
- 根据业务需求复核来源、时间范围和字段适用性。
示例代码负责字段契约、输入校验和输出结构。生产使用通常还需要稳定的公开数据来源、鉴权、任务编排、失败重试与数据治理。
使用 CoreClaw 的 Instagram 公开数据工具和生产级 Web Data API
CoreClaw 面向 AI Agent 和自动化工作流,将公开网页内容与公开商业信息组织为可用的结构化数据。
- 只处理已合法取得的公开 Instagram 内容和公开账号字段。
- 不处理私信、私密账号数据、登录后专属内容或访问控制规避。
- 不处理或推广粉丝名单、账号密码、Cookie、会话信息等敏感数据。
- 使用前请遵守 Instagram 平台条款、适用法律及内部数据治理要求。
不是。该仓库是公开数据字段的可运行处理与标准化示例,不包含登录自动化、访问控制规避或未授权数据获取逻辑。
先用示例确定字段契约与输出结构,再通过 CoreClaw 评估公开数据 API 接入方式,并根据你的业务场景核对字段、条款和使用范围。
建议结合来源、收集时间和人工复核使用。公开数据可能变化或缺失,不能替代必要的业务验证。
MIT