---
title: "数据湖"
description: "把分散资料沉淀为可查询、可追溯的数据。"
---

> Documentation Index
> Fetch the complete documentation index at: https://logbook.pennlam.com/llms.txt
> Use this file to discover all available pages before exploring further.

# 数据湖

## 当前定位

本人最近正在搭建的数据湖项目。现有 README 描述的是面向 Agent 查询的社交数据 Lakehouse MVP：原始响应、整理后的数据和目录元数据分层维护。

## 分层思路

- **Bronze**：保留原始来源响应，支持追溯。
- **Silver**：用 DuckLake 管理规范化 Parquet 数据。
- **Catalog**：保存表与文件的目录元数据。
- **Query**：由 DuckDB 完成查询与分析。

数据存储和元数据有不同职责，不把“存下来了”等同于“业务定义正确、可以可信分析”。

## 本次核对

读取了本地 README 和脚本入口。该目录目前不是 Git 仓库，不能记录不存在的远程地址或提交。

## 下一步

先补齐当前阶段、数据合同和查询验收。原始业务数据、访问凭据和内部资源地址不进入公开站点。

关联：[Data Agent 的业务上下文](/notes/reading/context-layer/)。

Source: https://logbook.pennlam.com/projects/data-lake/index.mdx
