Kỹ Thuật Tầng 4

Tầng 4: Pipeline Xử Lý Dữ Liệu RAG

Data Pipeline — Xử Lý & Nhập Dữ Liệu RAG

Pipeline xử lý tri thức y khoa từ tài liệu nguồn và Knowledge Cards, thực hiện phân mảnh (chunking), tạo vector embeddings và nhập liệu vào Vector Database (ChromaDB / Qdrant).


1. Cấu Trúc Pipeline

  • scripts/:
  • 01_extract_knowledge.py: Trích xuất tài liệu từ knowledge-base/sources/ thành cấu trúc trung gian.
  • 02_create_chunks.py: Phân đoạn văn bản theo topic và ngữ cảnh lâm sàng kèm metadata chi tiết.
  • 03_generate_embeddings.py: Tạo vector embeddings (Google text-embedding-004 hoặc OpenAI text-embedding-3-large).
  • 04_ingest_vectordb.py: Nạp embeddings và metadata vào Vector Store (ChromaDB).
  • 05_validate_ingestion.py: Kiểm thử truy xuất và đối soát độ chính xác của vector database.
  • utils/: Các hàm hỗ trợ parse markdown, trích xuất metadata và chống trùng lặp.
  • config/:
  • chunking_config.yaml: Kích thước chunk, overlap, và phân tách theo heading.
  • embedding_config.yaml: Model name, dimensions, batch size.
  • data/:
  • chunks/: Chứa các file chunks trung gian.
  • embeddings/: Cache vector embeddings.

2. Hướng Dẫn Chạy Pipeline

python scripts/02_create_chunks.py
python scripts/03_generate_embeddings.py
python scripts/04_ingest_vectordb.py
python scripts/05_validate_ingestion.py
⚠️

Khuyến Cáo & Miễn Trừ Trách Nhiệm Y Khoa

Hệ thống Trợ lý AI đóng vai trò hỗ trợ giáo dục sức khỏe và hướng dẫn tự chăm sóc hệ vận động. AI không thay thế chẩn đoán hoặc chỉ định điều trị của bác sĩ chuyên khoa. Khi xuất hiện các triệu chứng cờ đỏ (sốt, sụt cân, đau dữ dội, mất kiểm soát tiêu tiểu), người bệnh cần đến ngay cơ sở y tế gần nhất.

🔍
Gõ từ khóa để tìm kiếm nhanh trong toàn bộ 132+ tài liệu dự án CXK.