Kỹ Thuật
Tầng 4
Tầng 4: Pipeline Xử Lý Dữ Liệu RAG
Data Pipeline — Xử Lý & Nhập Dữ Liệu RAG
Pipeline xử lý tri thức y khoa từ tài liệu nguồn và Knowledge Cards, thực hiện phân mảnh (chunking), tạo vector embeddings và nhập liệu vào Vector Database (ChromaDB / Qdrant).
1. Cấu Trúc Pipeline
scripts/:01_extract_knowledge.py: Trích xuất tài liệu từknowledge-base/sources/thành cấu trúc trung gian.02_create_chunks.py: Phân đoạn văn bản theo topic và ngữ cảnh lâm sàng kèm metadata chi tiết.03_generate_embeddings.py: Tạo vector embeddings (Googletext-embedding-004hoặc OpenAItext-embedding-3-large).04_ingest_vectordb.py: Nạp embeddings và metadata vào Vector Store (ChromaDB).05_validate_ingestion.py: Kiểm thử truy xuất và đối soát độ chính xác của vector database.utils/: Các hàm hỗ trợ parse markdown, trích xuất metadata và chống trùng lặp.config/:chunking_config.yaml: Kích thước chunk, overlap, và phân tách theo heading.embedding_config.yaml: Model name, dimensions, batch size.data/:chunks/: Chứa các file chunks trung gian.embeddings/: Cache vector embeddings.
2. Hướng Dẫn Chạy Pipeline
python scripts/02_create_chunks.py
python scripts/03_generate_embeddings.py
python scripts/04_ingest_vectordb.py
python scripts/05_validate_ingestion.py
Khuyến Cáo & Miễn Trừ Trách Nhiệm Y Khoa
Hệ thống Trợ lý AI đóng vai trò hỗ trợ giáo dục sức khỏe và hướng dẫn tự chăm sóc hệ vận động. AI không thay thế chẩn đoán hoặc chỉ định điều trị của bác sĩ chuyên khoa. Khi xuất hiện các triệu chứng cờ đỏ (sốt, sụt cân, đau dữ dội, mất kiểm soát tiêu tiểu), người bệnh cần đến ngay cơ sở y tế gần nhất.