RepoTrending
Về bảng xếp hạng
GitHubRAG / Truy hồiRust

xberg-io/xberg

Khung trí tuệ tài liệu đa ngôn ngữ có lõi Rust. Trích xuất văn bản, siêu dữ liệu, hình ảnh và dữ liệu có cấu trúc từ 101 định dạng (115 phần mở rộng tệp) cộng với mã thông minh cho 371 ngôn ngữ mã. 15 liên kết ngôn ngữ — Rust, Python, Ruby, Java, Go, PHP, Elixir, C#, TypeScript — cộng với máy chủ CLI, REST API và MCP.

9.2k sao576 fork

README

Xberg

Bindings Rust Python Node.js WASM Java Go C# PHP Ruby Elixir Dart Kotlin Swift Zig C FFI Docker Helm chart License Documentation Hugging Face
Join Discord Live Demo GitHub Stars

Công cụ xử lý tài liệu nhanh chóng, chính xác — dành cho mọi ngôn ngữ.

Trỏ Xberg vào bất cứ thứ gì — PDF, hình ảnh được quét, bảng tính, tệp âm thanh, URL, toàn bộ kho lưu trữ hoặc cây nguồn — và lấy lại văn bản, bảng, siêu dữ liệu và dữ liệu có cấu trúc rõ ràng. Một công cụ xử lý việc phát hiện, đọc, OCR và trích xuất định dạng, do đó bạn không bao giờ kết hợp một quy trình với nhau từ hàng tá thư viện.

100 định dạng · 120 phần mở rộng tệp · 371 ngôn ngữ mã · 15 ràng buộc ngôn ngữ · 6 định dạng đầu ra · OCR · phiên âm · nhúng

Công cụ chuyển PDF sang Markdown và tài liệu nguồn mở nhanh nhất, chính xác nhất — xem điểm chuẩn.

cài đặt · Những gì bạn nhận được · Khả năng · CLI · Tài liệu

Xberg là phiên bản tiếp theo của Kreuzberg. Cùng một công cụ xử lý tài liệu thông minh, được xây dựng lại và đổi tên thành dòng v1 mới.


Những gì bạn nhận được

Hướng Xberg vào bất cứ thứ gì — PDF, bảng tính, hình ảnh được quét, tệp âm thanh, URL, kho lưu trữ, cây nguồn — và lấy lại nội dung có cấu trúc, rõ ràng mà bạn có thể sử dụng ngay. Một lõi thực hiện việc phát hiện, đọc và trích xuất định dạng, do đó bạn không cần phải tự mình lắp ráp một quy trình. Gọi nó từ Rust, Python, Node.js, Go, Java, C#, Ruby, PHP, Elixir, Dart, Swift, Zig, WASM, Kotlin hoặc C FFI và chạy nó dưới dạng thư viện, công cụ CLI, máy chủ REST API hoặc MCP.

Khả năng Những gì bạn nhận được
100 định dạng tài liệu PDF, Office, hình ảnh, HTML, email, sách điện tử, ấn phẩm khoa học, dữ liệu có cấu trúc trên 120 phần mở rộng tệp - phát hiện MIME thông minh, phát trực tuyến các tệp nhiều GB.
URL và web Hướng Xberg vào một http(s) URL — nó tìm nạp và trích xuất một tài liệu hoặc thu thập thông tin và đi theo các liên kết (Chế độ Tự động / Tài liệu / Thu thập thông tin thông qua tảng băng trôi động cơ). Yêu cầu url-ingestion tính năng.
Phiên âm âm thanh và video Chuyển giọng nói thành văn bản từ các bản nhạc MP3, M4A, WAV, WebM và MP4 thông qua Whisper ONNX (nhỏ → lớn-v3). Yêu cầu transcription tính năng.
Lưu trữ, duyệt qua Liệt kê và đệ quy trích xuất lồng nhau .zip, .tar, .gz, .7z — tài liệu bên trong tài liệu — được bảo vệ bằng zip-bom, tỷ lệ nén và giới hạn độ sâu lồng nhau.
OCR theo yêu cầu Phần phụ trợ Tesseract, PaddleOCR, Candle hoặc VLM - chuỗi dự phòng, điểm tin cậy, tự động phát hiện ngôn ngữ, có thể mở rộng thông qua plugin.
Bố cục & bảng Các mô hình bố cục ML (PP-DocLayout-V3, RT-DETR) và cấu trúc bảng (TATR, SLANet) tái cấu trúc thứ tự đọc và lưới ô để Markdown rõ ràng.
Mã thông minh Hàm, lớp, nhập, ký hiệu, chuỗi tài liệu từ 371 ngôn ngữ lập trình. Phân đoạn nhận biết cú pháp cho đường ống RAG.
Nhúng và tìm kiếm Nội dung nhúng cục bộ (ONNX) hoặc do nhà cung cấp lưu trữ (165 nhà cung cấp thông qua lít-LLM), xếp hạng lại bộ mã hóa chéo và thưa thớt và tương tác muộn.
Làm giàu NER, trích xuất từ khóa (YAKE/RAKE), tóm tắt, dịch, biên tập, phân loại trang, phát hiện QR, phát hiện ngôn ngữ, giảm mã thông báo (TOON).
Trích xuất có cấu trúc JSON dựa trên lược đồ trực tiếp từ bất kỳ tài liệu nào qua cục bộ (Ollama, LM Studio, vLLM) hoặc LLM được lưu trữ — không cần kỹ thuật nhanh chóng.
6 định dạng đầu ra Văn bản thuần túy, Markdown, Djot, HTML, cây JSON hoặc Có cấu trúc (cùng văn bản với Văn bản thuần túy, được gắn thẻ bằng structured nhãn siêu dữ liệu).
Chạy mọi nơi Thư viện, CLI (12 lệnh), REST API (xberg serve), máy chủ MCP, Docker, Helm — không cần GPU. Bộ nhớ đệm nội dung băm, hàng loạt song song, thời gian chờ cho mỗi tệp.

Khả năng được đánh dấu yêu cầu một tính năng là các cờ tính năng Hàng hóa trên thùng lõi (url-ingestion, transcription, reranker, bố cục/ORT). Các gói ngôn ngữ dựng sẵn và gói hình ảnh Docker là tập hợp chung; bản dựng từ nguồn chỉ kích hoạt những gì bạn chọn.


Cài đặt

Gói ngôn ngữ

Python
pip install xberg

Xem Python ĐỌC để có tài liệu đầy đủ.

Node.js / TypeScript
npm install @xberg-io/xberg

Xem Node.js ĐỌC để có tài liệu đầy đủ.

Rust
cargo add xberg

Xem Rust ĐỌC để có tài liệu đầy đủ.

Đi
go get github.com/xberg-io/xberg/packages/go@latest

⚠️ Gốc kho lưu trữ không phải là mô-đun Go — go get github.com/xberg-io/xberg sẽ thất bại. Luôn nhắm mục tiêu /packages/go thư mục con như được hiển thị ở trên.

Xem Đi ĐỌC KỸ để có tài liệu đầy đủ.

Java

Có sẵn trên Maven Central dưới dạng io.xberg:xberg. Xem Java README cho đoạn mã phụ thuộc.

C#
dotnet add package Xberg

Xem C# README để có tài liệu đầy đủ.

hồng ngọc
gem install xberg

Xem Ruby README để có tài liệu đầy đủ.

PHP
composer require xberg-io/xberg

Xem ĐỌC PHP để có tài liệu đầy đủ.

thuốc tiên

Thêm {:xberg, "~> 1.0"} đến của bạn mix.exs sự phụ thuộc. Xem Thuốc tiên README để có tài liệu đầy đủ.

WebAssembly
npm install @xberg-io/xberg-wasm

Xem WebAssembly README để có tài liệu đầy đủ.

Kotlin (Android)

Có sẵn trên Maven Central dưới dạng io.xberg:xberg-android. Xem Kotlin ĐỌC cho đoạn mã phụ thuộc.

Swift

Thêm thông qua Trình quản lý gói Swift. Xem Swift README để có tài liệu đầy đủ.

Phi tiêu / rung
dart pub add xberg

Xem Phi tiêu README để có tài liệu đầy đủ.

ngoằn ngoèo

Thêm qua zig fetch. Xem Zig ĐỌC TÔI để có tài liệu đầy đủ.

C/C++ (FFI)

Xây dựng từ nguồn như một phần của không gian làm việc này. Xem C (FFI) README để có tài liệu đầy đủ.

CLI & Triển khai

Công cụ CLI
brew install xberg-io/tap/xberg

12 lệnh: extract, batch, detect, formats, version, cache (số liệu thống kê/rõ ràng/biểu hiện/ấm), serve, mcp, api, embed, chunk, completions.

Xem hướng dẫn sử dụng CLI để biết tài liệu chi tiết.

Docker
docker pull ghcr.io/xberg-io/xberg:latest

Chạy ở chế độ API, CLI hoặc MCP. Xem hướng dẫn Docker để biết ví dụ.

Máy chủ REST API
xberg serve --host 0.0.0.0 --port 8000

Một điểm cuối POST xử lý tất cả các định dạng. Trả về JSON hoặc Markdown. Truyền phát các tập tin lớn. Xem Hướng dẫn máy chủ API.

Máy chủ MCP
xberg mcp --transport stdio

9 công cụ (giải nén, extract_batch, detect_mime_type, cache_stats, list_formats, cache_clear, get_version, cache_manifest, cache_warm). 3 lời nhắc (extract_document, extract_with_ocr, Semantic_search). 4 tài nguyên (định dạng, mô hình, ngôn ngữ OCR, cài đặt trước nhúng).

Thêm vào Claude Desktop hoặc Cursor:

{
  "mcpServers": {
    "xberg": { "command": "xberg", "args": ["mcp"] }
  }
}

Xem Hướng dẫn tích hợp MCP.

Trợ lý mã hóa AI

Cài đặt plugin Xberg từ xberg-io/xberg. Cung cấp các API trích xuất, chương trình phụ trợ OCR, cấu hình và quy ước ngôn ngữ.

Claude Code
/plugin marketplace add xberg-io/xberg
/plugin install xberg@xberg
Codex CLI
/plugins add https://github.com/xberg-io/xberg

Tìm kiếm xberg và chọn Cài đặt plugin.

Cursor

Cài đặt → Plugin → Thêm từ URL → https://github.com/xberg-io/xberg, sau đó chọn xberg.

Gemini CLI
gemini extensions install https://github.com/xberg-io/xberg
Nhà máy Droid
droid plugin marketplace add https://github.com/xberg-io/xberg
droid plugin install xberg@xberg
GitHub Copilot CLI
copilot plugin marketplace add https://github.com/xberg-io/xberg
copilot plugin install xberg@xberg
mã mở

Thêm vào opencode.json:

{
  "$schema": "https://opencode.ai/config.json",
  "plugin": ["@xberg-io/opencode-xberg"]
}

Bắt đầu nhanh

Trích xuất văn bản từ một tài liệu:

use xberg::{extract, ExtractInput, ExtractionConfig};

#[tokio::main]
async fn main() -> xberg::Result<()> {
    let config = ExtractionConfig::default();
    let output = extract(
        ExtractInput::from_uri("document.pdf"),
        &config
    ).await?;

    println!("{}", output.results[0].content);
    Ok(())
}

Các trường hợp sử dụng phổ biến - xem Hướng dẫn bắt đầu nhanh để biết các ví dụ dành riêng cho ngôn ngữ, OCR, xử lý hàng loạt và cấu hình API.


Khả năng

Danh sách đầy đủ tính năng

Định dạng tệp được hỗ trợ (100 định dạng · 120 phần mở rộng tệp)

100 định dạng trên 120 phần mở rộng tệp thuộc 8 danh mục chính với khả năng phát hiện định dạng thông minh và trích xuất siêu dữ liệu toàn diện.

Tài liệu văn phòng

Danh mục Định dạng Khả năng
Xử lý văn bản .docx, .docm, .doc, .dotx, .dotm, .dot, .odt, .pages, .wpd, .wp, .wp5, .wp6 Toàn văn, bảng, hình ảnh, siêu dữ liệu, kiểu
Bảng tính .xlsx, .xlsm, .xlsb, .xls, .xla, .xlam, .xltm, .xltx, .xlt, .ods, .numbers Dữ liệu trang tính, công thức, siêu dữ liệu ô, biểu đồ
Bài thuyết trình .pptx, .pptm, .ppt, .ppsx, .potx, .potm, .pot, .odp, .key Trang trình bày, ghi chú của người thuyết trình, hình ảnh, siêu dữ liệu
PDF .pdf Văn bản, bảng biểu, hình ảnh, siêu dữ liệu, hỗ trợ OCR
sách điện tử .epub, .fb2 Các chương, siêu dữ liệu, tài nguyên được nhúng
Cơ sở dữ liệu .dbf Trích xuất dữ liệu bảng, hỗ trợ loại trường
Hangul .hwp, .hwpx Định dạng tài liệu tiếng Hàn, trích xuất văn bản

Hình ảnh (Bật OCR)

Danh mục Định dạng Tính năng
Raster .png, .jpg, .jpeg, .gif, .webp, .bmp, .tiff, .tif OCR, phát hiện bảng, siêu dữ liệu EXIF, kích thước, không gian màu
Nâng cao .jp2, .jpx, .jpm, .mj2, .jbig2, .jb2, .pnm, .pbm, .pgm, .ppm OCR thông qua bộ giải mã pure-Rust JPEG2000, hỗ trợ JBIG2, phát hiện bảng
gia đình HEIC .heic, .heics, .heif, .avif, .avcs Siêu dữ liệu EXIF, giải mã pixel tùy chọn
Vectơ .svg Phân tích cú pháp DOM, văn bản nhúng, siêu dữ liệu đồ họa

Âm thanh & Video

Danh mục Định dạng Tính năng
Âm thanh .mp3, .mpga, .m4a, .wav, .webm Phiên âm thì thầm
Đoạn âm thanh video .mp4, .mpeg, .webm Chỉ phiên âm bản nhạc

Web & Dữ liệu

Danh mục Định dạng Tính năng
Đánh dấu .html, .htm, .xhtml, .xml, .svg Phân tích cú pháp DOM, siêu dữ liệu (Open Graph, Twitter Card), trích xuất liên kết
Dữ liệu có cấu trúc .json, .yaml, .yml, .toml, .csv, .tsv Phát hiện lược đồ, cấu trúc lồng nhau, xác nhận
Văn bản & Đánh dấu .txt, .md, .markdown, .djot, .mdx, .rst, .org, .rtf CommonMark, GFM, Djot, MDX, reStructuredText, Chế độ tổ chức

Email & Lưu trữ

Danh mục Định dạng Tính năng
Email .eml, .msg, .pst Tiêu đề, nội dung (HTML/plain), tệp đính kèm, luồng
Lưu trữ .zip, .tar, .tgz, .gz, .7z Danh sách tệp, lưu trữ lồng nhau, siêu dữ liệu, trích xuất đệ quy

Học thuật & Khoa học

Danh mục Định dạng Tính năng
Trích dẫn .bib, .ris, .nbib, .enw Phân tích cú pháp có cấu trúc: RIS, PubMed/MEDLINE, EndNote XML, BibTeX/BibLaTeX
khoa học .tex, .latex, .typ, .typst, .jats, .ipynb Sổ ghi chép LaTeX, Typst, Jupyter, PubMed JATS
Xuất bản .fb2, .docbook, .dbk, .docbook4, .docbook5, .opml Tóm tắt FictionBook, DocBook XML, OPML

Mã thông minh (371 ngôn ngữ)

Trích xuất cấu trúc từ 371 ngôn ngữ lập trình thông qua người trông cây:

tính năng Mô tả
Khai thác cấu trúc Hàm, lớp, phương thức, cấu trúc, giao diện, enum
Phân tích xuất nhập khẩu Phụ thuộc mô-đun, tái xuất, nhập ký tự đại diện
Trích xuất ký hiệu Biến, hằng, bí danh loại, thuộc tính
Phân tích chuỗi tài liệu Các định dạng Google, NumPy, Sphinx, JSDoc, RustDoc và hơn 10 định dạng
Phân đoạn nhận biết cú pháp Tách mã theo ranh giới ngữ nghĩa cho đường ống RAG
Chẩn đoán Phân tích lỗi theo vị trí dòng/cột

Được cung cấp bởi gói ngôn ngữ-người trông cây.

Định dạng đầu ra (6)

định dạng Trường hợp sử dụng Ví dụ
đồng bằng Văn bản thô, không có đánh dấu "Chapter 1\nIntroduction"
Giảm giá Dễ đọc, có cấu trúc, thân thiện với RAG "# Chapter 1\n## Introduction"
Djot Đánh dấu nhẹ hiện đại Tương tự như Markdown nhưng chặt chẽ hơn
HTML Kiểu dáng, sẵn sàng cho trình duyệt <h1>Chapter 1</h1>
JSON Cấu trúc cây có thể đọc được bằng máy Phần phân cấp với cấp độ tiêu đề
Có cấu trúc Nội dung văn bản thuần túy giống như đồng bằng, chỉ được phân biệt bởi structured nhãn siêu dữ liệu định dạng đầu ra Byte giống hệt với đầu ra đơn giản

Chế độ triển khai

Chế độ Lệnh Vận chuyển Trường hợp sử dụng
Thư viện xberg::extract() Hàm không đồng bộ Nhúng vào ứng dụng của bạn
CLI xberg extract document.pdf 12 lệnh Tập lệnh, công việc hàng loạt, CI/CD
Còn lại API xberg serve HTTP BÀI ĐĂNG Triển khai microservice, serverless
Máy chủ MCP xberg mcp stdio hoặc HTTP Claude, Cursor, tác nhân IDE
Docker docker run ghcr.io/xberg-io/xberg Tất cả các chế độ Triển khai vùng chứa

Phần cuối OCR

  • Tesseract — C FFI gốc (Linux/macOS/Windows) và WASM (trình duyệt)
  • Mái chèoOCR - ONNX Runtime, mô hình được tối ưu hóa cho thiết bị di động
  • Nến — thuần túy Rust, chỉ có CPU, nhẹ
  • VLM — GPT-4 Vision, Claude Vision, Gemini Vision hoặc 165 nhà cung cấp thông qua lít-LLM

Chuỗi dự phòng. Có thể mở rộng thông qua hệ thống plugin.

Nhúng

Cục bộ (Thời gian chạy ONNX):

  • Model cài sẵn: nhanh, cân bằng (mặc định), chất lượng, đa ngôn ngữ
  • Kích thước: 384, 768, 1024

Được lưu trữ bởi nhà cung cấp:

  • Tổng cộng OpenAI, Anthropic, Google, Hugging Face, Mistral, Cohere và 165 nhà cung cấp
  • qua lít-LLM hội nhập

Sắp xếp lại:

  • Trình xếp hạng lại ONNX cục bộ (mô hình mã hóa chéo)
  • Nhà cung cấp lưu trữ: Cohere Rerank, những nhà cung cấp khác

Trích xuất có cấu trúc LLM

Công cụ cục bộ: Ollama, LM Studio, vLLM

Từ xa: OpenAI, Anthropic, Google, Mistral, Cohere và 165 nhà cung cấp thông qua lít-LLM

Xác thực lược đồ. Điều chỉnh nhiệt độ, top-p, tần số.

Làm giàu

  • NER — Nhận dạng thực thể dựa trên GLiNER hoặc LLM
  • biên tập — Mặt nạ PII (điện thoại, email, SSN, thẻ tín dụng, địa chỉ)
  • Tóm tắt — Tóm tắt tài liệu và phần qua LLM
  • Dịch thuật — Đa ngôn ngữ qua LLM
  • Phân loại trang - Gắn thẻ các trang tài liệu (bìa, toc, nội dung, v.v.)
  • Phát hiện mã QR - Trích xuất và giải mã mã QR từ hình ảnh
  • Trích xuất từ khóa - Thuật toán YAKE hoặc RAKE
  • Phát hiện ngôn ngữ - Phát hiện ngôn ngữ tài liệu
  • Phát hiện bố cục — Mô hình RT-DETR + TATR cho cấu trúc tài liệu
  • Trích xuất bảng - Cấu trúc và nội dung cấp độ tế bào
  • Giảm mã thông báo — Định dạng dây TOON (ít hơn ~30–50% mã thông báo so với JSON)

CLI Tham khảo

Tất cả 12 lệnh
Lệnh Lệnh phụ Mục đích
extract Trích xuất văn bản từ một tài liệu (đường dẫn, URL hoặc stdin)
batch Trích xuất song song nhiều tài liệu
detect Xác định loại MIME của tệp
formats Liệt kê tất cả các định dạng và loại MIME được hỗ trợ
version Hiển thị phiên bản Xberg
cache stats, clear, manifest, warm Quản lý bộ đệm và mô hình trích xuất
serve Khởi động máy chủ REST API (mặc định: HTTP://127.0.0.1:8000)
mcp Khởi động máy chủ MCP (stdio hoặc HTTP vận chuyển)
api schema Thông số kỹ thuật OpenAPI 3.1 đầu ra
embed Tạo nội dung nhúng cho văn bản (cục bộ hoặc do nhà cung cấp lưu trữ)
chunk Chia văn bản thành các đoạn (văn bản, đánh dấu, YAML hoặc ngữ nghĩa)
completions Tạo tập lệnh hoàn thành shell

Chạy xberg --help hoặc xberg <command> --help để biết các tùy chọn chi tiết.


Tài liệu

Hướng dẫn đầy đủ, tài liệu tham khảo API cho mọi tài liệu liên kết, tham chiếu định dạng và cấu hình có tại xberg.io.


Được xây dựng với Xberg

Các dự án tuyên bố Xberg là một phần phụ thuộc. Xberg trước đây đã được xuất bản dưới dạng kreuzberg, và hầu hết các dự án này đều khai báo gói dưới tên đó.

dự án Nó là gì Ngôi sao
kẻ hèn hạ Lớp nội dung và bối cảnh AI dành cho các tác nhân mã hóa trên một máy chủ MCP: bản đồ mã, tài liệu RAG, bộ nhớ dùng chung và thu thập dữ liệu web Stars
cơn lũ Một bộ máy chủ MCP và công cụ CLI giúp LLM của bạn tìm kiếm tốt hơn và ít ảo giác hơn Stars
docs-MCP-server Máy chủ tài liệu có căn cứ MCP, một giải pháp thay thế nguồn mở cho Context7, Nia và Ref.Tools Stars
kỷ nguyên Nền tảng AI nguồn mở Stars
gửi nhanh-CLI Máy chủ CLI và MCP cho Fastmail: email, danh bạ, email ẩn, tệp đính kèm và trích xuất văn bản Stars
cổng thông tin ghfdb Cổng thông tin web về Cơ sở dữ liệu dòng nhiệt toàn cầu Stars
hawki-toolkit-file-chuyển đổi Chuẩn bị và chuyển đổi các tệp PDF cho bộ công cụ HAWKI Stars
tích hợp lõi cỏ khô Tích hợp mở rộng Haystack với các thành phần bổ sung và kho tài liệu Stars
kreuzakt Công cụ tìm kiếm dành cho con người và máy tính, nhằm vào những tài liệu nhàm chán nhất của bạn Stars
ong nhỏ Toàn bộ kho AI cục bộ trong một tệp thực thi, với tính năng tìm kiếm hội thoại và các câu trả lời được trích dẫn trên các tệp, mã và web của bạn Stars
LLM-workflow-engine Power CLI và trình quản lý quy trình làm việc cho LLM Stars
NGƯỜI NHỆN Quét toàn bộ mạng để tìm các tệp nằm trên chia sẻ SMB, tìm kiếm tên tệp hoặc nội dung bằng biểu thức chính quy Stars
otoroshi-LLM-phần mở rộng Kết nối, bảo mật và quản lý các mô hình LLM đằng sau một API tương thích với OpenAI Stars
sàng-kg Biến tập hợp tài liệu thành biểu đồ tri thức, trích xuất các thực thể và mối quan hệ bằng LLM Stars
sóc chuột Biến dữ liệu thô thành lớp thông minh và tìm kiếm theo thời gian thực, tự phát triển Stars
hỗ trợ-chatbot Chatbot hỗ trợ cấp 1 cho đội chữ thập đỏ Hà Lan 510 Stars

Sử dụng Xberg trong dự án của bạn? Mở một PR thêm nó vào danh sách này.


Đóng góp

Đóng góp được chào đón! Xem ĐÓNG GÓP.md để biết hướng dẫn.

Tham gia của chúng tôi Cộng đồng bất hòa cho các câu hỏi và thảo luận.


Một phần của Xberg.dev

Xberg là một trong sáu dự án nguồn mở của Kreuzberg, Inc.:

  • Xberg — thông tin tài liệu: văn bản, bảng biểu, siêu dữ liệu từ 100 định dạng với OCR tùy chọn.
  • Doanh nghiệp Xberg — trích xuất được quản lý API với SDK, trang tổng quan và khả năng quan sát.
  • tảng băng trôi — thu thập dữ liệu và quét web bằng HTML→Markdown và dự phòng Chrome không đầu.
  • html-để đánh dấu — công cụ HTML→Markdown nhanh, không mất dữ liệu.
  • lít-LLM — ứng dụng khách LLM API phổ quát với các liên kết gốc cho 14 ngôn ngữ và 165 nhà cung cấp.
  • gói ngôn ngữ-người trông cây — các ngữ pháp chăm sóc cây và các nguyên tắc thông minh mã.
  • alef — trình tạo liên kết đa ngôn ngữ tạo ra mọi liên kết theo từng ngôn ngữ trên 5 kho lưu trữ đa ngôn ngữ.

Giấy phép

Giấy phép MIT (MIT) - xem GIẤY PHÉP để biết chi tiết.

Dự án cùng danh mục

supabase/supabase

Nền tảng phát triển Postgres. Supabase cung cấp cho bạn cơ sở dữ liệu Postgres chuyên dụng để xây dựng các ứng dụng web, thiết bị di động và AI của bạn.

108k14k10 phút trước
GitHubRAG / Truy hồiTypeScript

opendataloader-project/opendataloader-pdf

Trình phân tích cú pháp PDF cho dữ liệu sẵn sàng cho AI. Tự động hóa khả năng truy cập PDF. Nguồn mở.

29k2.7k10 giờ trước
GitHubRAG / Truy hồiJava

zhaoxuya520/reverse-skill

Kỹ thuật đảo ngược / Kiểm tra thâm nhập được ủy quyền / Gói bộ định tuyến kỹ năng nghiên cứu bảo mật Định tuyến được hỗ trợ bởi AI + Khởi động chuỗi công cụ theo yêu cầu + Cơ sở kiến thức tự phát triển Hỗ trợ Claude Code, Kiro, Cursor, Cline và các ứng dụng khách mã hóa AI khác 逆向/渗透/安全技能路由包 - AI 自动路由 +按需自举工具链 + 自动进化经验库 | 支持 Claude Code / Kiro / Cursor / Cline 等代码 AI 客户端

29k3.9k17 giờ trước
GitHubRAG / Truy hồiPowerShell

RyanCodrai/turbovec

Chỉ mục vectơ được xây dựng trên TurboQuant, được viết bằng Rust với các liên kết Python

16k1.4k3 ngày trước
GitHubRAG / Truy hồiRust

Future-House/paper-qa

Độ chính xác cao RAG để trả lời các câu hỏi từ tài liệu khoa học có trích dẫn

9.1k91112 ngày trước
GitHubRAG / Truy hồiPython

vespa-engine/vespa

Nền tảng tìm kiếm AI

7.1k7352 giờ trước
GitHubRAG / Truy hồiJava