xberg-io/xberg
Khung trí tuệ tài liệu đa ngôn ngữ có lõi Rust. Trích xuất văn bản, siêu dữ liệu, hình ảnh và dữ liệu có cấu trúc từ 101 định dạng (115 phần mở rộng tệp) cộng với mã thông minh cho 371 ngôn ngữ mã. 15 liên kết ngôn ngữ — Rust, Python, Ruby, Java, Go, PHP, Elixir, C#, TypeScript — cộng với máy chủ CLI, REST API và MCP.
README
Xberg
Công cụ xử lý tài liệu nhanh chóng, chính xác — dành cho mọi ngôn ngữ.
Trỏ Xberg vào bất cứ thứ gì — PDF, hình ảnh được quét, bảng tính, tệp âm thanh, URL, toàn bộ kho lưu trữ hoặc cây nguồn — và lấy lại văn bản, bảng, siêu dữ liệu và dữ liệu có cấu trúc rõ ràng. Một công cụ xử lý việc phát hiện, đọc, OCR và trích xuất định dạng, do đó bạn không bao giờ kết hợp một quy trình với nhau từ hàng tá thư viện.
100 định dạng · 120 phần mở rộng tệp · 371 ngôn ngữ mã · 15 ràng buộc ngôn ngữ · 6 định dạng đầu ra · OCR · phiên âm · nhúng
Công cụ chuyển PDF sang Markdown và tài liệu nguồn mở nhanh nhất, chính xác nhất — xem điểm chuẩn.
cài đặt · Những gì bạn nhận được · Khả năng · CLI · Tài liệu
Xberg là phiên bản tiếp theo của Kreuzberg. Cùng một công cụ xử lý tài liệu thông minh, được xây dựng lại và đổi tên thành dòng v1 mới.
Những gì bạn nhận được
Hướng Xberg vào bất cứ thứ gì — PDF, bảng tính, hình ảnh được quét, tệp âm thanh, URL, kho lưu trữ, cây nguồn — và lấy lại nội dung có cấu trúc, rõ ràng mà bạn có thể sử dụng ngay. Một lõi thực hiện việc phát hiện, đọc và trích xuất định dạng, do đó bạn không cần phải tự mình lắp ráp một quy trình. Gọi nó từ Rust, Python, Node.js, Go, Java, C#, Ruby, PHP, Elixir, Dart, Swift, Zig, WASM, Kotlin hoặc C FFI và chạy nó dưới dạng thư viện, công cụ CLI, máy chủ REST API hoặc MCP.
| Khả năng | Những gì bạn nhận được |
|---|---|
| 100 định dạng tài liệu | PDF, Office, hình ảnh, HTML, email, sách điện tử, ấn phẩm khoa học, dữ liệu có cấu trúc trên 120 phần mở rộng tệp - phát hiện MIME thông minh, phát trực tuyến các tệp nhiều GB. |
| URL và web | Hướng Xberg vào một http(s) URL — nó tìm nạp và trích xuất một tài liệu hoặc thu thập thông tin và đi theo các liên kết (Chế độ Tự động / Tài liệu / Thu thập thông tin thông qua tảng băng trôi động cơ). Yêu cầu url-ingestion tính năng. |
| Phiên âm âm thanh và video | Chuyển giọng nói thành văn bản từ các bản nhạc MP3, M4A, WAV, WebM và MP4 thông qua Whisper ONNX (nhỏ → lớn-v3). Yêu cầu transcription tính năng. |
| Lưu trữ, duyệt qua | Liệt kê và đệ quy trích xuất lồng nhau .zip, .tar, .gz, .7z — tài liệu bên trong tài liệu — được bảo vệ bằng zip-bom, tỷ lệ nén và giới hạn độ sâu lồng nhau. |
| OCR theo yêu cầu | Phần phụ trợ Tesseract, PaddleOCR, Candle hoặc VLM - chuỗi dự phòng, điểm tin cậy, tự động phát hiện ngôn ngữ, có thể mở rộng thông qua plugin. |
| Bố cục & bảng | Các mô hình bố cục ML (PP-DocLayout-V3, RT-DETR) và cấu trúc bảng (TATR, SLANet) tái cấu trúc thứ tự đọc và lưới ô để Markdown rõ ràng. |
| Mã thông minh | Hàm, lớp, nhập, ký hiệu, chuỗi tài liệu từ 371 ngôn ngữ lập trình. Phân đoạn nhận biết cú pháp cho đường ống RAG. |
| Nhúng và tìm kiếm | Nội dung nhúng cục bộ (ONNX) hoặc do nhà cung cấp lưu trữ (165 nhà cung cấp thông qua lít-LLM), xếp hạng lại bộ mã hóa chéo và thưa thớt và tương tác muộn. |
| Làm giàu | NER, trích xuất từ khóa (YAKE/RAKE), tóm tắt, dịch, biên tập, phân loại trang, phát hiện QR, phát hiện ngôn ngữ, giảm mã thông báo (TOON). |
| Trích xuất có cấu trúc | JSON dựa trên lược đồ trực tiếp từ bất kỳ tài liệu nào qua cục bộ (Ollama, LM Studio, vLLM) hoặc LLM được lưu trữ — không cần kỹ thuật nhanh chóng. |
| 6 định dạng đầu ra | Văn bản thuần túy, Markdown, Djot, HTML, cây JSON hoặc Có cấu trúc (cùng văn bản với Văn bản thuần túy, được gắn thẻ bằng structured nhãn siêu dữ liệu). |
| Chạy mọi nơi | Thư viện, CLI (12 lệnh), REST API (xberg serve), máy chủ MCP, Docker, Helm — không cần GPU. Bộ nhớ đệm nội dung băm, hàng loạt song song, thời gian chờ cho mỗi tệp. |
Khả năng được đánh dấu yêu cầu một tính năng là các cờ tính năng Hàng hóa trên thùng lõi (
url-ingestion,transcription,reranker, bố cục/ORT). Các gói ngôn ngữ dựng sẵn và gói hình ảnh Docker là tập hợp chung; bản dựng từ nguồn chỉ kích hoạt những gì bạn chọn.
Cài đặt
Gói ngôn ngữ
Đi
go get github.com/xberg-io/xberg/packages/go@latest
⚠️ Gốc kho lưu trữ không phải là mô-đun Go —
go get github.com/xberg-io/xbergsẽ thất bại. Luôn nhắm mục tiêu/packages/gothư mục con như được hiển thị ở trên.
Xem Đi ĐỌC KỸ để có tài liệu đầy đủ.
Java
Có sẵn trên Maven Central dưới dạng io.xberg:xberg. Xem Java README cho đoạn mã phụ thuộc.
thuốc tiên
Thêm {:xberg, "~> 1.0"} đến của bạn mix.exs sự phụ thuộc. Xem Thuốc tiên README để có tài liệu đầy đủ.
Kotlin (Android)
Có sẵn trên Maven Central dưới dạng io.xberg:xberg-android. Xem Kotlin ĐỌC cho đoạn mã phụ thuộc.
Swift
Thêm thông qua Trình quản lý gói Swift. Xem Swift README để có tài liệu đầy đủ.
ngoằn ngoèo
Thêm qua zig fetch. Xem Zig ĐỌC TÔI để có tài liệu đầy đủ.
C/C++ (FFI)
Xây dựng từ nguồn như một phần của không gian làm việc này. Xem C (FFI) README để có tài liệu đầy đủ.
CLI & Triển khai
Công cụ CLI
brew install xberg-io/tap/xberg
12 lệnh: extract, batch, detect, formats, version, cache (số liệu thống kê/rõ ràng/biểu hiện/ấm), serve, mcp, api, embed, chunk, completions.
Xem hướng dẫn sử dụng CLI để biết tài liệu chi tiết.
Docker
docker pull ghcr.io/xberg-io/xberg:latest
Chạy ở chế độ API, CLI hoặc MCP. Xem hướng dẫn Docker để biết ví dụ.
Máy chủ REST API
xberg serve --host 0.0.0.0 --port 8000
Một điểm cuối POST xử lý tất cả các định dạng. Trả về JSON hoặc Markdown. Truyền phát các tập tin lớn. Xem Hướng dẫn máy chủ API.
Máy chủ MCP
xberg mcp --transport stdio
9 công cụ (giải nén, extract_batch, detect_mime_type, cache_stats, list_formats, cache_clear, get_version, cache_manifest, cache_warm). 3 lời nhắc (extract_document, extract_with_ocr, Semantic_search). 4 tài nguyên (định dạng, mô hình, ngôn ngữ OCR, cài đặt trước nhúng).
Thêm vào Claude Desktop hoặc Cursor:
{
"mcpServers": {
"xberg": { "command": "xberg", "args": ["mcp"] }
}
}
Trợ lý mã hóa AI
Cài đặt plugin Xberg từ xberg-io/xberg. Cung cấp các API trích xuất, chương trình phụ trợ OCR, cấu hình và quy ước ngôn ngữ.
Claude Code
/plugin marketplace add xberg-io/xberg
/plugin install xberg@xberg
Codex CLI
/plugins add https://github.com/xberg-io/xberg
Tìm kiếm xberg và chọn Cài đặt plugin.
Cursor
Cài đặt → Plugin → Thêm từ URL → https://github.com/xberg-io/xberg, sau đó chọn xberg.
Gemini CLI
gemini extensions install https://github.com/xberg-io/xberg
Nhà máy Droid
droid plugin marketplace add https://github.com/xberg-io/xberg
droid plugin install xberg@xberg
GitHub Copilot CLI
copilot plugin marketplace add https://github.com/xberg-io/xberg
copilot plugin install xberg@xberg
mã mở
Thêm vào opencode.json:
{
"$schema": "https://opencode.ai/config.json",
"plugin": ["@xberg-io/opencode-xberg"]
}
Bắt đầu nhanh
Trích xuất văn bản từ một tài liệu:
use xberg::{extract, ExtractInput, ExtractionConfig};
#[tokio::main]
async fn main() -> xberg::Result<()> {
let config = ExtractionConfig::default();
let output = extract(
ExtractInput::from_uri("document.pdf"),
&config
).await?;
println!("{}", output.results[0].content);
Ok(())
}
Các trường hợp sử dụng phổ biến - xem Hướng dẫn bắt đầu nhanh để biết các ví dụ dành riêng cho ngôn ngữ, OCR, xử lý hàng loạt và cấu hình API.
Khả năng
Danh sách đầy đủ tính năng
Định dạng tệp được hỗ trợ (100 định dạng · 120 phần mở rộng tệp)
100 định dạng trên 120 phần mở rộng tệp thuộc 8 danh mục chính với khả năng phát hiện định dạng thông minh và trích xuất siêu dữ liệu toàn diện.
Tài liệu văn phòng
| Danh mục | Định dạng | Khả năng |
|---|---|---|
| Xử lý văn bản | .docx, .docm, .doc, .dotx, .dotm, .dot, .odt, .pages, .wpd, .wp, .wp5, .wp6 |
Toàn văn, bảng, hình ảnh, siêu dữ liệu, kiểu |
| Bảng tính | .xlsx, .xlsm, .xlsb, .xls, .xla, .xlam, .xltm, .xltx, .xlt, .ods, .numbers |
Dữ liệu trang tính, công thức, siêu dữ liệu ô, biểu đồ |
| Bài thuyết trình | .pptx, .pptm, .ppt, .ppsx, .potx, .potm, .pot, .odp, .key |
Trang trình bày, ghi chú của người thuyết trình, hình ảnh, siêu dữ liệu |
.pdf |
Văn bản, bảng biểu, hình ảnh, siêu dữ liệu, hỗ trợ OCR | |
| sách điện tử | .epub, .fb2 |
Các chương, siêu dữ liệu, tài nguyên được nhúng |
| Cơ sở dữ liệu | .dbf |
Trích xuất dữ liệu bảng, hỗ trợ loại trường |
| Hangul | .hwp, .hwpx |
Định dạng tài liệu tiếng Hàn, trích xuất văn bản |
Hình ảnh (Bật OCR)
| Danh mục | Định dạng | Tính năng |
|---|---|---|
| Raster | .png, .jpg, .jpeg, .gif, .webp, .bmp, .tiff, .tif |
OCR, phát hiện bảng, siêu dữ liệu EXIF, kích thước, không gian màu |
| Nâng cao | .jp2, .jpx, .jpm, .mj2, .jbig2, .jb2, .pnm, .pbm, .pgm, .ppm |
OCR thông qua bộ giải mã pure-Rust JPEG2000, hỗ trợ JBIG2, phát hiện bảng |
| gia đình HEIC | .heic, .heics, .heif, .avif, .avcs |
Siêu dữ liệu EXIF, giải mã pixel tùy chọn |
| Vectơ | .svg |
Phân tích cú pháp DOM, văn bản nhúng, siêu dữ liệu đồ họa |
Âm thanh & Video
| Danh mục | Định dạng | Tính năng |
|---|---|---|
| Âm thanh | .mp3, .mpga, .m4a, .wav, .webm |
Phiên âm thì thầm |
| Đoạn âm thanh video | .mp4, .mpeg, .webm |
Chỉ phiên âm bản nhạc |
Web & Dữ liệu
| Danh mục | Định dạng | Tính năng |
|---|---|---|
| Đánh dấu | .html, .htm, .xhtml, .xml, .svg |
Phân tích cú pháp DOM, siêu dữ liệu (Open Graph, Twitter Card), trích xuất liên kết |
| Dữ liệu có cấu trúc | .json, .yaml, .yml, .toml, .csv, .tsv |
Phát hiện lược đồ, cấu trúc lồng nhau, xác nhận |
| Văn bản & Đánh dấu | .txt, .md, .markdown, .djot, .mdx, .rst, .org, .rtf |
CommonMark, GFM, Djot, MDX, reStructuredText, Chế độ tổ chức |
Email & Lưu trữ
| Danh mục | Định dạng | Tính năng |
|---|---|---|
.eml, .msg, .pst |
Tiêu đề, nội dung (HTML/plain), tệp đính kèm, luồng | |
| Lưu trữ | .zip, .tar, .tgz, .gz, .7z |
Danh sách tệp, lưu trữ lồng nhau, siêu dữ liệu, trích xuất đệ quy |
Học thuật & Khoa học
| Danh mục | Định dạng | Tính năng |
|---|---|---|
| Trích dẫn | .bib, .ris, .nbib, .enw |
Phân tích cú pháp có cấu trúc: RIS, PubMed/MEDLINE, EndNote XML, BibTeX/BibLaTeX |
| khoa học | .tex, .latex, .typ, .typst, .jats, .ipynb |
Sổ ghi chép LaTeX, Typst, Jupyter, PubMed JATS |
| Xuất bản | .fb2, .docbook, .dbk, .docbook4, .docbook5, .opml |
Tóm tắt FictionBook, DocBook XML, OPML |
Mã thông minh (371 ngôn ngữ)
Trích xuất cấu trúc từ 371 ngôn ngữ lập trình thông qua người trông cây:
| tính năng | Mô tả |
|---|---|
| Khai thác cấu trúc | Hàm, lớp, phương thức, cấu trúc, giao diện, enum |
| Phân tích xuất nhập khẩu | Phụ thuộc mô-đun, tái xuất, nhập ký tự đại diện |
| Trích xuất ký hiệu | Biến, hằng, bí danh loại, thuộc tính |
| Phân tích chuỗi tài liệu | Các định dạng Google, NumPy, Sphinx, JSDoc, RustDoc và hơn 10 định dạng |
| Phân đoạn nhận biết cú pháp | Tách mã theo ranh giới ngữ nghĩa cho đường ống RAG |
| Chẩn đoán | Phân tích lỗi theo vị trí dòng/cột |
Được cung cấp bởi gói ngôn ngữ-người trông cây.
Định dạng đầu ra (6)
| định dạng | Trường hợp sử dụng | Ví dụ |
|---|---|---|
| đồng bằng | Văn bản thô, không có đánh dấu | "Chapter 1\nIntroduction" |
| Giảm giá | Dễ đọc, có cấu trúc, thân thiện với RAG | "# Chapter 1\n## Introduction" |
| Djot | Đánh dấu nhẹ hiện đại | Tương tự như Markdown nhưng chặt chẽ hơn |
| HTML | Kiểu dáng, sẵn sàng cho trình duyệt | <h1>Chapter 1</h1> |
| JSON | Cấu trúc cây có thể đọc được bằng máy | Phần phân cấp với cấp độ tiêu đề |
| Có cấu trúc | Nội dung văn bản thuần túy giống như đồng bằng, chỉ được phân biệt bởi structured nhãn siêu dữ liệu định dạng đầu ra |
Byte giống hệt với đầu ra đơn giản |
Chế độ triển khai
| Chế độ | Lệnh | Vận chuyển | Trường hợp sử dụng |
|---|---|---|---|
| Thư viện | xberg::extract() |
Hàm không đồng bộ | Nhúng vào ứng dụng của bạn |
| CLI | xberg extract document.pdf |
12 lệnh | Tập lệnh, công việc hàng loạt, CI/CD |
| Còn lại API | xberg serve |
HTTP BÀI ĐĂNG | Triển khai microservice, serverless |
| Máy chủ MCP | xberg mcp |
stdio hoặc HTTP | Claude, Cursor, tác nhân IDE |
| Docker | docker run ghcr.io/xberg-io/xberg |
Tất cả các chế độ | Triển khai vùng chứa |
Phần cuối OCR
- Tesseract — C FFI gốc (Linux/macOS/Windows) và WASM (trình duyệt)
- Mái chèoOCR - ONNX Runtime, mô hình được tối ưu hóa cho thiết bị di động
- Nến — thuần túy Rust, chỉ có CPU, nhẹ
- VLM — GPT-4 Vision, Claude Vision, Gemini Vision hoặc 165 nhà cung cấp thông qua lít-LLM
Chuỗi dự phòng. Có thể mở rộng thông qua hệ thống plugin.
Nhúng
Cục bộ (Thời gian chạy ONNX):
- Model cài sẵn: nhanh, cân bằng (mặc định), chất lượng, đa ngôn ngữ
- Kích thước: 384, 768, 1024
Được lưu trữ bởi nhà cung cấp:
- Tổng cộng OpenAI, Anthropic, Google, Hugging Face, Mistral, Cohere và 165 nhà cung cấp
- qua lít-LLM hội nhập
Sắp xếp lại:
- Trình xếp hạng lại ONNX cục bộ (mô hình mã hóa chéo)
- Nhà cung cấp lưu trữ: Cohere Rerank, những nhà cung cấp khác
Trích xuất có cấu trúc LLM
Công cụ cục bộ: Ollama, LM Studio, vLLM
Từ xa: OpenAI, Anthropic, Google, Mistral, Cohere và 165 nhà cung cấp thông qua lít-LLM
Xác thực lược đồ. Điều chỉnh nhiệt độ, top-p, tần số.
Làm giàu
- NER — Nhận dạng thực thể dựa trên GLiNER hoặc LLM
- biên tập — Mặt nạ PII (điện thoại, email, SSN, thẻ tín dụng, địa chỉ)
- Tóm tắt — Tóm tắt tài liệu và phần qua LLM
- Dịch thuật — Đa ngôn ngữ qua LLM
- Phân loại trang - Gắn thẻ các trang tài liệu (bìa, toc, nội dung, v.v.)
- Phát hiện mã QR - Trích xuất và giải mã mã QR từ hình ảnh
- Trích xuất từ khóa - Thuật toán YAKE hoặc RAKE
- Phát hiện ngôn ngữ - Phát hiện ngôn ngữ tài liệu
- Phát hiện bố cục — Mô hình RT-DETR + TATR cho cấu trúc tài liệu
- Trích xuất bảng - Cấu trúc và nội dung cấp độ tế bào
- Giảm mã thông báo — Định dạng dây TOON (ít hơn ~30–50% mã thông báo so với JSON)
CLI Tham khảo
Tất cả 12 lệnh
| Lệnh | Lệnh phụ | Mục đích |
|---|---|---|
extract |
— | Trích xuất văn bản từ một tài liệu (đường dẫn, URL hoặc stdin) |
batch |
— | Trích xuất song song nhiều tài liệu |
detect |
— | Xác định loại MIME của tệp |
formats |
— | Liệt kê tất cả các định dạng và loại MIME được hỗ trợ |
version |
— | Hiển thị phiên bản Xberg |
cache |
stats, clear, manifest, warm |
Quản lý bộ đệm và mô hình trích xuất |
serve |
— | Khởi động máy chủ REST API (mặc định: HTTP://127.0.0.1:8000) |
mcp |
— | Khởi động máy chủ MCP (stdio hoặc HTTP vận chuyển) |
api |
schema |
Thông số kỹ thuật OpenAPI 3.1 đầu ra |
embed |
— | Tạo nội dung nhúng cho văn bản (cục bộ hoặc do nhà cung cấp lưu trữ) |
chunk |
— | Chia văn bản thành các đoạn (văn bản, đánh dấu, YAML hoặc ngữ nghĩa) |
completions |
— | Tạo tập lệnh hoàn thành shell |
Chạy xberg --help hoặc xberg <command> --help để biết các tùy chọn chi tiết.
Tài liệu
Hướng dẫn đầy đủ, tài liệu tham khảo API cho mọi tài liệu liên kết, tham chiếu định dạng và cấu hình có tại xberg.io.
- Bắt đầu
- Bắt đầu nhanh
- Hướng dẫn
- Tham chiếu API (lõi Rust) — mọi ràng buộc đều có trang riêng bên dưới
/reference/ - Định dạng tham chiếu
- Bản trình diễn trực tiếp (trình duyệt, WASM)
Được xây dựng với Xberg
Các dự án tuyên bố Xberg là một phần phụ thuộc. Xberg trước đây đã được xuất bản dưới dạng kreuzberg, và hầu hết các dự án này đều khai báo gói dưới tên đó.
| dự án | Nó là gì | Ngôi sao |
|---|---|---|
| kẻ hèn hạ | Lớp nội dung và bối cảnh AI dành cho các tác nhân mã hóa trên một máy chủ MCP: bản đồ mã, tài liệu RAG, bộ nhớ dùng chung và thu thập dữ liệu web | |
| cơn lũ | Một bộ máy chủ MCP và công cụ CLI giúp LLM của bạn tìm kiếm tốt hơn và ít ảo giác hơn | |
| docs-MCP-server | Máy chủ tài liệu có căn cứ MCP, một giải pháp thay thế nguồn mở cho Context7, Nia và Ref.Tools | |
| kỷ nguyên | Nền tảng AI nguồn mở | |
| gửi nhanh-CLI | Máy chủ CLI và MCP cho Fastmail: email, danh bạ, email ẩn, tệp đính kèm và trích xuất văn bản | |
| cổng thông tin ghfdb | Cổng thông tin web về Cơ sở dữ liệu dòng nhiệt toàn cầu | |
| hawki-toolkit-file-chuyển đổi | Chuẩn bị và chuyển đổi các tệp PDF cho bộ công cụ HAWKI | |
| tích hợp lõi cỏ khô | Tích hợp mở rộng Haystack với các thành phần bổ sung và kho tài liệu | |
| kreuzakt | Công cụ tìm kiếm dành cho con người và máy tính, nhằm vào những tài liệu nhàm chán nhất của bạn | |
| ong nhỏ | Toàn bộ kho AI cục bộ trong một tệp thực thi, với tính năng tìm kiếm hội thoại và các câu trả lời được trích dẫn trên các tệp, mã và web của bạn | |
| LLM-workflow-engine | Power CLI và trình quản lý quy trình làm việc cho LLM | |
| NGƯỜI NHỆN | Quét toàn bộ mạng để tìm các tệp nằm trên chia sẻ SMB, tìm kiếm tên tệp hoặc nội dung bằng biểu thức chính quy | |
| otoroshi-LLM-phần mở rộng | Kết nối, bảo mật và quản lý các mô hình LLM đằng sau một API tương thích với OpenAI | |
| sàng-kg | Biến tập hợp tài liệu thành biểu đồ tri thức, trích xuất các thực thể và mối quan hệ bằng LLM | |
| sóc chuột | Biến dữ liệu thô thành lớp thông minh và tìm kiếm theo thời gian thực, tự phát triển | |
| hỗ trợ-chatbot | Chatbot hỗ trợ cấp 1 cho đội chữ thập đỏ Hà Lan 510 |
Sử dụng Xberg trong dự án của bạn? Mở một PR thêm nó vào danh sách này.
Đóng góp
Đóng góp được chào đón! Xem ĐÓNG GÓP.md để biết hướng dẫn.
Tham gia của chúng tôi Cộng đồng bất hòa cho các câu hỏi và thảo luận.
Một phần của Xberg.dev
Xberg là một trong sáu dự án nguồn mở của Kreuzberg, Inc.:
- Xberg — thông tin tài liệu: văn bản, bảng biểu, siêu dữ liệu từ 100 định dạng với OCR tùy chọn.
- Doanh nghiệp Xberg — trích xuất được quản lý API với SDK, trang tổng quan và khả năng quan sát.
- tảng băng trôi — thu thập dữ liệu và quét web bằng HTML→Markdown và dự phòng Chrome không đầu.
- html-để đánh dấu — công cụ HTML→Markdown nhanh, không mất dữ liệu.
- lít-LLM — ứng dụng khách LLM API phổ quát với các liên kết gốc cho 14 ngôn ngữ và 165 nhà cung cấp.
- gói ngôn ngữ-người trông cây — các ngữ pháp chăm sóc cây và các nguyên tắc thông minh mã.
- alef — trình tạo liên kết đa ngôn ngữ tạo ra mọi liên kết theo từng ngôn ngữ trên 5 kho lưu trữ đa ngôn ngữ.
Giấy phép
Giấy phép MIT (MIT) - xem GIẤY PHÉP để biết chi tiết.
Dự án cùng danh mục
Nền tảng phát triển Postgres. Supabase cung cấp cho bạn cơ sở dữ liệu Postgres chuyên dụng để xây dựng các ứng dụng web, thiết bị di động và AI của bạn.
Trình phân tích cú pháp PDF cho dữ liệu sẵn sàng cho AI. Tự động hóa khả năng truy cập PDF. Nguồn mở.
Kỹ thuật đảo ngược / Kiểm tra thâm nhập được ủy quyền / Gói bộ định tuyến kỹ năng nghiên cứu bảo mật Định tuyến được hỗ trợ bởi AI + Khởi động chuỗi công cụ theo yêu cầu + Cơ sở kiến thức tự phát triển Hỗ trợ Claude Code, Kiro, Cursor, Cline và các ứng dụng khách mã hóa AI khác 逆向/渗透/安全技能路由包 - AI 自动路由 +按需自举工具链 + 自动进化经验库 | 支持 Claude Code / Kiro / Cursor / Cline 等代码 AI 客户端
Chỉ mục vectơ được xây dựng trên TurboQuant, được viết bằng Rust với các liên kết Python
Độ chính xác cao RAG để trả lời các câu hỏi từ tài liệu khoa học có trích dẫn