Natuurlijke taalverwerking

77 projecten in AI & ML

sentence-transformers

@UKPLab

State-of-the-Art Embeddings, Retrieval, and Reranking

Maintainer in de EU Commit 2 dagen geleden ★ 19.123
73 4/5 gemeten

unstructured

@Unstructured-IO

Convert documents to structured data effortlessly. Unstructured is open-source ETL solution for transforming complex documents into clean, structured formats for language models. Visit our website to learn more about our enterprise grade Platform product for production grade workflows, partitioning, enrichments, chunking and embedding.

Apache-2.0 Commit 1 dag geleden ★ 15.501
73 4/5 gemeten

LanguageTool

@languagetool-org

Proofread more than 20 languages. It finds many errors that a simple spell checker cannot detect.

Zelf te hosten Commit vandaag ★ 15.089
72 5/5 gemeten

BettaFish

@666ghj

微舆:人人可用的多Agent舆情分析助手,打破信息茧房,还原舆情原貌,预测未来走向,辅助决策!从0实现,不依赖任何框架。

GPL-2.0 Commit 10 dagen geleden ★ 42.296
71 4/5 gemeten

bible

@thiagobodruk

Bible text in JSON and XML — 90 versions across 35 languages, ready for apps, verse search, and NLP/AI datasets

MIT Commit 2 dagen geleden ★ 741
65 4/5 gemeten

Ciphey

@bee-san

⚡ Automatically decrypt encryptions without knowing the key or cipher, decode encodings, and crack hashes ⚡

MIT Commit 8 dagen geleden ★ 21.633
65 4/5 gemeten

nltk

@nltk

NLTK Source

Apache-2.0 Commit 2 dagen geleden ★ 14.728
64 5/5 gemeten

tokenizers

@huggingface

💥 Fast State-of-the-Art Tokenizers optimized for Research and Production

Maintainer in de EU Commit 1 dag geleden ★ 11.119
64 5/5 gemeten

presidio

@data-privacy-stack

An open-source framework for detecting, redacting, masking, and anonymizing sensitive data (PII) across text, images, and structured data. Supports NLP, pattern matching, and customizable pipelines.

MIT Commit 2 dagen geleden ★ 11.045
64 4/5 gemeten

sie

@superlinked

Open-source inference server and production cluster for all the models your agent needs.

Apache-2.0 Commit vandaag ★ 3.324
64 4/5 gemeten

MOSS

@OpenMOSS

An open-source, tool-augmented conversational language model from Fudan University

Apache-2.0 Commit 20 dagen geleden ★ 12.256
63 4/5 gemeten

compromise

@spencermountain

modest natural-language processing

MIT Commit 1 dag geleden ★ 12.159
63 5/5 gemeten

sentencepiece

@google

Unsupervised text tokenizer for Neural Network-based text generation.

Apache-2.0 Commit vandaag ★ 12.101
62 5/5 gemeten

gensim

@piskvorky

Topic Modelling for Humans

LGPL-2.1 Commit 11 maanden geleden ★ 16.493
59 4/5 gemeten

flash-linear-attention

@fla-org

🚀 Efficient implementations for emerging model architectures

MIT Commit vandaag ★ 5.792
59 4/5 gemeten

awesome-legal-data

@openlegaldata

A collection of datasets and other resources for legal text processing.

Maintainer in de EU Commit 24 dagen geleden ★ 309
58 4/5 gemeten

lingvo

@tensorflow

Lingvo

Apache-2.0 Commit 3 maanden geleden ★ 2.864
58 5/5 gemeten

MNBVC

@esbatmop

MNBVC(Massive Never-ending BT Vast Chinese corpus)超大规模中文语料集。对标chatGPT训练的40T数据。MNBVC数据集不但包括主流文化,也包括各个小众文化甚至火星文的数据。MNBVC数据集包括新闻、作文、小说、书籍、杂志、论文、台词、帖子、wiki、古诗、歌词、商品介绍、笑话、糗事、聊天记录等一切形式的纯文本中文数据。

MIT Commit 13 dagen geleden ★ 4.278
58 4/5 gemeten

RAGHub

@Andrew-Jang

A community-driven collection of RAG (Retrieval-Augmented Generation) frameworks, projects, and resources. Contribute and explore the evolving RAG ecosystem.

MIT Commit 2 maanden geleden ★ 2.003
57 4/5 gemeten

CoreNLP

@stanfordnlp

CoreNLP: A Java suite of core NLP tools for tokenization, sentence segmentation, NER, parsing, coreference, sentiment analysis, etc.

GPL-3.0 Commit 1 dag geleden ★ 10.121
57 5/5 gemeten

TextBlob

@sloria

Simple, Pythonic, text processing--Sentiment analysis, part-of-speech tagging, noun phrase extraction, translation, and more.

MIT Commit 4 dagen geleden ★ 9.549
55 5/5 gemeten

argilla

@argilla-io

Argilla is a collaboration tool for AI engineers and domain experts to build high-quality datasets

Apache-2.0 Commit 5 dagen geleden ★ 5.124
55 4/5 gemeten

HanLP

@hankcs

中文分词 词性标注 命名实体识别 依存句法分析 成分句法分析 语义依存分析 语义角色标注 指代消解 风格转换 语义相似度 新词发现 关键词短语提取 自动摘要 文本分类聚类 拼音简繁转换 自然语言处理

Apache-2.0 Commit 11 dagen geleden ★ 36.507
54 5/5 gemeten

rasa

@RasaHQ

💬 Open source machine learning framework to automate text- and voice-based conversations: NLU, dialogue management, connect to Slack, Facebook, and more - Create chatbots and voice assistants

Apache-2.0 Commit 2 maanden geleden ★ 21.330
54 5/5 gemeten

awesome-bioie

@caufieldjh

🧫 A curated list of resources relevant to doing Biomedical Information Extraction (including BioNLP)

CC0-1.0 Commit 4 maanden geleden ★ 467
51 4/5 gemeten

scispacy

@allenai

A full spaCy pipeline and models for scientific/biomedical documents.

Apache-2.0 Commit 10 maanden geleden ★ 1.995
51 5/5 gemeten

sd

@chmln

Intuitive find & replace CLI (sed alternative)

MIT Commit 7 maanden geleden ★ 7.367
50 5/5 gemeten

awesome-search

@frutik

Awesome Search - this is all about the (e-commerce, but not only) search and its awesomeness

Maintainer in de EU Commit vandaag ★ 1.564
50 4/5 gemeten

shekar

@amirivojdan

Simplifying Persian NLP for Modern Applications

MIT Commit 9 dagen geleden ★ 83
50 4/5 gemeten

TagUI

@aisingapore

Free RPA tool by AI Singapore

Apache-2.0 Commit 6 dagen geleden ★ 6.334
49 4/5 gemeten

argos-translate

@argosopentech

Open-source offline translation library written in Python

MIT Commit 2 maanden geleden ★ 6.511
49 4/5 gemeten

nlp_chinese_corpus

@brightmart

大规模中文自然语言处理语料 Large Scale Chinese Corpus for NLP

MIT Commit 8 maanden geleden ★ 9.918
48 4/5 gemeten

ctakes

@apache

Apache cTAKES is a Natural Language Processing (NLP) platform for clinical text.

Apache-2.0 Commit 2 maanden geleden ★ 138
47 4/5 gemeten

storm

@stanford-oval

An LLM-powered knowledge curation system that researches a topic and generates a full-length report with citations.

MIT Commit 12 maanden geleden ★ 31.507
47 4/5 gemeten

autoprompt

@ucinlp

AutoPrompt: Automatic Prompt Construction for Masked Language Models.

Apache-2.0 Commit 24 dagen geleden ★ 641
46 4/5 gemeten

Deta_Parser

@yaoguangluo

快速中文分词分析word segmentation

GPL-2.0 Commit 12 maanden geleden ★ 479
44 4/5 gemeten

LLMsPracticalGuide

@Mooler0410

A curated list of practical guide resources of LLMs (LLMs Tree, Examples, Papers)

Commit 6 maanden geleden ★ 10.212
44 4/5 gemeten

sensitive-word

@houbb

👮‍♂️The sensitive word tool for java.(敏感词/违禁词/违法词/脏词。基于 DFA 算法实现的高性能 java 敏感词过滤工具框架。内置支持单词标签分类分级。请勿发布涉及政治、广告、营销、翻墙、违反国家法律法规等内容。高性能敏感词检测过滤组件,附带繁体简体互换,支持全角半角互换,汉字转拼音,模糊搜索等功能。)

Apache-2.0 Commit 6 maanden geleden ★ 6.064
44 4/5 gemeten

obsei

@obsei

Obsei is a low code AI powered automation tool. It can be used in various business flows like social listening, AI based alerting, brand image analysis, comparative study and more .

Apache-2.0 Commit 1 dag geleden ★ 1.430
44 5/5 gemeten

fuzi.mingcha

@irlab-sdu

夫子•明察司法大模型是由山东大学、浪潮云、中国政法大学联合研发,以 ChatGLM 为大模型底座,基于海量中文无监督司法语料与有监督司法微调数据训练的中文司法大模型。该模型支持法条检索、案例分析、三段论推理判决以及司法对话等功能,旨在为用户提供全方位、高精准的法律咨询与解答服务。

Apache-2.0 Commit 1 jaar geleden ★ 393
43 4/5 gemeten

gr-nlp-toolkit

@nlpaueb

The Greek NLP toolkit for Python. Supports NER/DP/POS Tagging/Greeklish-to-Greek Transliteration. Visit the web demo here: https://huggingface.co/spaces/AUEB-NLP/greek-nlp-toolkit-demo (paper presented at COLING 2025)

Maintainer in de EU Commit 5 maanden geleden ★ 93
43 5/5 gemeten

NLP-progress

@sebastianruder

Repository to track the progress in Natural Language Processing (NLP), including the datasets and the current state-of-the-art for the most common NLP tasks.

Maintainer in de EU Commit 2 jaaren geleden ★ 22.952
37 5/5 gemeten

Unix-Text-Processing

@larrykollar

Recreated sources for the book "UNIX Text Processing," published in 1987.

Commit vandaag ★ 236
36 4/5 gemeten

models

@PaddlePaddle

Officially maintained, supported by PaddlePaddle, including CV, NLP, Speech, Rec, TS, big models and so on.

Apache-2.0 Commit 2 jaaren geleden ★ 6.931
35 5/5 gemeten

nlp.js

@axa-group

An NLP library for building bots, with entity extraction, sentiment analysis, automatic language identify, and so more

Maintainer in de EU Commit 2 jaaren geleden ★ 6.585
35 5/5 gemeten

flashtext

@vi3k6i5

Extract Keywords from sentence or Replace keywords in sentences.

MIT Commit 1 jaar geleden ★ 5.706
35 4/5 gemeten

flair

@flairNLP

A very simple framework for state-of-the-art Natural Language Processing (NLP)

Commit 11 maanden geleden ★ 14.390
35 5/5 gemeten

extractous

@yobix-ai

Fast and efficient unstructured data extraction. Written in Rust with bindings for many languages.

Apache-2.0 Commit 2 jaaren geleden ★ 1.780
34 4/5 gemeten

fashion-clip

@patrickjohncyh

FashionCLIP is a CLIP-like model fine-tuned for the fashion domain.

MIT Commit 2 jaaren geleden ★ 540
33 4/5 gemeten

Legal-Text-Analytics

@Liquid-Legal-Institute

A list of selected resources, methods, and tools dedicated to Legal Text Analytics.

Maintainer in de EU Commit 2 jaaren geleden ★ 738
32 4/5 gemeten

ltp

@HIT-SCIR

Language Technology Platform

Commit 7 maanden geleden ★ 5.260
32 5/5 gemeten

Med-ChatGLM

@SCIR-HI

Repo for Chinese Medical ChatGLM 基于中文医学知识的ChatGLM指令微调

Apache-2.0 Commit 3 jaaren geleden ★ 1.040
29 4/5 gemeten

browser-ml-inference

@jobergum

Edge Inference in Browser with Transformer NLP model

Apache-2.0 Commit 4 jaaren geleden ★ 313
29 4/5 gemeten

Awesome-Chinese-NLP

@crownpku

A curated list of resources for Chinese NLP 中文自然语言处理相关资料

Apache-2.0 Commit 3 jaaren geleden ★ 7.920
29 4/5 gemeten

GPT2-Chinese

@Morizeyao

Chinese version of GPT2 training code, using BERT tokenizer.

MIT Commit 2 jaaren geleden ★ 7.594
29 4/5 gemeten

BERT-pytorch

@codertimo

Google AI 2018 BERT pytorch implementation

Apache-2.0 Commit 3 jaaren geleden ★ 6.529
29 5/5 gemeten

Baichuan-7B

@baichuan-inc

A large-scale 7B pretraining language model developed by BaiChuan-Inc.

Apache-2.0 Commit 2 jaaren geleden ★ 5.649
28 4/5 gemeten

mordecai

@openeventdata

Full text geoparsing as a Python library

MIT Commit 5 jaaren geleden ★ 766
27 5/5 gemeten

ansj_seg

@NLPchina

ansj分词.ict的真正java实现.分词效果速度都超过开源版的ict. 中文分词,人名识别,词性标注,用户自定义词典

Apache-2.0 Commit 3 jaaren geleden ★ 6.505
27 5/5 gemeten

Leaf-Question-Generation

@KristiyanVachev

Easy to use and understand multiple-choice question generation algorithm using T5 Transformers.

Maintainer in de EU Commit 5 jaaren geleden ★ 140
26 4/5 gemeten

ailearning

@apachecn

AiLearning:数据分析+机器学习实战+线性代数+PyTorch+NLTK+TF2

Commit 2 jaaren geleden ★ 42.559
24 5/5 gemeten

Jiagu

@ownthink

Jiagu深度学习自然语言处理工具 知识图谱关系抽取 中文分词 词性标注 命名实体识别 情感分析 新词发现 关键词 文本摘要 文本聚类

MIT Commit 4 jaaren geleden ★ 3.425
24 5/5 gemeten

awesome_Chinese_medical_NLP

@GanjinZero

中文医学NLP公开资源整理:术语集/语料库/词向量/预训练模型/知识图谱/命名实体识别/QA/信息抽取/模型/论文/etc

Commit 3 jaaren geleden ★ 2.640
22 4/5 gemeten

Sharetape-Open-Source

@adhikary97

Script that takes any long form video or podcast and outputs clips for social media

MIT Commit 3 jaaren geleden ★ 121
22 4/5 gemeten

AILA-Artificial-Intelligence-for-Legal-Assistance

@Ananyapam7

Python implementations of the various methods used in FIRE 2019 conference.

MIT Commit 5 jaaren geleden ★ 60
20 4/5 gemeten

pytorch-pos-tagging

@bentrevett

A tutorial on how to implement models for part-of-speech tagging using PyTorch and TorchText.

MIT Commit 5 jaaren geleden ★ 177
20 4/5 gemeten

stanford-nlp-tagger

@patrickschur

PHP wrapper for the Stanford Natural Language Processing library. Supports POSTagger and CRFClassifier.

MIT Commit 6 jaaren geleden ★ 74
20 4/5 gemeten

wink-pos-tagger

@winkjs

English Part-of-speech (POS) tagger

MIT Commit 4 jaaren geleden ★ 70
19 5/5 gemeten

ParseLawDocuments

@yinhao0214

对收集的法律文档进行一系列分析,包括根据规范自动切分、案件相似度计算、案件聚类、法律条文推荐等(试验目前基于婚姻类案件,可扩展至其它领域)。

Commit 10 jaaren geleden ★ 205
17 4/5 gemeten

WantWords

@thunlp

An open-source online reverse dictionary.

Commit 5 jaaren geleden ★ 7.096
16 4/5 gemeten

monpa

@monpa-team

MONPA 罔拍是一個提供正體中文斷詞、詞性標註以及命名實體辨識的多任務模型

Commit 2 jaaren geleden ★ 248
15 5/5 gemeten

ner-slot_filling

@GaoQ1

中文自然语言的实体抽取和意图识别(Natural Language Understanding),可选Bi-LSTM + CRF 或者 IDCNN + CRF

Commit 8 jaaren geleden ★ 188
14 4/5 gemeten

Natural-Language-Processing-Specialization

@amanjeetsahu

This repo contains my coursework, assignments, and Slides for Natural Language Processing Specialization by deeplearning.ai on Coursera

Commit 3 jaaren geleden ★ 860
14 4/5 gemeten

knowledge_graph

@AnjaneyaTripathi

Knowledge Graph for Legal Documents using Litigation Releases from the SEC website. Classifies into different crimes, extracts relevant information (violator, violation, action taken by authorities and fines) and finally generates the knowledge graph.

Commit 5 jaaren geleden ★ 84
12 4/5 gemeten

cogcomp-nlp

@CogComp

CogComp's Natural Language Processing Libraries and Demos: Modules include lemmatizer, ner, pos, prep-srl, quantifier, question type, relation-extraction, similarity, temporal normalizer, tokenizer, transliteration, verb-sense, and more.

Commit 3 jaaren geleden ★ 479
11 5/5 gemeten

BillSum

@FiscalNote

US Bill Summarization Corpus

Commit 3 jaaren geleden ★ 71
10 4/5 gemeten

Fake-Reviews-Detection

@SayamAlt

Successfully developed a machine learning model which can predict whether an online review is fraudulent or not. The main idea used to detect the fake nature of reviews is that the review should be computer generated through unfair means. If the review is created manually, then it is considered legal and original.

Commit 4 jaaren geleden ★ 107
7 4/5 gemeten