Database schema optimization - part 8

This commit is contained in:
mdecimus
2025-11-07 18:50:39 +01:00
parent 73f09072ab
commit d9e6927606
44 changed files with 2003 additions and 849 deletions

View File

@@ -9,15 +9,13 @@ pub mod search_snippet;
pub mod stemmer;
pub mod stopwords;
use std::borrow::Cow;
use utils::config::utils::ParseValue;
use crate::tokenizers::{
Token, chinese::ChineseTokenizer, japanese::JapaneseTokenizer, word::WordTokenizer,
};
use self::detect::LanguageDetector;
use crate::tokenizers::{
Token, chinese::ChineseTokenizer, japanese::JapaneseTokenizer, space::SpaceTokenizer,
word::WordTokenizer,
};
use std::borrow::Cow;
use utils::config::utils::ParseValue;
pub type LanguageTokenizer<'x> = Box<dyn Iterator<Item = Token<Cow<'x, str>>> + 'x + Sync + Send>;
@@ -36,6 +34,15 @@ impl Language {
ChineseTokenizer::new(WordTokenizer::new(text, usize::MAX))
.filter(move |t| t.word.len() <= max_token_length),
),
Language::None => {
Box::new(
SpaceTokenizer::new(text, max_token_length).map(|word| Token {
word: word.into(),
from: 0,
to: 0,
}),
)
}
_ => Box::new(WordTokenizer::new(text, max_token_length)),
}
}