Upload folder using huggingface_hub

Files changed (6) hide show

README.md ADDED Viewed

+---
+license: mit
+library_name: transformers
+tags:
+ - transformers.js
+ - tokenizers
+---
+Cloned from [Xenova/gpt-4o](https://huggingface.co/Xenova/gpt-4o)
+# GPT-4o Tokenizer
+A 🤗-compatible version of the **GPT-4o tokenizer** (adapted from [openai/tiktoken](https://github.com/openai/tiktoken)). This means it can be used with Hugging Face libraries including [Transformers](https://github.com/huggingface/transformers), [Tokenizers](https://github.com/huggingface/tokenizers), and [Transformers.js](https://github.com/xenova/transformers.js).
+## Example usage:
+### Transformers/Tokenizers
+```py
+from transformers import GPT2TokenizerFast
+tokenizer = GPT2TokenizerFast.from_pretrained('Xenova/gpt-4o')
+assert tokenizer.encode('hello world') == [24912, 2375]
+```
+### Transformers.js
+```js
+import { AutoTokenizer } from '@xenova/transformers';
+const tokenizer = await AutoTokenizer.from_pretrained('Xenova/gpt-4o');
+const tokens = tokenizer.encode('hello world'); // [24912, 2375]
+```

merges.txt ADDED Viewed

The diff for this file is too large to render. See raw diff

special_tokens_map.json ADDED Viewed

+{
+  "bos_token": "<|endoftext|>",
+  "eos_token": "<|endoftext|>",
+  "unk_token": "<|endoftext|>"
+}

tokenizer.json ADDED Viewed

The diff for this file is too large to render. See raw diff

tokenizer_config.json ADDED Viewed

+{
+  "add_prefix_space": false,
+  "bos_token": "<|endoftext|>",
+  "clean_up_tokenization_spaces": false,
+  "eos_token": "<|endoftext|>",
+  "model_max_length": 128000,
+  "tokenizer_class": "GPT2Tokenizer",
+  "unk_token": "<|endoftext|>"
+}

vocab.json ADDED Viewed

The diff for this file is too large to render. See raw diff