96 KiB
96 KiB
| 1 | c931ef3163940227c9b6291e04216245cce21429 | a43741244a646d3f8fa3ff01bb9b7d059223d0a5 | 2026-05-18T17:34:37+08:00 | wangbomeng | calrt: fix prefill_by_ids.fix create_buf | |
|---|---|---|---|---|---|---|
| 2 | eeeef3f6d6a5aad9296323ca15d9d929745b8932 | 431ad6f1c787f1b47e9e7be14b2e1a7d8565485c | 2026-04-28T16:16:19+08:00 | wangbomeng | add unknown time info: prefill and decode | |
| 3 | 99962021f2dd1994dbbf90d5712f0ca2633f20f8 | 9af6682ef101c6d006c743c703cf150ac25f466f | 2026-04-17T14:48:33+08:00 | wangbomeng | origin/dev-ot | calrt: add onetoken slice and untile_prefill |
| 4 | a206460e610aef995e36e50b33e8bd41fe477541 | d8b2aaa00049978cebac15041f960d75b552f97b | 2026-04-14T10:23:43+08:00 | wangbomeng | calrt: support mixture of prefill_by_ids and prefill_by_embeds | |
| 5 | b8153b6b8f244b223c9f4c2940ae1f212634519e | 82842cfc3fa3d5c004c4540aeff8a81f38509bee | 2026-04-09T15:07:02+08:00 | wangbomeng | server: fix limit tokens to max_seq_len | |
| 6 | 82842cfc3fa3d5c004c4540aeff8a81f38509bee | 622a22991089c6debd5f4b57738f3df3a0bda8b5 | 2026-04-09T15:06:26+08:00 | wangbomeng | server: fix limit tokens to max_seq_len | |
| 7 | 1e8a16cd0e3ad3c9a0f8746852a0a38c6e52322e | 893e52bda0fee99bbda1521ea733a760bc4201f1 | 2026-04-01T10:14:22+08:00 | wangbomeng | calrt: fix slice and add infer/copy time | |
| 8 | e4eaab700333490e80ebefc8d023f6c1adfcc312 | aeacc23a883400db0ebffb50e23355ada054da66 | 2026-03-25T09:03:55+08:00 | wangbomeng | calrt: prefil to prefill | |
| 9 | aeacc23a883400db0ebffb50e23355ada054da66 | cbaa7492663630132adeddccd9fec5e44ffa3336 | 2026-03-25T08:49:22+08:00 | wangbomeng | calrt: add slice only on decode | |
| 10 | 3c08ebf0e442cd730ddffd959ec676f9caf31c82 | 613bc2b9a9d7af92efbe42d876ffcdb244f7a00e | 2026-03-24T02:43:03+08:00 | wangbomeng | calrt: comment LOG_ERROR in untile_decode_cpy | |
| 11 | 16cbf81a731f5839a2f6b0eb9d8539826353748b | 8b4e17d990c23025148c4abadefe1010a0dd0734 | 2026-03-23T09:38:21+08:00 | wangbomeng | calrt: fix model_name of untile_cpy | |
| 12 | b2c45d8ddefb7ec09435231c8ec5b736fabf9c91 | c6ea3f0d2468e3b8eab5de80bacee7fe4c9dd3d7 | 2026-03-09T15:03:26+08:00 | Bomeng Wang | clart: past_kv_len = n_tokens | |
| 13 | 583c387efaf7bc030574e554088de79d09a27fbd | 0edc14a60a2d5596f71d728c655e3523da924d89 | 2026-02-27T02:24:56+08:00 | wangbomeng | caserver: lim generated tokens to n_ctx_per_seq | |
| 14 | 0edc14a60a2d5596f71d728c655e3523da924d89 | aa0a17d719326a63e0d6fea60aa0ced44e7abc33 | 2026-02-27T01:57:39+08:00 | wangbomeng | caserver: limit generated tokens to n_ctx_per_seq | |
| 15 | 84f2c0b5f334a7ab77347c6779b6027a951d0ff0 | 0bd95719fed2f0247c8d0199dd897d24157dfae6 | 2026-02-09T01:46:36+08:00 | wangbomeng | add bf16_to_fp32 in untile_decode/prefill_cpy | |
| 16 | 9328f21378275f2354a19c3af907332b216ab492 | 49fea70a20f550bfdb59d0ffe041b54919c22447 | 2026-01-28T15:32:36+08:00 | Yunzhe Jia | add prefill-only mode | |
| 17 | 5d2387931528fbe04aa8d66de935147efb65ca4d | e6285a748657add8d974b78ca920c5b41753ee12 | 2025-12-08T16:40:34+08:00 | Yunzhe Jia | add timestamp for one decode process | |
| 18 | e492f5dc8cec17529f53ef2bbdf7b502107f8148 | 2e05afd22b3d77c7013b11eee88e88b17188f21a | 2025-11-04T14:09:59+08:00 | Yunzhe Jia | redo untile logic | |
| 19 | 070ff4d5356083d60b807bb34d36b31c3653a29e | bf7b0c9725ed0c406c5debaea022ec7258430634 | 2025-11-03T11:11:18+01:00 | Xuan-Son Nguyen | mtmd: add --image-min/max-tokens (#16921) | |
| 20 | cd5e3b57541ecc52421130742f4d89acbcf77cd4 | 87c9efc3b297b8a498716b1db3d061842e6fc85b | 2025-11-02T18:14:04+02:00 | Georgi Gerganov | server : support unified cache across slots (#16736) | |
| 21 | cf659bbb8ef9eb048e5153a27cf787fd83c05560 | d8b860a219c2415faac8cc0e50b48b4aa11e3b64 | 2025-11-01T15:51:36+01:00 | Xuan-Son Nguyen | mtmd: refactor preprocessing + support max/min pixels (#16878) | |
| 22 | b52edd25586fabb70f0c21b274473b307cf14499 | 517b7170e1a4d733583c4b07c5b7a49acc05911c | 2025-10-30T18:42:57+02:00 | Georgi Gerganov | server : remove n_past (#16818) | |
| 23 | 5a91109a5d7dab5d7adc40bedb397ede99a705b1 | f8f071faddf32ea09f4234edb6e809b380a9ee26 | 2025-10-24T12:02:02+02:00 | Daniel Bevenius | model-conversion : add trust_remote_code for orig model run [no ci] (#16751) | |
| 24 | 84bf3c677857279037adf67cdcfd89eaa4ca9281 | c9c1972e2c2cc6a771fcc145bfa138700179f961 | 2025-10-20T21:38:20+02:00 | Sigbjørn Skjæret | model : add BailingMoeV2 support (#16063) | |
| 25 | 17304cbcc1dd24de7741cbe57925d58e90a98ac1 | 3e3cb19f6449f9168a128eaeae01f8f41b049acc | 2025-10-15T16:53:12+03:00 | Georgi Gerganov | server : fix img token logs (#16595) | |
| 26 | bc07349a7f87ba6eb31ed4b0ea9d9a7352185213 | e60f241eacec42d3bd7c9edd37d236ebf35132a8 | 2025-10-14T08:48:50+03:00 | Georgi Gerganov | server : dynamic token limit for prompt cache (#16560) | |
| 27 | 477a66b03501cf3bd067f8968b77ca4d053ff1bd | e60f01d941bc5b7fae62dd57fee4cec76ec0ea6e | 2025-10-11T11:33:41+03:00 | amirai21 | convert : correctly handle LLaMA tokenizer for Jamba (#16470) | |
| 28 | 81086cd6a3ca1252f0dc0f938171648399179c53 | 68ee98ae181a5c83a5cc6261daeee69a1f588c15 | 2025-10-10T17:17:31+03:00 | Georgi Gerganov | vocab : mark EOT token for Granite models (#16499) | |
| 29 | 1faa13a1187051af66b0fd9f0d6effe4c77f0b3e | 1deee0f8d494981c32597dca8b5f8696d399b0f2 | 2025-10-09T22:54:57+02:00 | Pascal | webui: updated the chat service to only include max_tokens in the req… (#16489) | |
| 30 | c08002a1988348403a5fd59b1fa3de3a10a6f92f | 3a002afafa8e06555f11aed88b02d055d8a166f3 | 2025-10-06T10:59:40-06:00 | Gabe Goodhart | chat : Granite Docling stopping (#16438) | |
| 31 | ca71fb9b368e3db96e028f80c4c9df6b6b370edd | 35266573b968e1c947b367782fb4b3eddbb4f3c0 | 2025-10-05T06:57:47-06:00 | Gabe Goodhart | model : Granite docling + Idefics3 preprocessing (SmolVLM) (#16206) | |
| 32 | 77233277c912d495d1069543ca540c21a2f9e5b4 | e308efda8e54e3f07578937a45a5d83624eb7970 | 2025-10-03T11:30:39+02:00 | Aleksander Grygier | Capture model name only after first token (streaming) or completed request (#16405) | |
| 33 | e74c92e84236b2bab3f3c77bee4ead94928be360 | b2ba81dbe07b6dbea9c96b13346c66973dede32c | 2025-09-30T16:24:36-04:00 | Bartowski | model : support GLM 4.6 (make a few NextN/MTP tensors not required) (#16359) | |
| 34 | 2f61c0f5bf8a620ca4c3872408803ab38cfb9613 | 3ffd0fae473c954bb3e67526b31262048fb508d4 | 2025-09-29T12:33:12+05:30 | Vinkal | llama-cli: prevent spurious assistant token (#16202) | |
| 35 | 624207e676ab5eb3ce7af631902bb45fb73a8359 | 807e8c6d310952f2f5656afc63dab9d7083dcb5c | 2025-09-27T02:03:33+08:00 | Aaron Teo | devops: add s390x & ppc64le CI (#15925) | |
| 36 | 077c94d0caf87fbd3cf3288dbb5c0fd9670294cf | aa3ee0eb0b80efca126cedf9bcb4fb5864b46ce3 | 2025-09-25T22:35:05+08:00 | Aman Gupta | CUDA: add a fused top-K MoE kernel (#16130) | |
| 37 | aa3ee0eb0b80efca126cedf9bcb4fb5864b46ce3 | d0991da39d3c39b3980c24cdfccb9a4c95a46870 | 2025-09-25T12:02:36+02:00 | Daniel Bevenius | model-conversion : add embedding prompt file support (#15871) | |
| 38 | 351f3da39c85f59d581fc184f09283da7f099a3b | 3ecb2f671a2f49d56357f99d135a94e841759178 | 2025-09-23T01:57:46+08:00 | Haiyue Wang | clang-tidy : disable warning about performance enum size (#16127) | |
| 39 | 745cbcf2fe1eb88f8db615ac622f0b944d924ad6 | 1cbd80f8cf80a817715b1ccc5680fe2a3c5172c8 | 2025-09-17T15:30:55+08:00 | Jie Fu (傅杰) | llama-quant : fix the verification of attention layers for encoder-decoder models (#16023) | |
| 40 | 1cbd80f8cf80a817715b1ccc5680fe2a3c5172c8 | 85286f354813056f6c835046c0acfa3bf6ba9432 | 2025-09-17T15:29:00+08:00 | Jie Fu (傅杰) | examples : support encoder-decoder models in the simple example (#16002) | |
| 41 | c0389dba43d50695f9d3f57dd1f1a14cbefc100c | 00681dfc16ba4cebb9c7fbd2cf2656e06a0692a4 | 2025-09-11T15:59:37+08:00 | hipudding | CANN: Disable acl_graph for prefill stage (#15933) | |
| 42 | 4f658855fa8f2e42b7ed9a5b298fa39a2e39b096 | 6ab397e12ba8e9f776341cdae68f7ffb2f8d2cde | 2025-09-11T02:51:51+08:00 | Jie Fu (傅杰) | llama : support T5 models with unequal number of encoder-decoder layers (#15909) | |
| 43 | 70cd37dbbebdb7a2f84f08207f18eabb0b291a55 | acc1b008cfd95e63d5f99a370dbffb98e5a99d2c | 2025-09-09T06:06:52+02:00 | Daniel Bevenius | requirements : update transformers/torch for Embedding Gemma (#15828) | |
| 44 | 88021565f08e0b7c4e07ac089a15ec16fae9166c | 56920f56651908d5cce7a310dabf54ac4f6fbb7f | 2025-09-08T10:59:48-04:00 | Jesse | chat : Deepseek V3.1 reasoning and tool calling support (OpenAI Style) (#15533) | |
| 45 | 56920f56651908d5cce7a310dabf54ac4f6fbb7f | b0d52998b962bd2681c34bf52af993af79f178b8 | 2025-09-08T21:50:05+07:00 | Xuan-Son Nguyen | server : bring back timings_per_token (#15879) | |
| 46 | fd621880f3fd908424e675a41715a2dc760247a2 | 4281c7b315f8a904549fe527039b976e08098d1a | 2025-09-05T17:32:39-06:00 | Gabe Goodhart | aLoRA Support (#15327) | |
| 47 | 5fac79cbc77b6d12c9feb5f34fc63586b35fd561 | 408ff524b40baf4f51a81d42a9828200dd4fcb6b | 2025-09-05T14:31:24-06:00 | Gabe Goodhart | Thinking model disabled assistant prefill (#15404) | |
| 48 | 3dc7397a2799bdc07bccf637ab7ae5a1e786d1a4 | e92d53b29e393fc4c0f9f1f7c3fe651be8d36faa | 2025-09-01T08:57:00+08:00 | hipudding | CANN: fix RoPE cache issue on multi-device (#15629) | |
| 49 | e8d99dd0b67f2ecc1e45fca8074a3a18c3e036d2 | a8bca68f727844e7dcf24a956003b3c2039ea563 | 2025-08-28T18:39:31-06:00 | Gabe Goodhart | nvidia nemotron nano v2 (nemotronh) (#15507) | |
| 50 | 84ab83cc0b4b7e769451ee48e4c7d1acef91ef25 | 55042b3692cb1467c9ee15c62c4a9fbf180f89e3 | 2025-08-28T15:49:50+02:00 | Sigbjørn Skjæret | model : jina-embeddings-v3 support (#13693) | |
| 51 | 1e7489745a74996fc36e8fd05b73aa16bc184e0c | 1cf123a343ab7ca5586aacb9e0a1d2de7fe33be4 | 2025-08-27T17:21:41+08:00 | Chenguang Li | CANN: refactor mask handling and improve performance in FA (#15561) | |
| 52 | a6a58d64785cb458ed9de52f391aa38142d38d64 | 0373486dbc0dccbdcb3b5fdd65759d88cec06196 | 2025-08-26T21:05:25+05:30 | shalinib-ibm | llamafile: PowerPC Sgemm Optimization (#15558) | |
| 53 | 62cef26ac5b6b7acb635d3dc963813b43952dc2b | 8f5afa94c4f929da71f560db7c9f38ef6a783d95 | 2025-08-26T16:12:29+02:00 | Daniel Bevenius | model-conversion : add qat-q4 quantization targets (#15588) | |
| 54 | 79a546220c719e6a70627b243a478ab8d84dc9e1 | 85cc1ae998e4898d9fa992cb9b8620338cee97bf | 2025-08-26T12:54:19+02:00 | Xuan-Son Nguyen | mtmd : support Kimi VL model (#15458) | |
| 55 | 0115cfb7c1dec0753aecb34f3af4338bf9de8eeb | 3a617cb18121a85eed17ac5585788810c5d9c1e0 0d5a470223fc90b6b6807921d68011ff06ae7f9e | 2025-08-26T15:19:56+08:00 | Yunzhe Jia | Merge branch 'master' into dev | |
| 56 | 6b64f74b55628e4193f4fb00313f07dbd8556528 | 0d5a470223fc90b6b6807921d68011ff06ae7f9e | 2025-08-25T13:56:43+03:00 | Georgi Gerganov | batched-bench : fix unified KV cache handling + pp timing (#15562) | |
| 57 | 4afb0a746f22abaa545b3ebdb76a400d7da3a713 | e288693669cf9d0a71e2f2b8bd57305f06340257 | 2025-08-22T08:10:14Z | 65a | server : Support multimodal completion and embeddings prompts in JSON format (#15108) | |
| 58 | e288693669cf9d0a71e2f2b8bd57305f06340257 | a0f98dd604d34826eb5ea2560d1e23fe726921df | 2025-08-22T09:29:08+02:00 | Tarek Dakhran | readme : model : mtdm : lfm2 improvements (#15476) | |
| 59 | 657b8a77bd01854f99d37a47318fa24f2e7e298f | ec5ab1a36c11dd3efcf4ec8d1ac89a13a8117bc3 | 2025-08-20T14:26:01+02:00 | Daniel Bevenius | chat: handle gpt-oss return/end token inconsistency (#15421) | |
| 60 | f0d3c7405c323784a60f14ddddfbac3f7404d417 | f08c4c0d8d0cb6caaf8b7ad316039232b9fa059c | 2025-08-19T08:45:12+03:00 | Georgi Gerganov | batched-bench : use rand tokens (#15398) | |
| 61 | f08c4c0d8d0cb6caaf8b7ad316039232b9fa059c | 6d7f1117e3e3285d0c5c11b5ebb0439e27920082 | 2025-08-18T22:53:52+02:00 | Xuan-Son Nguyen | mtmd : clean up clip_n_output_tokens (#15391) | |
| 62 | 5e6229a8409ac786e62cb133d09f1679a9aec13e | e2c1bfff5305c661ac53e9d57cb732ff626a2242 | 2025-08-15T19:50:52+02:00 | Daniel Bevenius | common : fix double bos, use common_chat_templates for add_bos and add_eos (#15326) | |
| 63 | b204a5a234f4cf0b3f449476da639a5510c6d157 | 646944cfa8961afd914dd6637739b3cda9a72e11 | 2025-08-14T09:23:11-05:00 | Aldehir Rojas | gpt-oss: implement harmony parsing (#15181) | |
| 64 | 3a617cb18121a85eed17ac5585788810c5d9c1e0 | c42293848dd9f03eba9a6c1b85a600b398f06541 | 2025-08-13T10:58:59+08:00 | Yunzhe Jia | add calrt_decode | |
| 65 | 1ebbaddff2a44b0599df659175d3274bd5bbeb81 | a3a7874272e5a060079658eb5cca4617b7f99062 | 2025-08-11T10:21:24+02:00 | Daniel Bevenius | perplexity : update comments/error msg to use decode [no ci] (#15227) | |
| 66 | 99acbc9921b119aa7ed929eb5780a66a8f06e6d9 | 7ad67ba9fe2b909e271dd31b99c5fce3aba35899 | 2025-08-08T00:20:40+08:00 | RunningLeon | llama : Support intern-s1 (#14875) | |
| 67 | 1cbf442f50a154aac0bf35d7b8b3436a2cdfd6f5 | ba67d6c03fed3193987a4ef13050e6e2a4451df4 | 2025-07-24T15:50:19+08:00 | Yunzhe Jia | 1.sync with calrt prefill,decode,kv_update op 2.add hw pattern untile function | |
| 68 | fd1234cb468935ea087d6929b2487926c3afff4b | f324a3b715d5c1081c110ce459f8a8486fb1ee89 | 2025-08-05T22:10:36+03:00 | Georgi Gerganov | llama : add gpt-oss (#15091) | |
| 69 | ef0144c087b33e5b8da42d529ac71aaf05cb49df | 2721257e3e2c4c944ac8a08221113ee7cb503f1b | 2025-08-05T04:29:25+10:00 | Sam | model: support GLM 4.5 family of models (#14939) | |
| 70 | 97366dc6abdd0bdc74260bd3c42bd06f0feb7428 | 83bc2f288c0e08e676d9beca9c4669197e920593 | 2025-08-03T12:38:18-07:00 | Csaba Kecskemeti | vocab : JetBrains Mellum pre-tokenizer (#15045) | |
| 71 | 83bc2f288c0e08e676d9beca9c4669197e920593 | 6c7a441161080551ce8a52ba32563b6295067192 | 2025-08-03T09:56:25-05:00 | Gabriel Larson | model : add text-only support for Kimi-VL (and find special tokens in text_config) (#15051) | |
| 72 | 2bf3fbf0b54f97aef2b388b76d222789e1c170f1 | 711d5e6fe66eb6cd7a10d71cec4567321848be08 | 2025-08-02T14:39:01+02:00 | Sigbjørn Skjæret | ci : check that pre-tokenizer hashes are up-to-date (#15032) | |
| 73 | 711d5e6fe66eb6cd7a10d71cec4567321848be08 | f738989dcb9ccbe468c945553eafbeef7b869675 | 2025-08-02T05:51:02-05:00 | Douglas Hanley | convert : fix Qwen3-Embedding pre-tokenizer hash (#15030) | |
| 74 | f906275537d14c8fc7c6976d944233771fd6672c | a9f7541ec25c4c8547daf5ff48700ad2836e2b7d | 2025-08-02T10:12:41+02:00 | Johannes Gäßler | server: enable token array inputs for OAI API (#15001) | |
| 75 | 0f5ccd6fd1a1f709010312933db0316867cc30b6 | 1c872f71fb8a25589efa3ee9b6bf8b517cb8caa4 | 2025-08-01T21:31:12+08:00 | stevenkuang | model : add hunyuan dense (#14878) | |
| 76 | 94933c8c2eeaa9a7983e3f6c08af76bd86724094 | c1dacaa99b4ead6edbac928cd2da59436573f6b0 | 2025-07-31T05:25:23-07:00 | g2mt | server : implement universal assisted decoding (#12635) | |
| 77 | 8a4a85627702b569d7d2810f2de06a4321656e9d | 11490b36723d511d75fb601995c79b5c363ba3a2 | 2025-07-31T19:49:09+08:00 | Aman Gupta | Add LLaDA 8b Diffusion model (#14771) | |
| 78 | 92b8810ec7aa6d778bc287cc918443cf67b962e2 | 00131d6eaf4df029e1ec84de868c2c5957503007 | 2025-07-30T15:46:13+02:00 | Johannes Gäßler | CUDA: skip masked KV slices for all FA kernels (#14924) | |
| 79 | 00fa15fedc79263fa0285e6a3bbb0cfb3e3878a2 | 946b1f685909c8c9c044f145bce819c02f327eaa | 2025-07-28T15:01:48+02:00 | Xuan-Son Nguyen | mtmd : add support for Voxtral (#14862) | |
| 80 | ca0ef2dddb022cb1337d775cd05cd27d7808aff4 | 89d1029559bd2968f76db854f9f113d73e34527c | 2025-07-27T12:10:51+02:00 | Daniel Bevenius | llama : clarify comment about pp and tg graphs [no ci] (#14895) | |
| 81 | 793c0d7f46384001738c337d7afa46b45ae32745 | ce111d39d666f4a3b6a561ad020f6feb8cc67790 | 2025-07-25T10:47:39-06:00 | Gabe Goodhart | metal: SSM_SCAN performance (#14743) | |
| 82 | b4efd77f8ab407836ca73a5176f041650c5b2411 | 2be60cbc2707359241c2784f9d2e30d8fc7cdabb | 2025-07-21T09:24:51+02:00 | IsaacDynamo | server : add parse_special option to /tokenize endpoint (#14783) | |
| 83 | 09651d09ffc1e941bd1be23163abf5495c416547 | 349ea79fcebc75b0c55bf61594a47736966d4f95 | 2025-07-18T06:25:54+02:00 | Nexes the Elder | graph : Pass the graph placeholder message in debug mode (#14748) | |
| 84 | cb887f1bc1001c92f7b4a595b9014f3a454a07ab | d6fb3f6b49b27ef1c0f4cf5128e041f7e7dc03af | 2025-07-17T23:15:32+02:00 | Piotr Wilkin (ilintar) | model: add Ernie 4.5 MoE support (#14658) | |
| 85 | 19e5943d9e976b59ccd5a0a87ae3d2ff3da44390 | 496957e1cbcb522abc63aa18521036e40efce985 | 2025-07-16T23:17:43+02:00 | Sigbjørn Skjæret | convert : make hf token optional (#14717) | |
| 86 | 4b91d6f71f14040979bcdb7b6729b3bca93ec1c1 | cf91f217f1c8b98b6db8e4ba6b480f017f81d206 | 2025-07-16T08:52:04+02:00 | Sigbjørn Skjæret | convert : only check for tokenizer folder if we need it (#14704) | |
| 87 | 68e37a61a7b24863f67541db65b4f6195962a268 | cbc68be51d88b1d5531643b926a4b359c3cff131 | 2025-07-16T01:11:42+09:00 | Shunta Saito | model : add PLaMo-2 support (#14560) | |
| 88 | 576c82eda210ca0111c04f5256bf77897a4d4cc4 | 0aedae00e6fb48680324a5ac5da9cba0e35de6b5 | 2025-07-11T16:36:04+09:00 | Dowon | vocab : add midm-2.0 model pre-tokenizer (#14626) | |
| 89 | 0aedae00e6fb48680324a5ac5da9cba0e35de6b5 | 6bdda13981d6c8189b7dc4f9fb8ecb91c21529f8 | 2025-07-10T18:20:13-06:00 | Gabe Goodhart | model : Granite Four (#13550) | |
| 90 | 4bb625b713fd9b294b4f7af87eaa752b710c7cc1 | 11ee0fea2a24da1d3206eeba8fc52b759d9dfb24 | 2025-07-10T13:41:00-04:00 | Ryan Mangeno | Smoldocling support (#14597) | |
| 91 | 8f22dc0a53338c629c1ef8fa878d8e39bfe627c9 | 53903ae6fa5f1caf187889c839cdd1ad25da4018 | 2025-07-08T10:24:06+02:00 | Xuan-Son Nguyen | model : add hunyuan moe (#14425) | |
| 92 | ddef99522d1ba74193b7394e803fab8db5c78bae | 668168814601d2aef6161ce49ab186bc74177ae7 | 2025-07-05T09:17:14+02:00 | Sigbjørn Skjæret | server : fix assistant prefilling when content is an array (#14360) | |
| 93 | 5d46babdc2d4675d96ebcf23cac098a02f0d30cc | e17991c466ac835b2c71bd813c1ca7ff8dd97b94 | 2025-07-02T13:10:24-04:00 | compilade | llama : initial Mamba-2 support (#9126) | |
| 94 | caf5681fcb47dfe9bafee94ef9aa8f669ac986c7 | 83790b0e7e09ab17238b16452a33053a71dbdfad | 2025-06-29T20:02:53+02:00 | matteo | server : support jinja extra template kwargs (Qwen3 enable_thinking feature), from command line and from client (#13196) | |
| 95 | 8f52c6f8abb2ed9ad967cc0bfb90acb073011193 | d2f325130c4ed77a3dcff2c23a926587fb08e2cc | 2025-06-26T15:10:45+08:00 | Yunzhe Jia | Squashed commit of the following: | |
| 96 | 66aba7aca9a245d71f1ddf02c7a97223529752a8 | f1f5e82df6222dcbaca6396c0de44df259a1694f | 2025-06-23T01:28:06+08:00 | Ruikai Peng | run : avoid double tokenization (#14327) | |
| 97 | f1f5e82df6222dcbaca6396c0de44df259a1694f | af3373f1adfca56119f3e4de0e6a0a8df8edf3d9 | 2025-06-22T20:10:07+03:00 | Georgi Gerganov | examples : fix is_first logic for tokenization (#14329) | |
| 98 | aa0ef5c578eef4c2adc7be1282f21bab5f3e8d26 | bb16041caef45cd4348cd6f84906b5dfec7a1f6a | 2025-06-21T18:12:05+02:00 | Sigbjørn Skjæret | gguf-py : fix Qwen3-Embedding eos token (#14314) | |
| 99 | dd6e6d0b6a4bbe3ebfc931d1eb14db2f2b1d70af | 8308f98c7fb778e54bf75538f5234d8bd20915e9 | 2025-06-20T22:13:06+08:00 | Ruikai Peng | vocab : prevent tokenizer overflow (#14301) | |
| 100 | 88fc854b4bd2e3caf10e705e6afcbbca136f0a3c | e28c1b93fd7d3f8faf9551d962e8a65fe2122e38 | 2025-06-20T14:04:09+02:00 | Sigbjørn Skjæret | llama : improve sep token handling (#14272) | |
| 101 | 812939a9e90f99d1bd5bb1bc6b99d12600671d50 | 4c9fdfbe1580a66fd7d77c77418ce2c606a29fdd | 2025-06-20T10:50:27+03:00 | Georgi Gerganov | model : more uniform output id handling (#14275) | |
| 102 | d2f325130c4ed77a3dcff2c23a926587fb08e2cc | 6391ee7ffd97e723dfbdcc32f001e1b95a63cba6 | 2025-06-17T11:53:33+08:00 | Yunzhe Jia | calrt: add input_token in graph; input_token will be copy to calrt_in_buffer | |
| 103 | f6e1a7aa8787b5c00acba6370cb70a0beff48b1e | c3ee46fab49a765d2e32e171e9ed7a5fa121dd9c | 2025-06-12T11:50:01+03:00 | Georgi Gerganov | context : simplify output counting logic during decode (#14142) | |
| 104 | a20b2b05bce6622c585459ebf46f142f113d021c | 2e89f76b7af2c0b827be785e445f2e2b3e52e1ca | 2025-06-12T02:56:04-04:00 | compilade | context : round n_tokens to next multiple of n_seqs when reserving (#14140) | |
| 105 | cc66a7f78f95dcb5208420f4dd1abc3fc6aec0cc | bd248d4dc7265437e1918dc53ae3f49a0c592e5f | 2025-06-11T17:16:32+02:00 | Sigbjørn Skjæret | tests : add test-tokenizers-repo (#14017) | |
| 106 | dad5c44398b78467943ed0a603ea427fe9f6fc62 | 55f6b9fa6563f6ae49113f9abdc980c12348cc1c | 2025-06-10T18:20:14-04:00 | compilade | kv-cache : avoid modifying recurrent cells when setting inputs (#13834) | |
| 107 | 9f47fa5792bae5312615439e68dbf1826913f7ac | 9e31bec4fd53634c9e5b04650488a09a055f5dab | 2025-06-05T09:29:18+02:00 | Sigbjørn Skjæret | vocab : warn about missing mask token (#14022) | |
| 108 | 9e31bec4fd53634c9e5b04650488a09a055f5dab | 5a8ae3053ced350ed300ba91600519fcad1c6ba7 | 2025-06-05T09:06:29+03:00 | Georgi Gerganov | context : fix pos_min initialization upon error decode (#14008) | |
| 109 | 5e1c3aed4074480f63e914d6c44c93536ed1452a | c496fe0b1da28618dd17bda8b0a6bf5004554080 | 2025-06-01T18:07:21+02:00 | Sigbjørn Skjæret | convert : fix nomic-bert-moe mask token (#13757) | |
| 110 | 12d0188c0dc6146ffde6d277a93f232ccbe699f8 | eb3949938e82a128855bc0676220bb2ce6e4228d | 2025-05-31T10:24:04+03:00 | Georgi Gerganov | kv-cache : refactor + add llama_memory_state_i (#13746) | |
| 111 | db38704f0133be7832123495fa8fc2601ea999d4 | 07e4351ce663a7802b31f92fd7bc0e555c2044b6 | 2025-05-30T14:50:43+02:00 | Sigbjørn Skjæret | convert : fix rwkv bos/eos token (#13844) | |
| 112 | 07e4351ce663a7802b31f92fd7bc0e555c2044b6 | 291f2b6913c7ef8350dbf0e77da38f7af131a08e | 2025-05-30T12:24:37+02:00 | Xuan-Son Nguyen | convert : allow partial update to the chkhsh pre-tokenizer list (#13847) | |
| 113 | bc583e3c63c04a11d287c108ea9e6a515ead0423 | 72b090da2c50e540143fd312a2f9aa5f151e6136 | 2025-05-27T14:06:10+02:00 | Xuan-Son Nguyen | mtmd : support Qwen 2.5 Omni (input audio+vision, no audio output) (#13784) | |
| 114 | f9cd68398baf2ba8af4725ca9ed00bef205e6706 | 4f81b33e324b1669b282eb81104e4a1131be7dce | 2025-05-27T12:07:52+03:00 | Georgi Gerganov | sampling : make sure samplers return at least 1 token (#13822) | |
| 115 | 79c137f77677b3c8ee3c60a7da033721b938399a | 22229314fc46b2f741bb21b12cde71f6c6a60b52 | 2025-05-26T14:03:54+03:00 | Georgi Gerganov | examples : allow extracting embeddings from decoder contexts (#13797) | |
| 116 | aa50ba462f63759e1731227f20f5009cfc2a0f16 | de2ef53a4b2c0d703749a309d19fe68fd8f1b9ac | 2025-05-25T16:22:29+02:00 | Sigbjørn Skjæret | tests : improve UGM tokenizer test coverage (#13773) | |
| 117 | c3a2624339187e89c4f65fd72a5fe7103968b5ad | ffd0eae60b7642e942c8245b89642527e36099e6 | 2025-05-24T12:29:09+02:00 | Sigbjørn Skjæret | vocab : fix ugm tokenizer precision (#13743) | |
| 118 | 8a1d206f1d2b4e45918b589f3165b4be232f7ba8 | 797990c4bca0dca5be295c63e3fb2800dc0a69c2 | 2025-05-22T22:21:07+03:00 | Georgi Gerganov | tts : fix n_ubatch + make WavTokenizer cache-less (#13713) | |
| 119 | b7a17463ec190aeee7b9077c606c910fb4688b84 | be0239693c1530a18496086331fc18d8a9adbad1 | 2025-05-21T00:55:30+08:00 | l3utterfly | mtmd-helper : bug fix to token batching in mtmd (#13650) | |
| 120 | e298d2fbd082a52c0f6ed02729f94e9bf630cf17 | f0adb80bf7c2c0d80abb04f4533b5513622d9964 | 2025-05-20T08:05:46+03:00 | Georgi Gerganov | kv-cache : add SWA support (#13194) | |
| 121 | 92ecdcc06a4c405a415bcaa0cb772bc560aa23b1 | f71f40a2847d4c9f57b86cd206e0a27b2bfb6d1c | 2025-05-19T13:04:14+02:00 | Xuan-Son Nguyen | mtmd : add vision support for llama 4 (#13282) | |
| 122 | 6a2bc8bfb7cd502e5ebc72e36c97a6f848c21c2c | e3a7cf6c5bf6a0a24217f88607b06e4405a2b5d9 | 2025-05-17T17:59:48-04:00 | Isaac McFadyen | server : added --no-prefill-assistant flag (#13608) | |
| 123 | b2838049ccf50859cea4c390e81405c2fb01e820 | aa48e373f256df9608395ee6881e7010840d6202 | 2025-05-15T05:57:02+03:00 | Georgi Gerganov | bench : handle decode errors (#13548) | |
| 124 | aa48e373f256df9608395ee6881e7010840d6202 | e3a9421b78da5c810d812e6348a405f5acc39f34 | 2025-05-15T02:39:51+01:00 | Olivier Chafik | `server`: inject date_string in llama 3.x template + fix date for firefunction v2 (#12802) | |
| 125 | 360a9c98e13d35f322b4c5b1309aab0cc90ed82b | 09d13d94fb169093095416ac6323551c37b75339 | 2025-05-14T13:35:07+02:00 | Xuan-Son Nguyen | server : fix cache_tokens bug with no cache_prompt (#13533) | |
| 126 | 43dfd741a5da77982e0a94d1e522a2481dfb914d | b064a51a4e7246fa43a3307f58e59f65e6be170a | 2025-05-10T17:19:52+02:00 | Sigbjørn Skjæret | llguidance : set tokenizer slices to default (#13424) | |
| 127 | 33eff4024084d1f0c8441b79f7208a52fad79858 | 17512a94d636c4b6c1332370acb3e5af3ca70918 | 2025-05-09T19:29:37+02:00 | Xuan-Son Nguyen | server : vision support via libmtmd (#12898) | |
| 128 | efb8b47eda78ea8ae570d4fece3953aae499289e | 0527771dd80bd18479dfaaa0a98be297fc3592bf | 2025-05-09T05:53:58-04:00 | Bartowski | imatrix : Add --parse-special for enabling parsing of special tokens in imatrix calculation (#13389) | |
| 129 | f05a6d71a0f3dbf0730b56a1abbad41c0f42e63d | ee01d71e585f4a17ae83ec55d77acfdcf0bfa798 | 2025-05-08T14:25:39-04:00 | Matt Clayton | mtmd : Expose helper_decode_image_chunk (#13366) | |
| 130 | 0ccc1213549e39ef4c1affb1bf5f49651ef4ce48 | 6562e5a4d6c58326dcd79002ea396d4141f1b18e | 2025-05-08T22:03:53+09:00 | welix | mtmd : fix the calculation of n_tokens for smolvlm (#13381) | |
| 131 | 6562e5a4d6c58326dcd79002ea396d4141f1b18e | 51fb96b1ff2e1cc98b2492a012b7d93531a6a9a8 | 2025-05-08T14:28:33+03:00 | Georgi Gerganov | context : allow cache-less context for embeddings (#13108) | |
| 132 | 27aa2595321c4d9cc4086a8e67bdea204b8309b0 | 9fdfcdaeddd1ef57c6d041b89cd8fb7048a0f028 | 2025-05-04T23:43:42+02:00 | Xuan-Son Nguyen | mtmd : add C public API (#13184) | |
| 133 | 36667c8edcded08063ed51c7d57e9e086bbfc903 | 3bf785f3efa89ed28294fbf73054558a2b034bfb | 2025-05-03T20:07:54+02:00 | Xuan-Son Nguyen | clip : revert the change of BOI/EOI token for GLM-edge (⚠️ breaking change) (#13259) | |
| 134 | 3f3769ba76061a511f02f2a48da2ad2d93fce511 | 2f567611c0234bbca0a4009762acb47b56866095 | 2025-05-02T22:23:12+05:30 | shalinib-ibm | ggml : Enable MMA for BF16 in llamafile_sgemm (#13148) | |
| 135 | 2f567611c0234bbca0a4009762acb47b56866095 | 7d2123484e6ba8fcd90fff8c01661b9dbbefdc9d | 2025-05-02T11:42:30-04:00 | Jared Van Bortel | llama-model : support Qwen2 embedding models and pooling_mode_lasttoken (#13245) | |
| 136 | e2e1ddb93a01ce282e304431b37e60b3cddb6114 | d9d398f84f96d16c308d4976f5e90222ecc2a492 | 2025-04-29T20:33:10+02:00 | matteo | server : Prefilling assistant message in openai compatible API (#13174) | |
| 137 | 00e3e5a194e88e604e7c91391b9e90332888fd72 | e98b3692be4cd8fbbd9a56fbacc2f2bf0bf26a68 | 2025-04-29T11:47:04+02:00 | Xuan-Son Nguyen | mtmd : add qwen2vl and qwen2.5vl (#13141) | |
| 138 | 5f5e39e1ba5dbea814e41f2a15e035d749a520bc | eaea3253244dc4bbe07f6cd81325847ccc6cf93e | 2025-04-28T15:52:15-04:00 | AT | model : Nomic Embed Text V2 with Mixture-of-Experts (MoE) architecture (#12466) | |
| 139 | 4e87962e34a4b257ec374c4baf6b1568554b81a9 | fb0471d1753824e75474c24f82fbdd54c94dceda | 2025-04-28T16:12:56+02:00 | Xuan-Son Nguyen | mtmd : fix glm-edge redundant token count (#13139) | |
| 140 | d2b2031e5f11b826dcc718138642f147a2009665 | 5fa9e63be82225fb3249c76f39ddda3e5bdec0a3 | 2025-04-28T14:20:56+02:00 | Xuan-Son Nguyen | llama : (mrope) allow using normal 1D position for text token (#13138) | |
| 141 | ced44be34290fab450f8344efa047d8a08e723b4 | e291450b7602d7a36239e4ceeece37625f838373 | 2025-04-27T21:57:32+02:00 | matteo | llama-chat : fix wrong template in GLM4-0414 (#13140) | |
| 142 | 553a5c3a9fdf771be2101bc3529937963f817457 | 13be08daf992c89d5169518229b3740041c0f419 | 2025-04-25T10:08:08+03:00 | Radoslav Gerganov | rpc : do not wait for response when sending RPC_CMD_SET_TENSOR (#12943) | |
| 143 | ecda2ec4b347031a9b8a89ee2efc664ce63f599c | eb1776b15a32d832f1266deeeab75b9d255c5849 | 2025-04-23T20:21:59+02:00 | Xuan-Son Nguyen | mtmd : Support Pixtral 12B (#13065) | |
| 144 | b9154ecff93ff54dc554411eb844a2a654be49f2 | 2db9ba1464f3de0aceb2b5289963e69fc369cb66 | 2025-04-18T10:04:51+02:00 | Xuan-Son Nguyen | mtmd : add methods to access `mtmd_image_tokens` (#12906) | |
| 145 | 971f245b3b5f3f55991bb779cb541b00f82eea1d | 12b17501e6015ffe568ac54fdf08e6580833bf1b | 2025-04-17T01:37:05-07:00 | Mikko Juola | llama : recognize IBM Granite 3.3 FIM tokens (#12988) | |
| 146 | 8b9cc7cdd8a0dcf0176c60c755322c95b5965299 | 64eda5deb9859e87a020e56bab5d2f9ca956f1de | 2025-04-10T22:57:16+02:00 | Xuan-Son Nguyen | llava : introduce libmtmd (#12849) | |
| 147 | 64eda5deb9859e87a020e56bab5d2f9ca956f1de | fe5b78c89670b2f37ecb216306bed3e677b49d9f | 2025-04-10T17:24:44+02:00 | Xuan-Son Nguyen | convert : ability to lazy-load safetensors remotely without downloading to disk (#12820) | |
| 148 | 0090950f679475c5ecaac2f7bca5049cca96492b | 7ecd780b1a1d5214b8d04c25ebfc194d310816ed | 2025-04-09T00:25:08-05:00 | Jeff Bolz | vulkan: In coopmat2 mmq, load q4_k/q5_k scales through shared memory (#12833) | |
| 149 | 1466621e738779eefe1bb672e17dc55d63d166bb | 82974011f312057b446c27267105bd7ad3810599 | 2025-04-07T23:06:44+02:00 | Xuan-Son Nguyen | llama : Support llama 4 text-only (#12791) | |
| 150 | a10b36c91a091f4606710fba4e9327fd71e0e738 | 83a88bd6affbe148a622ac730952ac5b8b585979 | 2025-04-02T14:32:59+03:00 | Georgi Gerganov | llama : refactor kv cache guard (#12695) | |
| 151 | c80a7759dab10657b9b6c3e87eef988a133b9b6a | 250d7953e829ff0e16074510fef0e7cec696461b | 2025-03-31T18:40:56+02:00 | Daniel Bevenius | vocab : add special infill tokens for CodeLlama (#11850) | |
| 152 | 403fbacbbcd3650abcc53e84f5e6bf88e51dd6f5 | a8a1f3356786cbf8bcc3422e3c8737fc33b453e7 | 2025-03-31T16:36:25+02:00 | Sigbjørn Skjæret | convert : Qwerky : use lora_rank_tokenshift and lora_rank_decay if present (#12667) | |
| 153 | 52de2e594979be52f0da92601747aa44a13e50e4 | 2c3f8b850a4a6cff0f5dda2135c03fc81d33ed8b | 2025-03-31T10:20:30+02:00 | marcoStocchi | tts : remove printfs (#12640) | |
| 154 | 5d01670266859444366e4f333ade5e0e5e2ae63d | ef03229ff423dd1991f4f44ef1352f03334d86eb | 2025-03-28T01:05:44-07:00 | Benson Wong | server : include speculative decoding stats when timings_per_token is enabled (#12603) | |
| 155 | 13731766db91ec927c1b61bf502ac7a9be2b11b9 | ab6ab8f809bd514d88e02a63869b4d619f13fa86 | 2025-03-28T13:13:22+05:30 | amritahs-ibm | llamafile : ppc64le GEMV forwarding for FP32. (#12594) | |
| 156 | c7b43ab60855f752ae79937fb93d561bc30b69a4 | 24feaec05792b972d5ff3e2b12d9237ebd50d1ac | 2025-03-27T12:21:47+05:30 | amritahs-ibm | llamafile : ppc64le MMA implementation for Q4_0. (#12489) | |
| 157 | 00d53800e00bb22a26bf710fa6bd1150e412cc1d | 7ea75035b67f44c22ed7039967f718011fd35ce5 | 2025-03-24T06:47:24-04:00 | compilade | llama-vocab : add SuperBPE pre-tokenizer (#12532) | |
| 158 | 732b5fbf5e7f9cf069942f0c5850ee959ef321ba | 568013d0cd3d5add37c376b3d5e959809b711fc7 | 2025-03-20T02:36:37-04:00 | Bartowski | convert : avoid calls to tokenizer.added_tokens_decoder (#12473) | |
| 159 | 2048b5913d51beab82dfe29955f9008130b936c0 | f08f4b3187b691bb08a8884ed39ebaa94e956707 | 2025-03-13T06:10:05-04:00 | Ishaan Gandhi | server : fix crash when using verbose output with input tokens that are not in printable range (#12178) (#12338) | |
| 160 | 2b3a25c212f8c4d8a49cec23e03343a7719d51c9 | 8352cdc87b207a735d34c431a36c425728cb4586 | 2025-03-10T09:44:42Z | Olivier Chafik | `sampler`: fixes trigger tokens + lazy grammars (fix typo cast from token to string) (#12291) | |
| 161 | 06a92a193a07afe445929607be9d5e4d033956fb | a057897ad4e48e3df0354256e0cc80dadcb57595 | 2025-03-05T15:25:45+08:00 | Clauszy | server : fix cache reuse logic (#12161) | |
| 162 | 7b69003af74924ac04d97313c2e57c45ba56b616 | ece9745bb8079b9f4af45df29b67ad0c6e50584d | 2025-03-03T11:42:45+01:00 | Xuan-Son Nguyen | webui : add ?m=... and ?q=... params (#12148) | |
| 163 | 34a846b5847a18d133b360074f1fb485b2632b2d | 7a2c913e66353362d7f28d612fd3c9d51a831eda | 2025-02-24T13:47:07-08:00 | lhez | opencl: fix for small models (#11950) | |
| 164 | af7747c95ae71a5db4184947f837179e82c70b77 | a28e0d5eb18c18e6a4598286158f427269b1444e | 2025-02-23T05:39:24+08:00 | Aaron Teo | ggml-cpu: Support s390x SIMD Instruction Set (#12019) | |
| 165 | 36c258ee921dbb5c96bdc57c0872e4a9a129bef6 | f3e64859edb0d55d4223ead78672597cd1a218df | 2025-02-22T22:28:28+08:00 | Ting Lou | llava: build clip image from pixels (#11999) | |
| 166 | abd4d0bc4f1a9a0e429bc8ee0d5ece2a394a0a39 | 9626d9351a6dfb665400d9fccbda876a0a96ef67 | 2025-02-19T13:29:42+02:00 | Georgi Gerganov | speculative : update default params (#11954) | |
| 167 | 63e489c025d61c7ca5ec06c5d10f36e2b76aaa1d | 63ac12856303108ee46635e6c9e751f81415ee64 | 2025-02-18T18:03:23Z | Olivier Chafik | tool-call: refactor common chat / tool-call api (+ tests / fixes) (#11900) | |
| 168 | 3e693197724c31d53a9b69018c2f1bd0b93ebab2 | a394039db004c6ee00098250d160b5aa018c2314 | 2025-02-13T07:07:51+01:00 | Daniel Bevenius | llama : update llama_decode_internal ref [no ci] (#11840) | |
| 169 | a18f481f99962638092d6f1c98b1d34d3e3256de | b9ab0a4d0b2ed19effec130921d05fb5c30b68c5 | 2025-02-11T14:06:45+01:00 | Daniel Bevenius | server : use common_token_to_piece instead of common_detokenize (#11740) | |
| 170 | 2d219b389e8c8c40bce547b08c8aa7add60fde1f | 333820d7491cd31c707a340ff23b984a84e40154 | 2025-02-07T08:55:47-05:00 | Christian Fillion | vocab : ignore invalid UTF-8 input in the BPE tokenizer (#11729) | |
| 171 | c3db0480bb820e120249014b380e1f4badf2a1c1 | d774ab3acc4fee41fbed6dbfc192b57d5f79f34b | 2025-02-06T01:55:25+01:00 | Matvey Soloviev | readme : add link to Autopen under UIs (#11684) | |
| 172 | cde383323959544abe10a4d79e1d3e1ee479933c | b3451785aca16fbf4214eeba7e4612676cdf8ccb | 2025-02-03T23:49:27Z | Olivier Chafik | `tool-call`: allow `--chat-template chatml` w/ `--jinja`, default to chatml upon parsing issue, avoid double bos (#11616) | |
| 173 | ff227703d6d6e1888bdc7af6138514092ffcdb96 | 0cec062a638700495673f5494d200b74340538be | 2025-02-01T23:55:32-08:00 | Michał Moskal | sampling : support for llguidance grammars (#10224) | |
| 174 | 0cec062a638700495673f5494d200b74340538be | 53debe6f3c9cca87e9520a83ee8c14d88977afa4 | 2025-02-02T15:48:46+08:00 | piDack | llama : add support for GLM-Edge and GLM-Edge-V series models (#10573) | |
| 175 | ffd0821c57edc7e5d04338ab0c6b1461198df15f | 4314e56c4f8c5091f45732f39bd94c0c6c323798 | 2025-01-30T11:10:59+01:00 | mgroeber9110 | vocab : correctly identify LF token for GPT-2 style BPE tokenizer (#11496) | |
| 176 | df984e014714cba4c99ef894b20b51cbcef31b16 | acd38efee316f3a5ed2e6afcbc5814807c347053 | 2025-01-27T12:07:12+01:00 | Johannes Gäßler | llama: refactor llama_decode_impl (#11381) | |
| 177 | 6171c9d25820ccf676b243c172868819d882848f | e28245f35f2faaf249dd352998b3693a8cc28c51 | 2025-01-21T13:18:51Z | Olivier Chafik | Add Jinja template support (#11016) | |
| 178 | 6390a998bfc63241fde8509022b0768a71bf20bb | 44e18ef93995f3040660750b527e5becf85899d0 | 2025-01-18T18:20:57+08:00 | LostRuins Concedo | tts : add guide tokens support (#11186) | |
| 179 | 3edfa7d3753c29e44b964c0ff424d2ea8d5fdee6 | 667d72846c06b2cf4f7c8a4265e210991a49706b | 2025-01-17T20:57:56+08:00 | codezjx | llama.android: add field formatChat to control whether to parse special tokens when send message (#11270) | |
| 180 | 8f70fc3d1b1d3c17b61842330dd106d391cc1227 | 1244cdcf14900dd199907b13f25d9c91a507f578 | 2025-01-13T13:38:20+01:00 | Daniel Bevenius | llama : remove 'd' from bad special token log (#11212) | |
| 181 | 08f10f69c38288e9e8bb1f933af63a3fc9013d40 | afa8a9ec9b520137bbd1ca6838cda93ee39baf20 | 2025-01-12T12:15:53+02:00 | Georgi Gerganov | llama : remove notion of CLS token (#11064) | |
| 182 | afa8a9ec9b520137bbd1ca6838cda93ee39baf20 | c05e8c9934f94fde49bc1bc9dc51eed282605150 | 2025-01-12T11:32:42+02:00 | Georgi Gerganov | llama : add `llama_vocab`, functions -> methods, naming (#11110) | |
| 183 | 2739a71e4b88474833b64aa974ca4515574fd3c4 | ba8a1f9c5b675459c55a83e3f97f10df3a66c788 | 2025-01-11T05:50:33+01:00 | Daniel Bevenius | convert : sort print supported models [no ci] (#11179) | |
| 184 | ff3fcabc727b2dd0c477d23a258217b27cc639fb | c3f9d25706ac84297067aeaa662c1f1af42ed443 | 2025-01-10T11:30:53+01:00 | Daniel Bevenius | convert : add --print-supported-models option (#11172) | |
| 185 | 8cef75c743ba13ebbd6d380c531200c768a8b8aa | 0d52a69e4bf0d6181beec7853307bdcdeec9905b | 2025-01-08T16:24:19+05:30 | amritahs-ibm | llamafile : ppc64le MMA INT8 implementation (#10912) | |
| 186 | 3e6e7a6bc2c4b980a0cf0fcb5cb3b79a965b5f14 | ae2f606bb598b287f5fb69c9fdfc98b86598c6cc | 2025-01-06T10:54:25+02:00 | Georgi Gerganov | tokenize : escape the prompt (#11058) | |
| 187 | 727368c60f2ebf2d6a7473a4a9f80957ab063a8e | 5047dd3546951dea3d65c02257d06c46c8662338 | 2025-01-06T10:52:15+02:00 | Georgi Gerganov | llama : use LLAMA_TOKEN_NULL (#11062) | |
| 188 | 9394bbd484f802ce80d2858033583af3ef700d25 | f922a9c542ee117550a168395c63ea79261f5c99 | 2025-01-04T21:06:11+01:00 | fairydreaming | llama : Add support for DeepSeek V3 (#11049) | |
| 189 | 2f0ee84b9b02d2a98742308026f060ebdc2423f1 | 0da5d860266c6928b8c9408efbd264ae59fedda6 | 2025-01-02T18:06:12+01:00 | Pierrick Hymbert | server: bench: minor fixes (#10765) | |
| 190 | 16cdce7b68218959e0658e2f95b4572573d5008e | d79d8f39b4da6deca4aea8bf130c6034c482b320 | 2024-12-28T15:08:54Z | Alexey Parfenov | server : fix token duplication when streaming with stop strings (#10997) | |
| 191 | 30caac3a68a54de8396b21e20ba972554c587230 | 60cfa728e27c28537657d4e627ed432508eb9537 | 2024-12-24T09:44:20+02:00 | Georgi Gerganov | llama : the WPM vocabs use the CLS token as BOS (#10930) | |
| 192 | b92a14a841fb4dfaf27b29d982ec8ba5289a3bff | 6f0c9e034bb398915a6617ee4acc62adb87d387d | 2024-12-23T08:35:44+08:00 | Yun Dou | llama : support InfiniAI Megrez 3b (#10893) | |
| 193 | 7ae33a616f44ecc081f3dcb589be20962d1d4a92 | ebdee9478ca7ba65497b9b96f7457698c6ee5115 | 2024-12-23T01:09:58+03:00 | Billel Mokeddem | llama : add Falcon3 support (#10883) | |
| 194 | 57bb2c40cd94c5a09f5210ed8264cc93b21c4b7e | a3c33b1dce2d4f25040b75f66629104bd1e40128 | 2024-12-19T15:40:08+01:00 | Xuan Son Nguyen | server : fix logprobs, make it OAI-compatible (#10783) | |
| 195 | 2fffc52b50992ac5bc64db19d33c39cbc06f52cf | 7585edbdebd02861e0994dae67c9338731fb3fc5 | 2024-12-19T06:04:51-07:00 | Sukriti Sharma | llama : fix Roberta embeddings (#10856) | |
| 196 | 0bf2d10c5514ff61b99897a4a5054f846e384e1e | 7bbb5acf125d1d2840cac7d31b9aaa72210dd5ec | 2024-12-18T19:27:21+02:00 | Georgi Gerganov | tts : add OuteTTS support (#10784) | |
| 197 | 152610eda91217ac409342cd976d05f5114ad39f | 0e70ba686e6c717a0aa41d88284e2a392c2bd0cd | 2024-12-18T13:01:41+02:00 | Georgi Gerganov | server : output embeddings for all tokens when pooling = none (#10861) | |
| 198 | 644fd71b44c4cdbfc6482fbf0353d289c3bc29e6 | 4ddd199f6f6b980e0a7ed9f9b44efeae2fbdf5c4 | 2024-12-16T12:31:14+02:00 | Georgi Gerganov | sampling : refactor + optimize penalties sampler (#10803) | |
| 199 | ba1cb19cdd0d92e012e0f6e009e0620f854b6afd | 56eea0781cbd2608ed8ff524955495569b9264be | 2024-12-14T20:43:46+08:00 | HimariO | llama : add Qwen2VL support + multimodal RoPE (#10361) | |
| 200 | 8fc393f246c550d2481e53323a47644a94e8d01f | ec450d3bbf9fdb3cd06b27c00c684fd1861cb0cf | 2024-11-09T15:06:54+08:00 | haopeng | scripts : fix pattern and get n_tokens in one go (#10221) | |
| 201 | 2319126a70b541f8670225a04a38202bbdccbedb | 3bcd40b3c593d14261fb2abfabad3c0fb5b9e318 | 2024-11-07T02:02:08-06:00 | snadampal | fix q4_0_8_8 format for corrupted tokens issue (#10198) | |
| 202 | d865d1478cd4e403f82d793c2afcd0f943412f05 | 1804adb0cfee4811eaf633741503d683a46e4c77 | 2024-11-01T13:33:14Z | sasha0552 | server : fix smart selection of available slot (#10120) | |
| 203 | 958367bf530d943a902afa1ce1c342476098576b | 40f2555797f97314de749873cdc29dc102be66e2 | 2024-10-24T21:51:22+02:00 | Xuan Son Nguyen | server : refactor slot input data, move tokenizer to HTTP thread (#10023) | |
| 204 | c8c07d658a6cefc5a50cfdf6be7d726503612303 | 19d900a7565b8f6b0a708836a57d26966cb9efe2 | 2024-10-22T16:59:02+02:00 | Xuan Son Nguyen | llama : fix empty batch causing llama_batch_allocr to crash (#9966) | |
| 205 | c421ac072d46172ab18924e1e8be53680b54ed3b | 4ff7fe1fb36b04ddd158b2de881c348c5f0ff5e4 | 2024-10-22T13:08:41+02:00 | Xuan Son Nguyen | lora : warn user if new token is added in the adapter (#9948) | |
| 206 | 4ff7fe1fb36b04ddd158b2de881c348c5f0ff5e4 | 6b8447352df3d662b56280c8fc38d7f092885787 | 2024-10-22T18:33:37+08:00 | Molly Sophia | llama : add chat template for RWKV-World + fix EOT (#9968) | |
| 207 | cda0e4b648dde8fac162b3430b14a99597d3d74f | afd9909a6481402844aecefa8a8908afdd7f52f1 | 2024-10-18T23:18:01+02:00 | Xuan Son Nguyen | llama : remove all_pos_0, all_pos_1, all_seq_id from llama_batch (#9745) | |
| 208 | 6f55bccbb8835d42147add4ee48807450f5ff535 | 17bb9280807cfbb6611b853aa1ef05114bd9efe9 | 2024-10-18T01:41:51+02:00 | Daniel Bevenius | llama : rename batch_all to batch (#8881) | |
| 209 | 99bd4ac28c32cd17c0e337ff5601393b033dc5fc | 3752217ed5a6a11864682fbf009bcb36afffd6bc | 2024-10-17T22:32:47+03:00 | Georgi Gerganov | llama : infill sampling handle very long tokens (#9924) | |
| 210 | 9e041024481f6b249ab8918e18b9477f873b5a5e | dbf18e4de9e7aa496871f1555f9f0c8d84567108 | 2024-10-16T19:34:28+02:00 | Daniel Bevenius | llama : suppress conversion from 'size_t' to 'int' (#9046) | |
| 211 | fbc98b748e7b075e327bcf13237057f647678049 | dcdd535302fc9702a4709be25f56540d65163a44 | 2024-10-15T15:54:55+05:00 | MaggotHATE | sampling : add XTC sampler (#9742) | |
| 212 | 11ac9800aff532715a5bc7991062c68ba3472e6e | 943d20b4111c746bcd9dbc7e4771de313b08b50c | 2024-10-12T08:21:51+03:00 | Georgi Gerganov | llama : improve infill support and special token detection (#9798) | |
| 213 | 8c475b97b8ba7d678d4c9904b1161bd8811a9b44 | 58b16695e146628481c6b9b8a3b101c0c9bac00f | 2024-10-05T15:55:04+03:00 | Georgi Gerganov | rerank : use [SEP] token instead of [BOS] (#9737) | |
| 214 | e3c355ba654d4164c1c09e5d0dcacecb8b214af8 | 841713e1e487bdb82fd106a52ad998c5f87b59e9 | 2024-10-03T10:22:15-04:00 | compilade | convert : handle tokenizer merges format from transformers 4.45 (#9696) | |
| 215 | 1927378bcce20ba72b6c89d5977b854a4bcaeb5d | 6f1d9d71f4c568778a7637ff6582e6f6ba5fb9d3 | 2024-10-01T02:31:36-04:00 | compilade | convert : refactor rope_freqs generation (#9396) | |
| 216 | faac0bae265449fd988c57bf894018edc36fbe1e | f99d3f8367174f7aba73c07fd87de687d4a0ece1 | 2024-09-29T05:25:00-07:00 | matiaslin | common : ensure llama_batch size does not exceed max size (#9668) | |
| 217 | f4d2b8846a6b34419ff9e9491aee6cd95e444bfc | 1b2f992cd2cff0b69e5abe78bb8888d51ed19d67 | 2024-09-28T17:42:03+03:00 | Georgi Gerganov | llama : add reranking support (#9510) | |
| 218 | 6102037bbb55521880ae78a6ee6c2a0c00c901df | 9a913110cf471a8287ac06c43cbe307d3cf6df99 | 2024-09-28T20:10:58+08:00 | Zhenwei Jin | vocab : refactor tokenizer to reduce init overhead (#9449) | |
| 219 | 9a913110cf471a8287ac06c43cbe307d3cf6df99 | 43bcdd9703ec19af7d2a519640b5ed6f4aac3d53 | 2024-09-28T12:08:43Z | nopperl | llama : add support for Chameleon (#8543) | |
| 220 | 31ac5834fe75c296476658a124c06c84772aa641 | cea1486ecf34a1c7e014a9e290eb458f5a11f876 | 2024-09-24T10:16:06+03:00 | Georgi Gerganov | llama : keep track of all EOG tokens in the vocab (#9609) | |
| 221 | 6443ddd98576a9da904ef9f07df4e4398bb6a01a | 8a308354f6520df6bea851b435bd8054ee5617b4 | 2024-09-18T13:42:36+02:00 | Daniel Bevenius | llama : use reserve/emplace_back in sampler_sample (#9534) | |
| 222 | 8344ef58f8cdb8ebd6faf4463ca32ae91c374c81 | 0226613853133c081b55bb892a41bb5eacc0bc94 | 2024-09-17T12:18:22+02:00 | Michael Podvitskiy | llama : fix n_vocab init for 'no_vocab' case (#9511) | |
| 223 | 0abc6a2c25272d5cf01384dda8ee8bfec4ba8745 | bd35cb0ae357185c173345f10dc89a4ff925fc25 | 2024-09-13T09:53:38+03:00 | Georgi Gerganov | llama : llama_perf + option to disable timings during decode (#9355) | |
| 224 | 78203641fee3b1f82abaff0c7f667e1b4a286390 | e6b7801bd189d102d901d3e72035611a25456ef1 | 2024-09-12T22:30:11+02:00 | Mathijs Henquet | server : Add option to return token pieces in /tokenize endpoint (#9108) | |
| 225 | c837981bba7cf6839b69d32b25552ce685936b14 | 3c26a1644dacfa6b5d58af550210524efd7b93fc | 2024-09-12T20:28:20+09:00 | daminho | py : add Phi-1.5/Phi-2 tokenizer (#9361) | |
| 226 | 39f852f44039b058fdd0611ee127c6efa7ba4a04 | 2b00fa799773cc75d53b841c03d21d7468a1e3a1 | 2024-09-12T19:25:16+08:00 | Molly Sophia | py : add special tokens in hf_converter for RWKV v6 (#9428) | |
| 227 | 1b28061400eb9832603c9f1dfbec4d339a8490a2 | 8db003a19d7055b5bd248ce2afff9324e5b8da95 | 2024-09-11T17:52:13+02:00 | slaren | llama : skip token bounds check when evaluating embeddings (#9437) | |
| 228 | 83008b7cfe90ad89d0c0ed2c2424fd75edc25ac1 | 0b4ac75772b744bb0a0d674927587621d1057884 | 2024-09-10T09:03:21+02:00 | Daniel Bevenius | llama : update llm_build_copy_mask_state comment [no ci] (#9385) | |
| 229 | eae597182cb61bbde0b26e7cec5999d28b9327fe | 00b02bb249406ec0123757a67a5b714c3f33a699 | 2024-09-08T12:41:51+02:00 | slaren | llama : sanitize tokens in the upper bound (#9359) | |
| 230 | fbb7fcffbcfc50009c275e75982b1603a6cb6b80 | a5b5d9a1014248f385939e6739e9db9de7147e55 | 2024-09-07T22:51:00-07:00 | Kevin Gibbons | llama : set attrs of mislabelled EOT/EOM tokens (#9348) | |
| 231 | faf69d4237c9ae4d7f572b4674d1002463e8acd3 | e536426ded3fb4a8cd13626e53508cd92928d6c2 | 2024-09-08T00:33:13+03:00 | Georgi Gerganov | llama : sanitize invalid tokens (#9357) | |
| 232 | 9b2c24c0993487d3b34a873980e292da571481f3 | 134bc38ecf3e2c5460581badce289a1ffa680453 | 2024-09-06T23:21:29+02:00 | Xuan Son Nguyen | server : simplify state machine for slot (#9283) | |
| 233 | 9bc6db28d011d47a5f318dc4aebbe7927fac4629 | 32b2ec88bc44b086f3807c739daf28a1613abde1 | 2024-09-05T21:48:47-04:00 | compilade | ggml-quants : ternary packing for TriLMs and BitNet b1.58 (#8151) | |
| 234 | 9c1ba557335c3cab46807e6478eb7d17a63361f1 | c6d4cb46559b359d2682cf2a002e7fe01bb7a767 | 2024-09-02T16:51:01+05:30 | Tushar | build(nix): Package gguf-py (#5664) | |
| 235 | 8f1d81a0b6f50b9bad72db0b6fcd299ad9ecd48c | a47667cff41f5a198eb791974e0afcc1cddd3229 | 2024-09-01T22:38:17+08:00 | Molly Sophia | llama : support RWKV v6 models (#8980) | |
| 236 | c679e0cb5c378bfb63643c44a453345ba8b90126 | fb487bb5671b37267f35ff43fe8849ddccd925cd | 2024-08-16T15:35:18+09:00 | Minsoo Cheong | llama : add EXAONE model support (#9025) | |
| 237 | 4af8420afba39de4968adf2695ce12fd42422a13 | 6bda7ce6c3a9284fcbb70c1ace4107db8eb63e5c | 2024-08-15T15:23:23+08:00 | Zhenwei Jin | common : remove duplicate function llama_should_add_bos_token (#8778) | |
| 238 | 6bda7ce6c3a9284fcbb70c1ace4107db8eb63e5c | d5492f0525fa533817a67e93a4bde9d71d81cf58 | 2024-08-15T10:17:12+03:00 | Esko Toivonen | llama : add pre-tokenizer regexes for BLOOM and gpt3-finnish (#8850) | |
| 239 | 5ef07e25ac39e62297a67208c5bcced50835a2dd | 4134999e01f31256b15342b41c4de9e2477c4a6c | 2024-08-12T10:21:50+03:00 | Georgi Gerganov | server : handle models with missing EOS token (#8997) | |
| 240 | 7c3f55c10051c634546247387c5c359c9d499360 | 911b437f228e75aa3d235acec21bfddd23ecce2f | 2024-08-10T11:43:26+02:00 | fairydreaming | Add support for encoder-only T5 models (#8900) | |
| 241 | cdd1889de62a7140c8c016405ec917464bde8bd3 | c21a896405de4cdf4207eb8130555ceaac0ab110 | 2024-08-06T02:20:54-05:00 | Douglas Hanley | convert : add support for XLMRoberta embedding models (#8658) | |
| 242 | d3f0c7166adfa952237e0f437a5344362d8256d4 | e31a4f679779220312c165b0f5994c680a610e38 | 2024-08-05T09:38:01+02:00 | fairydreaming | Stop the generation when <|eom_id|> token is encountered - needed for Llama 3.1 tool call support (#8858) | |
| 243 | 978ba3d83d17b10fdf9807006048432b5b3769fc | ecf6b7f23e664afd7ff856ec39034240ce438daa | 2024-08-04T18:16:23Z | ardfork | Server: Don't ignore llama.cpp params (#8754) | |
| 244 | 9d03d085dd6cb275c078690bb64073b9b043e95f | bfb4c74981f0a40d757b450b596a9fe4ca983d26 | 2024-07-27T12:45:02+02:00 | Daniel Bevenius | common : add --no-warmup option for main/llama-cli (#8712) | |
| 245 | 938943cdbf4dd79005a394d732bc226f9e34e0ff | 751fcfc6c33ea5f43cadd4d976f8fb176871df5e | 2024-07-23T13:10:17+03:00 | Georgi Gerganov | llama : move vocab, grammar and sampling into separate files (#8508) | |
| 246 | d94c6e0ccbd29ee1ba4f44e9caa8682ad94df9fa | 566daa5a5b38018b2727950bbd280239adb981b6 | 2024-07-22T10:43:01-04:00 | Jason Stillerman | llama : add support for SmolLm pre-tokenizer (#8609) | |
| 247 | 6f11a83e4e7700fdf353ed4a29599cb662c792f6 | e093dd238282a980d248db0786063f8174400f70 | 2024-07-22T13:33:22+03:00 | Georgi Gerganov | llama : allow overrides for tokenizer flags (#8614) | |
| 248 | e093dd238282a980d248db0786063f8174400f70 | 50e05353e88d50b644688caa91f5955e8bdb9eb9 | 2024-07-22T13:32:49+03:00 | Georgi Gerganov | tests : re-enable tokenizer tests (#8611) | |
| 249 | 628154492a0b2dcc954a3af99e5c267097568eae | 04bab6b7da0ed2b0a57174a57784d602aabb6c10 | 2024-07-22T16:02:09+08:00 | Jan Boon | server : update doc to clarify n_keep when there is bos token (#8619) | |
| 250 | c69c63039cd75f8f33f253ab7485d82a8b4cd403 | 69c487f4ed57bb4d4514a1b7ff12608d5a8e7ef0 | 2024-07-20T21:53:01-04:00 | compilade | convert_hf : fix Gemma v1 conversion (#8597) | |
| 251 | 940362224d20e35f13aa5fd34a0d937ae57bdf7d | 69b9945b44c3057ec17cb556994cd36060455d44 | 2024-07-20T09:43:51-04:00 | Michael Coppola | llama : add support for Tekken pre-tokenizer (#8579) | |
| 252 | 69b9945b44c3057ec17cb556994cd36060455d44 | c3776cacabce2ee35f172fb72be7a519752125fa | 2024-07-20T09:09:37-04:00 | Huifeng Ou | llama.swiftui: fix end of generation bug (#8268) | |
| 253 | fa79495bb4897953a75607addd9d2cdd2ec63222 | 17eb6aa8a992cda37ee65cf848d9289bd6cad860 | 2024-07-13T23:35:10-04:00 | compilade | llama : fix pre-tokenization of non-special added tokens (#8228) | |
| 254 | c3ebcfa148e867a68e78fd5c4f0c23e8f84c788b | 8a4441ea1a2564578134404f31158c318e9c0bf3 | 2024-07-12T03:14:12-05:00 | Douglas Hanley | server : ensure batches are either all embed or all completion (#8420) | |
| 255 | 5aefbce27a66473d4b1263ba3f7bdd3d14245975 | 71c1121d11f1437be9421fd0cbaa011b9ef49098 | 2024-07-12T10:06:33+02:00 | Jiří Podivín | convert : remove fsep token from GPTRefactForCausalLM (#8237) | |
| 256 | 9a55ffe6fbf7f19c865f8f277ca7cd585cc0b094 | 7a221b672e49dfae459b1af27210ba3f2b5419b6 | 2024-07-11T03:41:48-04:00 | compilade | tokenize : add --no-parse-special option (#8423) | |
| 257 | 470939d483d1c89b7292f78bac1fd27c42c171ce | 6f0dbf6ab087bcd286fb78560099ca0458316735 | 2024-07-08T03:26:53-04:00 | Kevin Wang | common : preallocate sampling token data vector (#8363) | |
| 258 | 6f0dbf6ab087bcd286fb78560099ca0458316735 | ffd00797d81ef7db1528b9e10adbdc333ade6495 | 2024-07-08T09:34:35+03:00 | Georgi Gerganov | infill : assert prefix/suffix tokens + remove old space logic (#8351) | |
| 259 | 3fd62a6b1c9ca7b7c0093e984cc9c133c6f2726d | a8db2a9ce64cd4417f6a312ab61858f17f0f8584 | 2024-07-07T15:04:39-04:00 | compilade | py : type-check all Python scripts with Pyright (#8341) | |
| 260 | 905942abdba5ba0b28a1b0805e51e4f818c54bc9 | b5040086d436e7345e4fa33a5b9558060c75603f | 2024-07-07T20:52:10+08:00 | toyer | llama : support glm3 and glm4 (#8031) | |
| 261 | 86e7299ef5dff0f388922dc6fcbce009e99d8005 | 60d83a0149849e9217e4b8ae26e277a41aea906e | 2024-07-06T15:32:04-05:00 | Derrick T. Woolworth | added support for Authorization Bearer tokens when downloading model (#8307) | |
| 262 | 213701b51a17175d0d326b566efc03f30ec7fbe6 | be20e7f49d9e5c6d9e8d9b4871eeba3df7a1639d | 2024-07-05T19:01:35+02:00 | jaime-m-p | Detokenizer fixes (#8039) | |
| 263 | 6f63d646c1a06a6e09f721009a2676864ae04e31 | 51d2ebadbbf365b894f3888361df42dbacb12b7a | 2024-07-04T18:38:58+02:00 | Daniel Bevenius | tokenize : add --show-count (token) option (#8299) | |
| 264 | 807b0c49ff7071094f97ebc3a0a8e2b9e274f503 | f8c4c0738d72d2162736edd72dd5db8b269adca1 | 2024-07-04T15:46:11+02:00 | fairydreaming | Inference support for T5 and FLAN-T5 model families (#5763) | |
| 265 | 20fc3804bfb727074bc270b6eacb60af8d0bf7d4 | f619024764e72261f14d7c31d892b8fb976603b4 | 2024-07-04T10:41:03+03:00 | Georgi Gerganov | convert : fix gemma v1 tokenizer convert (#8248) | |
| 266 | 5fac350b9cc49d0446fc291b9c4ad53666c77591 | cb5fad4c6c2cbef92e9b8b63449e1cb7664e4846 | 2024-07-02T01:07:23+02:00 | Xuan Son Nguyen | Fix gemma2 tokenizer convert (#8244) | |
| 267 | e57dc62057d41211ac018056c19c02cd544694df | a27aa50ab7e07fe46aae619076b6e31d5663e914 | 2024-06-28T00:00:43-04:00 | pculliton | llama: Add support for Gemma2ForCausalLM (#8156) | |
| 268 | f675b20a3b7f878bf3be766b9a737e2c8321ff0d | 911e35bb8bb2fd1c7d3f40f27e96ff432eae7e14 | 2024-06-27T11:58:54+03:00 | kustaaya | Added support for Viking pre-tokenizer (#8135) | |
| 269 | 911e35bb8bb2fd1c7d3f40f27e96ff432eae7e14 | ac146628e47451c531a3c7e62e6a973a2bb467a0 | 2024-06-27T09:46:41+02:00 | Sigbjørn Skjæret | llama : fix CodeLlama FIM token checks (#8144) | |
| 270 | 6777c544bdd8c5d9de3220d6e2557957bbbf2a4f | 163d50adaf8897d8b734d701ff332de6be63d484 | 2024-06-26T01:45:58+01:00 | Olivier Chafik | `json`: fix additionalProperties, allow space after enum/const (#7840) | |
| 271 | 6fcbf6823553efabe52ed83e3c2a3329aa3387d1 | e6bf007744eb06336a231ef39cf08146dd16d2ce | 2024-06-25T21:14:35+02:00 | fairydreaming | llama : implement Unigram tokenizer needed by T5 and FLAN-T5 model families (#5763) | |
| 272 | d62e4aaa02540c89be8b59426340b909d02bbc9e | 9a590c82262dd518137f85406e65e452fdf2aca3 | 2024-06-24T14:13:39+02:00 | fairydreaming | gguf-py : fix tensor groups for encoder-decoder models in gguf-dump.py (#8090) | |
| 273 | de0d6a68ac99f307fe889c48e21124bc3b7ca29a | 95f57bb5d5b18ef0beb2702a0d6c06e46804075c | 2024-06-24T07:06:05+02:00 | fairydreaming | gguf-py, convert-hf : model conversion support for T5 and FLAN-T5 model variants (#5763) | |
| 274 | a927b0f3dd9a86ee042cd2bdcc8c9da4a855926b | 80ea089d771f0c2d97afa8bead80ded412f600d7 | 2024-06-21T08:51:28+03:00 | Georgi Gerganov | llama : optimize long word tokenization with WPM (#8034) | |
| 275 | 80ea089d771f0c2d97afa8bead80ded412f600d7 | 0e64591e8290037db6412665a56354b789a0597e | 2024-06-21T00:38:22-05:00 | Douglas Hanley | llama : allow pooled embeddings on any model (#7477) | |
| 276 | 37bef8943312d91183ff06d8f1214082a17344a5 | 91c188d6c296bd3384f2a02a83b71187aa3d18b3 | 2024-06-18T18:40:52+02:00 | jaime-m-p | tokenizer : BPE fixes (#7530) | |
| 277 | 91c188d6c296bd3384f2a02a83b71187aa3d18b3 | 84f6de17f6a8602e7ff7f7c7bda36a73f510a2dd | 2024-06-18T14:19:45+02:00 | Sigbjørn Skjæret | Only use FIM middle token if it exists (#7648) | |
| 278 | 0c7b3595b9e5ad2355818e259f06b0dc3f0065b3 | 7b2f4a7d193ef2475259bbe7656fcccfab4b1217 | 2024-06-15T18:53:40+02:00 | Xuan Son Nguyen | Add `cvector-generator` example (#7514) | |
| 279 | 6fcd1331efbfbb89c8c96eba2321bb7b4d0c40e4 | 41b9260f18eb7f325c952006ac46afc1d0d8ad2f | 2024-06-14T12:20:04+02:00 | Sigbjørn Skjæret | llama : more checks before assuming FIM tokens (#7644) | |
| 280 | 41b9260f18eb7f325c952006ac46afc1d0d8ad2f | 172c8256840ffd882ab9992ecedbb587d9b21f15 | 2024-06-14T13:16:49+03:00 | Elaine | convert : add Poro-34B-chat tokenizer support (#7713) | |
| 281 | ad675e1c67a05b16e4e12abe30dbecfc808e7b7e | a143c04375828b1f72eb1a326115791b63e79345 | 2024-06-06T06:08:52-07:00 | Clint Herron | Added support for . (any character) token in grammar engine. (#6467) | |
| 282 | c90dbe026b456a233f8f0fbe752212e6a0503ca2 | b90dc566c1c615289b05b50d61680f23744a21e7 | 2024-06-05T01:26:14+02:00 | jaime-m-p | Fix per token atrributes bits (#7749) | |
| 283 | 3b38d48609280aa5f8ab7ea135a4351b2a5ee240 | 6d1616944d9efd342ed2a4fd318722adfc9febcd | 2024-06-04T09:17:17+02:00 | jaime-m-p | Per token attributes (#7685) | |
| 284 | 549279d8049d78620a2b081e26edb654f83c3bbd | 9e405b6e2ecb888e860f7b92720b4809e21b3915 | 2024-06-03T08:34:43+03:00 | Georgi Gerganov | llama : avoid double token-to-piece cache (#7654) | |
| 285 | 2e666832e6ac78194edf030bd1c295e21bdb022c | 2ac95c9d5678d05e253691fb1f26471675bff5ad | 2024-06-01T21:31:48+02:00 | Yazan Agha-Schrader | server : new UI (#7633) | |
| 286 | 2ac95c9d5678d05e253691fb1f26471675bff5ad | 750f60c03e4d3f53fa51910551ce87a3d508d2d7 | 2024-06-01T21:50:18+05:30 | HanishKVC | SimpleChat: Simple histogram/repeatMatching driven garbageTrimming, Settings UI, Streaming mode, OpenAi Compat (Model, Authorization Bearer), Save/Restore session, Auto Settings UI (#7548) | |
| 287 | 5921b8f089d3b7bda86aac5a66825df6a6c10603 | 5dcdf946764fae49a8e2a90bf2f0960bde1c44e8 | 2024-05-30T19:01:41+03:00 | Georgi Gerganov | llama : cache llama_token_to_piece (#7587) | |
| 288 | 9c4c9cc83f7297a10bb3b2af54a22ac154fd5b20 | 59b0d077662fab430446b3119fa142f3291c45b2 | 2024-05-30T13:40:00+02:00 | Galunid | Move convert.py to examples/convert-legacy-llama.py (#7430) | |
| 289 | eb57fee51f7b4d78039f003249873c2eb46f12f6 | 55d62262a99cd8bc28a1492975791fe433c8cc0f | 2024-05-30T02:10:40+02:00 | Galunid | gguf-py : Add tokenizer.ggml.pre to gguf-new-metadata.py (#7627) | |
| 290 | 02c1ecad07f0e2d2febe8196271bcc64bdc9c006 | 6bd12ce409f949012935b7d1b15a21ffa473a565 | 2024-05-28T21:46:34+02:00 | jaime-m-p | Tokenizer WPM fixes (#7500) | |
| 291 | 5442939fcc5e6ae41abf40612a95fd71377e487e | 56411a950f255b523a9edd684fd1632752474399 | 2024-05-28T20:49:49+02:00 | Giuseppe Scrivano | llama : support small Granite models (#7481) | |
| 292 | edc29433fa08b4e5aeb67649a29fc7713af13d04 | 8b99e2aa66ba39e4e1114effea6ef7430881eca4 | 2024-05-28T15:04:09+03:00 | Georgi Gerganov | tests : fix test-tokenizer-0.sh | |
| 293 | 852aafb163d32d5bad63c10bc323a02c28fec59d | 0136966dafb452601c23f30395878d5a65ddc559 | 2024-05-28T01:40:47+02:00 | Djip007 | update HIP_UMA #7399 (#7414) | |
| 294 | d298382ad977ec89c8de7b57459b9d7965d2c272 | 32a28217f475119926c603341e8273b26932b56a | 2024-05-27T00:10:17+10:00 | Brian | main: replace --no-special with --special (#7534) | |
| 295 | b9adcbbf92fc7096bee23fe61496d25652ebf765 | 9588f196b1d7b21bdff013fcf958c249576b2619 | 2024-05-26T06:26:34+05:30 | HanishKVC | SimpleChat Completion Mode flexibility and cleanup, Settings gMe, Optional sliding window (#7480) | |
| 296 | 00c63907931bb08a0ed2b7e38cf44dd290143cb9 | faa0e6979a11dcb731e9d778ad42ceaa0302015e | 2024-05-25T05:04:03-04:00 | Justine Tunney | main : don't print special tokens with --grammar (#6923) | |
| 297 | 57684331fc2d685f7d1f5775af0b9e47d1829833 | b83bab15a5d2a1e7807d09613a9b34309d86cfaa | 2024-05-24T18:14:42-07:00 | Mikko Juola | Make tokenize CLI tool have nicer command line arguments. (#6188) | |
| 298 | fbca2f27fc7fa9aa4a8ad0357478fdb908472908 | 0df0aa8e43c3378975269a51f9b876c8692e70da | 2024-05-24T14:31:13+02:00 | fairydreaming | Add support for ArcticForCausalLM (#7020) | |
| 299 | 3015851c5ac7334fb544a23a70a284c117b87044 | 55ac3b7aeaf52f19786ed96e885d89521fc0f6c8 | 2024-05-23T14:29:26+02:00 | Daniel Bevenius | llama : add getters for n_threads/n_threads_batch (#7464) | |
| 300 | c3f8d583560b4f261fa21c976793e538c60cd66c | 11474e756de3f56b760986e73086d40e787e52f8 | 2024-05-21T19:53:48+03:00 | Georgi Gerganov | tests : test-tokenizer-0.sh print more info (#7402) | |
| 301 | d7e852c1bc8e85bf62a6f1aede08cd2de723404a | 917dc8cfa67a72fb7c8bf7392270da3bf4833af4 | 2024-05-21T14:39:48+02:00 | jaime-m-p | Tokenizer SPM fixes for phi-3 and llama-spm (bugfix) (#7425) | |
| 302 | 917dc8cfa67a72fb7c8bf7392270da3bf4833af4 | fabf30b4c4fca32e116009527180c252919ca922 | 2024-05-20T20:15:57+02:00 | jaime-m-p | Tokenizer SPM fixes for phi-3 and llama-spm (#7375) | |
| 303 | 1b01f06db0cff5f5f600bb754fc39fde565ed56a | 41858392e17abead21735309bf17cb55183d8c31 | 2024-05-19T16:26:02+02:00 | Johannes Gäßler | server: add test for token probs (#7347) | |
| 304 | 6aade19ee74b896c59929676629340b36be3e22c | ab33f7a338593f6cf1ae98b10b6f8684f63bd72c | 2024-05-19T14:46:46+02:00 | Anas Ahouzi | Add StableLM2 pre-tokenizer (#7349) | |
| 305 | 0f98acfac6cc561dc57586bfff778405e42b576b | ca57e0f35e33f714b9a6c2c4482b87bfe059c819 | 2024-05-18T10:04:55+02:00 | Steffen Röcker | llama : add support for larger Granite Code Models (20B, 34B) (#7324) | |
| 306 | 29c60d8cddcfd14fa8a6bf023a6c4eb8692c76ba | 359cbe3f46c90ce6f5151005e411b8fb74f8139e | 2024-05-17T09:59:57+02:00 | Johannes Gäßler | tokenization: add warning for double BOS (#7332) | |
| 307 | dc020985b8755dd6aa93a2f002f43c3ede808cce | 344f9126cc0d15891fde9472fe40b8572628ad7d | 2024-05-15T14:44:49+01:00 | agray3 | Avoid unnecessarily disabling CUDA graphs (#7302) | |
| 308 | 9aa672490c848e45eaa704a554e0f1f6df995fc8 | b1f8af1886e8187db6bb2a9b87cfc1c0f175f629 | 2024-05-13T10:35:14+02:00 | Joan Fontanals | llama : rename jina tokenizers to v2 (#7249) | |
| 309 | f99e1e456eaf69cc38c1982a2693ce41c0f897ef | 5ae3426b0b64672991563d4c28b2018b9f961467 | 2024-05-11T16:12:06+08:00 | Haoxiang Fei | llama : lookup word in vocab before doing BPE merges (#7193) | |
| 310 | 5ae3426b0b64672991563d4c28b2018b9f961467 | b83cc3f5b303ff30c52874b2d5864dc6385ebf9f | 2024-05-11T10:11:28+02:00 | Johannes Gäßler | server: fix reported top tokens for temperature 0 (#7203) | |
| 311 | b83cc3f5b303ff30c52874b2d5864dc6385ebf9f | 9cb317f77e53067f7a138cc89ef7657148eae8e6 | 2024-05-11T09:46:09+02:00 | Joan Fontanals | llama : add Jina Embeddings architecture (#6826) | |
| 312 | f89fe2732c5709f6e86d5f4aee2e6d2a561f2eb2 | d11afd665241c1b3910ab5f040d0216403019d87 | 2024-05-10T15:51:58+05:30 | HanishKVC | Main+: optionally allow special tokens from user in interactive mode (#7097) | |
| 313 | 43248e559472556f368988575d9fba906b3eb139 | a743d76a01f23038b2c85af1e9048ee836767b44 | 2024-05-09T15:30:44+02:00 | jaime-m-p | llama3 custom regex split (#6965) | |
| 314 | f31ec120bc36c6270e4948e6a065a7c4cfa0c404 | fd9f92b154850014146f61717cd292a59a5cee5a | 2024-05-09T14:13:05+02:00 | Galunid | Add warning if token is invalid (#7173) | |
| 315 | fd9f92b154850014146f61717cd292a59a5cee5a | 22842164bcae3251b81ad9e497a16ef66833cb9e | 2024-05-09T13:03:29+02:00 | Daniel Bevenius | llama : update llama_timings.n_p_eval setting (#7160) | |
| 316 | 22842164bcae3251b81ad9e497a16ef66833cb9e | 47345248827f426038098d016ed11975021b4919 | 2024-05-09T12:56:00+02:00 | Sigbjørn Skjæret | gguf-py : add special token modification capability (#7166) | |
| 317 | f98eb31c517c95960df1d0abc48002787f145f3b | bc4bba364fb96d908f2698e908648df5e6f55e02 | 2024-05-08T18:16:38-04:00 | compilade | convert-hf : save memory with lazy evaluation (#7075) | |
| 318 | 911b3900dded9a1cfe0f0e41b82c7a29baf3a217 | ad211edef5db1f1fb955874b7ca6a67bd0c88708 | 2024-05-08T14:27:58+02:00 | Johan | server : add_special option for tokenize endpoint (#7059) | |
| 319 | 229ffff872f8ad0d21c997d18ee7a23692ae60a0 | 1fd9c1741d864d01cd7ec6d67227b92d7bfabf22 | 2024-05-08T20:06:43+08:00 | Ren Xuancheng | llama : add BPE pre-tokenization for Qwen2 (#7114) | |
| 320 | 4cd621c26de2095cd7c4464bdec5fe2e696ef3f3 | 7e0b6a7b3ba94ff624dc27c1e0e735fded8819b8 | 2024-05-08T06:43:23-04:00 | DAN™ | convert : add BPE pre-tokenization for DBRX (#7132) | |
| 321 | af0a5b616359809ce886ea433acedebb39b12969 | b6aa6702030320a3d5fbc2508307af0d7c947e40 | 2024-05-07T23:07:58+02:00 | Johannes Gäßler | server: fix incorrectly reported token probabilities (#7125) | |
| 322 | 3af34c1d1b0da47f85b95f60922abeded1cb5d33 | 04976db7a819fcf8bfefbfc09a3344210b79dd27 | 2024-05-07T19:51:31+02:00 | RhinoDevel | main : update log text (EOS to EOG) (#7104) | |
| 323 | 889bdd76866ea31a7625ec2dcea63ff469f3e981 | 6fbd43221167bf96112f899daf22c127b282cbcf | 2024-05-05T01:19:30-04:00 | DAN™ | command-r : add BPE pre-tokenization (#7063) | |
| 324 | 03fb8a002df2e96104f9e06de9c78d2a8ed91e92 | 92139b90af4841d7fd060b526bdd443b621770ff | 2024-05-04T12:06:40+03:00 | maor-ps | If first token generated from the server is the stop word the server will crash (#7038) | |
| 325 | 92139b90af4841d7fd060b526bdd443b621770ff | a2ac89d6efb41b535778bfeaecaae8fe295b6ed3 | 2024-05-04T08:32:32+03:00 | Georgi Gerganov | tests : add test-tokenizer-0.sh + fix some tokenizers (#7036) | |
| 326 | f4ab2a41476600a98067a9474ea8f9e6db41bcfa | 3f167476b11efa7ab08f6cacdeb8cab0935c1249 | 2024-04-29T16:58:41+03:00 | Georgi Gerganov | llama : fix BPE pre-tokenization (#6920) | |
| 327 | 7f5ff558eed0f732af8f25c2ab0645610bdec80c | 9e4e077ec50fde6049b128662c72d37a3c28e34b | 2024-04-26T12:15:30+02:00 | Pierrick Hymbert | server: stop generation at `n_ctx_train` if `n_predict` is not set (#6638) | |
| 328 | 37246b1031b1680c0dcaf20aef736d6b446203fa | 28103f4832e301a9c84d44ff0df9d75d46ab6c76 | 2024-04-24T05:15:29-05:00 | Kyle Mistele | common : revert showing control tokens by default for server (#6860) | |
| 329 | 3fec68be4e9577fc53158366d3b3af039c17bb1f | c8297c6af5693555652c40b95974b95d49d2674d | 2024-04-24T15:16:21+08:00 | Junyang Lin | convert : add support of codeqwen due to tokenizer (#6707) | |
| 330 | c8297c6af5693555652c40b95974b95d49d2674d | 4e96a812b3ce7322a29a3008db2ed73d9087b176 | 2024-04-24T15:00:37+08:00 | liuwei-git | llama : add phi3 support (#6852) | |
| 331 | 8960fe86ae075c846c5df8848230d1904ba8877f | c0956b09ba845a7cd787d5580d7c8b96e80f40f5 | 2024-04-22T15:41:11+03:00 | Georgi Gerganov | llama : fix typo in <|im_end|> token text (#6745) | |
| 332 | 40f74e4d739e9250431cf339ae7588b28d8d0663 | b9cc76d87e3d7ae5900f19d4fe8f8976d0a35888 | 2024-04-21T18:36:45+03:00 | Georgi Gerganov | llama : add option to render special/control tokens (#6807) | |
| 333 | 7dbdba5690ca61b3ee8c92cfac8e7e251042e787 | c1386c936e9fbc38eb2816c711ab28f13355708e | 2024-04-21T15:03:39+02:00 | Wouter | llama : add llama-3 chat template (#6751) | |
| 334 | b97bc3966e852adb626c90be64fd48282800f504 | b8109bc0139f15a5b321909f47510b89dca47ffc | 2024-04-21T13:50:41+02:00 | Pedro Cuenca | llama : support Llama 3 HF conversion (#6745) | |
| 335 | 03c0946d73c63ea73e1d85015b7088298443d438 | e11b2e6e1e18522ca7cf129600875a0f6fb9307d | 2024-04-18T13:49:01+02:00 | Sigbjørn Skjæret | convert : support models with multiple chat templates (#6588) | |
| 336 | 8cc91dc63c0df397d644a581b2cbeea74eb51ae0 | dbceec87c0221ec952e69448df6a71f1372a7487 | 2024-04-16T14:55:30-04:00 | Justine Tunney | ggml : add llamafile sgemm (#6414) | |
| 337 | 4fbd8098e63670c6ae11a8adc350f5ba191cfda3 | 7593639ce335e8d7f89aa9a54d616951f273af60 | 2024-04-16T08:13:13+02:00 | Daniel Bevenius | gguf : add special tokens metadata for FIM/Infill (#6689) | |
| 338 | 1b67731e184e27a465b8c5476061294a4af668ea | c4a3a4ff47d62d2503ddf9bd91b58c21f04fe3c3 | 2024-04-09T13:44:08-04:00 | Jared Van Bortel | BERT tokenizer fixes (#6498) | |
| 339 | 5dc9dd7152dedc6046b646855585bd070c91e8c8 | e11a8999b5690f810c2c99c14347f0834e68c524 | 2024-04-09T09:16:13+01:00 | Carolinabanana | llama : add Command R Plus support (#6491) | |
| 340 | 75cd4c77292034ecec587ecb401366f57338f7c0 | a8bd14d55717754a1f48313a846a2b16fa998ad2 | 2024-04-06T05:40:47+02:00 | Pierrick Hymbert | ci: bench: support sse and fix prompt processing time / server: add tokens usage in stream OAI response (#6495) | |
| 341 | db214fa578e00b01e0884fc2725c9349608bdab5 | 1ff4d9f3d683f02ef8a12e04bfac84300c44bd3a | 2024-04-03T21:12:52+05:30 | Abhishek Gopinath K | Missing tokenizer.model error during gguf conversion (#6443) | |
| 342 | 1ff4d9f3d683f02ef8a12e04bfac84300c44bd3a | 076b08649ecc3b0e1c0709c2a086a63eddd1bf32 | 2024-04-03T23:24:31+08:00 | kaizau | Add OpenChat, Alpaca, Vicuna chat templates (#6397) | |
| 343 | 057400a3fd457f4f214684eeb171444663b47a23 | b75c38166cf0c66793a32d5c3d6cb69929dd083d | 2024-03-29T08:23:22+01:00 | Daniel Bevenius | llama : remove redundant reshape in build_kv_store (#6369) | |
| 344 | b75c38166cf0c66793a32d5c3d6cb69929dd083d | bfe7dafc9cf96b9a09ead347fed9a547930fc631 | 2024-03-29T08:15:00+01:00 | Pedro Cuenca | convert : allow conversion of Mistral HF models (#6144) | |
| 345 | 557410b8f06380560155ac7fcb8316d71ddc9837 | 55c1b2a3bbd470e9e2a3a0618b92cf64a885f806 | 2024-03-26T10:46:41-04:00 | compilade | llama : greatly reduce output buffer memory usage (#6122) | |
| 346 | e097633f63fdd26d492844f7eff056e4083fd9eb | d25b1c31b07c3675443a55a828dd58cfef5a241c | 2024-03-26T13:32:19+01:00 | Pedro Cuenca | convert-hf : fix exception in sentencepiece with added tokens (#6320) | |
| 347 | 94d1b3b4119209efcdd08df0dceaecbd1fe7f85c | 95562175f83a49755ff6fd3bad09409417c8e6f9 | 2024-03-23T18:48:02-04:00 | Jared Van Bortel | use _wfopen instead of fopen on Windows (#6248) | |
| 348 | 1d0331c12a2f2a6296b471232bd4e66fbf06e6a1 | dba1af612926cbd4ebe2d876277af1e3305177e0 | 2024-03-22T19:47:14+01:00 | Kawrakow | quantize: options for output and token embedding tensors qtype (#6239) | |
| 349 | bd60d82d0cc8b6852ec535495a5042dbdf05de24 | 6c0b287748327741b113d7d6018b68c63039b1c5 | 2024-03-20T01:33:49-04:00 | Jared Van Bortel | server tests : more pythonic process management; fix bare `except:` (#6146) | |
| 350 | b0bc9f4a9da7c19f4779106ea83b23feca747566 | 4755afd1cbd40d93c017e5b98c39796f52345314 | 2024-03-15T09:22:24+01:00 | slaren | llama-bench : use random tokens to improve accuracy with mixtral (#6069) | |
| 351 | 044ec4b2a567f649459ccd20af2f387c784faa51 | 77178eedc83d49f31bf757d8e12315d76460be78 | 2024-03-14T15:14:14+02:00 | Georgi Gerganov | embedding : add EOS token if not present (#899) | |
| 352 | f30ea47a87ed4446ad55adb265755dc9102956a2 | d8fd0ccf6ac8b07791ffd1575eed436930854ae3 | 2024-03-13T18:54:21+01:00 | slaren | llama : add pipeline parallelism support (#6017) | |
| 353 | 7ab7b733bb48250b2df26c12b00256ef42c76932 | d9f65c97c3dc3aa6fa27470b8c6e69b437ec1a27 | 2024-03-11T04:03:17+08:00 | Dean | android : fix utf8 decoding error (#5935) | |
| 354 | 621e86b331f8b0e71f79fd82a4ae1cd54c3e4396 | 77d1ac7e00bf049b9f2bba1b5a310a78318c49c4 | 2024-03-09T23:41:49+01:00 | Pierrick Hymbert | server: benchmark: chat/completions scenario and other llm servers comparison (#5941) | |
| 355 | 0db32beaf09d90b8959d3d0cc493ed1e45685353 | 8a3012a4ad08112bb3dc3f1399afec4e93780c44 | 2024-03-09T11:16:53Z | Alexey Parfenov | server : fix passing prompt as tokens (#5955) | |
| 356 | c2101a2e909ac7c08976d414e64e96c90ee5fa9e | 515f7d0d4fce41c752fc253acf30707c3be2531e | 2024-03-08T17:31:00-05:00 | compilade | llama : support Mamba Selective State Space Models (#5328) | |
| 357 | 515f7d0d4fce41c752fc253acf30707c3be2531e | 76e868821a94072fbc87cb1fcca291694319eae8 | 2024-03-08T10:53:37-05:00 | compilade | llama : fix quantization of shared token_embd (#5944) | |
| 358 | 76e868821a94072fbc87cb1fcca291694319eae8 | e457fb3540e0aaec47cfde0abf784c213f9216ee | 2024-03-08T12:25:04+01:00 | Pierrick Hymbert | server: metrics: add llamacpp:prompt_seconds_total and llamacpp:tokens_predicted_seconds_total, reset bucket only on /metrics. Fix values cast to int. Add Process-Start-Time-Unix header. (#5937) | |
| 359 | af37fd8b30e37ccbffdd82e6f48559e2fb7ce7dd | 581ed5c4fe3a8909aaa8313633ac443f471ba755 | 2024-03-08T12:40:02+02:00 | Georgi Gerganov | server : fix EOS token detection with disabled cache (#5938) | |
| 360 | 2002bc96bf2cbf5ab981a17d7e994d817c9801f5 | ceca1aef0738b57951cd12c603c3477e75312dec | 2024-03-07T11:41:53+02:00 | Georgi Gerganov | server : refactor (#5882) | |
| 361 | 21b08674331e1ea1b599f17c5ca91f0ed173be31 | 6a87ac3a52668e117d97bcea07b529c93188b303 | 2024-03-05T16:08:35+08:00 | Neo Zhang Jianyu | [SYCL] fix mul_mat fault in CI/unit-test (#5862) | |
| 362 | 29ae62d2ae163e2b68aa0ad3bf2ab4636de0c957 | e0843afe1b37890b631bc7d3d2da2ed36c862b91 | 2024-03-04T22:31:20+02:00 | Georgi Gerganov | llama : fix embeddings (#5796) | |
| 363 | 5a51cc1bb4592f0d71f9af89cd08b11a066ba447 | 67be2ce1015d070b3b2cd488bcb041eefb61de72 | 2024-03-04T02:57:20-05:00 | DAN™ | main : support special tokens as reverse/anti prompt (#5847) | |
| 364 | 9731134296af3a6839cd682e51d9c2109a871de5 | 4a6e2d6142ab815c964924896891e9ab3e050632 | 2024-03-02T22:00:14+01:00 | Pierrick Hymbert | server: tests: passkey challenge / self-extend with context shift demo (#5832) | |
| 365 | 4d4d2366fc9c54d4a275065cfe9299c6cf7c5b78 | c7a0ad8ec9ebb5ddb1c1c80c82f2ee041c525d47 | 2024-03-02T12:27:26-05:00 | Jared Van Bortel | convert : automatically fall back to HfVocab if tokenizer.model doesn't exist (#5821) | |
| 366 | 177628bfd85565070916ad66a5ac4071ee0527d8 | 6c4416868df2e5455da7d20547f62bcf9735ba8e | 2024-02-28T02:51:11-06:00 | Douglas Hanley | llama : improve BERT tokenization (#5740) | |
| 367 | f7625019c51ca437a5840576d92362cfa710e4a2 | abbabc5e51d0d4656b438aec10b7fae9479ef37d | 2024-02-25T13:43:50-05:00 | compilade | server : fix crash when system prompt is bigger than batch size (#5714) | |
| 368 | 525213d2f5da1eaf4b922b6b792cb52b2c613368 | fd43d66f46ee3b5345fb8a74a252d86ccd34a409 | 2024-02-24T12:28:55+01:00 | Pierrick Hymbert | server: init functional tests (#5566) | |
| 369 | 15499eb94227401bdc8875da6eb85c15d37068f7 | 96633eeca1265ed03e57230de54032041c58f9cd | 2024-02-22T17:05:23-05:00 | Jared Van Bortel | mpt : do not duplicate token_embd.weight on disk (#5670) | |
| 370 | 96633eeca1265ed03e57230de54032041c58f9cd | 847eedbdb2d1ebf14ef56eb507d4b4b975510908 | 2024-02-22T23:23:46+02:00 | Georgi Gerganov | gemma : use more bits for the token_embd.weight tensor (#5650) | |
| 371 | 73122473ffd73030146276dbb85da7c8021a3ee4 | 0d4177126b0556e202efb85bf3f768be81076400 | 2024-02-15T14:14:37+01:00 | Michaël de Vries | fix(gguf-py): special tokens are no longer skipped when add_<token>_token is set to false (#5487) | |
| 372 | c4e6dd59e45ef7b14f7763fb073b517395dc176c | 037259be689353081e7bae3c1ab4ab18e7fbe8c9 | 2024-02-13T18:18:16+02:00 | Aarni Koskela | llama : allow raw byte in SPM vocabs; don't crash on nl 404 (#5478) | |
| 373 | cf45252a7cfcb998bade46a886e20477cecc538a | 03bf161eb6dea6400ee49c6dc6b69bdcfa9fd3fc | 2024-02-13T15:14:22+02:00 | Georgi Gerganov | tests : multi-thread the tokenizer tests (#5474) | |
| 374 | 49cc1f7d67de2da99f3ac185f9ff1319b7bf35f8 | 99b8b43d7b185a6483f28cf798a2d968b2e16ca7 | 2024-02-13T13:01:29+02:00 | Georgi Gerganov | bert : add tests + fix quantization (#5475) | |
| 375 | 2891c8aa9af17f4ff636ff3868bc34ff72b56e25 | 97a336507ed9b971d72262bec7e2b8b7016a054a | 2024-02-11T10:21:38-06:00 | Douglas Hanley | Add support for BERT embedding models (#5423) | |
| 376 | 684780141a08200ec98eba3e982dbafd1d0b5000 | 85910c5b30f6e268321be8df044f5528a6efac52 | 2024-02-11T13:38:14Z | Alexey Parfenov | server : allow to specify tokens as strings in logit_bias (#5003) | |
| 377 | 0ef46da632c32faa1a538e5dc180994e8bbb46e1 | ee1628bdfea8b0079fed0140ac2f00ef1b465b57 | 2024-02-07T02:17:25-06:00 | Xiao-Yong Jin | llava-cli : always tokenize special tokens (#5382) | |
| 378 | 316c7faf7740fa98ea68f1445f4505810f706b9e | f3e2b4fa3f81a410ecb7dec929c259ef8d8dbb7d | 2024-02-07T14:15:56+08:00 | runfuture | llama : add MiniCPM support (#5346) | |
| 379 | 906cff55c2848fda091d888a1585915ec0c9ea9e | 098f6d737b65134cf220d12b9b706e8cfc5e4610 | 2024-02-06T07:47:22+02:00 | Georgi Gerganov | py : handle byte tokens in `get_token_type` (#5341) | |
| 380 | e1e721094d8169636d55f68efe37f222cd3f0677 | 128dcbd3c9c4b12f42b560a4430427d7b2828628 | 2024-02-01T23:20:13-08:00 | Ian Bull | llama : fix memory leak in llama_batch_free (#5252) | |
| 381 | e6f291d15844398f8326940fe5ad7f2e02b5aa56 | 4003be0e5feef320f3707786f22722b73cff9356 | 2024-01-30T20:17:30+02:00 | Georgi Gerganov | server : fix context shift (#5195) | |
| 382 | e76627bcce9f77adb6034cb127b7ec93d4287b69 | fbe7dfa53caff0a7e830b676e6e949917a5c71b4 | 2024-01-29T18:24:19+09:00 | Sang-Kil Park | py : improve BPE tokenizer support (#5189) | |
| 383 | 9241c3a2ace544aef708334e54bbdddb90208ee8 | b2b2bf988c098851b4f3831f0cf38394bff75121 | 2024-01-28T09:59:49+01:00 | Johannes Gäßler | Apply min_p to unsorted tokens (#5115) | |
| 384 | 44879ee885f48ecf4675dd216b373dce0a6f3690 | 9ecdd12e95aee20d6dfaf5f5a0f0ce5ac1fb2747 | 2024-01-23T15:17:20+02:00 | Kawrakow | Additional KL-divergence statistics (#5081) | |
| 385 | d6bd4d46ddb6926087c11e0f6633ab1c81da58c3 | 152d9d05e097e35f1cac21262946d57faec7542a | 2024-01-22T06:21:52-05:00 | compilade | llama : support StableLM 2 1.6B (#5052) | |
| 386 | 8b20858e5e9c44b99b4b31ae9c40b8f20d01d94f | 57e2a7a52a819883f40dada8a2edc24ecf48186b | 2024-01-19T10:45:06+02:00 | Georgi Gerganov | perplexity : faster Winogrande via batching (#5024) | |
| 387 | ad19812cda4062c9f154ef16315df41fbe6a770a | 682986a08eb5cb04865d2e713449f17304d266d8 | 2024-01-18T15:33:01+02:00 | Georgi Gerganov | perplexity : faster HellaSwag via batching (#5017) | |
| 388 | 4f4bf35f46600441dec2f941e667291eeb9a18d8 | 2b3a665d3917edf393761a24c4835447894df74a | 2024-01-17T15:45:03+02:00 | Georgi Gerganov | py : fix missing added_tokens_dict for SPM and BPE vocabs (#4971) | |
| 389 | cec8a4847062fbd76253e3b085683f39d91e80d3 | 334a835a1ccc8106a5fa355683a965efb1bfa24b | 2024-01-16T18:54:24+01:00 | Daniel Bevenius | finetune : add training data file to log message (#4979) | |
| 390 | f172de03f11465dc6c5a0fc3a22f8ec254c6832c | 2d57de525541247132e354f561ff48775fba5d85 | 2024-01-13T18:47:38+02:00 | Georgi Gerganov | llama : fix detokenization of non-special added-tokens (#4916) | |
| 391 | df845cc982e7e2ea7b9900e29d55b15338faa78d | 6b48ed089377330cdb362970a51c1c89b6d857a8 | 2024-01-13T17:29:43+01:00 | David Friehs | llama : minimize size used for state save/load (#4820) | |
| 392 | 722d33f34ec74c6f7046109f936d0928ffe171bc | c30b1ef39aeba497a943416d2897d69fee055b96 | 2024-01-14T00:09:08+08:00 | Yann Follet | main : add parameter --no-display-prompt (#4541) | |
| 393 | ee8243adaa9a9f51ff449213383874e49efe368f | 15ebe59210e7fd9817ff67f51fa1a5ee2d004294 | 2024-01-13T14:16:11Z | makomk | server : fix crash with multimodal models without BOS token (#4904) | |
| 394 | 3ca63b4538dfc78aaec88cd2c3e3f8417c1924e3 | b0377875488b33f7114138687d828da1de61775d | 2024-01-11T22:43:05+02:00 | Georgi Gerganov | main : disable token count by default (#4874) | |
| 395 | d8d90aa343c22fe01429d3540e47ded87e9dcb9d | 43f76bf1c362c067fce46bb8dcda0b64af8a9533 | 2024-01-11T17:22:34Z | Someone | ci: nix-flake-update: new token with pr permissions (#4879) | |
| 396 | 43f76bf1c362c067fce46bb8dcda0b64af8a9533 | 2f043328e3116724d15b915b5c6078e2df860a69 | 2024-01-11T16:14:52Z | pudepiedj | main : print total token count and tokens consumed so far (#4874) | |
| 397 | 6efb8eb30e7025b168f3fda3ff83b9b386428ad6 | 36e5a08b203542dca53cca4eaf172c5dc4bbc991 | 2024-01-09T13:46:46-05:00 | Austin | convert.py : fix vanilla LLaMA model conversion (#4818) | |
| 398 | 128de3585b0f58b1e562733448fc00109f23a95d | 8c5833031857c9e9ada61948bae894ab9c785f86 | 2024-01-09T05:02:05-05:00 | Behnam M | server : update readme about token probs (#4777) | |
| 399 | dd5ae06405c5565b99889bdb3f168f4351252cfb | 668b31fc7d86245435ad6574e0e1126e734049e2 | 2024-01-08T16:02:32+01:00 | Kawrakow | SOTA 2-bit quants (#4773) | |
| 400 | c75ca5d96f902564cbbbdd7f5cade80d53c288bb | 96e80dabc6e73ff68b09b68947b1fc25883c5094 | 2024-01-06T16:12:59+01:00 | Daniel Illescas Romero | llama.swiftui : use correct pointer for llama_token_eos (#4797) | |
| 401 | 0ef3ca2ac62016c0c545de1c89dc2e3e130f4a99 | 540938f8904707dd74cb3be18495f853b312e72f | 2024-01-02T15:48:49Z | Phil H | server : add token counts to html footer (#4738) | |
| 402 | 0040d42eeb237197054cc7790df5776eacfa608e | 83e633c27efdf0eb0ba54249e784b0ea760b1007 | 2024-01-02T06:15:16-08:00 | Marcus Dunn | llama : replace all API facing `int`'s with `int32_t` (#4577) | |
| 403 | 65e5f6dadbba4b496bba27f573e473c66b446496 | ea5497df5d138c83b2b0ca70aefdc4b1175c1001 | 2023-12-28T11:20:00-08:00 | Justine Tunney | Fix OpenAI server sampling w.r.t. temp and seed (#4668) | |
| 404 | f56d6077d0c37e6606ac0a4fa3169de70593acfe | dc68f0054cd279cddddb0cae0c9ef4f9cbaa512a | 2023-12-27T17:37:25+09:00 | wonjun Jang | Add byte token type when tokenizer.model is not exists (#4641) | |
| 405 | 7082d24cec35e9ce9147535a2224dfc67ee0a78c | ba661751322a7c201fd3bef71af077c5aebfaa2a | 2023-12-22T17:05:56+01:00 | LeonEricsson | lookup : add prompt lookup decoding example (#4484) | |
| 406 | 880e352277fc017df4d5794f0c21c44e1eae2b84 | 66f35a2f48e1965a13835a523e677223dbf148be | 2023-12-21T18:07:34+01:00 | howlger | py : open merges file as 'utf-8' (#4566) | |
| 407 | b9e74f9bca5fdf7d0a22ed25e7a9626335fdfa48 | 3c04bf6da89eaf4c7d317e0518f0687dfcbf2de7 | 2023-12-18T17:27:47Z | Ebey Abraham | llama : add phi-2 + fix NeoX rope + ggml_mul_mat_set_prec (#4490) | |
| 408 | 2994f0c5a2e8c96955b422dedc93ec2595d16b82 | b1306c439490c7fa4ec33594500d980d1e9e15e6 | 2023-12-17T19:39:02-05:00 | Jared Van Bortel | decode : fix logits_valid for legacy API (#4516) | |
| 409 | f7f468a97dceec2f8fe8b1ed7a2091083446ebc7 | 919c40660fd27157b391b5832d2a577d5afef4cb | 2023-12-17T10:45:46-05:00 | Jared Van Bortel | gguf-py : fail fast on nonsensical special token IDs (#4489) | |
| 410 | 873637afc7924f435ac44c067630a28e82eefa7b | 0353a1840134b24b07ab61fd4490192f28c4db6b | 2023-12-14T17:09:34+09:00 | wonjun Jang | convert : support loading vocab from fast tokenizer config (#3633) | |
| 411 | 948ff137ec37f1ec74c02905917fa0afc9b97514 | 4d98d9a65665eee3838cef936641f640e3f5b649 | 2023-12-13T23:57:15+04:00 | shibe2 | server : fix handling of characters that span multiple tokens when streaming (#4446) | |
| 412 | 799a1cb13b0b1b560ab0ceff485caed68faa8f1f | fecac45658a99eddc4d6e36ba0310ca8f87a77f0 | 2023-12-13T13:04:25+01:00 | slaren | llama : add Mixtral support (#4406) | |
| 413 | 6391817cd19a4507c6c941a1fd08756268662b2d | d9d4cfef64ea416dd66632173787d03ffb180cc7 | 2023-12-12T04:25:57-05:00 | crasm | llama : document logits_all deprecation (#4418) | |
| 414 | e18f7345a300920e234f732077bda660cc6cda9c | fe680e3d1080a765e5d3150ffd7bab189742898d | 2023-12-09T16:29:27-05:00 | Xiang (Kevin) Li | grammar : revert the replacement of llama_token_to_piece with id_to_token (#4396) | |
| 415 | 5f6e0c0dff1e7a89331e6b25eca9a9fd71324069 | 5aa365d88fdb8fdd430ef3fc141c7a5fd37c3502 | 2023-12-05T10:55:12-10:00 | Marcus Dunn | grammar : pre-computed pieces + reserve mem + less string copies (#4330) | |
| 416 | 23b5e12eb5a76489b4c3ee22213a081da68b1809 | d208995c6da66f252d4054c1c5a90eb8ccb7a2f7 | 2023-12-04T17:04:21+01:00 | Daniel Bevenius | simple : update error message for KV cache check (#4324) | |
| 417 | 5c9f90cba1cc6b0a2a7d19ee5dcb73cad6331d30 | 4fa44e84adb4c78e1885694cc3513982d4af2b08 | 2023-12-04T22:43:45+09:00 | Miwa / Ensan | swift : fix prompt tokenization logic (#4321) | |
| 418 | b220222a64ce760bfbec9c770f11db3ec6a6abb6 | 511f52c334e37033f9c9de07b98fca4abc9470bd | 2023-12-02T03:19:45+09:00 | Miwa / Ensan | swift : fix token_to_piece implementation (#4278) | |
| 419 | b18c66ca6eee4fe0465cff5042daf05005dc9ab2 | f4d973cecb7368c985720ba9100ae6abba14806d | 2023-11-30T22:43:08+01:00 | Daniel Bevenius | llama : fix alignment of general.name in print meta (#4254) | |
| 420 | 8406b0924bf323f37d536dee8b8165c1f3d9d11d | b38a16dfcff88d547f78f52d1bea31b84a05aff7 | 2023-11-28T10:32:03+02:00 | Georgi Gerganov | ggml : re-enable BLAS for CPU when src0 != F32 + remove redundant full offload checks in llama.cpp (#4240) | |
| 421 | 922754a8d60080e956891f6cee1fb03aa48d57c6 | 22da05536ff4ad963080773bef1fb839fdab95d3 | 2023-11-26T20:33:07+02:00 | Georgi Gerganov | lookahead : add example for lookahead decoding (#4207) | |
| 422 | f837c3a992b2b6146936cb120871a8cf9d0e3857 | 3014b5415d08e3dff961da6eea835b9760a701b8 | 2023-11-25T08:58:23-08:00 | Marcus Dunn | llama : grammar `reserve` space in `decode_utf8` (#4210) | |
| 423 | af19d3573481d409b3c4e55494810eb1f65a9aae | e9c13ff78114af6fc6a4f27cc8dcdda0f3d389fb | 2023-11-25T11:29:06+02:00 | Georgi Gerganov | server : OAI API compatibility (#4198) | |
| 424 | 2568a4bf548d7392e9c78c008b33b4c11d53fe95 | b35f3d0def3efde92ed465d92a267430d957e87d | 2023-11-24T18:25:10+09:00 | eastriver | main.swift : fix eos checking (#4197) | |
| 425 | 40a34fe8d034bd484efd79ccbb95059ca6308dcb | dae06c06e5c6232ae2be4d567dd5101e1e96c814 | 2023-11-20T03:50:04-06:00 | Branden Butler | speculative : fix prompt tokenization in speculative example (#4025) | |
| 426 | 35985acffaab1eb4ffcbc22c86063bc630f24a89 | e937066420b79a757bf80e9836eb12b88420a218 | 2023-11-19T18:50:49+02:00 | Georgi Gerganov | gitignore : tokenize | |
| 427 | 28a2e6e7d476717881be6eb9e2d3331342cec57b | 0b5c3b04572a05f80163a365070fb377a837ac27 | 2023-11-18T14:48:17-07:00 | Kerfuffle | tokenize example: Respect normal add BOS token behavior (#4126) | |
| 428 | 5ad387e994dde77a47ec547a4a65f7611dc325f4 | 2fa02b4b3d86182381311c98b75065ee1b7c2930 | 2023-11-17T18:01:38+02:00 | Georgi Gerganov | tokenize : fix trailing whitespace | |
| 429 | 2fa02b4b3d86182381311c98b75065ee1b7c2930 | 2ab0707acbf3a3ca9e5bc5959c7920c22eba2257 | 2023-11-17T17:36:44+02:00 | zakkor | examples : add tokenize (#4039) | |
| 430 | 91f6499393d2d999331fbfdba47a7f8b9f913f0d | 8da46278e1a57107591653275f8e03a281de94f0 | 2023-11-16T19:14:37-07:00 | Kerfuffle | Respect tokenizer.ggml.add_bos_token value when tokenizing (#4040) | |
| 431 | a6fc554e268634494f33b0de76f9dde650dd292f | 1cf2850d52bb027aa215e039ed9a0c61beeef8d3 | 2023-11-15T11:34:47-05:00 | Jared Van Bortel | llama : restore prefix space in llama tokenizer (#4081) | |
| 432 | 34b0a082074b073eb14c2bd93c0c070e20ddcd16 | 4a4fd3eefad5bd17ab6bcd8e2181b4f62eae76cf | 2023-11-10T22:04:50-07:00 | Kerfuffle | gguf-py: Refactor and allow reading/modifying existing GGUF files (#3981) | |
| 433 | 238657db2364cfb728c694470a4a81702afea760 | 07178c98e1b61a5e2af39d347add12e7eb9e08e1 | 2023-10-31T14:44:49-05:00 | kalomaze | samplers : Min-P sampler implementation [alternative to Top P/Top K] (#3841) | |
| 434 | 6e08281e588bbba1a5d180290a94a43f167f3a1a | 2046eb4345e62c4575b3cdc0115a51db89f3fb70 | 2023-10-29T11:31:40-06:00 | Kerfuffle | Extend llama_kv_cache_seq_rm to allow matching any sequence (#3843) | |
| 435 | 8a2f2fea2914aaa3f4b2f82800c7de15f15bdb09 | bd6d9e205982b34e0ba2c3b22bbf31a1ef1a1bb5 | 2023-10-28T15:25:15+03:00 | Georgi Gerganov | convert : ignore tokens if their IDs are within [0, vocab_size) (#3831) | |
| 436 | ee1a0ec9cb367ba41d138134795cbbbe93d2bf1c | 177461104b454163473dced2a5038f4e016cdb7e | 2023-10-28T14:23:11+03:00 | Georgi Gerganov | llama : add option for greedy sampling with probs (#3813) | |
| 437 | daab3d7f45832e10773c99f3484b0d5b14d86c0c | 469c9addef75893e6be12edda852d12e840bf064 | 2023-10-24T09:17:17+02:00 | Galunid | Add more tokenizer tests (#3742) | |
| 438 | 69a6735087c3634963c642fd69f0851ac479cd78 | 5be6c803fa5378f62a1590f3ad8c6b64c7c0c2ce | 2023-10-23T21:46:00+02:00 | Galunid | Update special token handling in conversion scripts for gpt2 derived tokenizers (#3746) | |
| 439 | 5be6c803fa5378f62a1590f3ad8c6b64c7c0c2ce | 6336701c9378c23c85d1c0e464b663ca2bbb8e60 | 2023-10-23T12:40:03-07:00 | Marcus Dunn | llama : remove token functions with `context` args in favor of `model` (#3720) | |
| 440 | 438c2ca83045a00ef244093d27e9ed41a8cb4ea9 | 9e70cc03229df19ca2d28ce23cc817198f897278 | 2023-10-22T22:53:08+03:00 | Georgi Gerganov | server : parallel decoding and multimodal (#3677) | |
| 441 | 9e70cc03229df19ca2d28ce23cc817198f897278 | 5a42a5f8e8a86da9ac88008d748cf232a83aa0e1 | 2023-10-22T21:21:42+02:00 | goerch | Add test for MPT tokenization (#3728) | |
| 442 | a5e7dbd6141128bfa3c40a19c2945a181df625d3 | d3956aea53369455008159cc405ed4c496976692 | 2023-10-22T12:14:56-06:00 | Kerfuffle | llama : validate special token ids are in range when loading GGUF model (#3635) | |
| 443 | d3956aea53369455008159cc405ed4c496976692 | 22c69a27945e7acf9690dd3210d316f22182751c | 2023-10-22T20:09:51+02:00 | vvhg1 | main : escape prompt for cfg_negative_prompt and consecutive inputs in main with interactive (#3623) | |
| 444 | 40e5ce054f4c4fa555e4510ea5f760bb29185332 | a5e8c1d8c71f01d98ae2ec63a57c118664f9764d | 2023-10-11T21:30:06+04:00 | shibe2 | CLBlast: Fix temporary buffer size for f16 conversion (wsize) | |
| 445 | 1a159553f921a9209fed8c714494e57b3649f232 | 281ef73c258cc1eebec8a64264240432d5878c4b | 2023-10-17T17:11:01+02:00 | staviq | tokenizer : special token handling (#3538) | |
| 446 | 940efa95fec0b8a98c226a889d2ad839dfeeae0d | 11bff290458f12f020b588792707f76ec658a27a | 2023-10-16T23:58:00+03:00 | Georgi Gerganov | llava : fix tokenization to not add bos between image embeddings and user prompt (#3645) | |
| 447 | 2a4bcbacead886996f175f33479d1d874a3e577f | 424b6381c4daeed62e6600e0402e72f39845b58d | 2023-10-13T12:33:16+02:00 | Daniel Bevenius | llama : remove n_threads from llama_decode_internal (#3614) | |
| 448 | 233fc1c69f6f415f35363e18a755f9610e89161b | c5b49360d0d9e49f32e05a9116e90bd0b39a282d | 2023-10-10T18:59:52+02:00 | goerch | Minor improvements in GPT2 tokenizer (#3567) | |
| 449 | f5f9121de140eff558f13b5c5e78a3a3b6b94377 | 11ea5c7d96f2c28e1c99659e08ec0a44574056e2 | 2023-10-10T09:50:23+02:00 | Jan Ploski | llm : add MPT support (#3417) | |
| 450 | 11ea5c7d96f2c28e1c99659e08ec0a44574056e2 | 95bd60a0a69f57e9a2ff1269667ea484a1a9bb40 | 2023-10-10T09:31:21+02:00 | vvhg1 | infill. : fix tokenization (#3508) | |
| 451 | 3a716b4dae545c3db307594fbc509a95d3e21b6e | 1faaae8c2bdc4a21302e367e0754c3fe74a8113e | 2023-10-07T06:57:01+02:00 | goerch | Fix for #3454 (#3455) | |
| 452 | 9ca79d5cbbc8d43f2bff951404b6a40ff1ee3788 | 0c731ca4039ccff86ffab90eaae4ca98037c4496 | 2023-10-06T10:10:13-06:00 | Kerfuffle | kv cache slot search improvements (#3493) | |
| 453 | 97af49fa395df77e4c18af0e1655b2fee67c9686 | 16820a5a0d885113f21021ce934f0b0027b9d69a | 2023-10-06T07:44:24-05:00 | Jhen-Jie Hong | server : reuse llama_sample_token common util (#3494) | |
| 454 | e8b8d32e8663ffc55a02c9721af3a5190382cbb0 | 8f3a642ec1d878b2d0a0d15e3a4277f522790d4c | 2023-10-05T09:02:55-05:00 | Jhen-Jie Hong | server : fix incorrect num_tokens_predicted (#3480) | |
| 455 | ac2219fef34eb5b713c286c34c6e4162c39c8f3b | 48be797ffbd80b062f55778e09e97180eb25d2ab | 2023-10-03T21:04:01+03:00 | Georgi Gerganov | llama : fix session saving/loading (#3400) | |
| 456 | ff5a3f0c09dfa0a8e0bf76d1748df5c6dee0e8ff | 1c84003c08027f5d3a4cb876f51d6b6224a34d0e | 2023-10-03T09:16:26+02:00 | goerch | Work on the BPE tokenizer (#3252) | |
| 457 | 16bc66d9479edd5ee12ec734973554d4493c5dfa | 0512d66670de3f650c579519833c085014b0f200 | 2023-09-28T21:42:38+02:00 | slaren | llama.cpp : split llama_context_params into model and context params (#3301) | |
| 458 | 0e76a8992c8200237bbc6471a53fb8796b3872f7 | 2db94d98eda56982d80238840b0652b4137a2a84 | 2023-09-28T20:40:11+02:00 | xaedes | train : finetune LORA (#2632) | |
| 459 | ecf90b1a5114034bc0939b3968f549fe4d63cf6d | 2619109ad57d7a75388a9cce51e5da645410d92e | 2023-09-28T14:30:15-04:00 | Cebtenzzre | gguf : make token scores and types optional (#3347) | |
| 460 | ec893798b7a2a803466cc8f063051499ec3d96f7 | 45855b3f1c7bdd0320aa632334d0b3e8965c26c4 | 2023-09-28T19:04:36+03:00 | Georgi Gerganov | llama : custom attention mask + parallel decoding + no context swaps (#3228) | |
| 461 | b08e75baea294e366628b898e85c0bd359b58115 | e6616cf0db2b63189fc34d0076f654af9adecdf8 | 2023-09-16T13:41:33+02:00 | goerch | Fixing the last deviations from sentencepiece indicated by test-tokenizer-1 (#3170) | |
| 462 | 35f73049af6c676a106a5a990a819ae0bc3fcd7d | 71ca2fad7d6c0ef95ef9944fb3a1a843e481f314 | 2023-09-14T09:14:44-07:00 | Leng Yue | speculative : add heuristic algorithm (#3006) | |
| 463 | 71ca2fad7d6c0ef95ef9944fb3a1a843e481f314 | 1b6c650d16048d6427dd502a9627e72837265844 | 2023-09-13T15:19:44+02:00 | goerch | whisper : tokenizer fix + re-enable tokenizer test for LLaMa (#3096) | |
| 464 | 15b67a66c2f2d6032415b28a699b5131962318f1 | be8c9c245bd129ebabb80e0a7a8dd7daeb4d30af | 2023-09-07T15:52:34+02:00 | slaren | llama-bench : use two tokens in the warmup run for prompt evals (#3059) | |
| 465 | c4f496648c1e32efeb714200e7eae7fc7cfbb223 | fec2fb19e4229aac58c98171c46e77144b99f8a3 | 2023-09-07T15:49:09+03:00 | Georgi Gerganov | metal : fix kernel_norm (fixes Falcon on Metal) (#3057) | |
| 466 | 921772104ba2219bfdc2b2980d05ebc0aa0c92a4 | 2ba85c8609309a59d49c45ab43c31800b7ba141c | 2023-09-05T08:46:17+03:00 | Georgi Gerganov | speculative : add grammar support (#2991) | |
| 467 | 37301347767d555d0a66c043ce4ef6ead8e61c55 | d9151e6f570eb20bfd54427bd8a337d9b1a08018 | 2023-09-03T19:18:09+09:00 | opparco | llama : fix bpe tokenize from byte (#2889) | |
| 468 | afc43d5f82588d2ed71ea104e8262f5e5da13980 | 6460f758dbd472653296044d36bed8c4554988f5 | 2023-09-03T11:48:49+03:00 | Alon | cov : add Code Coverage and codecov.io integration (#2928) | |
| 469 | cff7b0bf07cb46e1ad4fd199f6bdeb538925c8c4 | 340af42f09a80e32f4998857b4f0543e41124525 | 2023-09-02T23:52:13-06:00 | Kerfuffle | convert.py : BPE fixes (#2938) | |
| 470 | 950929442070874d45561d2a4b68b010457767de | 35092fb54712d032860f3976a6fc1ae1f84a4a28 | 2023-08-30T12:42:51+03:00 | alonfaraj | make : add test and update CI (#2897) | |
| 471 | dc07dc492ef9640bbb82904d7c7679f7bdcf6d76 | ad9ddcff6ef322db5cf13785bd7c856b610d242e | 2023-08-30T02:25:50-06:00 | Kerfuffle | convert : various script cleanups/fixes + merges and special token handling (#2842) | |
| 472 | 8341a25957b319a03d4a811176cd5ad7f2b0fbd4 | 849408957c687cde4ab32c147107f643fc55130b | 2023-08-30T08:29:32+02:00 | staviq | main : log file (#2748) | |
| 473 | fa3582f509a2715e80a473e79f88dcd1ebff44c2 | e37e69dcc3d52f21222a63cafed2a71b3f6b53c6 | 2023-08-29T23:55:45+03:00 | Kawrakow | Tell users attmepting to run perplexity with too few tokens to use more (#2882) | |
| 474 | e37e69dcc3d52f21222a63cafed2a71b3f6b53c6 | 53885d7256909ec3e2176cdc2477f3986c15ec69 | 2023-08-29T23:55:03+03:00 | Kawrakow | 10X faster BPE tokenizer (#2876) | |
| 475 | 44c117f41ee01c5ac8fb86bba041f08d8b87b46d | 43033b7bb4858da4f591715b3babdf906c9b7cbc | 2023-08-28T21:51:47+02:00 | xaedes | train : mem usage and other improvements (#2439) | |
| 476 | 230d46c723edf5999752e4cb67fd94edb19ef9c7 | 463173a6c0ff353055eb90665794884c888c790f | 2023-08-27T15:13:31+01:00 | Olivier Chafik | examples : update llama2.c converter to read vocab and write models in GGUF format (#2751) | |
| 477 | 463173a6c0ff353055eb90665794884c888c790f | eaa13a48ff4136f01c1cdb79cacd61b67ec53095 | 2023-08-27T16:50:33+03:00 | Kawrakow | llama : speedup tokenization (#2831) | |
| 478 | edd4c1481708fcd788b0e423268304fd26e2b125 | 1591e2e590762011b43b10a9b6e04f13f98f2aa5 | 2023-08-27T14:19:19+03:00 | Georgi Gerganov | llama : more tokenizer fixes (#2810) | |
| 479 | c1ac54b77aaba10d029084d152be786102010eb2 | 730d9c681e339b76407659344e5a2cd50af7d7d5 | 2023-08-26T16:11:45-07:00 | Bruce MacDonald | server : add `/detokenize` endpoint (#2802) | |
| 480 | 72f895c923ba98b8f2af294440206f35915c0501 | 50526f37eba0b28336700890242ff282b949cd83 | 2023-08-26T14:12:56-04:00 | Dr. Tom Murphy VII Ph.D | main : fix bug (penalize_nl=false doesn't work) + suppress warning on mingw (#1528) | |
| 481 | 2ba83c8685177faea3399db9564f9c52df75c366 | bae5c5f679e043371bc2b4dffff8d4964d6cb953 | 2023-08-26T13:45:53+02:00 | klosax | Fix spm whitespaces (#2806) | |
| 482 | c82742ac9cd96fd34aa961978805c1d8a361d589 | 28b2c996ca0ab90a5669946084f13443ec98e241 | 2023-08-25T11:18:48-04:00 | Matt Pulver | llama : add llama_beam_search() (#2267) | |
| 483 | 29674ab4e847fcaba60cc6558f0d46d5f74ae279 | 5439a0ab57c16b556ffa91a0953df5e46b1e7fb4 | 2023-08-25T18:32:45+08:00 | Jhen-Jie Hong | server : display token probabilities in the UI (#2489) | |
| 484 | 2e5f70a25fc4576e9ed78603fe493eb7702c37a3 | d0f77b1353fc820d1ff1e6b87bc6bedde315938d | 2023-08-24T14:49:30-07:00 | Marcus Dunn | Added `enum` to `llama_token_get_type` return type (#2774) | |
| 485 | cf658adc832badaaa2ca119fe86070e5a830f8f6 | a192860cfec89a38d59a943623bf595b1fe4495b | 2023-08-23T23:08:04+03:00 | Georgi Gerganov | llm : add Falcon support (#2717) | |
| 486 | 95385241a91a616788a3bb76d12c9b7b2379ca2d | 335acd2ffd7b04501c6d8773ab9fcee6e7bf8639 | 2023-08-23T20:33:05+01:00 | Olivier Chafik | examples : restore the functionality to import llama2.c models (#2685) | |
| 487 | 5290c38e6e9b66ee2b543e560e301c1a1a90929c | cc34dbda9681418a2b18382446b90cdcec398d82 | 2023-08-23T16:46:03+02:00 | klosax | main : insert bos if no tokens (#2727) | |
| 488 | b8ad1b66b23f9b2e6e4531e9a62753323036a556 | f5fe98d11bdf9e7797bcfb05c0c3601ffc4b9d26 | 2023-08-23T02:12:12-05:00 | Xiao-Yong Jin | server : allow json array in prompt or content for direct token input (#2306) | |
| 489 | 777f42ba18b29f25c71ff8de3ecf97b8017304c0 | 46ef5b5fcf4c366e1fb27726b6394adbbf8fd0ea | 2023-08-22T17:39:39-06:00 | Kerfuffle | Improve handling of special tokens in GGML to GGUF converter (#2725) | |
| 490 | 46ef5b5fcf4c366e1fb27726b6394adbbf8fd0ea | c63bb1d16a70c03440671b76954bb767513cead8 | 2023-08-22T23:10:42+02:00 | goerch | llama : fix whitespace escaping in tokenizer (#2724) | |
| 491 | 6381d4e110bd0ec02843a60bbeb8b6fc37a9ace9 | dadbed99e65252d79f81101a392d0d6497b86caa | 2023-08-21T23:07:43+03:00 | Georgi Gerganov | gguf : new file format with flexible meta data (beta) (#2398) | |
| 492 | cb1c0727bd59803b439b6a3af121c99e6393ff3d | 9e232f0234073358e7031c1b8d7aa45020469a3b | 2023-08-21T11:11:31+03:00 | Kawrakow | HellaSwag: split token evaluation into batches if needed (#2681) | |
| 493 | 220d9318647a8ce127dbf7c9de5400455f41e7d8 | 81844fbcfd93a162b7aeaea9e4f2ab1358f7f97e | 2023-08-02T16:21:11+08:00 | ldwang | readme : add Aquila-7B model series to supported models (#2487) | |
| 494 | ee1b497c985f61d6ec519c39fcfed78a3c6f1d06 | d73b8d48b45d6e2c0ae9bb8c39623c4024adc275 | 2023-07-29T02:10:05+08:00 | eric8607242 | llama : support more diverse tokenizers? (#2420) | |
| 495 | fce48caf9a6b9930eee9e2a5971428cdff403ba8 | 875086bdb95ce1f3294439811536533199e3b579 | 2023-07-25T21:22:09+08:00 | ldwang | convert.py : support bpe tokenizer (#2228) | |
| 496 | 84e09a7d8bc4ab6d658b5cd81295ac0add60be78 | 2f9cf974a066ac0e03fbb235d834b01b0164d743 | 2023-07-23T23:58:10-04:00 | Evan Jones | llama : add grammar-based sampling (#1773) | |
| 497 | 355c80f49e32b0b15c0a457f3bad380e57f5b9ac | 83a00ce69bef9124c0702424a012ea799128b77d | 2023-07-23T06:16:48-05:00 | AustinMroz | examples : simplify vim plugin (#2327) | |
| 498 | f257fd255044decffad93dee2502875ce66ad80c | 7ee76e45afae7f9a7a53e93393accfb5b36684e1 | 2023-07-05T03:06:12+09:00 | jwj7140 | Add an API example using server.cpp similar to OAI. (#2009) | |
| 499 | cc45a7feb8412e84ff292207621412fffc0d3d51 | 55dbb915cc2a95048f56e667b09dfad38d840421 | 2023-07-04T02:43:55+08:00 | Howard Su | Fix crash of test-tokenizer-0 under Debug build (#2064) | |
| 500 | d7d2e6a0f0c74f7a570dae384dfff371ac744d2a | 46088f72318981341a2d646f12f6eee6aec06d65 | 2023-07-03T05:38:44+08:00 | WangHaoranRobin | server: add option to output probabilities for completion (#1962) | |
| 501 | ca7c3f4da5d144d4cd1dd44903552e6ba49b8ec8 | b97ca431db35ec96a339a721acb1219c1dd78bed | 2023-06-19T18:14:09+03:00 | Kawrakow | cuda : faster k-quants on older GPUs (#1930) | |
| 502 | b24c3049d96557c24782e4d32feaae65f47277af | 0ede372a51fd8160688e01b587582666c14e94e5 | 2023-06-18T17:41:26+02:00 | Johannes Gäßler | Added tokens per second to info prints (#1928) | |
| 503 | 794db3e7b982fee37e3995db9c3a216a57ff65e3 | 5ddf7ea1fb42bac21026de2f77e0f9c069b92234 | 2023-06-17T07:53:04-04:00 | Randall Fitzgerald | Server Example Refactor and Improvements (#1570) | |
| 504 | e32089b2c20b1b87b22912f4a8b93fe01647d5b9 | 2347e45e7bdb09c9a7d74b2c0bc86c2b65f0c343 | 2023-06-13T21:04:40+02:00 | xaedes | train : improved training-from-scratch example (#1652) | |
| 505 | 74a6d922f12ccfe16b0c265f43be8978c6f25e98 | e4caa8da59c1c97dc23fa336f4d726984a20560f | 2023-06-12T22:39:21+03:00 | Kawrakow | Metal implementation for all k_quants (#1807) | |
| 506 | fa84c4b3e80199a5683438f062009c031a06c4fa | 12b063f0ecf280e98028e444fc492ee6222cdcdc | 2023-06-11T08:19:17-06:00 | Kerfuffle | Fix issue where interactive mode crashes when input exceeds ctx size (#1789) | |
| 507 | e9b66ee9829039d4ab54550d6222e42a0b31e52a | 4f0154b0bad775ac4651bf73b5c216eb43c45cdc | 2023-06-10T11:28:11+03:00 | Kawrakow | metal : add Q4_1 implementation (#1785) | |
| 508 | 72ff5282bf0388c60821f504c4c8cc2b1f491aa6 | 0bf7cf1b296fc9fca05411b37afdf08a531487d2 | 2023-06-08T22:28:21+03:00 | Kawrakow | metal : add Q2_K implementation (#1762) | |
| 509 | 0f291e1f65c1d68201e71ce99c89562a36686b6d | 8fc8179919a11738910db07a800f2b176f8adf09 | 2023-06-08T19:46:22+03:00 | Kawrakow | metal : Q6_K implementation (#1752) | |
| 510 | 4161bdc04debb70bf5f275492b4d89fd9330087c | 0035858273ebe0694926bf4414d279f3e1cd109d | 2023-06-08T10:08:23+03:00 | Kawrakow | metal : add Q4_K implementation (#1733) | |
| 511 | 99009e72f8072fa552eb02efee436be596c71cdd | 5220a991a5e92bddad9542267ab445a2c033681c | 2023-06-05T22:56:18+03:00 | Kawrakow | ggml : add SOTA 2,3,4,5,6 bit k-quantizations (#1684) | |
| 512 | 2e6cd4b02549e343bef3768e6b946f999c82e823 | 7e4ea5beff567f53be92f75f9089e6f11fa5dabd | 2023-05-22T23:33:24+02:00 | 0cc4m | OpenCL Token Generation Acceleration (#1459) | |
| 513 | affc76edfdefa7b326f526e463cc65ff13fcfb92 | ea600071cb005267e9e8f2629c1e406dd5fde083 | 2023-05-20T14:19:28+02:00 | Johannes Gäßler | cuda : loading models directly into VRAM, norm calculation on GPU, broadcasting for ggml_mul (#1483) | |
| 514 | 7694b52b9a206b93d59139c3c7c9b55da0f5aa59 | 79e3efb0e97b65b6cc72cd9ee970fa8189ad79a4 | 2023-05-19T10:24:59-07:00 | Jason McCartney | main : make reverse prompt option act as a stop token in non-interactive mode (#1032) | |
| 515 | 905d87b70aa189623d500a28602d7a3a755a4769 | f954edda935a70a14cf0cc45ecc7fe7d60cf3e4b | 2023-05-13T15:38:36+02:00 | Johannes Gäßler | ggml : GPU-accelerated token generation (#1412) | |
| 516 | f954edda935a70a14cf0cc45ecc7fe7d60cf3e4b | f048af0230ad5381bb20b9e3c1467ec6fc7debdf | 2023-05-13T14:56:40+02:00 | xaedes | ggml : implement backward pass for llama + small training-llama-from-scratch example (#1360) | |
| 517 | b9fd7eee57df101d4a3e3eabc9fd6c2cb13c9ca1 | b608b55a3ea8e4760c617418538465449175bdb8 | 2023-05-12T00:23:08+03:00 | Georgi Gerganov | ggml : remove bit shuffling (#1405) | |
| 518 | b608b55a3ea8e4760c617418538465449175bdb8 | cf348a60e0af3905acd1d297cb064b918265b7ac | 2023-05-11T10:10:19-05:00 | CRD716 | prompts : model agnostic DAN (#1304) | |
| 519 | f9a6364912fd0463fddfdbc9ef9f79fdc281570d | 95078cc554fe03d4512363c7e4dec963f0047c72 | 2023-05-08T17:41:54+03:00 | Georgi Gerganov | llama : require first token to be BOS (#1303) | |
| 520 | 018f2279f5fe3ef743bd8254b23ea8f0efae7e73 | 9411288271ab548216902a029f42a0a38ebcedb7 | 2023-04-22T02:27:06+08:00 | 源文雨 | cmake : link threads publicly to ggml (#1042) | |
| 521 | 9411288271ab548216902a029f42a0a38ebcedb7 | 8687c1f2581d059cd5b6a9502f89bd343566062a | 2023-04-21T11:18:09-07:00 | Alex Klinkhamer | main : evaluate tokens in batches after swapping context (#1014) | |
| 522 | 1bfc153e2f35ddd9d64b084e8d1a5e6fa57ad1c9 | 3d59769c3bb7e72c915646ddb1e239b1face19f5 | 2023-04-21T17:18:26+02:00 | Kawrakow | ggml : a faster version for Q4_1 x Q8_0 dot products (#1083) | |
| 523 | 884e7d7a2bfd7325b107442d6758983f5886ed3d | 7cd5c4a3e9106151d48f328bb3c94c298a211f18 | 2023-04-19T20:10:08+03:00 | Georgi Gerganov | ggml : use 8-bit precision for Q4_1 intermediate results (#1047) | |
| 524 | 723dac55fa2ba7adc6e3fc8609781d1ad0378906 | 0f07cacb05f49704d35a39aa27cfd4b419eb6f8d | 2023-04-14T00:03:03-07:00 | comex | py : new conversion script (#545) | |
| 525 | e986f94829bae0b9e66b326acbbba179931c84f1 | c0bb1d3ce21005ab21d686626ba87261a6e3a660 | 2023-04-02T12:23:04+02:00 | Christian Falch | Added api for getting/setting the kv_cache (#685) | |
| 526 | cbef542879962fdc491656cd0c8cadd65a5f1356 | 9733104be5389ebb1ff05095eca2a70280cd875a | 2023-03-29T21:31:24+02:00 | Pavol Rusnak | py : cleanup the code | |
| 527 | 2e17dfd80a473099dacc0f41c9146d233c6a5972 | 20a1a4e09c522a80e2a0db51643d25fa38326065 | 2023-03-23T15:22:47-05:00 | rabidcopy | Replace EOS with newline to prevent context/memory being flushed by EOS in interactive mode (#333) | |
| 528 | 8eea5ae0e5f31238a97c79ea9103c27647380e37 | 93208cfb929c2323e5d2ac6bf354e278040e70ed | 2023-03-23T12:26:19+02:00 | anzz1 | Delete SHA256SUMS for now (#416) | |
| 529 | 305ba6f0e6daa3796aad9dd18053a1945dd4cc58 | 4122dffff958cd137175b58f1f27c0913528d7ba | 2023-03-22T18:16:35+01:00 | tjohnman | Don't force immediate interactive without `-i` (#354) | |
| 530 | 56e659a0b271436e24813a801640d015e7b05328 | 40ea807a972ec7b5a426f034ebfa593b5e7a06ed | 2023-03-22T17:09:38+01:00 | Erik Scholz | fix perplexity after c-api refactor (#390) | |
| 531 | f5a77a629bd0f37ae1696747633ab42a5530ec15 | da0e9fe90ccf6e73597eb19dd0cfc0a28363fb3b | 2023-03-22T07:32:36+02:00 | Georgi Gerganov | Introduce C-style API (#370) | |
| 532 | 353ec251a42491f5192c48561da4b444ef67f23c | 89d5d90f3b6d25f134da7a8e252c3432bffcf674 | 2023-03-21T14:21:50-03:00 | Fabio R. Sluzala | We could use std::unordered_map over std::map (#305) | |
| 533 | 486ae645fd3eda8b9d7413d5ff34fb65a3e337fb | 3ab3e6582f7320c2b6568c892fdfc8215caf7e6c | 2023-03-21T09:27:42-07:00 | Gary Linscott | Compute perplexity over prompt (#270) | |
| 534 | 6a612959e1b6c37b68b6b141329751a2902b1030 | d5f56a5e5a0069329a81f96460221e7afb1daddc | 2023-03-21T17:05:06+01:00 | tjohnman | Check for reverse prompt by characters instead of tokens (#292) (#330) | |
| 535 | d5f56a5e5a0069329a81f96460221e7afb1daddc | 3bfa3b43b7319b71853bfc7d3cf4e9767c24bbc8 | 2023-03-21T17:04:43+01:00 | tjohnman | Check for reverse prompt by characters instead of tokens (#292) (#330) | |
| 536 | e0ffc861fae5ac8b40ce973f822d03db02929d36 | 8f644a0a859938c787d329d27f98e03c58d7df27 | 2023-03-21T08:34:49-07:00 | Kevin Kwok | Update IPFS links to quantized alpaca with new tokenizer format (#352) | |
| 537 | eb34620aeceaf9d9df7fcb19acc17ad41b9f60f8 | 2e664f1ff413995506c9a54f3a8d5b8c64e37a91 | 2023-03-21T17:29:41+02:00 | Georgi Gerganov | Add tokenizer test + revert to C++11 (#355) | |
| 538 | 6b6d5b5024faaf82019d08cde5e8a9d69c6ca316 | a791a68b613b162c88a83f5f0225223bc167c762 | 2023-03-21T03:33:10+08:00 | Qingyou Meng | Fixed tokenizer.model not found error when model dir is symlink (#325) | |
| 539 | 0f1b21cb90ac6b84a9af70cafb8e13b5389e3b32 | 074bea2eb1f1349a0118239c4152914aecaa1be4 | 2023-03-20T18:05:20+01:00 | Bernat Vadell | Docker - Fix publish docker image in GitHub Registry (#235) | |
| 540 | 074bea2eb1f1349a0118239c4152914aecaa1be4 | 5cb63e2493c49bc2c3b9b355696e8dc26cdd0380 | 2023-03-20T03:17:23-07:00 | Mack Straight | sentencepiece bpe compatible tokenizer (#252) | |
| 541 | 368d0c8a9ebae16a20e1c8971b21ee888bdefad5 | 50fae10d0339f2bd639f69dd679c0201d939a265 | 2023-03-19T19:31:17+01:00 | tjohnman | Respect the maximum number of tokens in interactive. (#298) | |
| 542 | d7def1a7524f712e5ebb7cd02bab0f13aa56a7f9 | 6f61c18ec9a30416e21ed5abfb1321bdb14979be | 2023-03-18T17:10:47-07:00 | Ronsor | Warn user if a context size greater than 2048 tokens is specified (#274) | |
| 543 | a81d0c2a171a4446e6a21a3ec74a0c0768d71184 | b2de7f18dfbb93463eeb5b4392117bbe82d5bd1b | 2023-03-18T04:17:19-07:00 | Gary Linscott | Fix n^2 loop in tokenization (#254) | |
| 544 | c9f670a17755311aa28c411f5c7f3c8c05434770 | 4f546091102a418ffdc6230f872ac56e5cedb835 | 2023-03-17T21:05:58+01:00 | thement | Implement non-greedy tokenizer that tries to maximize token lengths (#242) | |
| 545 | 956dfda8ad8cea7961e22e0384bbc315bf79aed2 | 113e685d18ac4edb20f647fd34b000941556f6a6 | 2023-03-15T12:37:50-07:00 | Ronsor | Use `tokenizer.vocab_size()` instead of hardcoding 32000 in convert-pth-to-ggml.py (#142) | |
| 546 | 460c48254098b28d422382a2bbff6a0b3d7f7e17 | c80e2a8f2adeda202cbffe76ef800f134e51f03f | 2023-03-13T00:35:51+01:00 | Matvey Soloviev | Fix token count accounting |