data: publish complete Calculet NPU research archive

This commit is contained in:
2026-08-02 14:57:11 +08:00
parent b5c4fbffab
commit 98e6cadcb6
12400 changed files with 6166642 additions and 0 deletions
Binary file not shown.
File diff suppressed because it is too large Load Diff
@@ -0,0 +1,18 @@
fd9bd632f346085920d523dd307a3e4c11cc0a05 refs/heads/dev
0d5a470223fc90b6b6807921d68011ff06ae7f9e refs/heads/master
0d5a470223fc90b6b6807921d68011ff06ae7f9e refs/remotes/origin/HEAD
fd9bd632f346085920d523dd307a3e4c11cc0a05 refs/remotes/origin/dev
1bec0db5a675ddc60fb793be2a746e8f3c8855dc refs/remotes/origin/dev-ben
99962021f2dd1994dbbf90d5712f0ca2633f20f8 refs/remotes/origin/dev-ot
0d5a470223fc90b6b6807921d68011ff06ae7f9e refs/remotes/origin/master
ebce9e1a548c2329aa97f53b8b2ad50d968088dc refs/remotes/origin/runtime_replace
795179beb5bba728e0ccf0a7e80a5ec5ef36e92a refs/remotes/origin/test-cicd
1921024604db640f09ade83c8a437ebf15bde360 refs/stash
41e6636ea1fb3884e41fb2023f92b0e7262ef09b refs/tags/v0.0.1
818a7215a8cc9e3d35999ea6e4187c5a1367c997 refs/tags/v0.1.0
bf461bb42c632b810c2c27b8b4291eaa5ef72f22 refs/tags/v0.1.1
f0dd7128023f2e18cb9a831180dc26adf360cbe9 refs/tags/v0.2.0
85f6fcd7f0ef420b171625a2a1ebc431ab9156a0 refs/tags/v0.2.1
d55872adc99aa7b35c9a32b27fb5a77cfe665c05 refs/tags/v0.2.2
92460d41d588c6993c5a438c578afeeafc08ad78 refs/tags/v0.3.0
fd9bd632f346085920d523dd307a3e4c11cc0a05 HEAD
1 fd9bd632f346085920d523dd307a3e4c11cc0a05 refs/heads/dev
2 0d5a470223fc90b6b6807921d68011ff06ae7f9e refs/heads/master
3 0d5a470223fc90b6b6807921d68011ff06ae7f9e refs/remotes/origin/HEAD
4 fd9bd632f346085920d523dd307a3e4c11cc0a05 refs/remotes/origin/dev
5 1bec0db5a675ddc60fb793be2a746e8f3c8855dc refs/remotes/origin/dev-ben
6 99962021f2dd1994dbbf90d5712f0ca2633f20f8 refs/remotes/origin/dev-ot
7 0d5a470223fc90b6b6807921d68011ff06ae7f9e refs/remotes/origin/master
8 ebce9e1a548c2329aa97f53b8b2ad50d968088dc refs/remotes/origin/runtime_replace
9 795179beb5bba728e0ccf0a7e80a5ec5ef36e92a refs/remotes/origin/test-cicd
10 1921024604db640f09ade83c8a437ebf15bde360 refs/stash
11 41e6636ea1fb3884e41fb2023f92b0e7262ef09b refs/tags/v0.0.1
12 818a7215a8cc9e3d35999ea6e4187c5a1367c997 refs/tags/v0.1.0
13 bf461bb42c632b810c2c27b8b4291eaa5ef72f22 refs/tags/v0.1.1
14 f0dd7128023f2e18cb9a831180dc26adf360cbe9 refs/tags/v0.2.0
15 85f6fcd7f0ef420b171625a2a1ebc431ab9156a0 refs/tags/v0.2.1
16 d55872adc99aa7b35c9a32b27fb5a77cfe665c05 refs/tags/v0.2.2
17 92460d41d588c6993c5a438c578afeeafc08ad78 refs/tags/v0.3.0
18 fd9bd632f346085920d523dd307a3e4c11cc0a05 HEAD
@@ -0,0 +1,162 @@
fd9bd632f346085920d523dd307a3e4c11cc0a05 e08e473cf292ba73789769b993bb35bcdfc31689 wangbomeng wangbomeng@calculet.tech 2026-06-01T14:15:35+08:00 HEAD -> dev, origin/dev llama-bench: fix device-info
e08e473cf292ba73789769b993bb35bcdfc31689 f86112d6758298241ab2fa84ad4f0f7b1ace35c6 wangbomeng wangbomeng@calculet.tech 2026-06-01T11:47:01+08:00 llama-bench:add device-info
f86112d6758298241ab2fa84ad4f0f7b1ace35c6 d1bc743c10080fed1253686ce01749b42611ded4 wangbomeng wangbomeng@calculet.tech 2026-05-29T16:40:38+08:00 add dump_pos,fix pos_tensor of pre_by_embeds
d1bc743c10080fed1253686ce01749b42611ded4 2f201160b1960fd7be18b70d5770599d7082dd2f wangbomeng wangbomeng@calculet.tech 2026-05-28T14:23:06+08:00 set u_batch = max_seq_len
2f201160b1960fd7be18b70d5770599d7082dd2f f131bf1908b8c5dd1f49d7ae7f616506fc471666 wangbomeng wangbomeng@calculet.tech 2026-05-27T09:58:31+08:00 delete useless code
f131bf1908b8c5dd1f49d7ae7f616506fc471666 33d96dae28e17208ef61a71dba40cda3c04f135a wangbomeng wangbomeng@calculet.tech 2026-05-27T09:38:51+08:00 fix patch of qwen2.5vl,n_patch of minicpm = 64,fix n_ctx_slot,comment out M-ROPE
ebce9e1a548c2329aa97f53b8b2ad50d968088dc e850ff4de25ad1221abc9bf3bb30df252ccd9c36 Yunzhe Jia yunzhe@calculet.tech 2026-05-27T09:38:00+08:00 origin/runtime_replace Refactor cal-llm integration by removing runtime capacity loading and adjusting request handling
e850ff4de25ad1221abc9bf3bb30df252ccd9c36 9985688f7fa96f755882f96a2cd8a18114fdc42d Yunzhe Jia yunzhe@calculet.tech 2026-05-26T10:59:45+08:00 Enhance cal-llm integration by adding runtime checks for CALRT_LIBRARY and updating link settings for Linux and Windows
9985688f7fa96f755882f96a2cd8a18114fdc42d 38ca6895815671a87ceec86b4aa4eb976580ce76 Yunzhe Jia yunzhe@calculet.tech 2026-05-25T09:05:49+08:00 Refactor CalrtEngineConfig initialization by removing redundant parameters
33d96dae28e17208ef61a71dba40cda3c04f135a 37f068d87cc2d0a0b40ce978031fc9932fc89077 wangbomeng wangbomeng@calculet.tech 2026-05-22T14:33:45+08:00 add llama-build.sh
1921024604db640f09ade83c8a437ebf15bde360 d028722a12c5a463cc97207787cfd03d7a2590b0 5af229fe518ee2d761ab8ae2a69f7a9aaa9057f4 Bomeng Wang wangbomeng@calculet.tech 2026-05-21T14:08:14+08:00 refs/stash WIP on dev: d028722a replace cparam.n_ubatch with n_ubatch()
5af229fe518ee2d761ab8ae2a69f7a9aaa9057f4 d028722a12c5a463cc97207787cfd03d7a2590b0 Bomeng Wang wangbomeng@calculet.tech 2026-05-21T14:08:14+08:00 index on dev: d028722a replace cparam.n_ubatch with n_ubatch()
37f068d87cc2d0a0b40ce978031fc9932fc89077 13508e5e18bbb1202ae60c2ee5ecbdda1cca817b wangbomeng wangbomeng@calculet.tech 2026-05-21T14:07:00+08:00 release
13508e5e18bbb1202ae60c2ee5ecbdda1cca817b b6b7919468126d5ba30a10941825154789e9082f wangbomeng wangbomeng@calculet.tech 2026-05-21T11:43:59+08:00 reduce cmake log
b6b7919468126d5ba30a10941825154789e9082f 46847c24fc5c52dd57bb4fb17fc4d684149bb4fa wangbomeng wangbomeng@calculet.tech 2026-05-20T16:40:33+08:00 reduce cmake log
38ca6895815671a87ceec86b4aa4eb976580ce76 ddd60c928224b52eb4e1e60e01e8a1ecbb80ee45 Yunzhe Jia yunzhe@calculet.tech 2026-05-20T16:37:13+08:00 Add support for cal-llm profile dumping to JSONL file
46847c24fc5c52dd57bb4fb17fc4d684149bb4fa d028722a12c5a463cc97207787cfd03d7a2590b0 wangbomeng wangbomeng@calculet.tech 2026-05-20T16:02:12+08:00 Simplify CMakeLists.txt
d028722a12c5a463cc97207787cfd03d7a2590b0 63442fde8dc285817f725bd6c5fae80f478a3813 wangbomeng wangbomeng@calculet.tech 2026-05-20T14:41:05+08:00 replace cparam.n_ubatch with n_ubatch()
63442fde8dc285817f725bd6c5fae80f478a3813 fc3f4a9fab88e98eff8eeca8cbc6617333edba2c wangbomeng wangbomeng@calculet.tech 2026-05-20T11:47:42+08:00 fix ubatch and cmakelist
ddd60c928224b52eb4e1e60e01e8a1ecbb80ee45 2716130010c58f1cdd9d94f0e2f8e047bc92dc66 Yunzhe Jia yunzhe@calculet.tech 2026-05-20T09:22:40+08:00 Add cal-llm backend profiling support with command-line option
fc3f4a9fab88e98eff8eeca8cbc6617333edba2c c931ef3163940227c9b6291e04216245cce21429 wangbomeng wangbomeng@calculet.tech 2026-05-19T16:54:16+08:00 add dump and rt case generation
c931ef3163940227c9b6291e04216245cce21429 a43741244a646d3f8fa3ff01bb9b7d059223d0a5 wangbomeng wangbomeng@calculet.tech 2026-05-18T17:34:37+08:00 calrt: fix prefill_by_ids.fix create_buf
2716130010c58f1cdd9d94f0e2f8e047bc92dc66 b35bda124ccd4ed581dd6088d3ffa4931c2809b6 Yunzhe Jia yunzhe@calculet.tech 2026-05-18T08:40:54+08:00 fix n_ctx_slot error by adding runtime capacity loading for cal-llm
a43741244a646d3f8fa3ff01bb9b7d059223d0a5 b2003d6c90ef0fa26ab9e930ba3e22b355eb3d39 wangbomeng wangbomeng@calculet.tech 2026-05-15T14:39:53+08:00 run llama-passkey successfully, fix llama-bench, copy 3 times input to infer qwen2.5vl
b35bda124ccd4ed581dd6088d3ffa4931c2809b6 81a2cbd4cef5d28334ff513d6b69e593d9d1cb49 Yunzhe Jia yunzhe@calculet.tech 2026-05-15T09:19:31+08:00 Implement vocab-only model initialization and enhance cal-llm backend error handling
81a2cbd4cef5d28334ff513d6b69e593d9d1cb49 3b14ed556c15529fe1f94b649f49db7156dfaf67 Yunzhe Jia yunzhe@calculet.tech 2026-05-14T16:06:37+08:00 Enhance CMake configuration for cal-llm integration by updating paths and adding library properties
3b14ed556c15529fe1f94b649f49db7156dfaf67 dde8b8228081769c8d8f1e0751d47fa7875f8423 Yunzhe Jia yunzhe@calculet.tech 2026-05-14T14:34:25+08:00 - Removed references to CALRT from clip.h, mtmd-helper.cpp, mtmd-helper.h, mtmd.cpp, and mtmd.h. - Updated server.cpp to conditionally include CAL-LLM support. - Introduced option LLAMA_SERVER_USE_CAL_LLM in CMakeLists.txt to enable CAL-LLM integration. - Refactored server context to handle CAL-LLM requests and responses. - Updated image processing logic to remove CALRT-specific implementations. - Ensured compatibility with existing llama functionality while integrating new CAL-LLM features.
b2003d6c90ef0fa26ab9e930ba3e22b355eb3d39 7800c772d44a7415640ec1669a691232939927cf wangbomeng wangbomeng@calculet.tech 2026-05-13T15:24:24+08:00 try passkey and embedding
7800c772d44a7415640ec1669a691232939927cf dde8b8228081769c8d8f1e0751d47fa7875f8423 wangbomeng wangbomeng@calculet.tech 2026-05-13T15:23:54+08:00 try passkey and embedding
dde8b8228081769c8d8f1e0751d47fa7875f8423 fabcc7dac4b34d83fe430980bb364b81087c7ee9 wangbomeng wangbomeng@calculet.tech 2026-05-12T10:46:08+08:00 clip:add minicpm patch;
fabcc7dac4b34d83fe430980bb364b81087c7ee9 1e9787962f20a7e82c71589ac1dd0585454e4bfe wangbomeng wangbomeng@calculet.tech 2026-04-30T16:17:17+08:00 calrt: fix encode dump
1e9787962f20a7e82c71589ac1dd0585454e4bfe f584311c716dd078c4b737eebbfda97fe12b7274 1bec0db5a675ddc60fb793be2a746e8f3c8855dc wangbomeng wangbomeng@calculet.tech 2026-04-30T16:06:23+08:00 Merge remote-tracking branch 'origin/dev-ben' into dev
f584311c716dd078c4b737eebbfda97fe12b7274 a339954cc2a145a80c5ea349e7896211916cbed9 wangbomeng wangbomeng@calculet.tech 2026-04-30T16:05:15+08:00 calrt: fix encode dump
1bec0db5a675ddc60fb793be2a746e8f3c8855dc 465df20c3e1f3f58d0f5531c796e0941a49c32b0 wangbomeng wangbomeng@calculet.tech 2026-04-30T16:02:59+08:00 origin/dev-ben bench: support 2 calbins
465df20c3e1f3f58d0f5531c796e0941a49c32b0 a339954cc2a145a80c5ea349e7896211916cbed9 wangbomeng wangbomeng@calculet.tech 2026-04-30T09:08:12+08:00 support one calbin
a339954cc2a145a80c5ea349e7896211916cbed9 8e76fc330ad624d1768b412d7894e272dbe696f4 eeeef3f6d6a5aad9296323ca15d9d929745b8932 wangbomeng wangbomeng@calculet.tech 2026-04-29T14:57:55+08:00 tag: v0.3.0 Merge branch 'dev' into dev-cli
8e76fc330ad624d1768b412d7894e272dbe696f4 431ad6f1c787f1b47e9e7be14b2e1a7d8565485c wangbomeng wangbomeng@calculet.tech 2026-04-29T14:56:59+08:00 finish dev of llama-cli
eeeef3f6d6a5aad9296323ca15d9d929745b8932 431ad6f1c787f1b47e9e7be14b2e1a7d8565485c wangbomeng wangbomeng@calculet.tech 2026-04-28T16:16:19+08:00 add unknown time info: prefill and decode
431ad6f1c787f1b47e9e7be14b2e1a7d8565485c efa1876bb8b2a449a55054a8c3745892f2c0f262 wangbomeng wangbomeng@calculet.tech 2026-04-27T16:52:15+08:00 update calrt_infer
efa1876bb8b2a449a55054a8c3745892f2c0f262 4a2a3181f1cea170105c771e6ba69d851b82b937 wangbomeng wangbomeng@calculet.tech 2026-04-27T11:35:58+08:00 tag: v0.2.2 update version print
4a2a3181f1cea170105c771e6ba69d851b82b937 e3ea5541259f35871c3e995331770aaca297e9ec wangbomeng wangbomeng@calculet.tech 2026-04-26T10:56:02+08:00 add calrt-version
e3ea5541259f35871c3e995331770aaca297e9ec 0b8e43943846a1cd05c26c9186b9ef778ebae6e2 wangbomeng wangbomeng@calculet.tech 2026-04-26T10:55:48+08:00 add calrt-version
0b8e43943846a1cd05c26c9186b9ef778ebae6e2 5eb46fffbd2e260c540fb112314ad67bbb8f56b6 wangbomeng wangbomeng@calculet.tech 2026-04-26T08:43:43+08:00 to debug
5eb46fffbd2e260c540fb112314ad67bbb8f56b6 005112c51e00d998b457337ca3dad53fc46e2d0b wangbomeng wangbomeng@calculet.tech 2026-04-24T16:24:51+08:00 clip: add image_to_patches; calrt: vision copy data from bf16 to fp32
005112c51e00d998b457337ca3dad53fc46e2d0b 509670642e8090a1713f5d73590b549be827aaef wangbomeng wangbomeng@calculet.tech 2026-04-24T16:24:31+08:00 clip: add image_to_patches; calrt: vision copy data from bf16 to fp32
509670642e8090a1713f5d73590b549be827aaef 5d219bfcef239c1e3ddd1baecc0514a9462ff6a8 wangbomeng wangbomeng@calculet.tech 2026-04-24T09:40:34+08:00 rm debug code
5d219bfcef239c1e3ddd1baecc0514a9462ff6a8 6787a53ab9b4897c5a7b51a4062d7b90e6697d35 wangbomeng wangbomeng@calculet.tech 2026-04-24T09:31:32+08:00 calrt: recover base = batch_index * dict_len
6787a53ab9b4897c5a7b51a4062d7b90e6697d35 e1a76abf66178ea85656479a5e19aea7785c09f4 wangbomeng wangbomeng@calculet.tech 2026-04-24T09:22:02+08:00 calrt:input of multimodel from fp32 to bf16
e1a76abf66178ea85656479a5e19aea7785c09f4 99dd308adb8488fa869bb669e3335e646a938eff wangbomeng wangbomeng@calculet.tech 2026-04-22T16:29:22+08:00 calrt:add CalcoreRT version print
99dd308adb8488fa869bb669e3335e646a938eff 06c7852e99e34c71e24e3ef6001cb54c72970e4d wangbomeng wangbomeng@calculet.tech 2026-04-21T15:50:01+08:00 tag: v0.2.1 server: fix max_seq_len
06c7852e99e34c71e24e3ef6001cb54c72970e4d 96b4e267e562f44e76ec6c965ee0fa361f0439bf ed62eb33447f993d578e156a3c7e38c91b420ece wangbomeng wangbomeng@calculet.tech 2026-04-21T15:06:01+08:00 Merge branch 'dev-ot' into dev
ed62eb33447f993d578e156a3c7e38c91b420ece 015e988a271573a7c11e2a4b45084e1219d69d50 wangbomeng wangbomeng@calculet.tech 2026-04-21T15:05:22+08:00 try server-test:not success
015e988a271573a7c11e2a4b45084e1219d69d50 99962021f2dd1994dbbf90d5712f0ca2633f20f8 wangbomeng wangbomeng@calculet.tech 2026-04-17T16:56:08+08:00 little change
96b4e267e562f44e76ec6c965ee0fa361f0439bf 99962021f2dd1994dbbf90d5712f0ca2633f20f8 wangbomeng wangbomeng@calculet.tech 2026-04-17T15:33:01+08:00 merge dev-ot
99962021f2dd1994dbbf90d5712f0ca2633f20f8 9af6682ef101c6d006c743c703cf150ac25f466f wangbomeng wangbomeng@calculet.tech 2026-04-17T14:48:33+08:00 origin/dev-ot calrt: add onetoken slice and untile_prefill
9af6682ef101c6d006c743c703cf150ac25f466f e24f775ee26ea5249d5ff6cd23b8a0a17fe1438d wangbomeng wangbomeng@calculet.tech 2026-04-16T10:09:44+08:00 args: add -ca
e24f775ee26ea5249d5ff6cd23b8a0a17fe1438d a206460e610aef995e36e50b33e8bd41fe477541 wangbomeng wangbomeng@calculet.tech 2026-04-15T10:01:09+08:00 calrt: add copy_data_to_ibuf for vision model
795179beb5bba728e0ccf0a7e80a5ec5ef36e92a 6d55eae7e76b768acfcec045b8e84cded8ae3b55 Yunzhe Jia yunzhe@calculet.tech 2026-04-14T16:03:22+08:00 origin/test-cicd add ci yaml
a206460e610aef995e36e50b33e8bd41fe477541 d8b2aaa00049978cebac15041f960d75b552f97b wangbomeng wangbomeng@calculet.tech 2026-04-14T10:23:43+08:00 calrt: support mixture of prefill_by_ids and prefill_by_embeds
d8b2aaa00049978cebac15041f960d75b552f97b b6f29ec8140028619efaa50aa6e73146cecf631d wangbomeng wangbomeng@calculet.tech 2026-04-13T11:23:44+08:00 server: fix context-shift
b6f29ec8140028619efaa50aa6e73146cecf631d 6d55eae7e76b768acfcec045b8e84cded8ae3b55 wangbomeng wangbomeng@calculet.tech 2026-04-13T11:23:31+08:00 server: fix context-shift
6d55eae7e76b768acfcec045b8e84cded8ae3b55 af8055f5f033a730e7e1fe80185b18b7e9473966 wangbomeng wangbomeng@calculet.tech 2026-04-10T14:58:56+08:00 tag: v0.2.0 add annotations
af8055f5f033a730e7e1fe80185b18b7e9473966 6f54682df62b8ec6bb4154b99c47b5becda3291f wangbomeng wangbomeng@calculet.tech 2026-04-10T14:58:19+08:00 add annotations
6f54682df62b8ec6bb4154b99c47b5becda3291f 42a181674565411efa5c8b318bc77d6fd084df8a a2d5bf362d6c9a546f9deadf4f8975605a915d33 Yunzhe Jia yunzhe@calculet.tech 2026-04-10T09:07:20+08:00 Merge branch 'dev' of http://192.168.10.26:1000/yunzhe/llama.cpp into dev
42a181674565411efa5c8b318bc77d6fd084df8a bd3a57a11aa008e0b5dc2a30f82fcd3a02587208 Yunzhe Jia yunzhe@calculet.tech 2026-04-10T09:06:55+08:00 fix prompt_cache issue
a2d5bf362d6c9a546f9deadf4f8975605a915d33 bd3a57a11aa008e0b5dc2a30f82fcd3a02587208 Bomeng Wang wangbomeng@calculet.tech 2026-04-09T21:01:46+08:00 server: comment fixed time
bd3a57a11aa008e0b5dc2a30f82fcd3a02587208 fcfcdf80b01664a08fb12df879a05df3cc0eba70 74d437ab1456831573def7ca385a74d0ca460c37 Yunzhe Jia yunzhe@calculet.tech 2026-04-09T19:42:57+08:00 Merge branch 'dev' of http://192.168.10.26:1000/yunzhe/llama.cpp into dev
fcfcdf80b01664a08fb12df879a05df3cc0eba70 0cd44929b442860dc0e5f88976108be82350f9dc Yunzhe Jia yunzhe@calculet.tech 2026-04-09T19:41:52+08:00 tmp fix one run >4K problem
74d437ab1456831573def7ca385a74d0ca460c37 5813c943005d1ede551e67ee98e35aefd210ff22 0cd44929b442860dc0e5f88976108be82350f9dc wangbomeng wangbomeng@calculet.tech 2026-04-09T17:44:26+08:00 Merge branch 'dev' of http://192.168.10.26:1000/yunzhe/llama.cpp into dev
5813c943005d1ede551e67ee98e35aefd210ff22 1f0d5bb0453f93ffa51faf68237c89251c2e0c40 wangbomeng wangbomeng@calculet.tech 2026-04-09T17:38:57+08:00 add --device-info
1f0d5bb0453f93ffa51faf68237c89251c2e0c40 b8153b6b8f244b223c9f4c2940ae1f212634519e wangbomeng wangbomeng@calculet.tech 2026-04-09T17:38:37+08:00 add --device-info
0cd44929b442860dc0e5f88976108be82350f9dc b8153b6b8f244b223c9f4c2940ae1f212634519e Bomeng Wang wangbomeng@calculet.tech 2026-04-09T15:08:50+08:00 rm calculet0.txt
b8153b6b8f244b223c9f4c2940ae1f212634519e 82842cfc3fa3d5c004c4540aeff8a81f38509bee wangbomeng wangbomeng@calculet.tech 2026-04-09T15:07:02+08:00 server: fix limit tokens to max_seq_len
82842cfc3fa3d5c004c4540aeff8a81f38509bee 622a22991089c6debd5f4b57738f3df3a0bda8b5 wangbomeng wangbomeng@calculet.tech 2026-04-09T15:06:26+08:00 server: fix limit tokens to max_seq_len
622a22991089c6debd5f4b57738f3df3a0bda8b5 5f47a738ba56a37d0ff281a16212f41979568e35 wangbomeng wangbomeng@calculet.tech 2026-04-09T10:36:31+08:00 server: comment circle print
5f47a738ba56a37d0ff281a16212f41979568e35 ecf01a17651cd7b1e8b85fd6075e83831463ee23 207ca38c751f7e6c251833eb11e89a2a0bb0fd07 Yunzhe Jia yunzhe@calculet.tech 2026-04-09T09:48:20+08:00 Merge branch 'dev' of http://192.168.10.26:1000/yunzhe/llama.cpp into dev
ecf01a17651cd7b1e8b85fd6075e83831463ee23 99d2078e89305035d87d966cee7987c7d50b3925 Yunzhe Jia yunzhe@calculet.tech 2026-04-09T09:47:55+08:00 fix n_parallel problem
207ca38c751f7e6c251833eb11e89a2a0bb0fd07 99d2078e89305035d87d966cee7987c7d50b3925 wangbomeng wangbomeng@calculet.tech 2026-04-08T19:14:37+08:00 delet extra printf
99d2078e89305035d87d966cee7987c7d50b3925 9626239f5a9e568c9975d67dd6745fef90279a87 Yunzhe Jia yunzhe@calculet.tech 2026-04-08T19:01:16+08:00 fix buffer resize problem
9626239f5a9e568c9975d67dd6745fef90279a87 da724f3e2a8af2c2537e3edcff41e9415ac66fef wangbomeng wangbomeng@calculet.tech 2026-04-08T17:47:04+08:00 calrt: fix MapBuf
da724f3e2a8af2c2537e3edcff41e9415ac66fef 18814f9bf1a423ebe8f32d6043c9cbc5b21b0218 Bomeng Wang wangbomeng@calculet.tech 2026-04-08T16:58:32+08:00 calrt: add MapBuf
18814f9bf1a423ebe8f32d6043c9cbc5b21b0218 bbee06d6d851e3f84f75b578047967d7e0e4a8dc wangbomeng wangbomeng@calculet.tech 2026-04-08T13:55:52+08:00 server : reset inference time
bbee06d6d851e3f84f75b578047967d7e0e4a8dc e126c21ed7b793b648d63533ea7ee30885f5a82a wangbomeng wangbomeng@calculet.tech 2026-04-08T11:29:36+08:00 calrt: add test time print
39edc6ec2e9560ccb20a2b8e547f58102bb268c1 2006831fd6ea8a8e16518b81bcee29fb674676ea Bomeng Wang wangbomeng@calculet.tech 2026-04-01T14:06:50+08:00 tag: v0.1.1 add t_incopy t_outcopy
2006831fd6ea8a8e16518b81bcee29fb674676ea 41e6636ea1fb3884e41fb2023f92b0e7262ef09b wangbomeng wangbomeng@calculet.tech 2026-04-01T10:42:27+08:00 tag: v0.1.0 v0.1.0
e126c21ed7b793b648d63533ea7ee30885f5a82a 5603e050af07173589f3b8850121263d86da01fd wangbomeng wangbomeng@calculet.tech 2026-04-01T10:07:12+08:00 sever: fix commit id
5603e050af07173589f3b8850121263d86da01fd 1e8a16cd0e3ad3c9a0f8746852a0a38c6e52322e wangbomeng wangbomeng@calculet.tech 2026-04-01T05:57:55+08:00 calrt: add t_incopy and t_outcopy
1e8a16cd0e3ad3c9a0f8746852a0a38c6e52322e 893e52bda0fee99bbda1521ea733a760bc4201f1 wangbomeng wangbomeng@calculet.tech 2026-04-01T10:14:22+08:00 calrt: fix slice and add infer/copy time
893e52bda0fee99bbda1521ea733a760bc4201f1 398ecf71f5f574037ce33f84dd1576fa164909ad Bomeng Wang wangbomeng@calculet.tech 2026-03-30T11:35:40+08:00 delete unnecessary commit id
398ecf71f5f574037ce33f84dd1576fa164909ad 6d5e83902bdd3142a8ff0d3db19f02a8619e95a0 wangbomeng wangbomeng@calculet.tech 2026-03-27T02:01:23+08:00 rm llama-server_old.cpp
6d5e83902bdd3142a8ff0d3db19f02a8619e95a0 e4eaab700333490e80ebefc8d023f6c1adfcc312 wangbomeng wangbomeng@calculet.tech 2026-03-27T00:57:11+08:00 server: printf calrt commit ID
e4eaab700333490e80ebefc8d023f6c1adfcc312 aeacc23a883400db0ebffb50e23355ada054da66 wangbomeng wangbomeng@calculet.tech 2026-03-25T09:03:55+08:00 calrt: prefil to prefill
aeacc23a883400db0ebffb50e23355ada054da66 cbaa7492663630132adeddccd9fec5e44ffa3336 wangbomeng wangbomeng@calculet.tech 2026-03-25T08:49:22+08:00 calrt: add slice only on decode
cbaa7492663630132adeddccd9fec5e44ffa3336 3c08ebf0e442cd730ddffd959ec676f9caf31c82 wangbomeng wangbomeng@calculet.tech 2026-03-25T03:21:02+08:00 reduce warning
3c08ebf0e442cd730ddffd959ec676f9caf31c82 613bc2b9a9d7af92efbe42d876ffcdb244f7a00e wangbomeng wangbomeng@calculet.tech 2026-03-24T02:43:03+08:00 calrt: comment LOG_ERROR in untile_decode_cpy
613bc2b9a9d7af92efbe42d876ffcdb244f7a00e 4e194ecc6c4b8ebe4c72d93f6055e3605dbfcefa wangbomeng wangbomeng@calculet.tech 2026-03-24T02:30:12+08:00 calrt: fix max_seq_len judgment
4e194ecc6c4b8ebe4c72d93f6055e3605dbfcefa 16cbf81a731f5839a2f6b0eb9d8539826353748b wangbomeng wangbomeng@calculet.tech 2026-03-24T01:59:03+08:00 calrt: fix ubatch.embd cpy
16cbf81a731f5839a2f6b0eb9d8539826353748b 8b4e17d990c23025148c4abadefe1010a0dd0734 wangbomeng wangbomeng@calculet.tech 2026-03-23T09:38:21+08:00 calrt: fix model_name of untile_cpy
8b4e17d990c23025148c4abadefe1010a0dd0734 6dacdd2cf9574214ca272a86674e7bd7ba21c4f0 41e6636ea1fb3884e41fb2023f92b0e7262ef09b wangbomeng wangbomeng@calculet.tech 2026-03-23T14:50:27+08:00 merge origin dev
6dacdd2cf9574214ca272a86674e7bd7ba21c4f0 3e6ad64467771224f072e5bad90e270951ba4cdf wangbomeng wangbomeng@calculet.tech 2026-03-23T14:42:28+08:00 calrt: add multimodal
3e6ad64467771224f072e5bad90e270951ba4cdf b37b7d9756feb3dac2db526eeab38b572a095d47 wangbomeng wangbomeng@calculet.tech 2026-03-23T14:36:41+08:00 calrt: add multimodal
41e6636ea1fb3884e41fb2023f92b0e7262ef09b d0a1b2c758440720d42fa108b3444f54593daa73 Bomeng Wang wangbomeng@calculet.tech 2026-03-12T16:36:07+08:00 tag: v0.0.1 server: correct the max_seq_len judgment
d0a1b2c758440720d42fa108b3444f54593daa73 b37b7d9756feb3dac2db526eeab38b572a095d47 Bomeng Wang wangbomeng@calculet.tech 2026-03-12T16:10:28+08:00 calrt: comment out dump
b37b7d9756feb3dac2db526eeab38b572a095d47 07817cefc14fa359dcecad0630defd3610f8f5c8 7ddafbdcb9426ae3af016925b8b596f11e8742d0 Yunzhe Jia yunzhe@calculet.tech 2026-03-10T16:32:31+08:00 Merge branch 'dev' of http://192.168.10.26:1000/yunzhe/llama.cpp into dev
07817cefc14fa359dcecad0630defd3610f8f5c8 b2c45d8ddefb7ec09435231c8ec5b736fabf9c91 Yunzhe Jia yunzhe@calculet.tech 2026-03-10T16:32:07+08:00 fix kv issue
7ddafbdcb9426ae3af016925b8b596f11e8742d0 059009eeaf20a569abfbac5eb37dad3bb9376428 wangbomeng wangbomeng@calculet.tech 2026-03-10T07:13:04+08:00 calrt: commented out cal_ctx->encode(batch)
059009eeaf20a569abfbac5eb37dad3bb9376428 1b073661d1311b5300173993b9f31ee7241d8606 wangbomeng wangbomeng@calculet.tech 2026-03-10T07:04:22+08:00 calrt: add multimodel
1b073661d1311b5300173993b9f31ee7241d8606 6295273c5866b9249bacdedbfc3a31877e6e6a85 b2c45d8ddefb7ec09435231c8ec5b736fabf9c91 wangbomeng wangbomeng@calculet.tech 2026-03-10T06:58:35+08:00 Merge branch 'dev' of http://192.168.20.229:1000/yunzhe/llama.cpp into dev
6295273c5866b9249bacdedbfc3a31877e6e6a85 c6ea3f0d2468e3b8eab5de80bacee7fe4c9dd3d7 wangbomeng wangbomeng@calculet.tech 2026-03-10T06:54:41+08:00 arg: update hf_repo url to https://download.calculet.tech:9443
b2c45d8ddefb7ec09435231c8ec5b736fabf9c91 c6ea3f0d2468e3b8eab5de80bacee7fe4c9dd3d7 Bomeng Wang wangbomeng@calculet.tech 2026-03-09T15:03:26+08:00 clart: past_kv_len = n_tokens
c6ea3f0d2468e3b8eab5de80bacee7fe4c9dd3d7 f8fba66b657c51a1df1efc7267bfea9f6140cebf wangbomeng wangbomeng@calculet.tech 2026-03-09T03:26:47+08:00 CMakeLists: STATIC to SHARED
f8fba66b657c51a1df1efc7267bfea9f6140cebf db4a61d2234c2f457b42ecc3f7219a1e1a35508a Yunzhe Jia yunzhe@calculet.tech 2026-03-06T15:06:36+08:00 fix calrt_install include path
db4a61d2234c2f457b42ecc3f7219a1e1a35508a e672e02ca1a582f9e3a9d011d9e1b4fea4942a25 Yunzhe Jia yunzhe@calculet.tech 2026-03-06T06:59:58+08:00 adapt to host-rt install structure
e672e02ca1a582f9e3a9d011d9e1b4fea4942a25 27b82f64252779ad160a3fa76bd378c39421de36 7a3a9a0e76bb5f530beafcfe52e87e388e93117a Yunzhe Jia yunzhe@calculet.tech 2026-03-06T11:47:09+08:00 Merge branch 'dev' of http://192.168.10.26:1000/yunzhe/llama.cpp into dev
27b82f64252779ad160a3fa76bd378c39421de36 0bd95719fed2f0247c8d0199dd897d24157dfae6 Yunzhe Jia yunzhe@calculet.tech 2026-03-06T11:42:45+08:00 adapt to calrt_objs target
7a3a9a0e76bb5f530beafcfe52e87e388e93117a 583c387efaf7bc030574e554088de79d09a27fbd wangbomeng wangbomeng@calculet.tech 2026-03-05T07:24:59+08:00 calrt_infer: fix past_kv_len
583c387efaf7bc030574e554088de79d09a27fbd 0edc14a60a2d5596f71d728c655e3523da924d89 wangbomeng wangbomeng@calculet.tech 2026-02-27T02:24:56+08:00 caserver: lim generated tokens to n_ctx_per_seq
0edc14a60a2d5596f71d728c655e3523da924d89 aa0a17d719326a63e0d6fea60aa0ced44e7abc33 wangbomeng wangbomeng@calculet.tech 2026-02-27T01:57:39+08:00 caserver: limit generated tokens to n_ctx_per_seq
aa0a17d719326a63e0d6fea60aa0ced44e7abc33 fa332e773da681f3e77d6ffe83a87edb557f758b wangbomeng wangbomeng@calculet.tech 2026-02-27T01:40:11+08:00 calrt: add bf16_to_fp32
fa332e773da681f3e77d6ffe83a87edb557f758b aa54a7c637f2c92d924a5f35386975b1c27de898 wangbomeng wangbomeng@calculet.tech 2026-02-27T01:31:42+08:00 Add bf16_to_fp32
aa54a7c637f2c92d924a5f35386975b1c27de898 84f2c0b5f334a7ab77347c6779b6027a951d0ff0 wangbomeng wangbomeng@calculet.tech 2026-02-27T01:30:36+08:00 Add bf16_to_fp32
84f2c0b5f334a7ab77347c6779b6027a951d0ff0 0bd95719fed2f0247c8d0199dd897d24157dfae6 wangbomeng wangbomeng@calculet.tech 2026-02-09T01:46:36+08:00 add bf16_to_fp32 in untile_decode/prefill_cpy
0bd95719fed2f0247c8d0199dd897d24157dfae6 365eb0b719e30b0f9e348d854f11c9c3f954a96e Yunzhe Jia yunzhe@calculet.tech 2026-02-07T10:25:06+08:00 fix get_model_by_name
365eb0b719e30b0f9e348d854f11c9c3f954a96e 886cd1fb3b217efcf51c46209fcb694022346797 Yunzhe Jia yunzhe@calculet.tech 2026-02-07T09:05:17+08:00 comment out pos buffer file
886cd1fb3b217efcf51c46209fcb694022346797 9328f21378275f2354a19c3af907332b216ab492 Yunzhe Jia yunzhe@calculet.tech 2026-02-06T17:36:54+08:00 fix compile problem
9328f21378275f2354a19c3af907332b216ab492 49fea70a20f550bfdb59d0ffe041b54919c22447 Yunzhe Jia yunzhe@calculet.tech 2026-01-28T15:32:36+08:00 add prefill-only mode
49fea70a20f550bfdb59d0ffe041b54919c22447 74a118df31b6a4acc8876b2a2db90d2395cc6ec3 Yunzhe Jia yunzhe@calculet.tech 2026-01-28T09:11:16+08:00 adapt to new calbin test_case
74a118df31b6a4acc8876b2a2db90d2395cc6ec3 98e8f9acfe87cd93646482cb2d942b8a132f0852 Yunzhe Jia yunzhe@calculet.tech 2026-01-13T14:32:47+08:00 sync with calrt update
98e8f9acfe87cd93646482cb2d942b8a132f0852 8c8152a04036bb0d4756a4e08e54f514dae4e64d Yunzhe Jia yunzhe@calculet.tech 2025-12-10T00:20:57+08:00 add timestamp
8c8152a04036bb0d4756a4e08e54f514dae4e64d 5d2387931528fbe04aa8d66de935147efb65ca4d Yunzhe Jia yunzhe@calculet.tech 2025-12-09T14:40:04+08:00 adapt to calrt csr
5d2387931528fbe04aa8d66de935147efb65ca4d e6285a748657add8d974b78ca920c5b41753ee12 Yunzhe Jia yunzhe@calculet.tech 2025-12-08T16:40:34+08:00 add timestamp for one decode process
e6285a748657add8d974b78ca920c5b41753ee12 6b1ecdbbe3cc72ed8888be38f9e934cfd79b9fbb Yunzhe Jia yunzhe@calculet.tech 2025-11-27T16:58:35+08:00 adapt to calrt
6b1ecdbbe3cc72ed8888be38f9e934cfd79b9fbb 240d9bb75241c91896afe125f2fc74698a7395f3 Yunzhe Jia yunzhe@calculet.tech 2025-11-25T17:06:14+08:00 add kv_tensor for pld test
240d9bb75241c91896afe125f2fc74698a7395f3 7eeb241aad429a68fb8cfa3ba85d000fb2348cd2 Yunzhe Jia yunzhe@calculet.tech 2025-11-24T12:03:00+08:00 adapt to calrt modification
7eeb241aad429a68fb8cfa3ba85d000fb2348cd2 dfb6250031a25058dbc3757e8a7ec75d90dcb48a Yunzhe Jia yunzhe@calculet.tech 2025-11-21T09:20:01+08:00 fix byte_size error
dfb6250031a25058dbc3757e8a7ec75d90dcb48a e31bce25e85dc7fdf0a0e69fd0e58ba4a2ffaf3e Yunzhe Jia yunzhe@calculet.tech 2025-11-18T10:28:00+08:00 add elf in CMakelist
e31bce25e85dc7fdf0a0e69fd0e58ba4a2ffaf3e 6444e227c36df16199c40d8cead2244fe014f377 Yunzhe Jia yunzhe@calculet.tech 2025-11-07T11:52:17+08:00 dump src tensor
6444e227c36df16199c40d8cead2244fe014f377 d81d7b190ff5f21325167936496dfe5ab48b922e Yunzhe Jia yunzhe@calculet.tech 2025-11-07T09:19:11+08:00 test golden case
d81d7b190ff5f21325167936496dfe5ab48b922e e492f5dc8cec17529f53ef2bbdf7b502107f8148 1f5accb8d0056e6099cd5b772b1cb787dd590a13 Yunzhe Jia yunzhe@calculet.tech 2025-11-04T14:43:32+08:00 Merge branch 'master' into dev
e492f5dc8cec17529f53ef2bbdf7b502107f8148 2e05afd22b3d77c7013b11eee88e88b17188f21a Yunzhe Jia yunzhe@calculet.tech 2025-11-04T14:09:59+08:00 redo untile logic
2e05afd22b3d77c7013b11eee88e88b17188f21a c20c0a5c0c44179f5267a262546624854b1203d1 Yunzhe Jia yunzhe@calculet.tech 2025-10-31T14:06:06+08:00 add pcie support
c20c0a5c0c44179f5267a262546624854b1203d1 62425b3a7e8b169a3bbe6ce8c7324513a7fcee8c Yunzhe Jia yunzhe@calculet.tech 2025-10-20T14:41:08+08:00 kv: turn on common-prefix mtmd: fix output size bug
62425b3a7e8b169a3bbe6ce8c7324513a7fcee8c 76a63a2998286c1649de2496bccb7d8a46549895 Yunzhe Jia yunzhe@calculet.tech 2025-10-16T17:34:39+08:00 kv: let seq_rm free whole seq since current hw-op cannot support common-prefix
76a63a2998286c1649de2496bccb7d8a46549895 b67217078aa748b06e1b2269d88dd18c0aca2c26 Yunzhe Jia yunzhe@calculet.tech 2025-10-16T16:31:15+08:00 kv: fix common-prefix bug by implementing llama_memory_seq_rm
b67217078aa748b06e1b2269d88dd18c0aca2c26 98c8269abefdfa8fde47dfb2769ceebc8b704e86 Yunzhe Jia yunzhe@calculet.tech 2025-10-13T11:48:14+08:00 add different path for unified and seperate compilation
98c8269abefdfa8fde47dfb2769ceebc8b704e86 2790ecc304e384d9075c55d0628d8bf440025dc4 Yunzhe Jia yunzhe@calculet.tech 2025-09-30T17:42:57+08:00 server: adapt to calrt
2790ecc304e384d9075c55d0628d8bf440025dc4 f528e97d894b4d93934a0711a00253eea980e799 Yunzhe Jia yunzhe@calculet.tech 2025-09-30T17:37:58+08:00 adapt to calrt
f528e97d894b4d93934a0711a00253eea980e799 dcbe998a6d8f13b6c9cb36bbe7b355ced2ac3842 Yunzhe Jia yunzhe@calculet.tech 2025-09-11T14:13:35+08:00 add calrt mtmd support
dcbe998a6d8f13b6c9cb36bbe7b355ced2ac3842 87932ec016f0ec81e98a13ce5212851f8c12458a Yunzhe Jia yunzhe@calculet.tech 2025-09-05T14:34:07+08:00 add calrt API used in server side
87932ec016f0ec81e98a13ce5212851f8c12458a 0115cfb7c1dec0753aecb34f3af4338bf9de8eeb Yunzhe Jia yunzhe@calculet.tech 2025-08-27T14:29:18+08:00 fix merge problem
0115cfb7c1dec0753aecb34f3af4338bf9de8eeb 3a617cb18121a85eed17ac5585788810c5d9c1e0 0d5a470223fc90b6b6807921d68011ff06ae7f9e Yunzhe Jia yunzhe@calculet.tech 2025-08-26T15:19:56+08:00 Merge branch 'master' into dev
3a617cb18121a85eed17ac5585788810c5d9c1e0 c42293848dd9f03eba9a6c1b85a600b398f06541 Yunzhe Jia yunzhe@calculet.tech 2025-08-13T10:58:59+08:00 add calrt_decode
c42293848dd9f03eba9a6c1b85a600b398f06541 1cbf442f50a154aac0bf35d7b8b3436a2cdfd6f5 Yunzhe Jia yunzhe@calculet.tech 2025-08-06T15:46:06+08:00 sync with calrt API
1cbf442f50a154aac0bf35d7b8b3436a2cdfd6f5 ba67d6c03fed3193987a4ef13050e6e2a4451df4 Yunzhe Jia yunzhe@calculet.tech 2025-07-24T15:50:19+08:00 1.sync with calrt prefill,decode,kv_update op 2.add hw pattern untile function
ba67d6c03fed3193987a4ef13050e6e2a4451df4 8f52c6f8abb2ed9ad967cc0bfb90acb073011193 Yunzhe Jia yunzhe@calculet.tech 2025-06-26T17:42:32+08:00 llama-calrt: infer-op: copy data from output buffer to dst-tensor.data
8f52c6f8abb2ed9ad967cc0bfb90acb073011193 d2f325130c4ed77a3dcff2c23a926587fb08e2cc Yunzhe Jia yunzhe@calculet.tech 2025-06-26T15:10:45+08:00 Squashed commit of the following:
d2f325130c4ed77a3dcff2c23a926587fb08e2cc 6391ee7ffd97e723dfbdcc32f001e1b95a63cba6 Yunzhe Jia yunzhe@calculet.tech 2025-06-17T11:53:33+08:00 calrt: add input_token in graph; input_token will be copy to calrt_in_buffer
6391ee7ffd97e723dfbdcc32f001e1b95a63cba6 b9850050a5b5147cb2e6720b98ed8c1e8e02eff9 Yunzhe Jia yunzhe@calculet.tech 2025-06-13T10:58:06+08:00 update .gitignore to update cal_test.gguf
b9850050a5b5147cb2e6720b98ed8c1e8e02eff9 933b205c32551848589b8339437d778cb4f2a46d Yunzhe Jia yunzhe@calculet.tech 2025-06-06T17:25:52+08:00 calrt: add call chain for using calrt::infer
933b205c32551848589b8339437d778cb4f2a46d 33fea9a8592fd338abe279b89350a3af2e0ff1f7 Yunzhe Jia yunzhe@calculet.tech 2025-06-12T17:47:19+08:00 gguf-py: add cal_test.py
33fea9a8592fd338abe279b89350a3af2e0ff1f7 806f05a353d322e97d97e02f910de2b408a8b4ab Yunzhe Jia yunzhe@calculet.tech 2025-06-06T17:25:52+08:00 calrt: add load calbin
806f05a353d322e97d97e02f910de2b408a8b4ab ec9e0301fef6476df83e94842c3b625501c95566 Yunzhe Jia yunzhe@calculet.tech 2025-05-30T09:45:37+08:00 add calrt demo
1 fd9bd632f346085920d523dd307a3e4c11cc0a05 e08e473cf292ba73789769b993bb35bcdfc31689 wangbomeng wangbomeng@calculet.tech 2026-06-01T14:15:35+08:00 HEAD -> dev, origin/dev llama-bench: fix device-info
2 e08e473cf292ba73789769b993bb35bcdfc31689 f86112d6758298241ab2fa84ad4f0f7b1ace35c6 wangbomeng wangbomeng@calculet.tech 2026-06-01T11:47:01+08:00 llama-bench:add device-info
3 f86112d6758298241ab2fa84ad4f0f7b1ace35c6 d1bc743c10080fed1253686ce01749b42611ded4 wangbomeng wangbomeng@calculet.tech 2026-05-29T16:40:38+08:00 add dump_pos,fix pos_tensor of pre_by_embeds
4 d1bc743c10080fed1253686ce01749b42611ded4 2f201160b1960fd7be18b70d5770599d7082dd2f wangbomeng wangbomeng@calculet.tech 2026-05-28T14:23:06+08:00 set u_batch = max_seq_len
5 2f201160b1960fd7be18b70d5770599d7082dd2f f131bf1908b8c5dd1f49d7ae7f616506fc471666 wangbomeng wangbomeng@calculet.tech 2026-05-27T09:58:31+08:00 delete useless code
6 f131bf1908b8c5dd1f49d7ae7f616506fc471666 33d96dae28e17208ef61a71dba40cda3c04f135a wangbomeng wangbomeng@calculet.tech 2026-05-27T09:38:51+08:00 fix patch of qwen2.5vl,n_patch of minicpm = 64,fix n_ctx_slot,comment out M-ROPE
7 ebce9e1a548c2329aa97f53b8b2ad50d968088dc e850ff4de25ad1221abc9bf3bb30df252ccd9c36 Yunzhe Jia yunzhe@calculet.tech 2026-05-27T09:38:00+08:00 origin/runtime_replace Refactor cal-llm integration by removing runtime capacity loading and adjusting request handling
8 e850ff4de25ad1221abc9bf3bb30df252ccd9c36 9985688f7fa96f755882f96a2cd8a18114fdc42d Yunzhe Jia yunzhe@calculet.tech 2026-05-26T10:59:45+08:00 Enhance cal-llm integration by adding runtime checks for CALRT_LIBRARY and updating link settings for Linux and Windows
9 9985688f7fa96f755882f96a2cd8a18114fdc42d 38ca6895815671a87ceec86b4aa4eb976580ce76 Yunzhe Jia yunzhe@calculet.tech 2026-05-25T09:05:49+08:00 Refactor CalrtEngineConfig initialization by removing redundant parameters
10 33d96dae28e17208ef61a71dba40cda3c04f135a 37f068d87cc2d0a0b40ce978031fc9932fc89077 wangbomeng wangbomeng@calculet.tech 2026-05-22T14:33:45+08:00 add llama-build.sh
11 1921024604db640f09ade83c8a437ebf15bde360 d028722a12c5a463cc97207787cfd03d7a2590b0 5af229fe518ee2d761ab8ae2a69f7a9aaa9057f4 Bomeng Wang wangbomeng@calculet.tech 2026-05-21T14:08:14+08:00 refs/stash WIP on dev: d028722a replace cparam.n_ubatch with n_ubatch()
12 5af229fe518ee2d761ab8ae2a69f7a9aaa9057f4 d028722a12c5a463cc97207787cfd03d7a2590b0 Bomeng Wang wangbomeng@calculet.tech 2026-05-21T14:08:14+08:00 index on dev: d028722a replace cparam.n_ubatch with n_ubatch()
13 37f068d87cc2d0a0b40ce978031fc9932fc89077 13508e5e18bbb1202ae60c2ee5ecbdda1cca817b wangbomeng wangbomeng@calculet.tech 2026-05-21T14:07:00+08:00 release
14 13508e5e18bbb1202ae60c2ee5ecbdda1cca817b b6b7919468126d5ba30a10941825154789e9082f wangbomeng wangbomeng@calculet.tech 2026-05-21T11:43:59+08:00 reduce cmake log
15 b6b7919468126d5ba30a10941825154789e9082f 46847c24fc5c52dd57bb4fb17fc4d684149bb4fa wangbomeng wangbomeng@calculet.tech 2026-05-20T16:40:33+08:00 reduce cmake log
16 38ca6895815671a87ceec86b4aa4eb976580ce76 ddd60c928224b52eb4e1e60e01e8a1ecbb80ee45 Yunzhe Jia yunzhe@calculet.tech 2026-05-20T16:37:13+08:00 Add support for cal-llm profile dumping to JSONL file
17 46847c24fc5c52dd57bb4fb17fc4d684149bb4fa d028722a12c5a463cc97207787cfd03d7a2590b0 wangbomeng wangbomeng@calculet.tech 2026-05-20T16:02:12+08:00 Simplify CMakeLists.txt
18 d028722a12c5a463cc97207787cfd03d7a2590b0 63442fde8dc285817f725bd6c5fae80f478a3813 wangbomeng wangbomeng@calculet.tech 2026-05-20T14:41:05+08:00 replace cparam.n_ubatch with n_ubatch()
19 63442fde8dc285817f725bd6c5fae80f478a3813 fc3f4a9fab88e98eff8eeca8cbc6617333edba2c wangbomeng wangbomeng@calculet.tech 2026-05-20T11:47:42+08:00 fix ubatch and cmakelist
20 ddd60c928224b52eb4e1e60e01e8a1ecbb80ee45 2716130010c58f1cdd9d94f0e2f8e047bc92dc66 Yunzhe Jia yunzhe@calculet.tech 2026-05-20T09:22:40+08:00 Add cal-llm backend profiling support with command-line option
21 fc3f4a9fab88e98eff8eeca8cbc6617333edba2c c931ef3163940227c9b6291e04216245cce21429 wangbomeng wangbomeng@calculet.tech 2026-05-19T16:54:16+08:00 add dump and rt case generation
22 c931ef3163940227c9b6291e04216245cce21429 a43741244a646d3f8fa3ff01bb9b7d059223d0a5 wangbomeng wangbomeng@calculet.tech 2026-05-18T17:34:37+08:00 calrt: fix prefill_by_ids.fix create_buf
23 2716130010c58f1cdd9d94f0e2f8e047bc92dc66 b35bda124ccd4ed581dd6088d3ffa4931c2809b6 Yunzhe Jia yunzhe@calculet.tech 2026-05-18T08:40:54+08:00 fix n_ctx_slot error by adding runtime capacity loading for cal-llm
24 a43741244a646d3f8fa3ff01bb9b7d059223d0a5 b2003d6c90ef0fa26ab9e930ba3e22b355eb3d39 wangbomeng wangbomeng@calculet.tech 2026-05-15T14:39:53+08:00 run llama-passkey successfully, fix llama-bench, copy 3 times input to infer qwen2.5vl
25 b35bda124ccd4ed581dd6088d3ffa4931c2809b6 81a2cbd4cef5d28334ff513d6b69e593d9d1cb49 Yunzhe Jia yunzhe@calculet.tech 2026-05-15T09:19:31+08:00 Implement vocab-only model initialization and enhance cal-llm backend error handling
26 81a2cbd4cef5d28334ff513d6b69e593d9d1cb49 3b14ed556c15529fe1f94b649f49db7156dfaf67 Yunzhe Jia yunzhe@calculet.tech 2026-05-14T16:06:37+08:00 Enhance CMake configuration for cal-llm integration by updating paths and adding library properties
27 3b14ed556c15529fe1f94b649f49db7156dfaf67 dde8b8228081769c8d8f1e0751d47fa7875f8423 Yunzhe Jia yunzhe@calculet.tech 2026-05-14T14:34:25+08:00 - Removed references to CALRT from clip.h, mtmd-helper.cpp, mtmd-helper.h, mtmd.cpp, and mtmd.h. - Updated server.cpp to conditionally include CAL-LLM support. - Introduced option LLAMA_SERVER_USE_CAL_LLM in CMakeLists.txt to enable CAL-LLM integration. - Refactored server context to handle CAL-LLM requests and responses. - Updated image processing logic to remove CALRT-specific implementations. - Ensured compatibility with existing llama functionality while integrating new CAL-LLM features.
28 b2003d6c90ef0fa26ab9e930ba3e22b355eb3d39 7800c772d44a7415640ec1669a691232939927cf wangbomeng wangbomeng@calculet.tech 2026-05-13T15:24:24+08:00 try passkey and embedding
29 7800c772d44a7415640ec1669a691232939927cf dde8b8228081769c8d8f1e0751d47fa7875f8423 wangbomeng wangbomeng@calculet.tech 2026-05-13T15:23:54+08:00 try passkey and embedding
30 dde8b8228081769c8d8f1e0751d47fa7875f8423 fabcc7dac4b34d83fe430980bb364b81087c7ee9 wangbomeng wangbomeng@calculet.tech 2026-05-12T10:46:08+08:00 clip:add minicpm patch;
31 fabcc7dac4b34d83fe430980bb364b81087c7ee9 1e9787962f20a7e82c71589ac1dd0585454e4bfe wangbomeng wangbomeng@calculet.tech 2026-04-30T16:17:17+08:00 calrt: fix encode dump
32 1e9787962f20a7e82c71589ac1dd0585454e4bfe f584311c716dd078c4b737eebbfda97fe12b7274 1bec0db5a675ddc60fb793be2a746e8f3c8855dc wangbomeng wangbomeng@calculet.tech 2026-04-30T16:06:23+08:00 Merge remote-tracking branch 'origin/dev-ben' into dev
33 f584311c716dd078c4b737eebbfda97fe12b7274 a339954cc2a145a80c5ea349e7896211916cbed9 wangbomeng wangbomeng@calculet.tech 2026-04-30T16:05:15+08:00 calrt: fix encode dump
34 1bec0db5a675ddc60fb793be2a746e8f3c8855dc 465df20c3e1f3f58d0f5531c796e0941a49c32b0 wangbomeng wangbomeng@calculet.tech 2026-04-30T16:02:59+08:00 origin/dev-ben bench: support 2 calbins
35 465df20c3e1f3f58d0f5531c796e0941a49c32b0 a339954cc2a145a80c5ea349e7896211916cbed9 wangbomeng wangbomeng@calculet.tech 2026-04-30T09:08:12+08:00 support one calbin
36 a339954cc2a145a80c5ea349e7896211916cbed9 8e76fc330ad624d1768b412d7894e272dbe696f4 eeeef3f6d6a5aad9296323ca15d9d929745b8932 wangbomeng wangbomeng@calculet.tech 2026-04-29T14:57:55+08:00 tag: v0.3.0 Merge branch 'dev' into dev-cli
37 8e76fc330ad624d1768b412d7894e272dbe696f4 431ad6f1c787f1b47e9e7be14b2e1a7d8565485c wangbomeng wangbomeng@calculet.tech 2026-04-29T14:56:59+08:00 finish dev of llama-cli
38 eeeef3f6d6a5aad9296323ca15d9d929745b8932 431ad6f1c787f1b47e9e7be14b2e1a7d8565485c wangbomeng wangbomeng@calculet.tech 2026-04-28T16:16:19+08:00 add unknown time info: prefill and decode
39 431ad6f1c787f1b47e9e7be14b2e1a7d8565485c efa1876bb8b2a449a55054a8c3745892f2c0f262 wangbomeng wangbomeng@calculet.tech 2026-04-27T16:52:15+08:00 update calrt_infer
40 efa1876bb8b2a449a55054a8c3745892f2c0f262 4a2a3181f1cea170105c771e6ba69d851b82b937 wangbomeng wangbomeng@calculet.tech 2026-04-27T11:35:58+08:00 tag: v0.2.2 update version print
41 4a2a3181f1cea170105c771e6ba69d851b82b937 e3ea5541259f35871c3e995331770aaca297e9ec wangbomeng wangbomeng@calculet.tech 2026-04-26T10:56:02+08:00 add calrt-version
42 e3ea5541259f35871c3e995331770aaca297e9ec 0b8e43943846a1cd05c26c9186b9ef778ebae6e2 wangbomeng wangbomeng@calculet.tech 2026-04-26T10:55:48+08:00 add calrt-version
43 0b8e43943846a1cd05c26c9186b9ef778ebae6e2 5eb46fffbd2e260c540fb112314ad67bbb8f56b6 wangbomeng wangbomeng@calculet.tech 2026-04-26T08:43:43+08:00 to debug
44 5eb46fffbd2e260c540fb112314ad67bbb8f56b6 005112c51e00d998b457337ca3dad53fc46e2d0b wangbomeng wangbomeng@calculet.tech 2026-04-24T16:24:51+08:00 clip: add image_to_patches; calrt: vision copy data from bf16 to fp32
45 005112c51e00d998b457337ca3dad53fc46e2d0b 509670642e8090a1713f5d73590b549be827aaef wangbomeng wangbomeng@calculet.tech 2026-04-24T16:24:31+08:00 clip: add image_to_patches; calrt: vision copy data from bf16 to fp32
46 509670642e8090a1713f5d73590b549be827aaef 5d219bfcef239c1e3ddd1baecc0514a9462ff6a8 wangbomeng wangbomeng@calculet.tech 2026-04-24T09:40:34+08:00 rm debug code
47 5d219bfcef239c1e3ddd1baecc0514a9462ff6a8 6787a53ab9b4897c5a7b51a4062d7b90e6697d35 wangbomeng wangbomeng@calculet.tech 2026-04-24T09:31:32+08:00 calrt: recover base = batch_index * dict_len
48 6787a53ab9b4897c5a7b51a4062d7b90e6697d35 e1a76abf66178ea85656479a5e19aea7785c09f4 wangbomeng wangbomeng@calculet.tech 2026-04-24T09:22:02+08:00 calrt:input of multimodel from fp32 to bf16
49 e1a76abf66178ea85656479a5e19aea7785c09f4 99dd308adb8488fa869bb669e3335e646a938eff wangbomeng wangbomeng@calculet.tech 2026-04-22T16:29:22+08:00 calrt:add CalcoreRT version print
50 99dd308adb8488fa869bb669e3335e646a938eff 06c7852e99e34c71e24e3ef6001cb54c72970e4d wangbomeng wangbomeng@calculet.tech 2026-04-21T15:50:01+08:00 tag: v0.2.1 server: fix max_seq_len
51 06c7852e99e34c71e24e3ef6001cb54c72970e4d 96b4e267e562f44e76ec6c965ee0fa361f0439bf ed62eb33447f993d578e156a3c7e38c91b420ece wangbomeng wangbomeng@calculet.tech 2026-04-21T15:06:01+08:00 Merge branch 'dev-ot' into dev
52 ed62eb33447f993d578e156a3c7e38c91b420ece 015e988a271573a7c11e2a4b45084e1219d69d50 wangbomeng wangbomeng@calculet.tech 2026-04-21T15:05:22+08:00 try server-test:not success
53 015e988a271573a7c11e2a4b45084e1219d69d50 99962021f2dd1994dbbf90d5712f0ca2633f20f8 wangbomeng wangbomeng@calculet.tech 2026-04-17T16:56:08+08:00 little change
54 96b4e267e562f44e76ec6c965ee0fa361f0439bf 99962021f2dd1994dbbf90d5712f0ca2633f20f8 wangbomeng wangbomeng@calculet.tech 2026-04-17T15:33:01+08:00 merge dev-ot
55 99962021f2dd1994dbbf90d5712f0ca2633f20f8 9af6682ef101c6d006c743c703cf150ac25f466f wangbomeng wangbomeng@calculet.tech 2026-04-17T14:48:33+08:00 origin/dev-ot calrt: add onetoken slice and untile_prefill
56 9af6682ef101c6d006c743c703cf150ac25f466f e24f775ee26ea5249d5ff6cd23b8a0a17fe1438d wangbomeng wangbomeng@calculet.tech 2026-04-16T10:09:44+08:00 args: add -ca
57 e24f775ee26ea5249d5ff6cd23b8a0a17fe1438d a206460e610aef995e36e50b33e8bd41fe477541 wangbomeng wangbomeng@calculet.tech 2026-04-15T10:01:09+08:00 calrt: add copy_data_to_ibuf for vision model
58 795179beb5bba728e0ccf0a7e80a5ec5ef36e92a 6d55eae7e76b768acfcec045b8e84cded8ae3b55 Yunzhe Jia yunzhe@calculet.tech 2026-04-14T16:03:22+08:00 origin/test-cicd add ci yaml
59 a206460e610aef995e36e50b33e8bd41fe477541 d8b2aaa00049978cebac15041f960d75b552f97b wangbomeng wangbomeng@calculet.tech 2026-04-14T10:23:43+08:00 calrt: support mixture of prefill_by_ids and prefill_by_embeds
60 d8b2aaa00049978cebac15041f960d75b552f97b b6f29ec8140028619efaa50aa6e73146cecf631d wangbomeng wangbomeng@calculet.tech 2026-04-13T11:23:44+08:00 server: fix context-shift
61 b6f29ec8140028619efaa50aa6e73146cecf631d 6d55eae7e76b768acfcec045b8e84cded8ae3b55 wangbomeng wangbomeng@calculet.tech 2026-04-13T11:23:31+08:00 server: fix context-shift
62 6d55eae7e76b768acfcec045b8e84cded8ae3b55 af8055f5f033a730e7e1fe80185b18b7e9473966 wangbomeng wangbomeng@calculet.tech 2026-04-10T14:58:56+08:00 tag: v0.2.0 add annotations
63 af8055f5f033a730e7e1fe80185b18b7e9473966 6f54682df62b8ec6bb4154b99c47b5becda3291f wangbomeng wangbomeng@calculet.tech 2026-04-10T14:58:19+08:00 add annotations
64 6f54682df62b8ec6bb4154b99c47b5becda3291f 42a181674565411efa5c8b318bc77d6fd084df8a a2d5bf362d6c9a546f9deadf4f8975605a915d33 Yunzhe Jia yunzhe@calculet.tech 2026-04-10T09:07:20+08:00 Merge branch 'dev' of http://192.168.10.26:1000/yunzhe/llama.cpp into dev
65 42a181674565411efa5c8b318bc77d6fd084df8a bd3a57a11aa008e0b5dc2a30f82fcd3a02587208 Yunzhe Jia yunzhe@calculet.tech 2026-04-10T09:06:55+08:00 fix prompt_cache issue
66 a2d5bf362d6c9a546f9deadf4f8975605a915d33 bd3a57a11aa008e0b5dc2a30f82fcd3a02587208 Bomeng Wang wangbomeng@calculet.tech 2026-04-09T21:01:46+08:00 server: comment fixed time
67 bd3a57a11aa008e0b5dc2a30f82fcd3a02587208 fcfcdf80b01664a08fb12df879a05df3cc0eba70 74d437ab1456831573def7ca385a74d0ca460c37 Yunzhe Jia yunzhe@calculet.tech 2026-04-09T19:42:57+08:00 Merge branch 'dev' of http://192.168.10.26:1000/yunzhe/llama.cpp into dev
68 fcfcdf80b01664a08fb12df879a05df3cc0eba70 0cd44929b442860dc0e5f88976108be82350f9dc Yunzhe Jia yunzhe@calculet.tech 2026-04-09T19:41:52+08:00 tmp fix one run >4K problem
69 74d437ab1456831573def7ca385a74d0ca460c37 5813c943005d1ede551e67ee98e35aefd210ff22 0cd44929b442860dc0e5f88976108be82350f9dc wangbomeng wangbomeng@calculet.tech 2026-04-09T17:44:26+08:00 Merge branch 'dev' of http://192.168.10.26:1000/yunzhe/llama.cpp into dev
70 5813c943005d1ede551e67ee98e35aefd210ff22 1f0d5bb0453f93ffa51faf68237c89251c2e0c40 wangbomeng wangbomeng@calculet.tech 2026-04-09T17:38:57+08:00 add --device-info
71 1f0d5bb0453f93ffa51faf68237c89251c2e0c40 b8153b6b8f244b223c9f4c2940ae1f212634519e wangbomeng wangbomeng@calculet.tech 2026-04-09T17:38:37+08:00 add --device-info
72 0cd44929b442860dc0e5f88976108be82350f9dc b8153b6b8f244b223c9f4c2940ae1f212634519e Bomeng Wang wangbomeng@calculet.tech 2026-04-09T15:08:50+08:00 rm calculet0.txt
73 b8153b6b8f244b223c9f4c2940ae1f212634519e 82842cfc3fa3d5c004c4540aeff8a81f38509bee wangbomeng wangbomeng@calculet.tech 2026-04-09T15:07:02+08:00 server: fix limit tokens to max_seq_len
74 82842cfc3fa3d5c004c4540aeff8a81f38509bee 622a22991089c6debd5f4b57738f3df3a0bda8b5 wangbomeng wangbomeng@calculet.tech 2026-04-09T15:06:26+08:00 server: fix limit tokens to max_seq_len
75 622a22991089c6debd5f4b57738f3df3a0bda8b5 5f47a738ba56a37d0ff281a16212f41979568e35 wangbomeng wangbomeng@calculet.tech 2026-04-09T10:36:31+08:00 server: comment circle print
76 5f47a738ba56a37d0ff281a16212f41979568e35 ecf01a17651cd7b1e8b85fd6075e83831463ee23 207ca38c751f7e6c251833eb11e89a2a0bb0fd07 Yunzhe Jia yunzhe@calculet.tech 2026-04-09T09:48:20+08:00 Merge branch 'dev' of http://192.168.10.26:1000/yunzhe/llama.cpp into dev
77 ecf01a17651cd7b1e8b85fd6075e83831463ee23 99d2078e89305035d87d966cee7987c7d50b3925 Yunzhe Jia yunzhe@calculet.tech 2026-04-09T09:47:55+08:00 fix n_parallel problem
78 207ca38c751f7e6c251833eb11e89a2a0bb0fd07 99d2078e89305035d87d966cee7987c7d50b3925 wangbomeng wangbomeng@calculet.tech 2026-04-08T19:14:37+08:00 delet extra printf
79 99d2078e89305035d87d966cee7987c7d50b3925 9626239f5a9e568c9975d67dd6745fef90279a87 Yunzhe Jia yunzhe@calculet.tech 2026-04-08T19:01:16+08:00 fix buffer resize problem
80 9626239f5a9e568c9975d67dd6745fef90279a87 da724f3e2a8af2c2537e3edcff41e9415ac66fef wangbomeng wangbomeng@calculet.tech 2026-04-08T17:47:04+08:00 calrt: fix MapBuf
81 da724f3e2a8af2c2537e3edcff41e9415ac66fef 18814f9bf1a423ebe8f32d6043c9cbc5b21b0218 Bomeng Wang wangbomeng@calculet.tech 2026-04-08T16:58:32+08:00 calrt: add MapBuf
82 18814f9bf1a423ebe8f32d6043c9cbc5b21b0218 bbee06d6d851e3f84f75b578047967d7e0e4a8dc wangbomeng wangbomeng@calculet.tech 2026-04-08T13:55:52+08:00 server : reset inference time
83 bbee06d6d851e3f84f75b578047967d7e0e4a8dc e126c21ed7b793b648d63533ea7ee30885f5a82a wangbomeng wangbomeng@calculet.tech 2026-04-08T11:29:36+08:00 calrt: add test time print
84 39edc6ec2e9560ccb20a2b8e547f58102bb268c1 2006831fd6ea8a8e16518b81bcee29fb674676ea Bomeng Wang wangbomeng@calculet.tech 2026-04-01T14:06:50+08:00 tag: v0.1.1 add t_incopy t_outcopy
85 2006831fd6ea8a8e16518b81bcee29fb674676ea 41e6636ea1fb3884e41fb2023f92b0e7262ef09b wangbomeng wangbomeng@calculet.tech 2026-04-01T10:42:27+08:00 tag: v0.1.0 v0.1.0
86 e126c21ed7b793b648d63533ea7ee30885f5a82a 5603e050af07173589f3b8850121263d86da01fd wangbomeng wangbomeng@calculet.tech 2026-04-01T10:07:12+08:00 sever: fix commit id
87 5603e050af07173589f3b8850121263d86da01fd 1e8a16cd0e3ad3c9a0f8746852a0a38c6e52322e wangbomeng wangbomeng@calculet.tech 2026-04-01T05:57:55+08:00 calrt: add t_incopy and t_outcopy
88 1e8a16cd0e3ad3c9a0f8746852a0a38c6e52322e 893e52bda0fee99bbda1521ea733a760bc4201f1 wangbomeng wangbomeng@calculet.tech 2026-04-01T10:14:22+08:00 calrt: fix slice and add infer/copy time
89 893e52bda0fee99bbda1521ea733a760bc4201f1 398ecf71f5f574037ce33f84dd1576fa164909ad Bomeng Wang wangbomeng@calculet.tech 2026-03-30T11:35:40+08:00 delete unnecessary commit id
90 398ecf71f5f574037ce33f84dd1576fa164909ad 6d5e83902bdd3142a8ff0d3db19f02a8619e95a0 wangbomeng wangbomeng@calculet.tech 2026-03-27T02:01:23+08:00 rm llama-server_old.cpp
91 6d5e83902bdd3142a8ff0d3db19f02a8619e95a0 e4eaab700333490e80ebefc8d023f6c1adfcc312 wangbomeng wangbomeng@calculet.tech 2026-03-27T00:57:11+08:00 server: printf calrt commit ID
92 e4eaab700333490e80ebefc8d023f6c1adfcc312 aeacc23a883400db0ebffb50e23355ada054da66 wangbomeng wangbomeng@calculet.tech 2026-03-25T09:03:55+08:00 calrt: prefil to prefill
93 aeacc23a883400db0ebffb50e23355ada054da66 cbaa7492663630132adeddccd9fec5e44ffa3336 wangbomeng wangbomeng@calculet.tech 2026-03-25T08:49:22+08:00 calrt: add slice only on decode
94 cbaa7492663630132adeddccd9fec5e44ffa3336 3c08ebf0e442cd730ddffd959ec676f9caf31c82 wangbomeng wangbomeng@calculet.tech 2026-03-25T03:21:02+08:00 reduce warning
95 3c08ebf0e442cd730ddffd959ec676f9caf31c82 613bc2b9a9d7af92efbe42d876ffcdb244f7a00e wangbomeng wangbomeng@calculet.tech 2026-03-24T02:43:03+08:00 calrt: comment LOG_ERROR in untile_decode_cpy
96 613bc2b9a9d7af92efbe42d876ffcdb244f7a00e 4e194ecc6c4b8ebe4c72d93f6055e3605dbfcefa wangbomeng wangbomeng@calculet.tech 2026-03-24T02:30:12+08:00 calrt: fix max_seq_len judgment
97 4e194ecc6c4b8ebe4c72d93f6055e3605dbfcefa 16cbf81a731f5839a2f6b0eb9d8539826353748b wangbomeng wangbomeng@calculet.tech 2026-03-24T01:59:03+08:00 calrt: fix ubatch.embd cpy
98 16cbf81a731f5839a2f6b0eb9d8539826353748b 8b4e17d990c23025148c4abadefe1010a0dd0734 wangbomeng wangbomeng@calculet.tech 2026-03-23T09:38:21+08:00 calrt: fix model_name of untile_cpy
99 8b4e17d990c23025148c4abadefe1010a0dd0734 6dacdd2cf9574214ca272a86674e7bd7ba21c4f0 41e6636ea1fb3884e41fb2023f92b0e7262ef09b wangbomeng wangbomeng@calculet.tech 2026-03-23T14:50:27+08:00 merge origin dev
100 6dacdd2cf9574214ca272a86674e7bd7ba21c4f0 3e6ad64467771224f072e5bad90e270951ba4cdf wangbomeng wangbomeng@calculet.tech 2026-03-23T14:42:28+08:00 calrt: add multimodal
101 3e6ad64467771224f072e5bad90e270951ba4cdf b37b7d9756feb3dac2db526eeab38b572a095d47 wangbomeng wangbomeng@calculet.tech 2026-03-23T14:36:41+08:00 calrt: add multimodal
102 41e6636ea1fb3884e41fb2023f92b0e7262ef09b d0a1b2c758440720d42fa108b3444f54593daa73 Bomeng Wang wangbomeng@calculet.tech 2026-03-12T16:36:07+08:00 tag: v0.0.1 server: correct the max_seq_len judgment
103 d0a1b2c758440720d42fa108b3444f54593daa73 b37b7d9756feb3dac2db526eeab38b572a095d47 Bomeng Wang wangbomeng@calculet.tech 2026-03-12T16:10:28+08:00 calrt: comment out dump
104 b37b7d9756feb3dac2db526eeab38b572a095d47 07817cefc14fa359dcecad0630defd3610f8f5c8 7ddafbdcb9426ae3af016925b8b596f11e8742d0 Yunzhe Jia yunzhe@calculet.tech 2026-03-10T16:32:31+08:00 Merge branch 'dev' of http://192.168.10.26:1000/yunzhe/llama.cpp into dev
105 07817cefc14fa359dcecad0630defd3610f8f5c8 b2c45d8ddefb7ec09435231c8ec5b736fabf9c91 Yunzhe Jia yunzhe@calculet.tech 2026-03-10T16:32:07+08:00 fix kv issue
106 7ddafbdcb9426ae3af016925b8b596f11e8742d0 059009eeaf20a569abfbac5eb37dad3bb9376428 wangbomeng wangbomeng@calculet.tech 2026-03-10T07:13:04+08:00 calrt: commented out cal_ctx->encode(batch)
107 059009eeaf20a569abfbac5eb37dad3bb9376428 1b073661d1311b5300173993b9f31ee7241d8606 wangbomeng wangbomeng@calculet.tech 2026-03-10T07:04:22+08:00 calrt: add multimodel
108 1b073661d1311b5300173993b9f31ee7241d8606 6295273c5866b9249bacdedbfc3a31877e6e6a85 b2c45d8ddefb7ec09435231c8ec5b736fabf9c91 wangbomeng wangbomeng@calculet.tech 2026-03-10T06:58:35+08:00 Merge branch 'dev' of http://192.168.20.229:1000/yunzhe/llama.cpp into dev
109 6295273c5866b9249bacdedbfc3a31877e6e6a85 c6ea3f0d2468e3b8eab5de80bacee7fe4c9dd3d7 wangbomeng wangbomeng@calculet.tech 2026-03-10T06:54:41+08:00 arg: update hf_repo url to https://download.calculet.tech:9443
110 b2c45d8ddefb7ec09435231c8ec5b736fabf9c91 c6ea3f0d2468e3b8eab5de80bacee7fe4c9dd3d7 Bomeng Wang wangbomeng@calculet.tech 2026-03-09T15:03:26+08:00 clart: past_kv_len = n_tokens
111 c6ea3f0d2468e3b8eab5de80bacee7fe4c9dd3d7 f8fba66b657c51a1df1efc7267bfea9f6140cebf wangbomeng wangbomeng@calculet.tech 2026-03-09T03:26:47+08:00 CMakeLists: STATIC to SHARED
112 f8fba66b657c51a1df1efc7267bfea9f6140cebf db4a61d2234c2f457b42ecc3f7219a1e1a35508a Yunzhe Jia yunzhe@calculet.tech 2026-03-06T15:06:36+08:00 fix calrt_install include path
113 db4a61d2234c2f457b42ecc3f7219a1e1a35508a e672e02ca1a582f9e3a9d011d9e1b4fea4942a25 Yunzhe Jia yunzhe@calculet.tech 2026-03-06T06:59:58+08:00 adapt to host-rt install structure
114 e672e02ca1a582f9e3a9d011d9e1b4fea4942a25 27b82f64252779ad160a3fa76bd378c39421de36 7a3a9a0e76bb5f530beafcfe52e87e388e93117a Yunzhe Jia yunzhe@calculet.tech 2026-03-06T11:47:09+08:00 Merge branch 'dev' of http://192.168.10.26:1000/yunzhe/llama.cpp into dev
115 27b82f64252779ad160a3fa76bd378c39421de36 0bd95719fed2f0247c8d0199dd897d24157dfae6 Yunzhe Jia yunzhe@calculet.tech 2026-03-06T11:42:45+08:00 adapt to calrt_objs target
116 7a3a9a0e76bb5f530beafcfe52e87e388e93117a 583c387efaf7bc030574e554088de79d09a27fbd wangbomeng wangbomeng@calculet.tech 2026-03-05T07:24:59+08:00 calrt_infer: fix past_kv_len
117 583c387efaf7bc030574e554088de79d09a27fbd 0edc14a60a2d5596f71d728c655e3523da924d89 wangbomeng wangbomeng@calculet.tech 2026-02-27T02:24:56+08:00 caserver: lim generated tokens to n_ctx_per_seq
118 0edc14a60a2d5596f71d728c655e3523da924d89 aa0a17d719326a63e0d6fea60aa0ced44e7abc33 wangbomeng wangbomeng@calculet.tech 2026-02-27T01:57:39+08:00 caserver: limit generated tokens to n_ctx_per_seq
119 aa0a17d719326a63e0d6fea60aa0ced44e7abc33 fa332e773da681f3e77d6ffe83a87edb557f758b wangbomeng wangbomeng@calculet.tech 2026-02-27T01:40:11+08:00 calrt: add bf16_to_fp32
120 fa332e773da681f3e77d6ffe83a87edb557f758b aa54a7c637f2c92d924a5f35386975b1c27de898 wangbomeng wangbomeng@calculet.tech 2026-02-27T01:31:42+08:00 Add bf16_to_fp32
121 aa54a7c637f2c92d924a5f35386975b1c27de898 84f2c0b5f334a7ab77347c6779b6027a951d0ff0 wangbomeng wangbomeng@calculet.tech 2026-02-27T01:30:36+08:00 Add bf16_to_fp32
122 84f2c0b5f334a7ab77347c6779b6027a951d0ff0 0bd95719fed2f0247c8d0199dd897d24157dfae6 wangbomeng wangbomeng@calculet.tech 2026-02-09T01:46:36+08:00 add bf16_to_fp32 in untile_decode/prefill_cpy
123 0bd95719fed2f0247c8d0199dd897d24157dfae6 365eb0b719e30b0f9e348d854f11c9c3f954a96e Yunzhe Jia yunzhe@calculet.tech 2026-02-07T10:25:06+08:00 fix get_model_by_name
124 365eb0b719e30b0f9e348d854f11c9c3f954a96e 886cd1fb3b217efcf51c46209fcb694022346797 Yunzhe Jia yunzhe@calculet.tech 2026-02-07T09:05:17+08:00 comment out pos buffer file
125 886cd1fb3b217efcf51c46209fcb694022346797 9328f21378275f2354a19c3af907332b216ab492 Yunzhe Jia yunzhe@calculet.tech 2026-02-06T17:36:54+08:00 fix compile problem
126 9328f21378275f2354a19c3af907332b216ab492 49fea70a20f550bfdb59d0ffe041b54919c22447 Yunzhe Jia yunzhe@calculet.tech 2026-01-28T15:32:36+08:00 add prefill-only mode
127 49fea70a20f550bfdb59d0ffe041b54919c22447 74a118df31b6a4acc8876b2a2db90d2395cc6ec3 Yunzhe Jia yunzhe@calculet.tech 2026-01-28T09:11:16+08:00 adapt to new calbin test_case
128 74a118df31b6a4acc8876b2a2db90d2395cc6ec3 98e8f9acfe87cd93646482cb2d942b8a132f0852 Yunzhe Jia yunzhe@calculet.tech 2026-01-13T14:32:47+08:00 sync with calrt update
129 98e8f9acfe87cd93646482cb2d942b8a132f0852 8c8152a04036bb0d4756a4e08e54f514dae4e64d Yunzhe Jia yunzhe@calculet.tech 2025-12-10T00:20:57+08:00 add timestamp
130 8c8152a04036bb0d4756a4e08e54f514dae4e64d 5d2387931528fbe04aa8d66de935147efb65ca4d Yunzhe Jia yunzhe@calculet.tech 2025-12-09T14:40:04+08:00 adapt to calrt csr
131 5d2387931528fbe04aa8d66de935147efb65ca4d e6285a748657add8d974b78ca920c5b41753ee12 Yunzhe Jia yunzhe@calculet.tech 2025-12-08T16:40:34+08:00 add timestamp for one decode process
132 e6285a748657add8d974b78ca920c5b41753ee12 6b1ecdbbe3cc72ed8888be38f9e934cfd79b9fbb Yunzhe Jia yunzhe@calculet.tech 2025-11-27T16:58:35+08:00 adapt to calrt
133 6b1ecdbbe3cc72ed8888be38f9e934cfd79b9fbb 240d9bb75241c91896afe125f2fc74698a7395f3 Yunzhe Jia yunzhe@calculet.tech 2025-11-25T17:06:14+08:00 add kv_tensor for pld test
134 240d9bb75241c91896afe125f2fc74698a7395f3 7eeb241aad429a68fb8cfa3ba85d000fb2348cd2 Yunzhe Jia yunzhe@calculet.tech 2025-11-24T12:03:00+08:00 adapt to calrt modification
135 7eeb241aad429a68fb8cfa3ba85d000fb2348cd2 dfb6250031a25058dbc3757e8a7ec75d90dcb48a Yunzhe Jia yunzhe@calculet.tech 2025-11-21T09:20:01+08:00 fix byte_size error
136 dfb6250031a25058dbc3757e8a7ec75d90dcb48a e31bce25e85dc7fdf0a0e69fd0e58ba4a2ffaf3e Yunzhe Jia yunzhe@calculet.tech 2025-11-18T10:28:00+08:00 add elf in CMakelist
137 e31bce25e85dc7fdf0a0e69fd0e58ba4a2ffaf3e 6444e227c36df16199c40d8cead2244fe014f377 Yunzhe Jia yunzhe@calculet.tech 2025-11-07T11:52:17+08:00 dump src tensor
138 6444e227c36df16199c40d8cead2244fe014f377 d81d7b190ff5f21325167936496dfe5ab48b922e Yunzhe Jia yunzhe@calculet.tech 2025-11-07T09:19:11+08:00 test golden case
139 d81d7b190ff5f21325167936496dfe5ab48b922e e492f5dc8cec17529f53ef2bbdf7b502107f8148 1f5accb8d0056e6099cd5b772b1cb787dd590a13 Yunzhe Jia yunzhe@calculet.tech 2025-11-04T14:43:32+08:00 Merge branch 'master' into dev
140 e492f5dc8cec17529f53ef2bbdf7b502107f8148 2e05afd22b3d77c7013b11eee88e88b17188f21a Yunzhe Jia yunzhe@calculet.tech 2025-11-04T14:09:59+08:00 redo untile logic
141 2e05afd22b3d77c7013b11eee88e88b17188f21a c20c0a5c0c44179f5267a262546624854b1203d1 Yunzhe Jia yunzhe@calculet.tech 2025-10-31T14:06:06+08:00 add pcie support
142 c20c0a5c0c44179f5267a262546624854b1203d1 62425b3a7e8b169a3bbe6ce8c7324513a7fcee8c Yunzhe Jia yunzhe@calculet.tech 2025-10-20T14:41:08+08:00 kv: turn on common-prefix mtmd: fix output size bug
143 62425b3a7e8b169a3bbe6ce8c7324513a7fcee8c 76a63a2998286c1649de2496bccb7d8a46549895 Yunzhe Jia yunzhe@calculet.tech 2025-10-16T17:34:39+08:00 kv: let seq_rm free whole seq since current hw-op cannot support common-prefix
144 76a63a2998286c1649de2496bccb7d8a46549895 b67217078aa748b06e1b2269d88dd18c0aca2c26 Yunzhe Jia yunzhe@calculet.tech 2025-10-16T16:31:15+08:00 kv: fix common-prefix bug by implementing llama_memory_seq_rm
145 b67217078aa748b06e1b2269d88dd18c0aca2c26 98c8269abefdfa8fde47dfb2769ceebc8b704e86 Yunzhe Jia yunzhe@calculet.tech 2025-10-13T11:48:14+08:00 add different path for unified and seperate compilation
146 98c8269abefdfa8fde47dfb2769ceebc8b704e86 2790ecc304e384d9075c55d0628d8bf440025dc4 Yunzhe Jia yunzhe@calculet.tech 2025-09-30T17:42:57+08:00 server: adapt to calrt
147 2790ecc304e384d9075c55d0628d8bf440025dc4 f528e97d894b4d93934a0711a00253eea980e799 Yunzhe Jia yunzhe@calculet.tech 2025-09-30T17:37:58+08:00 adapt to calrt
148 f528e97d894b4d93934a0711a00253eea980e799 dcbe998a6d8f13b6c9cb36bbe7b355ced2ac3842 Yunzhe Jia yunzhe@calculet.tech 2025-09-11T14:13:35+08:00 add calrt mtmd support
149 dcbe998a6d8f13b6c9cb36bbe7b355ced2ac3842 87932ec016f0ec81e98a13ce5212851f8c12458a Yunzhe Jia yunzhe@calculet.tech 2025-09-05T14:34:07+08:00 add calrt API used in server side
150 87932ec016f0ec81e98a13ce5212851f8c12458a 0115cfb7c1dec0753aecb34f3af4338bf9de8eeb Yunzhe Jia yunzhe@calculet.tech 2025-08-27T14:29:18+08:00 fix merge problem
151 0115cfb7c1dec0753aecb34f3af4338bf9de8eeb 3a617cb18121a85eed17ac5585788810c5d9c1e0 0d5a470223fc90b6b6807921d68011ff06ae7f9e Yunzhe Jia yunzhe@calculet.tech 2025-08-26T15:19:56+08:00 Merge branch 'master' into dev
152 3a617cb18121a85eed17ac5585788810c5d9c1e0 c42293848dd9f03eba9a6c1b85a600b398f06541 Yunzhe Jia yunzhe@calculet.tech 2025-08-13T10:58:59+08:00 add calrt_decode
153 c42293848dd9f03eba9a6c1b85a600b398f06541 1cbf442f50a154aac0bf35d7b8b3436a2cdfd6f5 Yunzhe Jia yunzhe@calculet.tech 2025-08-06T15:46:06+08:00 sync with calrt API
154 1cbf442f50a154aac0bf35d7b8b3436a2cdfd6f5 ba67d6c03fed3193987a4ef13050e6e2a4451df4 Yunzhe Jia yunzhe@calculet.tech 2025-07-24T15:50:19+08:00 1.sync with calrt prefill,decode,kv_update op 2.add hw pattern untile function
155 ba67d6c03fed3193987a4ef13050e6e2a4451df4 8f52c6f8abb2ed9ad967cc0bfb90acb073011193 Yunzhe Jia yunzhe@calculet.tech 2025-06-26T17:42:32+08:00 llama-calrt: infer-op: copy data from output buffer to dst-tensor.data
156 8f52c6f8abb2ed9ad967cc0bfb90acb073011193 d2f325130c4ed77a3dcff2c23a926587fb08e2cc Yunzhe Jia yunzhe@calculet.tech 2025-06-26T15:10:45+08:00 Squashed commit of the following:
157 d2f325130c4ed77a3dcff2c23a926587fb08e2cc 6391ee7ffd97e723dfbdcc32f001e1b95a63cba6 Yunzhe Jia yunzhe@calculet.tech 2025-06-17T11:53:33+08:00 calrt: add input_token in graph; input_token will be copy to calrt_in_buffer
158 6391ee7ffd97e723dfbdcc32f001e1b95a63cba6 b9850050a5b5147cb2e6720b98ed8c1e8e02eff9 Yunzhe Jia yunzhe@calculet.tech 2025-06-13T10:58:06+08:00 update .gitignore to update cal_test.gguf
159 b9850050a5b5147cb2e6720b98ed8c1e8e02eff9 933b205c32551848589b8339437d778cb4f2a46d Yunzhe Jia yunzhe@calculet.tech 2025-06-06T17:25:52+08:00 calrt: add call chain for using calrt::infer
160 933b205c32551848589b8339437d778cb4f2a46d 33fea9a8592fd338abe279b89350a3af2e0ff1f7 Yunzhe Jia yunzhe@calculet.tech 2025-06-12T17:47:19+08:00 gguf-py: add cal_test.py
161 33fea9a8592fd338abe279b89350a3af2e0ff1f7 806f05a353d322e97d97e02f910de2b408a8b4ab Yunzhe Jia yunzhe@calculet.tech 2025-06-06T17:25:52+08:00 calrt: add load calbin
162 806f05a353d322e97d97e02f910de2b408a8b4ab ec9e0301fef6476df83e94842c3b625501c95566 Yunzhe Jia yunzhe@calculet.tech 2025-05-30T09:45:37+08:00 add calrt demo
File diff suppressed because it is too large Load Diff
File diff suppressed because it is too large Load Diff
@@ -0,0 +1,822 @@
fd9bd632f346085920d523dd307a3e4c11cc0a05 e08e473cf292ba73789769b993bb35bcdfc31689 2026-06-01T14:15:35+08:00 wangbomeng llama-bench: fix device-info
e08e473cf292ba73789769b993bb35bcdfc31689 f86112d6758298241ab2fa84ad4f0f7b1ace35c6 2026-06-01T11:47:01+08:00 wangbomeng llama-bench:add device-info
f86112d6758298241ab2fa84ad4f0f7b1ace35c6 d1bc743c10080fed1253686ce01749b42611ded4 2026-05-29T16:40:38+08:00 wangbomeng add dump_pos,fix pos_tensor of pre_by_embeds
d1bc743c10080fed1253686ce01749b42611ded4 2f201160b1960fd7be18b70d5770599d7082dd2f 2026-05-28T14:23:06+08:00 wangbomeng set u_batch = max_seq_len
2f201160b1960fd7be18b70d5770599d7082dd2f f131bf1908b8c5dd1f49d7ae7f616506fc471666 2026-05-27T09:58:31+08:00 wangbomeng delete useless code
f131bf1908b8c5dd1f49d7ae7f616506fc471666 33d96dae28e17208ef61a71dba40cda3c04f135a 2026-05-27T09:38:51+08:00 wangbomeng fix patch of qwen2.5vl,n_patch of minicpm = 64,fix n_ctx_slot,comment out M-ROPE
33d96dae28e17208ef61a71dba40cda3c04f135a 37f068d87cc2d0a0b40ce978031fc9932fc89077 2026-05-22T14:33:45+08:00 wangbomeng add llama-build.sh
37f068d87cc2d0a0b40ce978031fc9932fc89077 13508e5e18bbb1202ae60c2ee5ecbdda1cca817b 2026-05-21T14:07:00+08:00 wangbomeng release
13508e5e18bbb1202ae60c2ee5ecbdda1cca817b b6b7919468126d5ba30a10941825154789e9082f 2026-05-21T11:43:59+08:00 wangbomeng reduce cmake log
b6b7919468126d5ba30a10941825154789e9082f 46847c24fc5c52dd57bb4fb17fc4d684149bb4fa 2026-05-20T16:40:33+08:00 wangbomeng reduce cmake log
46847c24fc5c52dd57bb4fb17fc4d684149bb4fa d028722a12c5a463cc97207787cfd03d7a2590b0 2026-05-20T16:02:12+08:00 wangbomeng Simplify CMakeLists.txt
d028722a12c5a463cc97207787cfd03d7a2590b0 63442fde8dc285817f725bd6c5fae80f478a3813 2026-05-20T14:41:05+08:00 wangbomeng replace cparam.n_ubatch with n_ubatch()
63442fde8dc285817f725bd6c5fae80f478a3813 fc3f4a9fab88e98eff8eeca8cbc6617333edba2c 2026-05-20T11:47:42+08:00 wangbomeng fix ubatch and cmakelist
fc3f4a9fab88e98eff8eeca8cbc6617333edba2c c931ef3163940227c9b6291e04216245cce21429 2026-05-19T16:54:16+08:00 wangbomeng add dump and rt case generation
c931ef3163940227c9b6291e04216245cce21429 a43741244a646d3f8fa3ff01bb9b7d059223d0a5 2026-05-18T17:34:37+08:00 wangbomeng calrt: fix prefill_by_ids.fix create_buf
a43741244a646d3f8fa3ff01bb9b7d059223d0a5 b2003d6c90ef0fa26ab9e930ba3e22b355eb3d39 2026-05-15T14:39:53+08:00 wangbomeng run llama-passkey successfully, fix llama-bench, copy 3 times input to infer qwen2.5vl
b2003d6c90ef0fa26ab9e930ba3e22b355eb3d39 7800c772d44a7415640ec1669a691232939927cf 2026-05-13T15:24:24+08:00 wangbomeng try passkey and embedding
7800c772d44a7415640ec1669a691232939927cf dde8b8228081769c8d8f1e0751d47fa7875f8423 2026-05-13T15:23:54+08:00 wangbomeng try passkey and embedding
dde8b8228081769c8d8f1e0751d47fa7875f8423 fabcc7dac4b34d83fe430980bb364b81087c7ee9 2026-05-12T10:46:08+08:00 wangbomeng clip:add minicpm patch;
fabcc7dac4b34d83fe430980bb364b81087c7ee9 1e9787962f20a7e82c71589ac1dd0585454e4bfe 2026-04-30T16:17:17+08:00 wangbomeng calrt: fix encode dump
1e9787962f20a7e82c71589ac1dd0585454e4bfe f584311c716dd078c4b737eebbfda97fe12b7274 1bec0db5a675ddc60fb793be2a746e8f3c8855dc 2026-04-30T16:06:23+08:00 wangbomeng Merge remote-tracking branch 'origin/dev-ben' into dev
f584311c716dd078c4b737eebbfda97fe12b7274 a339954cc2a145a80c5ea349e7896211916cbed9 2026-04-30T16:05:15+08:00 wangbomeng calrt: fix encode dump
1bec0db5a675ddc60fb793be2a746e8f3c8855dc 465df20c3e1f3f58d0f5531c796e0941a49c32b0 2026-04-30T16:02:59+08:00 wangbomeng bench: support 2 calbins
465df20c3e1f3f58d0f5531c796e0941a49c32b0 a339954cc2a145a80c5ea349e7896211916cbed9 2026-04-30T09:08:12+08:00 wangbomeng support one calbin
a339954cc2a145a80c5ea349e7896211916cbed9 8e76fc330ad624d1768b412d7894e272dbe696f4 eeeef3f6d6a5aad9296323ca15d9d929745b8932 2026-04-29T14:57:55+08:00 wangbomeng Merge branch 'dev' into dev-cli
8e76fc330ad624d1768b412d7894e272dbe696f4 431ad6f1c787f1b47e9e7be14b2e1a7d8565485c 2026-04-29T14:56:59+08:00 wangbomeng finish dev of llama-cli
eeeef3f6d6a5aad9296323ca15d9d929745b8932 431ad6f1c787f1b47e9e7be14b2e1a7d8565485c 2026-04-28T16:16:19+08:00 wangbomeng add unknown time info: prefill and decode
431ad6f1c787f1b47e9e7be14b2e1a7d8565485c efa1876bb8b2a449a55054a8c3745892f2c0f262 2026-04-27T16:52:15+08:00 wangbomeng update calrt_infer
efa1876bb8b2a449a55054a8c3745892f2c0f262 4a2a3181f1cea170105c771e6ba69d851b82b937 2026-04-27T11:35:58+08:00 wangbomeng update version print
4a2a3181f1cea170105c771e6ba69d851b82b937 e3ea5541259f35871c3e995331770aaca297e9ec 2026-04-26T10:56:02+08:00 wangbomeng add calrt-version
e3ea5541259f35871c3e995331770aaca297e9ec 0b8e43943846a1cd05c26c9186b9ef778ebae6e2 2026-04-26T10:55:48+08:00 wangbomeng add calrt-version
0b8e43943846a1cd05c26c9186b9ef778ebae6e2 5eb46fffbd2e260c540fb112314ad67bbb8f56b6 2026-04-26T08:43:43+08:00 wangbomeng to debug
5eb46fffbd2e260c540fb112314ad67bbb8f56b6 005112c51e00d998b457337ca3dad53fc46e2d0b 2026-04-24T16:24:51+08:00 wangbomeng clip: add image_to_patches; calrt: vision copy data from bf16 to fp32
005112c51e00d998b457337ca3dad53fc46e2d0b 509670642e8090a1713f5d73590b549be827aaef 2026-04-24T16:24:31+08:00 wangbomeng clip: add image_to_patches; calrt: vision copy data from bf16 to fp32
509670642e8090a1713f5d73590b549be827aaef 5d219bfcef239c1e3ddd1baecc0514a9462ff6a8 2026-04-24T09:40:34+08:00 wangbomeng rm debug code
5d219bfcef239c1e3ddd1baecc0514a9462ff6a8 6787a53ab9b4897c5a7b51a4062d7b90e6697d35 2026-04-24T09:31:32+08:00 wangbomeng calrt: recover base = batch_index * dict_len
6787a53ab9b4897c5a7b51a4062d7b90e6697d35 e1a76abf66178ea85656479a5e19aea7785c09f4 2026-04-24T09:22:02+08:00 wangbomeng calrt:input of multimodel from fp32 to bf16
e1a76abf66178ea85656479a5e19aea7785c09f4 99dd308adb8488fa869bb669e3335e646a938eff 2026-04-22T16:29:22+08:00 wangbomeng calrt:add CalcoreRT version print
99dd308adb8488fa869bb669e3335e646a938eff 06c7852e99e34c71e24e3ef6001cb54c72970e4d 2026-04-21T15:50:01+08:00 wangbomeng server: fix max_seq_len
06c7852e99e34c71e24e3ef6001cb54c72970e4d 96b4e267e562f44e76ec6c965ee0fa361f0439bf ed62eb33447f993d578e156a3c7e38c91b420ece 2026-04-21T15:06:01+08:00 wangbomeng Merge branch 'dev-ot' into dev
ed62eb33447f993d578e156a3c7e38c91b420ece 015e988a271573a7c11e2a4b45084e1219d69d50 2026-04-21T15:05:22+08:00 wangbomeng try server-test:not success
015e988a271573a7c11e2a4b45084e1219d69d50 99962021f2dd1994dbbf90d5712f0ca2633f20f8 2026-04-17T16:56:08+08:00 wangbomeng little change
96b4e267e562f44e76ec6c965ee0fa361f0439bf 99962021f2dd1994dbbf90d5712f0ca2633f20f8 2026-04-17T15:33:01+08:00 wangbomeng merge dev-ot
99962021f2dd1994dbbf90d5712f0ca2633f20f8 9af6682ef101c6d006c743c703cf150ac25f466f 2026-04-17T14:48:33+08:00 wangbomeng calrt: add onetoken slice and untile_prefill
9af6682ef101c6d006c743c703cf150ac25f466f e24f775ee26ea5249d5ff6cd23b8a0a17fe1438d 2026-04-16T10:09:44+08:00 wangbomeng args: add -ca
e24f775ee26ea5249d5ff6cd23b8a0a17fe1438d a206460e610aef995e36e50b33e8bd41fe477541 2026-04-15T10:01:09+08:00 wangbomeng calrt: add copy_data_to_ibuf for vision model
a206460e610aef995e36e50b33e8bd41fe477541 d8b2aaa00049978cebac15041f960d75b552f97b 2026-04-14T10:23:43+08:00 wangbomeng calrt: support mixture of prefill_by_ids and prefill_by_embeds
d8b2aaa00049978cebac15041f960d75b552f97b b6f29ec8140028619efaa50aa6e73146cecf631d 2026-04-13T11:23:44+08:00 wangbomeng server: fix context-shift
b6f29ec8140028619efaa50aa6e73146cecf631d 6d55eae7e76b768acfcec045b8e84cded8ae3b55 2026-04-13T11:23:31+08:00 wangbomeng server: fix context-shift
6d55eae7e76b768acfcec045b8e84cded8ae3b55 af8055f5f033a730e7e1fe80185b18b7e9473966 2026-04-10T14:58:56+08:00 wangbomeng add annotations
af8055f5f033a730e7e1fe80185b18b7e9473966 6f54682df62b8ec6bb4154b99c47b5becda3291f 2026-04-10T14:58:19+08:00 wangbomeng add annotations
6f54682df62b8ec6bb4154b99c47b5becda3291f 42a181674565411efa5c8b318bc77d6fd084df8a a2d5bf362d6c9a546f9deadf4f8975605a915d33 2026-04-10T09:07:20+08:00 Yunzhe Jia Merge branch 'dev' of http://192.168.10.26:1000/yunzhe/llama.cpp into dev
42a181674565411efa5c8b318bc77d6fd084df8a bd3a57a11aa008e0b5dc2a30f82fcd3a02587208 2026-04-10T09:06:55+08:00 Yunzhe Jia fix prompt_cache issue
a2d5bf362d6c9a546f9deadf4f8975605a915d33 bd3a57a11aa008e0b5dc2a30f82fcd3a02587208 2026-04-09T21:01:46+08:00 Bomeng Wang server: comment fixed time
bd3a57a11aa008e0b5dc2a30f82fcd3a02587208 fcfcdf80b01664a08fb12df879a05df3cc0eba70 74d437ab1456831573def7ca385a74d0ca460c37 2026-04-09T19:42:57+08:00 Yunzhe Jia Merge branch 'dev' of http://192.168.10.26:1000/yunzhe/llama.cpp into dev
fcfcdf80b01664a08fb12df879a05df3cc0eba70 0cd44929b442860dc0e5f88976108be82350f9dc 2026-04-09T19:41:52+08:00 Yunzhe Jia tmp fix one run >4K problem
74d437ab1456831573def7ca385a74d0ca460c37 5813c943005d1ede551e67ee98e35aefd210ff22 0cd44929b442860dc0e5f88976108be82350f9dc 2026-04-09T17:44:26+08:00 wangbomeng Merge branch 'dev' of http://192.168.10.26:1000/yunzhe/llama.cpp into dev
5813c943005d1ede551e67ee98e35aefd210ff22 1f0d5bb0453f93ffa51faf68237c89251c2e0c40 2026-04-09T17:38:57+08:00 wangbomeng add --device-info
1f0d5bb0453f93ffa51faf68237c89251c2e0c40 b8153b6b8f244b223c9f4c2940ae1f212634519e 2026-04-09T17:38:37+08:00 wangbomeng add --device-info
0cd44929b442860dc0e5f88976108be82350f9dc b8153b6b8f244b223c9f4c2940ae1f212634519e 2026-04-09T15:08:50+08:00 Bomeng Wang rm calculet0.txt
b8153b6b8f244b223c9f4c2940ae1f212634519e 82842cfc3fa3d5c004c4540aeff8a81f38509bee 2026-04-09T15:07:02+08:00 wangbomeng server: fix limit tokens to max_seq_len
82842cfc3fa3d5c004c4540aeff8a81f38509bee 622a22991089c6debd5f4b57738f3df3a0bda8b5 2026-04-09T15:06:26+08:00 wangbomeng server: fix limit tokens to max_seq_len
622a22991089c6debd5f4b57738f3df3a0bda8b5 5f47a738ba56a37d0ff281a16212f41979568e35 2026-04-09T10:36:31+08:00 wangbomeng server: comment circle print
5f47a738ba56a37d0ff281a16212f41979568e35 ecf01a17651cd7b1e8b85fd6075e83831463ee23 207ca38c751f7e6c251833eb11e89a2a0bb0fd07 2026-04-09T09:48:20+08:00 Yunzhe Jia Merge branch 'dev' of http://192.168.10.26:1000/yunzhe/llama.cpp into dev
ecf01a17651cd7b1e8b85fd6075e83831463ee23 99d2078e89305035d87d966cee7987c7d50b3925 2026-04-09T09:47:55+08:00 Yunzhe Jia fix n_parallel problem
207ca38c751f7e6c251833eb11e89a2a0bb0fd07 99d2078e89305035d87d966cee7987c7d50b3925 2026-04-08T19:14:37+08:00 wangbomeng delet extra printf
99d2078e89305035d87d966cee7987c7d50b3925 9626239f5a9e568c9975d67dd6745fef90279a87 2026-04-08T19:01:16+08:00 Yunzhe Jia fix buffer resize problem
9626239f5a9e568c9975d67dd6745fef90279a87 da724f3e2a8af2c2537e3edcff41e9415ac66fef 2026-04-08T17:47:04+08:00 wangbomeng calrt: fix MapBuf
da724f3e2a8af2c2537e3edcff41e9415ac66fef 18814f9bf1a423ebe8f32d6043c9cbc5b21b0218 2026-04-08T16:58:32+08:00 Bomeng Wang calrt: add MapBuf
18814f9bf1a423ebe8f32d6043c9cbc5b21b0218 bbee06d6d851e3f84f75b578047967d7e0e4a8dc 2026-04-08T13:55:52+08:00 wangbomeng server : reset inference time
bbee06d6d851e3f84f75b578047967d7e0e4a8dc e126c21ed7b793b648d63533ea7ee30885f5a82a 2026-04-08T11:29:36+08:00 wangbomeng calrt: add test time print
e126c21ed7b793b648d63533ea7ee30885f5a82a 5603e050af07173589f3b8850121263d86da01fd 2026-04-01T10:07:12+08:00 wangbomeng sever: fix commit id
5603e050af07173589f3b8850121263d86da01fd 1e8a16cd0e3ad3c9a0f8746852a0a38c6e52322e 2026-04-01T05:57:55+08:00 wangbomeng calrt: add t_incopy and t_outcopy
1e8a16cd0e3ad3c9a0f8746852a0a38c6e52322e 893e52bda0fee99bbda1521ea733a760bc4201f1 2026-04-01T10:14:22+08:00 wangbomeng calrt: fix slice and add infer/copy time
893e52bda0fee99bbda1521ea733a760bc4201f1 398ecf71f5f574037ce33f84dd1576fa164909ad 2026-03-30T11:35:40+08:00 Bomeng Wang delete unnecessary commit id
398ecf71f5f574037ce33f84dd1576fa164909ad 6d5e83902bdd3142a8ff0d3db19f02a8619e95a0 2026-03-27T02:01:23+08:00 wangbomeng rm llama-server_old.cpp
6d5e83902bdd3142a8ff0d3db19f02a8619e95a0 e4eaab700333490e80ebefc8d023f6c1adfcc312 2026-03-27T00:57:11+08:00 wangbomeng server: printf calrt commit ID
e4eaab700333490e80ebefc8d023f6c1adfcc312 aeacc23a883400db0ebffb50e23355ada054da66 2026-03-25T09:03:55+08:00 wangbomeng calrt: prefil to prefill
aeacc23a883400db0ebffb50e23355ada054da66 cbaa7492663630132adeddccd9fec5e44ffa3336 2026-03-25T08:49:22+08:00 wangbomeng calrt: add slice only on decode
cbaa7492663630132adeddccd9fec5e44ffa3336 3c08ebf0e442cd730ddffd959ec676f9caf31c82 2026-03-25T03:21:02+08:00 wangbomeng reduce warning
3c08ebf0e442cd730ddffd959ec676f9caf31c82 613bc2b9a9d7af92efbe42d876ffcdb244f7a00e 2026-03-24T02:43:03+08:00 wangbomeng calrt: comment LOG_ERROR in untile_decode_cpy
613bc2b9a9d7af92efbe42d876ffcdb244f7a00e 4e194ecc6c4b8ebe4c72d93f6055e3605dbfcefa 2026-03-24T02:30:12+08:00 wangbomeng calrt: fix max_seq_len judgment
4e194ecc6c4b8ebe4c72d93f6055e3605dbfcefa 16cbf81a731f5839a2f6b0eb9d8539826353748b 2026-03-24T01:59:03+08:00 wangbomeng calrt: fix ubatch.embd cpy
16cbf81a731f5839a2f6b0eb9d8539826353748b 8b4e17d990c23025148c4abadefe1010a0dd0734 2026-03-23T09:38:21+08:00 wangbomeng calrt: fix model_name of untile_cpy
8b4e17d990c23025148c4abadefe1010a0dd0734 6dacdd2cf9574214ca272a86674e7bd7ba21c4f0 41e6636ea1fb3884e41fb2023f92b0e7262ef09b 2026-03-23T14:50:27+08:00 wangbomeng merge origin dev
6dacdd2cf9574214ca272a86674e7bd7ba21c4f0 3e6ad64467771224f072e5bad90e270951ba4cdf 2026-03-23T14:42:28+08:00 wangbomeng calrt: add multimodal
3e6ad64467771224f072e5bad90e270951ba4cdf b37b7d9756feb3dac2db526eeab38b572a095d47 2026-03-23T14:36:41+08:00 wangbomeng calrt: add multimodal
41e6636ea1fb3884e41fb2023f92b0e7262ef09b d0a1b2c758440720d42fa108b3444f54593daa73 2026-03-12T16:36:07+08:00 Bomeng Wang server: correct the max_seq_len judgment
d0a1b2c758440720d42fa108b3444f54593daa73 b37b7d9756feb3dac2db526eeab38b572a095d47 2026-03-12T16:10:28+08:00 Bomeng Wang calrt: comment out dump
b37b7d9756feb3dac2db526eeab38b572a095d47 07817cefc14fa359dcecad0630defd3610f8f5c8 7ddafbdcb9426ae3af016925b8b596f11e8742d0 2026-03-10T16:32:31+08:00 Yunzhe Jia Merge branch 'dev' of http://192.168.10.26:1000/yunzhe/llama.cpp into dev
07817cefc14fa359dcecad0630defd3610f8f5c8 b2c45d8ddefb7ec09435231c8ec5b736fabf9c91 2026-03-10T16:32:07+08:00 Yunzhe Jia fix kv issue
7ddafbdcb9426ae3af016925b8b596f11e8742d0 059009eeaf20a569abfbac5eb37dad3bb9376428 2026-03-10T07:13:04+08:00 wangbomeng calrt: commented out cal_ctx->encode(batch)
059009eeaf20a569abfbac5eb37dad3bb9376428 1b073661d1311b5300173993b9f31ee7241d8606 2026-03-10T07:04:22+08:00 wangbomeng calrt: add multimodel
1b073661d1311b5300173993b9f31ee7241d8606 6295273c5866b9249bacdedbfc3a31877e6e6a85 b2c45d8ddefb7ec09435231c8ec5b736fabf9c91 2026-03-10T06:58:35+08:00 wangbomeng Merge branch 'dev' of http://192.168.20.229:1000/yunzhe/llama.cpp into dev
6295273c5866b9249bacdedbfc3a31877e6e6a85 c6ea3f0d2468e3b8eab5de80bacee7fe4c9dd3d7 2026-03-10T06:54:41+08:00 wangbomeng arg: update hf_repo url to https://download.calculet.tech:9443
b2c45d8ddefb7ec09435231c8ec5b736fabf9c91 c6ea3f0d2468e3b8eab5de80bacee7fe4c9dd3d7 2026-03-09T15:03:26+08:00 Bomeng Wang clart: past_kv_len = n_tokens
c6ea3f0d2468e3b8eab5de80bacee7fe4c9dd3d7 f8fba66b657c51a1df1efc7267bfea9f6140cebf 2026-03-09T03:26:47+08:00 wangbomeng CMakeLists: STATIC to SHARED
f8fba66b657c51a1df1efc7267bfea9f6140cebf db4a61d2234c2f457b42ecc3f7219a1e1a35508a 2026-03-06T15:06:36+08:00 Yunzhe Jia fix calrt_install include path
db4a61d2234c2f457b42ecc3f7219a1e1a35508a e672e02ca1a582f9e3a9d011d9e1b4fea4942a25 2026-03-06T06:59:58+08:00 Yunzhe Jia adapt to host-rt install structure
e672e02ca1a582f9e3a9d011d9e1b4fea4942a25 27b82f64252779ad160a3fa76bd378c39421de36 7a3a9a0e76bb5f530beafcfe52e87e388e93117a 2026-03-06T11:47:09+08:00 Yunzhe Jia Merge branch 'dev' of http://192.168.10.26:1000/yunzhe/llama.cpp into dev
27b82f64252779ad160a3fa76bd378c39421de36 0bd95719fed2f0247c8d0199dd897d24157dfae6 2026-03-06T11:42:45+08:00 Yunzhe Jia adapt to calrt_objs target
7a3a9a0e76bb5f530beafcfe52e87e388e93117a 583c387efaf7bc030574e554088de79d09a27fbd 2026-03-05T07:24:59+08:00 wangbomeng calrt_infer: fix past_kv_len
583c387efaf7bc030574e554088de79d09a27fbd 0edc14a60a2d5596f71d728c655e3523da924d89 2026-02-27T02:24:56+08:00 wangbomeng caserver: lim generated tokens to n_ctx_per_seq
0edc14a60a2d5596f71d728c655e3523da924d89 aa0a17d719326a63e0d6fea60aa0ced44e7abc33 2026-02-27T01:57:39+08:00 wangbomeng caserver: limit generated tokens to n_ctx_per_seq
aa0a17d719326a63e0d6fea60aa0ced44e7abc33 fa332e773da681f3e77d6ffe83a87edb557f758b 2026-02-27T01:40:11+08:00 wangbomeng calrt: add bf16_to_fp32
fa332e773da681f3e77d6ffe83a87edb557f758b aa54a7c637f2c92d924a5f35386975b1c27de898 2026-02-27T01:31:42+08:00 wangbomeng Add bf16_to_fp32
aa54a7c637f2c92d924a5f35386975b1c27de898 84f2c0b5f334a7ab77347c6779b6027a951d0ff0 2026-02-27T01:30:36+08:00 wangbomeng Add bf16_to_fp32
84f2c0b5f334a7ab77347c6779b6027a951d0ff0 0bd95719fed2f0247c8d0199dd897d24157dfae6 2026-02-09T01:46:36+08:00 wangbomeng add bf16_to_fp32 in untile_decode/prefill_cpy
0bd95719fed2f0247c8d0199dd897d24157dfae6 365eb0b719e30b0f9e348d854f11c9c3f954a96e 2026-02-07T10:25:06+08:00 Yunzhe Jia fix get_model_by_name
365eb0b719e30b0f9e348d854f11c9c3f954a96e 886cd1fb3b217efcf51c46209fcb694022346797 2026-02-07T09:05:17+08:00 Yunzhe Jia comment out pos buffer file
886cd1fb3b217efcf51c46209fcb694022346797 9328f21378275f2354a19c3af907332b216ab492 2026-02-06T17:36:54+08:00 Yunzhe Jia fix compile problem
9328f21378275f2354a19c3af907332b216ab492 49fea70a20f550bfdb59d0ffe041b54919c22447 2026-01-28T15:32:36+08:00 Yunzhe Jia add prefill-only mode
49fea70a20f550bfdb59d0ffe041b54919c22447 74a118df31b6a4acc8876b2a2db90d2395cc6ec3 2026-01-28T09:11:16+08:00 Yunzhe Jia adapt to new calbin test_case
74a118df31b6a4acc8876b2a2db90d2395cc6ec3 98e8f9acfe87cd93646482cb2d942b8a132f0852 2026-01-13T14:32:47+08:00 Yunzhe Jia sync with calrt update
98e8f9acfe87cd93646482cb2d942b8a132f0852 8c8152a04036bb0d4756a4e08e54f514dae4e64d 2025-12-10T00:20:57+08:00 Yunzhe Jia add timestamp
8c8152a04036bb0d4756a4e08e54f514dae4e64d 5d2387931528fbe04aa8d66de935147efb65ca4d 2025-12-09T14:40:04+08:00 Yunzhe Jia adapt to calrt csr
5d2387931528fbe04aa8d66de935147efb65ca4d e6285a748657add8d974b78ca920c5b41753ee12 2025-12-08T16:40:34+08:00 Yunzhe Jia add timestamp for one decode process
e6285a748657add8d974b78ca920c5b41753ee12 6b1ecdbbe3cc72ed8888be38f9e934cfd79b9fbb 2025-11-27T16:58:35+08:00 Yunzhe Jia adapt to calrt
6b1ecdbbe3cc72ed8888be38f9e934cfd79b9fbb 240d9bb75241c91896afe125f2fc74698a7395f3 2025-11-25T17:06:14+08:00 Yunzhe Jia add kv_tensor for pld test
240d9bb75241c91896afe125f2fc74698a7395f3 7eeb241aad429a68fb8cfa3ba85d000fb2348cd2 2025-11-24T12:03:00+08:00 Yunzhe Jia adapt to calrt modification
7eeb241aad429a68fb8cfa3ba85d000fb2348cd2 dfb6250031a25058dbc3757e8a7ec75d90dcb48a 2025-11-21T09:20:01+08:00 Yunzhe Jia fix byte_size error
dfb6250031a25058dbc3757e8a7ec75d90dcb48a e31bce25e85dc7fdf0a0e69fd0e58ba4a2ffaf3e 2025-11-18T10:28:00+08:00 Yunzhe Jia add elf in CMakelist
e31bce25e85dc7fdf0a0e69fd0e58ba4a2ffaf3e 6444e227c36df16199c40d8cead2244fe014f377 2025-11-07T11:52:17+08:00 Yunzhe Jia dump src tensor
6444e227c36df16199c40d8cead2244fe014f377 d81d7b190ff5f21325167936496dfe5ab48b922e 2025-11-07T09:19:11+08:00 Yunzhe Jia test golden case
d81d7b190ff5f21325167936496dfe5ab48b922e e492f5dc8cec17529f53ef2bbdf7b502107f8148 1f5accb8d0056e6099cd5b772b1cb787dd590a13 2025-11-04T14:43:32+08:00 Yunzhe Jia Merge branch 'master' into dev
e492f5dc8cec17529f53ef2bbdf7b502107f8148 2e05afd22b3d77c7013b11eee88e88b17188f21a 2025-11-04T14:09:59+08:00 Yunzhe Jia redo untile logic
1f5accb8d0056e6099cd5b772b1cb787dd590a13 2759ccdb4adc8568add4316780d5e675519b0775 2025-11-04T05:04:59Z Noah Fix garbled output with REPACK at high thread counts (#16956)
2759ccdb4adc8568add4316780d5e675519b0775 c5023daf607c578d6344c628eb7da18ac3d92d32 2025-11-04T10:53:48+08:00 Aman Gupta CUDA: avoid mul + bias fusion when doing fusion (#16935)
c5023daf607c578d6344c628eb7da18ac3d92d32 e7da30b584dc1f2ee0414c4a1298ce64eef97e8d 2025-11-03T11:47:57-08:00 lhez opencl: support imrope (#16914)
e7da30b584dc1f2ee0414c4a1298ce64eef97e8d ed8aa63320393512bdcfe4b05b5ae01ba91888e1 2025-11-03T18:53:26+01:00 Aleksander Grygier fix: Viewing multiple PDF attachments (#16974)
ed8aa63320393512bdcfe4b05b5ae01ba91888e1 48bd26501b08a3f0bff1249db47f313641f7bebb 2025-11-03T18:01:59+01:00 Daniel Bevenius model-conversion : pass config to from_pretrained (#16963)
48bd26501b08a3f0bff1249db47f313641f7bebb 622cd010ff4a65bef67edbf2f9bf4707c01f98f7 2025-11-03T15:38:23+02:00 Georgi Gerganov server : add props.model_alias (#16943)
622cd010ff4a65bef67edbf2f9bf4707c01f98f7 070ff4d5356083d60b807bb34d36b31c3653a29e 2025-11-03T14:29:11+01:00 theo77186 ggml: CUDA: add head size 72 for flash-attn (#16962)
070ff4d5356083d60b807bb34d36b31c3653a29e bf7b0c9725ed0c406c5debaea022ec7258430634 2025-11-03T11:11:18+01:00 Xuan-Son Nguyen mtmd: add --image-min/max-tokens (#16921)
bf7b0c9725ed0c406c5debaea022ec7258430634 fcfce040e816c542f374ad51461b3561d73c4bc9 2025-11-03T10:25:55+01:00 Xuan-Son Nguyen mtmd: pad mask for qwen2.5vl (#16954)
fcfce040e816c542f374ad51461b3561d73c4bc9 ee3a5a10adf9e83722d1914dddc56a0623ececaf 2025-11-03T14:40:02+08:00 Jinyang He ggml : LoongArch fixes (#16958)
ee3a5a10adf9e83722d1914dddc56a0623ececaf 7e994168b1ccc12337ba8de939c4fd466107c1fb 2025-11-03T05:33:56Z Olivier Chafik sync: minja (glm 4.6 & minmax m2 templates) (#16949)
7e994168b1ccc12337ba8de939c4fd466107c1fb bcfa87622ae46be6345a8e3dfdbdc5ba5414042b 2025-11-03T03:35:33+02:00 shani-f SYCL: optimized repeat_back kernel (3× fewer asm instructions, 2× faster)Feature/sycl repeat back opt (#16869)
bcfa87622ae46be6345a8e3dfdbdc5ba5414042b a2054e3a8ff0da3978a4acc18c349ff58554d336 2025-11-03T00:41:08+01:00 Sascha Rogmann feat(webui): improve LaTeX rendering with currency detection (#16508)
a2054e3a8ff0da3978a4acc18c349ff58554d336 dd5286805004db1f9ac3176a1cbbfe373bdda0f8 2025-11-03T04:40:30+05:30 Shagun Bera test-backend-ops : fix segfault in moe-expert-reduce test in support mode and coverage (#16936)
dd5286805004db1f9ac3176a1cbbfe373bdda0f8 6b9a52422bac0f50dd8f1f8386744fa3ce9783bf 2025-11-02T23:11:21+01:00 Sigbjørn Skjæret ci : disable failing riscv cross build (#16952)
6b9a52422bac0f50dd8f1f8386744fa3ce9783bf 2f966b8ed87514e74bb96592217226cb6a6974dd 2025-11-02T13:08:04-08:00 Zhiyong Wang model: add Janus Pro for image understanding (#16906)
2f966b8ed87514e74bb96592217226cb6a6974dd cd5e3b57541ecc52421130742f4d89acbcf77cd4 2025-11-02T22:21:48+02:00 Georgi Gerganov clip : use FA (#16837)
cd5e3b57541ecc52421130742f4d89acbcf77cd4 87c9efc3b297b8a498716b1db3d061842e6fc85b 2025-11-02T18:14:04+02:00 Georgi Gerganov server : support unified cache across slots (#16736)
87c9efc3b297b8a498716b1db3d061842e6fc85b 76af40aaaad78c42faecd8016a88362c788b84b0 2025-11-02T08:56:28-06:00 Aldehir Rojas common : move gpt-oss reasoning processing to init params (#16937)
76af40aaaad78c42faecd8016a88362c788b84b0 7db35a7958a943be1693879f42d166f152613979 2025-11-02T10:28:37+01:00 Adrian Lundberg docs: remove llama_sampler_accept reference in sampling sample usage (#16920)
7db35a7958a943be1693879f42d166f152613979 a864132ba546b6385922226480ee4e392aaa065c 2025-11-02T08:42:57+05:30 mnehete32 CUDA: add FLOOR, CEIL, ROUND, TRUNC unary ops (#16917)
a864132ba546b6385922226480ee4e392aaa065c d38d9f0877a5872daa3c5f06fb9a86376bf15d50 2025-11-02T08:48:46+08:00 Aaron Teo devops: fix failing s390x docker build (#16918)
d38d9f0877a5872daa3c5f06fb9a86376bf15d50 7fd205a8e8832ead273f62c5fd81d2b8aa910535 2025-11-02T08:48:23+08:00 Aaron Teo ggml: add s390x cpu-feats (#16774)
7fd205a8e8832ead273f62c5fd81d2b8aa910535 2f68ce7cfd20e9e7098514bf730e5389b7bba908 2025-11-02T00:15:31+02:00 Georgi Gerganov scripts : add script to bench models (#16894)
2f68ce7cfd20e9e7098514bf730e5389b7bba908 e4a71599e5846110159955dec0008eb4aa24222b 2025-11-01T19:49:51+01:00 Pascal webui: auto-refresh /props on inference start to resync model metadata (#16784)
e4a71599e5846110159955dec0008eb4aa24222b dd5e8cab512c7752392b6e51a6f118f348fb3f16 2025-11-01T17:14:54+01:00 Pascal webui: add HTML/JS preview support to MarkdownContent with sandboxed iframe (#16757)
dd5e8cab512c7752392b6e51a6f118f348fb3f16 cf659bbb8ef9eb048e5153a27cf787fd83c05560 2025-11-01T16:52:17+01:00 Adrien Gallouët vendor : update cpp-httplib to 0.27.0 (#16846)
cf659bbb8ef9eb048e5153a27cf787fd83c05560 d8b860a219c2415faac8cc0e50b48b4aa11e3b64 2025-11-01T15:51:36+01:00 Xuan-Son Nguyen mtmd: refactor preprocessing + support max/min pixels (#16878)
d8b860a219c2415faac8cc0e50b48b4aa11e3b64 1ae74882f8f6755e44dff8f23f3abdc5b53ab7c1 2025-11-01T15:35:57+01:00 Aleksander Grygier Add a setting to display message generation statistics (#16901)
1ae74882f8f6755e44dff8f23f3abdc5b53ab7c1 961660b8c395afb8903f61ace69396a158ea0cb4 2025-11-01T15:02:57+01:00 Jaromír Hradílek webui: recognize AsciiDoc files as valid text files (#16850)
961660b8c395afb8903f61ace69396a158ea0cb4 74fef4129fa58f6277c243777a4894371479dbad 2025-11-01T11:01:42+01:00 Sigbjørn Skjæret common : allow --system-prompt-file for diffusion-cli (#16903)
74fef4129fa58f6277c243777a4894371479dbad 5d8bb900bc7daa84bfa7bb1d25ab7e32394919f3 2025-11-01T08:55:25+01:00 Sigbjørn Skjæret codeowners : update after refactor (#16905)
5d8bb900bc7daa84bfa7bb1d25ab7e32394919f3 2e76e013600cb0d51ccf158571ca1d0502952a07 2025-11-01T00:52:14-05:00 Jeff Bolz vulkan: Fix multi_add invalid descriptor usage (#16899)
2e76e013600cb0d51ccf158571ca1d0502952a07 d3dc9dd898be805c23a408cc36daed5b3bf29221 2025-11-01T00:45:28-05:00 Jeff Bolz vulkan: fuse mul_mat+add and mul_mat_id+add_id (#16868)
d3dc9dd898be805c23a408cc36daed5b3bf29221 bea04522ff1a0d8559ccfd353aa018dcfbb608cc 2025-11-01T06:13:26+01:00 Oliver Simons CUDA: Remove unneded bias/gate dims in fused mmvq (#16858)
bea04522ff1a0d8559ccfd353aa018dcfbb608cc 0de0a01576772032008a689afc4d7c80685074c4 2025-10-31T23:40:23+01:00 Piotr Wilkin (ilintar) refactor : llama-model.cpp (#16252)
0de0a01576772032008a689afc4d7c80685074c4 e58d585604bbbbbc24f8149effe444621b5191c6 2025-10-31T21:20:47+01:00 Piotr Wilkin (ilintar) model : Minimax M2 (#16831)
e58d585604bbbbbc24f8149effe444621b5191c6 31c511a968348281e11d590446bb815048a1e912 2025-10-31T21:20:07+01:00 Giuseppe Scrivano model : add Granite Hybrid nano types (#16896)
31c511a968348281e11d590446bb815048a1e912 6d39015a744b47bb7643ea73f412e6d64677f305 2025-10-31T15:57:19+01:00 Johannes Gäßler CUDA: Volta tensor core support for MMF (#16843)
6d39015a744b47bb7643ea73f412e6d64677f305 4146d6a1a6228711a487a1e3e9ddd120f8d027d7 2025-10-31T16:25:50+02:00 Georgi Gerganov sync : ggml
4146d6a1a6228711a487a1e3e9ddd120f8d027d7 8da3c0e200a586f768ada6f38745acb01380174c 2025-10-31T20:05:07+08:00 Aman Gupta CUDA: add expert reduce kernel (#16857)
8da3c0e200a586f768ada6f38745acb01380174c c22473b580807929fd9e3a3344a48e8cfbe6c88f 2025-10-31T13:50:33+02:00 Georgi Gerganov batch : fix consistency checks for the input positions (#16890)
c22473b580807929fd9e3a3344a48e8cfbe6c88f 0f715b4e759acceccb9f437cfd2a988fff85514a 2025-10-31T10:54:19+02:00 Georgi Gerganov server : don't print user inputs to console (#16871)
0f715b4e759acceccb9f437cfd2a988fff85514a d2d931f173b8a736b08999436e9259aafddec718 2025-10-31T09:51:26+01:00 Daniel Bevenius server : fix typos in server.cpp comments [no ci] (#16883)
d2d931f173b8a736b08999436e9259aafddec718 2976b0374d36609b0429dd6ce48807e2ad39a7c2 2025-10-31T02:34:47-05:00 Jeff Bolz vulkan: disable spirv-opt for rope shaders (#16872)
2976b0374d36609b0429dd6ce48807e2ad39a7c2 d2a2673dd1c86a01ab010e18b13b8bb959968c48 2025-10-31T16:18:59+09:00 Masato Nakasaka vulkan: Fix crash when FP16 mul_mat accumulation is not supported (#16796)
d2a2673dd1c86a01ab010e18b13b8bb959968c48 13002a08960e51a76c4d696165b5d7638d2f2b99 2025-10-31T08:14:49+01:00 Ruben Ortlam vulkan: fix shmem overrun in mmq id shader (#16873)
2e05afd22b3d77c7013b11eee88e88b17188f21a c20c0a5c0c44179f5267a262546624854b1203d1 2025-10-31T14:06:06+08:00 Yunzhe Jia add pcie support
13002a08960e51a76c4d696165b5d7638d2f2b99 6eb208d17ea29bb60295d9a2b5e7122dfb8f4b55 2025-10-31T12:46:31+08:00 l3utterfly ggml-hexagon: respect input size when getting/setting tensor data (#16836)
6eb208d17ea29bb60295d9a2b5e7122dfb8f4b55 9984cbb61d12491d604484fb38b678fa15064061 2025-10-31T00:34:27+01:00 Sigbjørn Skjæret ci : enable free-disk-space on cuda docker build (#16877)
9984cbb61d12491d604484fb38b678fa15064061 ce18efeaf1234bd08f25bc08f88ef95cf5d9e51f 2025-10-30T16:00:20-07:00 lhez opencl: fix boundary handling for mul_mm (#16875)
ce18efeaf1234bd08f25bc08f88ef95cf5d9e51f 16724b5b6836a2d4b8936a5824d2ff27c52b4517 2025-10-30T23:15:03+01:00 RodriMora convert : update transformers requirements (#16866)
16724b5b6836a2d4b8936a5824d2ff27c52b4517 b52edd25586fabb70f0c21b274473b307cf14499 2025-10-30T14:22:23-04:00 chansikpark server : bump request URI max length to 32768 (#16862)
b52edd25586fabb70f0c21b274473b307cf14499 517b7170e1a4d733583c4b07c5b7a49acc05911c 2025-10-30T18:42:57+02:00 Georgi Gerganov server : remove n_past (#16818)
517b7170e1a4d733583c4b07c5b7a49acc05911c 835e918d8428f5119927d7150bf5a26176dedda0 2025-10-30T09:06:13-07:00 Max Krasnyansky cpu: introduce chunking for repack matmuls and enable matmul-id chunking on ARM64 (#16833)
835e918d8428f5119927d7150bf5a26176dedda0 d261223d24e97f2df50220e4a5b7f0adb69bba81 2025-10-30T21:17:31+05:30 Shagun Bera common: fix typo in cli help text (#16864)
d261223d24e97f2df50220e4a5b7f0adb69bba81 dcca0d3ab840ebe9b2ccd4719033d408eeb758d7 2025-10-30T23:19:14+08:00 JJJYmmm model: add support for qwen3vl series (#16780)
dcca0d3ab840ebe9b2ccd4719033d408eeb758d7 bacddc049a00786df44e682262f6e298742bfbc3 2025-10-30T05:26:05-07:00 Max Krasnyansky cpu: introduce chunking for flash attention (#16829)
bacddc049a00786df44e682262f6e298742bfbc3 229bf686287d18f82c44e89888cc662145ecfdb4 2025-10-30T07:18:50-04:00 Tianyue-Zhao model: Add support for CogVLM model (#15002)
229bf686287d18f82c44e89888cc662145ecfdb4 d7395115baf395b75a73a17b0b796e746e468da9 2025-10-30T08:56:28+01:00 Sigbjørn Skjæret cuda : fix argsort with 64k+ rows (#16849)
d7395115baf395b75a73a17b0b796e746e468da9 052df28b0e3ca0398e5928c61c7de40254317894 2025-10-30T14:30:58+08:00 Jan Boon llama : use std::abs instead of abs (#16853)
052df28b0e3ca0398e5928c61c7de40254317894 8b11deea4663f29d3e042ce1056ba643264cd5f1 2025-10-30T01:27:41-05:00 Jeff Bolz vulkan: Handle argsort with a large number of rows (#16851)
8b11deea4663f29d3e042ce1056ba643264cd5f1 b9ce94017729465895402cbcfffb51fa926c15e3 2025-10-30T04:34:15+01:00 Oliver Simons Hide latency of bias and gate-loading (#16847)
b9ce94017729465895402cbcfffb51fa926c15e3 3464bdac37027c5e9661621fc75ffcef3c19c6ef 2025-10-29T15:13:10-05:00 Jeff Bolz vulkan: Fuse rope+set_rows (#16769)
3464bdac37027c5e9661621fc75ffcef3c19c6ef e3af5563bd049141e036b50f843196db33d23e97 2025-10-29T20:11:39+01:00 Xuan-Son Nguyen llama: fix ASAN error with M-RoPE (#16848)
e3af5563bd049141e036b50f843196db33d23e97 10fcc41290e233788f5a4215314156e8e023eb92 2025-10-29T18:09:18+01:00 Xuan-Son Nguyen llama: store mrope data in KV cell (#16825)
10fcc41290e233788f5a4215314156e8e023eb92 bcf5bda6f5df559565d11d7c8e8295c1159a85ec 2025-10-29T08:44:29-05:00 Jeff Bolz vulkan: Update topk_moe fusion to handle gpt's late softmax (#16656)
bcf5bda6f5df559565d11d7c8e8295c1159a85ec 3eb2be1ca5f37480aeb16102970d9e65f43347fe 2025-10-29T14:39:03+01:00 Ruben Ortlam Vulkan MMQ Integer Dot Refactor and K-Quant support (#16536)
3eb2be1ca5f37480aeb16102970d9e65f43347fe e41bcce8f0b53032a1fed275cd253e931c041cf6 2025-10-29T06:29:12-07:00 Max Krasnyansky Hexagon Op queue & dispatch optimizations (#16820)
e41bcce8f0b53032a1fed275cd253e931c041cf6 144a4ce824b6bd0e48d62009d10cae1daf5308db 2025-10-29T21:11:53+08:00 Aman Gupta CUDA: use fastdiv in set-rows (#16834)
144a4ce824b6bd0e48d62009d10cae1daf5308db f549b0007dbdd683215820f7229ce180a12b191d 2025-10-29T14:09:50+01:00 Sigbjørn Skjæret vendor : sync minja (#16500)
f549b0007dbdd683215820f7229ce180a12b191d 9a3ea685b937c0f0cbfda2e50004ea54bf187512 2025-10-29T03:53:04-05:00 Jeff Bolz vulkan: Call ggml_vk_buffer_write_2d from ggml_vk_buffer_copy (#16793)
9a3ea685b937c0f0cbfda2e50004ea54bf187512 338074c383c81366320d176d83b94b0a567ee0c2 2025-10-29T15:55:06+08:00 Aman Gupta CUDA: Fix bug in topk-moe for gpt-oss (#16821)
338074c383c81366320d176d83b94b0a567ee0c2 851553ea6b24cb39fd5fd188b437d777cb411de8 2025-10-29T08:14:39+02:00 YaelLogic sycl: add RMS_NORM_BACK operation support (#16808)
851553ea6b24cb39fd5fd188b437d777cb411de8 85a7d8677bf2200981e52f744a21d5267964ffcf 2025-10-28T21:10:28+02:00 YaelGitAccount cuda: add SET operation support (#16804)
85a7d8677bf2200981e52f744a21d5267964ffcf a8ca18b4b815a2abdbecb958ee5f4c542d69aac7 2025-10-28T20:19:44+02:00 Georgi Gerganov memory : remove KV cache size padding (#16812)
a8ca18b4b815a2abdbecb958ee5f4c542d69aac7 8284efc35c909217ee1b9a06903245d808ac2283 2025-10-28T19:41:43+02:00 Georgi Gerganov llama-bench : clarify benchmarked parts of the computation (#16823)
8284efc35c909217ee1b9a06903245d808ac2283 1c1409e13169d0ced4b1b4d39fb5b268b7525091 2025-10-28T23:16:20+08:00 l3utterfly initialise buffer.device in ggml_hexagon_session (#16816)
1c1409e13169d0ced4b1b4d39fb5b268b7525091 7a0e900e3615fa46c074a7fdf900b47d3c0a1c7e 2025-10-28T03:51:41-07:00 Sam Malayek embedding: add raw option for --embd-output-format (#16541)
7a0e900e3615fa46c074a7fdf900b47d3c0a1c7e 280d97be9660e7a5feaa28a6e7a299bc73dd83fc 2025-10-28T11:23:54+01:00 Johannes Gäßler llama: consistent ctx <-> buf order for KV cache (#16746)
280d97be9660e7a5feaa28a6e7a299bc73dd83fc 3479efd112b3910d2d008ad08fe4cb4895605903 2025-10-28T03:37:52-05:00 Aldehir Rojas grammar : support array references in json schema (#16792)
3479efd112b3910d2d008ad08fe4cb4895605903 463bbf20bfbe0da10ac58984d4d62bed5a49362a 2025-10-28T10:54:53+08:00 Chenguang Li CANN: Improve device ID handling and aclnnArange checks (#16752)
463bbf20bfbe0da10ac58984d4d62bed5a49362a ad8d36beffd791db10c94eb9e964afb891e3ca55 2025-10-28T10:31:21+08:00 Aman Gupta CUDA: add unused vars to mmvf and mmvq (#16807)
ad8d36beffd791db10c94eb9e964afb891e3ca55 c053e18a66dd95dc340aa61317877c2a41d4e3cf 2025-10-28T03:50:33+02:00 tamarPal sycl: add SSM_CONV operation support (#16800)
c053e18a66dd95dc340aa61317877c2a41d4e3cf e1ab0848037c9f9bfe68b3e1cee9ee375e1018a3 2025-10-27T18:54:01-04:00 Yuri Khrustalev chat: Add LFM2 tool handling (#16763)
e1ab0848037c9f9bfe68b3e1cee9ee375e1018a3 5a4ff43e7dd049e35942bc3d12361dab2f155544 2025-10-27T23:12:16+01:00 Xuan-Son Nguyen mtmd : fix idefics3 preprocessing (#16806)
5a4ff43e7dd049e35942bc3d12361dab2f155544 10640e31aab0819f31c1e1f2d008b019ee737232 2025-10-27T13:51:28-07:00 Diego Devesa llama : disable pipeline parallelism if compute buffer allocation fails (#16748)
10640e31aab0819f31c1e1f2d008b019ee737232 80d28f104c0c3e61c11d6af073642b246a9fc19c 2025-10-27T21:50:22+01:00 Acly ggml : fix interpolate with align-corners and ne=1 (#16700)
80d28f104c0c3e61c11d6af073642b246a9fc19c c55d53acec864f64afa1ba92972203dce1bf88f5 2025-10-27T21:39:49+01:00 Johannes Gäßler HIP: fix AMDGPU_TARGETS, update documentation (#16803)
c55d53acec864f64afa1ba92972203dce1bf88f5 945501f5ea4b8ca56b181ecb035e9ee3fb31f432 2025-10-27T16:02:58+01:00 Xuan-Son Nguyen model : add LightOnOCR-1B model (#16764)
945501f5ea4b8ca56b181ecb035e9ee3fb31f432 75cbdd3fce38ea12d50cd19e73a069aa5dbbd5fa 2025-10-27T09:17:31+01:00 Johannes Gäßler llama: fix leaked buffers for mmap + split files (#16765)
75cbdd3fce38ea12d50cd19e73a069aa5dbbd5fa 2b9bd9bf4e759c05db629ec1c391dc8aeaa71887 2025-10-27T09:25:10+08:00 Aman Gupta test-backend-ops: print failed tests at the end (#16785)
2b9bd9bf4e759c05db629ec1c391dc8aeaa71887 59fc1ec8e83b14354c1a3a8acf8c5c2cbf9af42f 2025-10-27T03:20:24+02:00 tamarPal sycl: add ROLL operation support (#16665)
59fc1ec8e83b14354c1a3a8acf8c5c2cbf9af42f 75d33b9302f84a5b89f82205d2bcd8def5a64e0a 2025-10-27T03:19:50+02:00 shani-f sycl: add REPEAT_BACK operation support (#16734)
75d33b9302f84a5b89f82205d2bcd8def5a64e0a 3470a5c891dcc94363e492a3760af92b6b07241c 2025-10-27T09:06:16+08:00 Aman Gupta CUDA: support for weight clamp in top-k norm (#16702)
3470a5c891dcc94363e492a3760af92b6b07241c bd562fe4f7bd55625511d5f9d639c4fb1db1d440 2025-10-26T23:19:03+01:00 Acly ggml-alloc : make gallocr prefer chunks that allow memory reuse (#16788)
bd562fe4f7bd55625511d5f9d639c4fb1db1d440 bbac6a26b2bd7f7c1f0831cb1e7b52734c66673b 2025-10-26T21:31:41+01:00 Sigbjørn Skjæret cuda : use fast copy when src and dst are of different type and contiguous (#16789)
bbac6a26b2bd7f7c1f0831cb1e7b52734c66673b 73a48c9790d320476b3e5ef75bda09f2f8269e6e 2025-10-27T02:13:31+08:00 leejet ggml: fix cuda kernel launch configuration for k_compute_batched_ptrs to support large batch (#16744)
73a48c9790d320476b3e5ef75bda09f2f8269e6e f696428ce8e4d16c17acbffeaa7feac3b0fb9061 2025-10-26T17:21:23+01:00 Sigbjørn Skjæret convert : enable expert group selection for all models with it (#16691)
f696428ce8e4d16c17acbffeaa7feac3b0fb9061 7cce4f8158f0c4c88d8dadd4c23d33938127b897 2025-10-26T17:20:32+01:00 Sigbjørn Skjæret graph : add clamping to ffn_moe_weights_sum to avoid div-by-zero (#16655)
7cce4f8158f0c4c88d8dadd4c23d33938127b897 8d8862829cd770fc9c0c7a726ed162de824ff5ea 2025-10-26T16:08:52+01:00 Sigbjørn Skjæret model : set res->t_embd in SmallThinker models (#16782)
8d8862829cd770fc9c0c7a726ed162de824ff5ea f77c13b91f4d25754b6a0b857f98a6bc922a0aa7 2025-10-26T14:01:20+02:00 amirai21 docs : add Jamba to Text-only models list (#16778)
f77c13b91f4d25754b6a0b857f98a6bc922a0aa7 3cfa9c3f125763305b4226bc032f1954f08990dc 2025-10-26T19:28:04+08:00 Aman Gupta CUDA: General GEMV fusion (#16715)
3cfa9c3f125763305b4226bc032f1954f08990dc 5d195f17bc60eacc15cfb929f9403cf29ccdf419 2025-10-26T06:37:38+02:00 Gilad S. vulkan: deduplicate Microsoft Direct3D12 devices (#16689)
5d195f17bc60eacc15cfb929f9403cf29ccdf419 226f295f4dd92ad714533adc5497afed5fa88bb8 2025-10-25T20:41:36+02:00 Galunid convert : handle mmproj filename/path properly (#16760)
226f295f4dd92ad714533adc5497afed5fa88bb8 f90b4a8efe4466215c51155a5c22c1ae6207da23 2025-10-25T19:26:27+09:00 Shunta Saito model : set res->t_embd in PLaMo2 models (#16766)
f90b4a8efe4466215c51155a5c22c1ae6207da23 8423d019318b446640bb620e4ce80066d8530f05 2025-10-25T10:59:54+02:00 Giuseppe Scrivano vulkan: delete dead code (#16732)
8423d019318b446640bb620e4ce80066d8530f05 5cca2542ac3f3f86831d32bce744d08fc2b353b0 2025-10-25T00:04:12-05:00 Jeff Bolz vulkan: Optimize SSM_SCAN (#16645)
5cca2542ac3f3f86831d32bce744d08fc2b353b0 55945d2ef51b93821d4b6f4a9b994393344a90db 2025-10-24T20:52:00-04:00 compilade convert : avoid dequantizing mxfp4 for GPT-OSS (#16756)
55945d2ef51b93821d4b6f4a9b994393344a90db 0bcb40b48c6fc6f17ba9672625e526ab2574344b 2025-10-25T03:39:37+08:00 leejet ggml: fix CUDA grid launch condition for large block_nums.y in binbcast (#16742)
0bcb40b48c6fc6f17ba9672625e526ab2574344b 69e9ff010309a1155d704cf9320bdb3aaf4160ca 2025-10-24T20:46:19+08:00 Aman Gupta CUDA: use CUB for arbitary size argsort (#16754)
69e9ff010309a1155d704cf9320bdb3aaf4160ca 5a91109a5d7dab5d7adc40bedb397ede99a705b1 2025-10-24T14:10:29+02:00 Florian Badie webui: support q URL parameter (#16728)
5a91109a5d7dab5d7adc40bedb397ede99a705b1 f8f071faddf32ea09f4234edb6e809b380a9ee26 2025-10-24T12:02:02+02:00 Daniel Bevenius model-conversion : add trust_remote_code for orig model run [no ci] (#16751)
f8f071faddf32ea09f4234edb6e809b380a9ee26 0bf47a1dbba4d36f2aff4e8c34b06210ba34e688 2025-10-23T16:31:41-04:00 compilade convert : handle pre-quantized models (#14810)
0bf47a1dbba4d36f2aff4e8c34b06210ba34e688 dd62dcfab97e420949519fd0eac9fca7bf97e635 2025-10-23T21:30:17+02:00 Johannes Gäßler server: add memory breakdown print (#16740)
dd62dcfab97e420949519fd0eac9fca7bf97e635 d0660f237a5c31771a3d6d1030ebe3e0c409ba92 2025-10-23T15:54:46+02:00 Julien Denize convert : Make mistral-common dependency optional (#16738)
d0660f237a5c31771a3d6d1030ebe3e0c409ba92 fe6a9882acf5c02f96624ed8f80144100d7006cb 2025-10-23T15:00:49+02:00 Xuan-Son Nguyen mtmd-cli : allow using --jinja (#16718)
fe6a9882acf5c02f96624ed8f80144100d7006cb 061f0eff02dc9a82f7bd850db3bd70b8a0b5e87a 2025-10-23T17:07:31+05:30 Prajwal B Mehendarkar Manually link -lbsd to resolve flock symbol on AIX (#16610)
061f0eff02dc9a82f7bd850db3bd70b8a0b5e87a 8cf6b42d467d05fa7d9776d2bcc69974ecce6900 2025-10-23T19:14:06+08:00 Aman Gupta ggml-cuda: use passed ops instead of hardcoded ops (#16712)
8cf6b42d467d05fa7d9776d2bcc69974ecce6900 9de9672adb0f4ca4e39483ac3ffed52b3f70a55d 2025-10-23T11:32:24+02:00 matteo server : send partial stop string when <EOG> is reached (#15007)
9de9672adb0f4ca4e39483ac3ffed52b3f70a55d 63d2fc46e17a06be5b4b5823a5ada088317f1f0a 2025-10-22T20:05:15-05:00 Matthew Michel sycl: use async memory allocation to fix crashes during graph recording (#16644)
63d2fc46e17a06be5b4b5823a5ada088317f1f0a a2e0088d9242bd9e57f8b852b05a6e47843b5a45 2025-10-22T13:47:09-07:00 Max Krasnyansky Add experimental ggml-hexagon backend for the Hexagon NPU (#16547)
a2e0088d9242bd9e57f8b852b05a6e47843b5a45 9b9201f65a22c02cee8e300f58f480a588591227 2025-10-22T11:20:55-07:00 Diego Devesa Revert "ggml : Leverage the existing GGML_F32_VEC helpers to vectorize ggml_v…" (#16723)
9b9201f65a22c02cee8e300f58f480a588591227 19a5a3edfd306516cc419679d69d6435943b6816 2025-10-22T16:58:23+02:00 Pascal webui: introduce OpenAI-compatible model selector in JSON payload (#16562)
19a5a3edfd306516cc419679d69d6435943b6816 d8eaa26e4d9228df3aa46a930db60c8eaab67c1b 2025-10-22T05:14:14-05:00 sirus20x6 ggml : Leverage the existing GGML_F32_VEC helpers to vectorize ggml_vec_set_f32 for faster fills (#16522)
d8eaa26e4d9228df3aa46a930db60c8eaab67c1b 9285325ce0174631c3cd6121d56084adc4ef2d8f 2025-10-22T12:01:22+02:00 Acly tests : fix test-thread-safety when compiling with multiple backends (#16699)
9285325ce0174631c3cd6121d56084adc4ef2d8f 03792ad93609fc67e41041c6347d9aa14e5e0d74 2025-10-22T12:33:08+08:00 Aman Gupta CUDA: fix bug in topk-moe softmax (#16711)
03792ad93609fc67e41041c6347d9aa14e5e0d74 51d1a8c997bd2629ef211a30208058ea87a30982 2025-10-21T22:40:38+08:00 Aman Gupta CUDA: topk-moe: add optional parameter for gpt-oss (#16649)
51d1a8c997bd2629ef211a30208058ea87a30982 4926419c4d74a1cf724e7163d937eb72f36e7b26 2025-10-21T15:27:53+02:00 Johannes Gäßler CUDA: better error for FA kernel with 0 occupancy (#16643)
4926419c4d74a1cf724e7163d937eb72f36e7b26 6ea37f57391d27736c35cd3c20c1f990b7952b74 2025-10-21T16:43:14+08:00 Aman Gupta ggml: add ggml_can_fuse_subgraph (#16662)
6ea37f57391d27736c35cd3c20c1f990b7952b74 fb349848f387f355450c3187556e71e6d32c145f 2025-10-20T22:26:17-07:00 lhez opencl: fix warnings and clean up profiling (#16688)
fb349848f387f355450c3187556e71e6d32c145f 6de8ed75196c7cd98c1f34bbf3a7452451ba8ac2 2025-10-20T22:16:08-05:00 Jeff Bolz vulkan: Handle FA with all -inf mask values (#16447)
6de8ed75196c7cd98c1f34bbf3a7452451ba8ac2 84bf3c677857279037adf67cdcfd89eaa4ca9281 2025-10-21T01:21:12+03:00 YehuditE sycl : add PAD_REFLECT_D1 operator support (#16145)
84bf3c677857279037adf67cdcfd89eaa4ca9281 c9c1972e2c2cc6a771fcc145bfa138700179f961 2025-10-20T21:38:20+02:00 Sigbjørn Skjæret model : add BailingMoeV2 support (#16063)
c9c1972e2c2cc6a771fcc145bfa138700179f961 b617cfd2896edd592a36ebbc041817eb030a1005 2025-10-20T19:49:02+02:00 Aleksander Grygier Handle legacy 'context' attachments (#16687)
b617cfd2896edd592a36ebbc041817eb030a1005 79068501fac9a74cca7129a8e5a8281b410a853e 2025-10-20T05:53:50-07:00 Diego Devesa ggml-alloc : fix leak when reusing a tensor with a larger size (#16679)
79068501fac9a74cca7129a8e5a8281b410a853e 0e4a0cf2fae667d3efcf52f2f52398779d986b1d 2025-10-20T14:21:12+02:00 Aleksander Grygier Prevent premature submission on IME input (#16673)
0e4a0cf2fae667d3efcf52f2f52398779d986b1d 13f2cfad4170c096c51a02c24a6a158cb47f1480 2025-10-20T13:29:14+02:00 Aleksander Grygier Import/Export UX improvements (#16619)
13f2cfad4170c096c51a02c24a6a158cb47f1480 06332e28672356b964d6dfc2ba4657e20581cd43 2025-10-20T12:41:13+02:00 Aleksander Grygier Enable per-conversation loading states to allow having parallel conversations (#16327)
06332e28672356b964d6dfc2ba4657e20581cd43 72d53e6c4decee8b339e49aed8cc0e234b9639dc 2025-10-20T16:27:09+08:00 takuya kodama llama-batch: fix build fails with `-Werror=missing-braces` (#16614)
72d53e6c4decee8b339e49aed8cc0e234b9639dc 2330de7b847ca84eac766df372c604c26db72747 2025-10-20T10:20:04+02:00 Ron Evans readme: update bindings (#16651)
2330de7b847ca84eac766df372c604c26db72747 7062dd8460685d6700ed7621e50a22c6f3400ca3 2025-10-20T11:08:32+03:00 safranowith SYCL: Add support for FLOOR,CEIL,ROUND and TRUNC unary operators (#16613)
7062dd8460685d6700ed7621e50a22c6f3400ca3 0398752dd450dfabdd1b9e289f6364c2600f6ab5 2025-10-20T15:44:21+08:00 takuya kodama llama-context: only warn on pooling_type when user specified (#16674)
c20c0a5c0c44179f5267a262546624854b1203d1 62425b3a7e8b169a3bbe6ce8c7324513a7fcee8c 2025-10-20T14:41:08+08:00 Yunzhe Jia kv: turn on common-prefix mtmd: fix output size bug
0398752dd450dfabdd1b9e289f6364c2600f6ab5 4f73d0a95120687e2c527739f771330a5271259a 2025-10-19T23:54:31+02:00 Giuseppe Scrivano model : add Granite Hybrid types (#16635)
4f73d0a95120687e2c527739f771330a5271259a cec5edbcaec69bbf6d5851cabce4ac148be41701 2025-10-20T05:06:39+08:00 Aaron Teo ci : fix binaries release failure for s390x (binaries may not work yet) (#16664)
cec5edbcaec69bbf6d5851cabce4ac148be41701 fcb235b46618921cbd826acd49b553b5302233aa 2025-10-19T14:03:25+02:00 Sigbjørn Skjæret ci : avoid manual updates of docs/ops.md (#16663)
fcb235b46618921cbd826acd49b553b5302233aa 55754bebd5d570960cde9c0ba991a0b2991f6b1e 2025-10-19T18:37:47+08:00 Aaron Teo ci: include s390x release binaries (#16648)
55754bebd5d570960cde9c0ba991a0b2991f6b1e ee09828cb057460b369576410601a3a09279e23c 2025-10-19T15:37:12+08:00 Aman Gupta CODEOWNERS: update for ggml-cuda/mmf (#16660)
ee09828cb057460b369576410601a3a09279e23c e56abd2098dd2e2b0804691b93c13b48ae421627 2025-10-18T14:47:32+02:00 Johannes Gäßler HIP: fix GPU_TARGETS (#16642)
e56abd2098dd2e2b0804691b93c13b48ae421627 38355c6c8e43204e11a22daa7483082c0ff01e71 2025-10-18T05:22:57-05:00 Jeff Bolz vulkan: Implement topk_moe fused shader, ported from CUDA (#16641)
38355c6c8e43204e11a22daa7483082c0ff01e71 81387858f1fbcc1acedbd308486e1016618ca8f8 2025-10-18T17:52:53+08:00 Aman Gupta CUDA: use registers instead of smem in topk-moe (#16647)
81387858f1fbcc1acedbd308486e1016618ca8f8 66b0dbcb2d462e7b70ba5a69ee8c3899ac2efb1c 2025-10-17T17:55:32-07:00 Shawn Gu opencl: transposed gemm/gemv moe kernel with mxfp4,f32 (#16602)
66b0dbcb2d462e7b70ba5a69ee8c3899ac2efb1c 41386cf365d894134ee0813d15e2f5d76f6a4d8e 2025-10-17T17:41:09+02:00 Johannes Gäßler llama-model: fix insonsistent ctxs <-> bufs order (#16581)
41386cf365d894134ee0813d15e2f5d76f6a4d8e 3d4e86bbeb15f487d6da6174ba6191b7c212cc25 2025-10-17T18:02:52+03:00 Radoslav Gerganov rpc : report actual free memory (#16616)
3d4e86bbeb15f487d6da6174ba6191b7c212cc25 342c728d031d50673feded797520a44127d73379 2025-10-17T14:23:47+02:00 Giuseppe Scrivano vulkan: Add State Space Model (SSM) Operations Support (#16463)
342c728d031d50673feded797520a44127d73379 ababae7e1ec3e9cfdab0322ee55ea3389e82a4d5 2025-10-17T18:01:23+08:00 muggle-stack ggml : fix SpaceMit IME array out-of-bounds in task assignment (#16629)
ababae7e1ec3e9cfdab0322ee55ea3389e82a4d5 b19491599d4d42c606601d75e95c1d1de3291f8e 2025-10-17T10:35:03+02:00 Pascal webui: reorganize settings layout (#16607)
b19491599d4d42c606601d75e95c1d1de3291f8e 9ad4f1931ee0f3b41d9355245ef744786aaae0aa 2025-10-17T02:31:04-05:00 Jeff Bolz vulkan: fix debug build (add_rms_len/data not found) (#16624)
9ad4f1931ee0f3b41d9355245ef744786aaae0aa 79967ec596c0dacfd2251b085a57e79df292b1cc 2025-10-17T02:33:58-04:00 Ilia Ilmer metal : add `CONV_TRANSPOSE_2D` (#16542)
79967ec596c0dacfd2251b085a57e79df292b1cc ceff6bb253dd306f5404d7ccb3f11fadafe71b52 2025-10-17T06:59:31+01:00 Olivier Chafik grammar : use int64_t to avoid int overflows in int schema to grammar conversion logic (#16626)
ceff6bb253dd306f5404d7ccb3f11fadafe71b52 1bb4f43380944e94c9a86e305789ba103f5e62bd 2025-10-17T05:36:40+03:00 GittyBurstein SYCL SET operator optimized for F32 tensors (#16350)
1bb4f43380944e94c9a86e305789ba103f5e62bd 683fa6ba4ed3a23b939d3e11e6dc860bd47a0ccf 2025-10-16T19:00:31+02:00 Xuan-Son Nguyen mtmd : support home-cooked Mistral Small Omni (#14928)
683fa6ba4ed3a23b939d3e11e6dc860bd47a0ccf b22572e97dc51757d3ebe917a5a283385010ec68 2025-10-16T16:28:41+02:00 Pascal fix: added a normalization step for MathJax-style \[\] and \(\) delimiters (#16599)
b22572e97dc51757d3ebe917a5a283385010ec68 7a50cf388a530127cbbdd2a507ef81a451c9d819 2025-10-16T16:26:21+03:00 GittyBurstein sycl : add ARANGE operator (#16362)
62425b3a7e8b169a3bbe6ce8c7324513a7fcee8c 76a63a2998286c1649de2496bccb7d8a46549895 2025-10-16T17:34:39+08:00 Yunzhe Jia kv: let seq_rm free whole seq since current hw-op cannot support common-prefix
7a50cf388a530127cbbdd2a507ef81a451c9d819 6f5d924637a15abedb111cbbffd7da5f31c81855 2025-10-16T16:41:11+08:00 Chenguang Li CANN: format code using .clang-format (#15863)
76a63a2998286c1649de2496bccb7d8a46549895 b67217078aa748b06e1b2269d88dd18c0aca2c26 2025-10-16T16:31:15+08:00 Yunzhe Jia kv: fix common-prefix bug by implementing llama_memory_seq_rm
6f5d924637a15abedb111cbbffd7da5f31c81855 adc9b60f190c1016a09f439862fa1cbb302262ac 2025-10-16T01:11:33-04:00 takasurazeem common : Update the docs on -t --threads (#16236)
adc9b60f190c1016a09f439862fa1cbb302262ac ee50ee1eadff58777ae746827b04de7ba0befc55 2025-10-16T13:10:32+08:00 takuya kodama ggml-cpu: replace putenv with setenv for const-correctness (#16573)
ee50ee1eadff58777ae746827b04de7ba0befc55 7adc79c03234de9a20661fd6dbf2d02c32ca7acb 2025-10-16T07:21:28+03:00 yael-works SYCL: Add GGML_OP_MEAN operator support (#16009)
7adc79c03234de9a20661fd6dbf2d02c32ca7acb 466c1911ab736f0b7366127edee99f8ee5687417 2025-10-15T22:43:08+02:00 Aleksei Nikiforov gguf-py : add support for endian conversion of BF16 data (#16594)
466c1911ab736f0b7366127edee99f8ee5687417 0cb7a0683b0529172472d74d21f05470a607f297 2025-10-15T22:24:51+03:00 safranowith cpu : add FLOOR, CEIL, ROUND and TRUNC unary operators (#16083)
0cb7a0683b0529172472d74d21f05470a607f297 d93f8439b08c4f35e13a41a7366901fdbe770fc8 2025-10-15T10:51:04-07:00 lhez opencl: add q8_0 mm support (#16469)
d93f8439b08c4f35e13a41a7366901fdbe770fc8 f9fb33f2630b4b4ba9081ce9c0c921f8cd8ba4eb 2025-10-15T10:48:28-07:00 lhez opencl: fix FA for f32 (#16584)
f9fb33f2630b4b4ba9081ce9c0c921f8cd8ba4eb f4ce81c45e7bd910e36bf44c253fc5255c49b1e4 2025-10-15T16:22:20+02:00 Aleksander Grygier Add server-driven parameter defaults and syncing (#16515)
f4ce81c45e7bd910e36bf44c253fc5255c49b1e4 17304cbcc1dd24de7741cbe57925d58e90a98ac1 2025-10-15T23:05:56+09:00 Sam/Samuel metal: optimise `GGML_OP_SUM` (#16559)
17304cbcc1dd24de7741cbe57925d58e90a98ac1 3e3cb19f6449f9168a128eaeae01f8f41b049acc 2025-10-15T16:53:12+03:00 Georgi Gerganov server : fix img token logs (#16595)
3e3cb19f6449f9168a128eaeae01f8f41b049acc 5acd455460f457942d8dd02e3dd9b1eebfce99fe 2025-10-15T14:48:08+02:00 Xuan-Son Nguyen llama-quant: add support for mmproj (#16592)
5acd455460f457942d8dd02e3dd9b1eebfce99fe 554fd578a5ed78a10f371f5850c6a69aa83df15a 2025-10-15T13:54:15+02:00 Julius Tischbein CUDA: Changing the CUDA scheduling strategy to spin (#16585)
554fd578a5ed78a10f371f5850c6a69aa83df15a fa882fd2b1bcb663de23af06fdc391489d05b007 2025-10-15T12:51:27+03:00 Georgi Gerganov server : fix mtmd checkpoints (#16591)
fa882fd2b1bcb663de23af06fdc391489d05b007 ffa059034c1e41f3e58363ef3c46d2fcf854bc4d 2025-10-14T20:33:05+03:00 Georgi Gerganov metal : avoid using Metal's gpuAddress property (#16576)
ffa059034c1e41f3e58363ef3c46d2fcf854bc4d 120bf7046d85a893f064c12abe58bfeebd735f84 2025-10-14T19:18:05+02:00 SavicStefan vulkan: Add ACC_TYPE_VEC2 implementation (#16203)
120bf7046d85a893f064c12abe58bfeebd735f84 4258e0cfe72c72ad2787be1e9f93253e89219455 2025-10-14T22:48:08+08:00 Aman Gupta CUDA + openCL: fix bug in accessing rms_norm->src while doing fusion (#16577)
4258e0cfe72c72ad2787be1e9f93253e89219455 7ea15bb64c81e3813eb0babf9a57e1bc5697f569 2025-10-14T08:53:37-05:00 Jeff Bolz vulkan: Support FA with K/V in F32 (#16543)
7ea15bb64c81e3813eb0babf9a57e1bc5697f569 9c7185dd28416cf67f5e3b268381f311b5e3da56 2025-10-14T07:51:36-05:00 Jeff Bolz vulkan: Improve build time for MSVC (#16545)
9c7185dd28416cf67f5e3b268381f311b5e3da56 1ee9d0b415cdf5240418c110a18b419f4002b154 2025-10-14T14:22:47+02:00 Johannes Gäßler CUDA: enable FA for FP32 KV cache (#16546)
1ee9d0b415cdf5240418c110a18b419f4002b154 48e2fa9fb7c2de1e53808fdb65ec33f916020fc4 2025-10-14T19:16:21+08:00 Aman Gupta CUDA: use fastdiv + ggml_cuda_mad for mmvf (#16557)
48e2fa9fb7c2de1e53808fdb65ec33f916020fc4 5b6913c47b6bc71a6f927805a45387d5657d8b89 2025-10-14T19:15:15+08:00 Aman Gupta CUDA: add fp kernel for larger batch size MoE (#16512)
5b6913c47b6bc71a6f927805a45387d5657d8b89 bc07349a7f87ba6eb31ed4b0ea9d9a7352185213 2025-10-14T09:53:49Z Anav Prasad cuda : remove legacy copy-op pointer indirection code (#16485)
bc07349a7f87ba6eb31ed4b0ea9d9a7352185213 e60f241eacec42d3bd7c9edd37d236ebf35132a8 2025-10-14T08:48:50+03:00 Georgi Gerganov server : dynamic token limit for prompt cache (#16560)
e60f241eacec42d3bd7c9edd37d236ebf35132a8 e38b7c6e9e4453e3b3e96d76e38bc2ccb6bce458 2025-10-13T23:07:57+03:00 Georgi Gerganov metal : FA support F32 K and V and head size = 32 (#16531)
e38b7c6e9e4453e3b3e96d76e38bc2ccb6bce458 5016b7286240d29f8f640039989b84ea3a854344 2025-10-13T22:42:37+03:00 Georgi Gerganov graph : support cacheless embeddings with FA and iSWA (#16528)
5016b7286240d29f8f640039989b84ea3a854344 7049736b2dd9011bf819e298b844ebbc4b5afdc9 2025-10-13T11:50:37-07:00 lhez opencl: fix build targeting CL 2 (#16554)
7049736b2dd9011bf819e298b844ebbc4b5afdc9 01d2bdc2bc61b676706830305b286b08b9885a41 2025-10-13T16:29:45+02:00 Johannes Gäßler CUDA: fix numerical issues in tile FA kernel (#16540)
01d2bdc2bc61b676706830305b286b08b9885a41 56fc38b9655fbe1869d8bd6cfb269418196cea69 2025-10-13T20:48:47+08:00 Jie Fu (傅杰) ggml : fix build broken with -march=armv9-a on MacOS (#16520)
56fc38b9655fbe1869d8bd6cfb269418196cea69 1fb9504eb744969a990bfe4cfcf1d3d7a479541c 2025-10-13T17:01:24+08:00 Chenguang Li CANN: fix CPU memory leak in CANN backend (#16549)
1fb9504eb744969a990bfe4cfcf1d3d7a479541c 3f750f8d760ab5a61491e6a9409072dfeee4b4d7 2025-10-13T10:55:32+02:00 Pascal fix: add remark plugin to render raw HTML as literal text (#16505)
b67217078aa748b06e1b2269d88dd18c0aca2c26 98c8269abefdfa8fde47dfb2769ceebc8b704e86 2025-10-13T11:48:14+08:00 Yunzhe Jia add different path for unified and seperate compilation
3f750f8d760ab5a61491e6a9409072dfeee4b4d7 c515fc577166042234241c6bd0da9b08dcbe2bb9 2025-10-13T16:25:02+08:00 Sam/Samuel metal: add support for opt_step_sgd (#16539)
c515fc577166042234241c6bd0da9b08dcbe2bb9 f9bc66c3ebcfddb5f09e4b21253623caeb8e414a 2025-10-13T11:22:27+03:00 Georgi Gerganov ggml : fix scalar path for computing norm (#16558)
f9bc66c3ebcfddb5f09e4b21253623caeb8e414a a31cf36ad946a13b3a646bf0dadf2a481e89f944 2025-10-13T08:52:22+08:00 hipudding CANN: Update several operators to support FP16 data format (#16251)
a31cf36ad946a13b3a646bf0dadf2a481e89f944 81d54bbfd599811b354c39f04550888168be7780 2025-10-13T02:43:14+08:00 Sam/Samuel metal : add opt_step_adamw and op_sum (#16529)
81d54bbfd599811b354c39f04550888168be7780 c7be9febcbafa9af7d1b9443f86475c59c9c5f87 2025-10-12T18:06:41+02:00 Pascal webui: remove client-side context pre-check and rely on backend for limits (#16506)
c7be9febcbafa9af7d1b9443f86475c59c9c5f87 8415f61e23d04427cd0d912fbb9d33b85f849456 2025-10-12T21:53:35+08:00 Neo Zhang Jianyu [SYCL] fix UT fault cases: count-equal, argsort, pad OPs (#16521)
8415f61e23d04427cd0d912fbb9d33b85f849456 2c301e91abb92d03c1a682b4b540ba835562a74b 2025-10-12T15:48:03+02:00 Mathieu Baudier ci : add Vulkan on Ubuntu with default packages build (#16532)
2c301e91abb92d03c1a682b4b540ba835562a74b 4b2dae383df708e2afc49c4859a81cd074f5ac10 2025-10-12T08:18:47-05:00 Aldehir Rojas common : handle unicode during partial json parsing (#16526)
4b2dae383df708e2afc49c4859a81cd074f5ac10 41aac5c69b5fb281bc1f486afb053f78101bb39e 2025-10-12T09:29:13+03:00 Georgi Gerganov common : update presets (#16504)
41aac5c69b5fb281bc1f486afb053f78101bb39e a2fba89a426ff8005d303c73f0436e7e67368b70 2025-10-12T00:25:37-05:00 sirus20x6 ggml : Fix FP16 ELU positive branch (#16519)
a2fba89a426ff8005d303c73f0436e7e67368b70 20cc625edc2264aae2779e71bef1593e6a4e8c43 2025-10-12T07:19:06+02:00 Daniel Bevenius hparams : add check for layer index in is_recurrent (#16511)
20cc625edc2264aae2779e71bef1593e6a4e8c43 11f0af5504252e453d57406a935480c909e3ff37 2025-10-12T00:15:00-05:00 sirus20x6 ggml: Correct SVE implementation in ggml_vec_dot_f16_unroll (#16518)
11f0af5504252e453d57406a935480c909e3ff37 a3cb04744fb5c591985f53b749fef5407d07a145 2025-10-11T20:54:32+02:00 Johannes Gäßler CUDA: faster tile FA, add oob checks, more HSs (#16492)
a3cb04744fb5c591985f53b749fef5407d07a145 4a8fbe0a5eb75f339782ebcf29c17848122184d3 2025-10-11T16:54:10+03:00 Georgi Gerganov metal : fix mul-mm condition + fix mul-mv permuted kernels (#16494)
4a8fbe0a5eb75f339782ebcf29c17848122184d3 31d0ff1869aa2ea31f4e96d5877d0343e9a2171b 2025-10-11T15:50:49+02:00 Pascal feat: render user content as markdown option (#16358)
31d0ff1869aa2ea31f4e96d5877d0343e9a2171b 97870e64975b26c5e06a3540a8dc0ff601351e86 2025-10-11T21:39:04+08:00 Yann Follet server / ranking : add sorting and management of top_n (#16403)
97870e64975b26c5e06a3540a8dc0ff601351e86 477a66b03501cf3bd067f8968b77ca4d053ff1bd 2025-10-11T04:02:26-07:00 Diego Devesa cuda : avoid initializing unused devices (#16510)
477a66b03501cf3bd067f8968b77ca4d053ff1bd e60f01d941bc5b7fae62dd57fee4cec76ec0ea6e 2025-10-11T11:33:41+03:00 amirai21 convert : correctly handle LLaMA tokenizer for Jamba (#16470)
e60f01d941bc5b7fae62dd57fee4cec76ec0ea6e 81086cd6a3ca1252f0dc0f938171648399179c53 2025-10-10T22:15:05+03:00 Georgi Gerganov server : fix division by zero when reporting stats (#16501)
81086cd6a3ca1252f0dc0f938171648399179c53 68ee98ae181a5c83a5cc6261daeee69a1f588c15 2025-10-10T17:17:31+03:00 Georgi Gerganov vocab : mark EOT token for Granite models (#16499)
68ee98ae181a5c83a5cc6261daeee69a1f588c15 cdb6da468cc33323955a523738d2e1675aeb5e9a 2025-10-10T17:11:07+03:00 Radoslav Gerganov server : return HTTP 400 if prompt exceeds context length (#16486)
cdb6da468cc33323955a523738d2e1675aeb5e9a 6d69ab3f262eca3f0c6ad0ce075d2c80b9924d0e 2025-10-10T13:22:27+03:00 Radoslav Gerganov server : log requests to /v1/completions (#16495)
6d69ab3f262eca3f0c6ad0ce075d2c80b9924d0e 1faa13a1187051af66b0fd9f0d6effe4c77f0b3e 2025-10-10T13:45:46+05:30 Prajwal B Mehendarkar cmake : Dont define XOPENSOURCE on AIX (#16481)
1faa13a1187051af66b0fd9f0d6effe4c77f0b3e 1deee0f8d494981c32597dca8b5f8696d399b0f2 2025-10-09T22:54:57+02:00 Pascal webui: updated the chat service to only include max_tokens in the req… (#16489)
1deee0f8d494981c32597dca8b5f8696d399b0f2 d00cbea63c671cd85a57adaa50abf60b3b87d86f 2025-10-09T22:11:15+03:00 duduta cpu : optimize the ggml NORM operation (#15953)
d00cbea63c671cd85a57adaa50abf60b3b87d86f 8328fd4bae76fc027f8ca0e9a05acd3788dabe3f 2025-10-09T18:54:51+03:00 Georgi Gerganov server : host-memory prompt caching (#16391)
8328fd4bae76fc027f8ca0e9a05acd3788dabe3f 56b4795842d852152222ca7a2d4304008facf1b9 2025-10-09T17:36:29+02:00 Pascal No markdown in cot (#16483)
56b4795842d852152222ca7a2d4304008facf1b9 2c0d875ae6c6043fbbafd2831e160955e9ca6af1 2025-10-09T14:35:22+02:00 Daniel Bevenius model-conversion : add support for SentenceTransformers (#16387)
2c0d875ae6c6043fbbafd2831e160955e9ca6af1 aa4711d369b0d4adb6802b98ad6ea362f838710e 2025-10-09T09:13:18+01:00 sudhiarm ci: add ARM64 Kleidiai build and test support (#16462)
aa4711d369b0d4adb6802b98ad6ea362f838710e d80d6d2400b8faa80654c723cb5bdf9fc8f4db06 2025-10-09T15:50:25+08:00 Chenguang Li CANN: Improve ACL graph matching (#16166)
d80d6d2400b8faa80654c723cb5bdf9fc8f4db06 b2602137557b2b28a39e03612717d85ead9a6f5a 2025-10-09T09:29:17+02:00 Charles Xu kleidiai: kernel interface refactoring (#16460)
b2602137557b2b28a39e03612717d85ead9a6f5a e08db4259521de493b7aeb49dadf29ebd1ee966a 2025-10-09T15:25:11+08:00 Neo Zhang Jianyu [SYCL] refactor soft_max, add soft_max_back (#16472)
e08db4259521de493b7aeb49dadf29ebd1ee966a 12bbc3fa50b6df03318a4451c9a2210200a0b28d 2025-10-09T08:39:18+02:00 Saba Fallah model: EmbeddingGemma Adding Support for SentenceTransformers Dense Modules (#16367)
12bbc3fa50b6df03318a4451c9a2210200a0b28d 9d0882840e6c3fb62965d03af0e22880ea90e012 2025-10-08T22:18:41+02:00 Pascal refactor: centralize CoT parsing in backend for streaming mode (#16394)
9d0882840e6c3fb62965d03af0e22880ea90e012 d2ee056e1df0fdf646270fb5621e9f92084b59a7 2025-10-08T20:21:46+02:00 ai-fonsi Disable CUDA host buffers on integrated GPUs (#16308)
d2ee056e1df0fdf646270fb5621e9f92084b59a7 b2c08c9ec4cd59ed88c1ebdd94f109af5ccc978e 2025-10-08T17:20:18+09:00 issixx server : fix cancel pending task (#16467)
b2c08c9ec4cd59ed88c1ebdd94f109af5ccc978e 7fdd16b432d247121fe5fe7b21f8805f85266c85 2025-10-08T10:57:53+03:00 Georgi Gerganov metal : mark FA blocks (#16372)
7fdd16b432d247121fe5fe7b21f8805f85266c85 74b8fc17f92ada295a648e3c5eb28f46bca7d892 2025-10-08T10:57:29+03:00 Georgi Gerganov server : improve context checkpoint logic (#16440)
74b8fc17f92ada295a648e3c5eb28f46bca7d892 aeaf8a36f06b5810f5ae4bbefe26edb33925cf5e 2025-10-07T13:48:56-07:00 Reese Levine ggml webgpu: profiling, CI updates, reworking of command submission (#16452)
aeaf8a36f06b5810f5ae4bbefe26edb33925cf5e df1b612e29ba97a2e67db339b1e8c7465702b7e8 2025-10-07T20:03:35+02:00 Tarek Dakhran llama : support LiquidAI LFM2-MoE hybrid model (#16464)
df1b612e29ba97a2e67db339b1e8c7465702b7e8 4e0388aa8a1f4ef1065701dc9c3947aea0a1b9a5 2025-10-07T15:57:14+03:00 Georgi Gerganov server : add `/v1/health` endpoint (#16461)
4e0388aa8a1f4ef1065701dc9c3947aea0a1b9a5 ef4c5b87ea2556ff8ca99cca3abdf48bdbca22f2 2025-10-07T11:11:08+02:00 Sascha Rogmann webui : added download action (#13552) (#16282)
ef4c5b87ea2556ff8ca99cca3abdf48bdbca22f2 c61ae20d05bd4fdd8551311325a2845336449426 2025-10-07T10:32:32+03:00 Georgi Gerganov presets : fix pooling param for embedding models (#16455)
c61ae20d05bd4fdd8551311325a2845336449426 0123ff38f53d34752f29239a29d0e40a6dc4110f 2025-10-07T09:59:13+03:00 Radoslav Gerganov rpc : update documentation (#16441)
0123ff38f53d34752f29239a29d0e40a6dc4110f 0a319bb75ed29d968e2a9b544011b09ccb932915 2025-10-07T08:24:17+03:00 Georgi Gerganov memory : use sequential equal splits for recurrent modules (#16442)
0a319bb75ed29d968e2a9b544011b09ccb932915 1d6092fc72f4d10f4486ac95edfd414bc08b62b8 2025-10-07T08:23:30+03:00 Georgi Gerganov metal : add support for non-padded FA KV (#16148)
1d6092fc72f4d10f4486ac95edfd414bc08b62b8 8ae32dc9ecd7aeebf3a5b43557e0552a0a04cd4f 2025-10-07T08:22:35+03:00 Georgi Gerganov tests : add -INF blocks to the KQ mask in the FA tests (#16380)
8ae32dc9ecd7aeebf3a5b43557e0552a0a04cd4f 3df2244df40c67dfd6ad548b40ccc507a066af2b 2025-10-07T08:21:40+03:00 Georgi Gerganov metal : various optimizations + refactoring (#16446)
3df2244df40c67dfd6ad548b40ccc507a066af2b c08002a1988348403a5fd59b1fa3de3a10a6f92f 2025-10-06T12:55:53-05:00 Gadflyii llama : add --no-host to disable host buffers (#16310)
c08002a1988348403a5fd59b1fa3de3a10a6f92f 3a002afafa8e06555f11aed88b02d055d8a166f3 2025-10-06T10:59:40-06:00 Gabe Goodhart chat : Granite Docling stopping (#16438)
3a002afafa8e06555f11aed88b02d055d8a166f3 a23b9bdbd3b64ce172f9962249f432d01aea7437 2025-10-06T17:40:21+02:00 Sigbjørn Skjæret ci : refactor sdk caching to minimize storage (#16414)
a23b9bdbd3b64ce172f9962249f432d01aea7437 04e632a4aab8e6bfff0f8bc216b36ceb1e199ff9 2025-10-06T16:05:27+03:00 Georgi Gerganov ggml : fix unaligned access in AMX code (#16315)
04e632a4aab8e6bfff0f8bc216b36ceb1e199ff9 a80ff183abe4e5a76316257ffa597da41b3b6fa0 2025-10-06T14:56:59+02:00 Daniel Bevenius ci : remove missing reranker model files (#16444)
a80ff183abe4e5a76316257ffa597da41b3b6fa0 1d49ca37594fb49db6aa9518ba7c512e5ccd0108 2025-10-06T14:17:12+02:00 Daniel Bevenius ggml-cpu : fix leftover handling in ggml_vec_scale_f32 for SVE (#16443)
1d49ca37594fb49db6aa9518ba7c512e5ccd0108 c5fef0fcea3b978a2318b1af170209ecec7c37b4 2025-10-06T09:29:56Z Yuannan nix : removed metal for nix (#16118)
c5fef0fcea3b978a2318b1af170209ecec7c37b4 ca71fb9b368e3db96e028f80c4c9df6b6b370edd 2025-10-06T03:53:31-04:00 Oleksandr Kuvshynov server: update readme to mention n_past_max metric (#16436)
ca71fb9b368e3db96e028f80c4c9df6b6b370edd 35266573b968e1c947b367782fb4b3eddbb4f3c0 2025-10-05T06:57:47-06:00 Gabe Goodhart model : Granite docling + Idefics3 preprocessing (SmolVLM) (#16206)
35266573b968e1c947b367782fb4b3eddbb4f3c0 86df2c9ae4f2f1ee63d2558a9dc797b98524639b 2025-10-04T20:59:31-07:00 Reese Levine ggml webgpu: actually add softmax, fix rms_norm offset (#16400)
86df2c9ae4f2f1ee63d2558a9dc797b98524639b f39283960b58a92ecc0c72567711318b20e22b55 2025-10-04T20:04:27Z Eve vulkan: use a more appropriate amount of threads when generating shaders (#16418)
f39283960b58a92ecc0c72567711318b20e22b55 898acba6816ad23b6a9491347d30e7570bffadfd 2025-10-04T16:22:45+03:00 Radoslav Gerganov rpc : check src buffer when copying tensor (#16421)
898acba6816ad23b6a9491347d30e7570bffadfd e29acf74fea996014380d59d31aa504ae8964258 2025-10-04T12:49:16+03:00 Radoslav Gerganov rpc : add support for multiple devices (#16276)
e29acf74fea996014380d59d31aa504ae8964258 128d522c04286e019666bd6ee4d18e3fbf8772e2 2025-10-04T11:42:56+02:00 Acly vulkan : incremental shader builds (#16341)
128d522c04286e019666bd6ee4d18e3fbf8772e2 f6dcda390004b627ef30af378d0c01ad2519289e 2025-10-03T20:51:48+02:00 Pascal chat : support Magistral thinking (#16413)
f6dcda390004b627ef30af378d0c01ad2519289e 606a73f53175077429484b23dcf799f69a31d0bd 2025-10-03T13:34:51-05:00 ddh0 server : context checkpointing for hybrid and recurrent models (#16382)
606a73f53175077429484b23dcf799f69a31d0bd 946f71ed9ade07e319859b5ce656144140e066fb 2025-10-03T19:18:56+03:00 Georgi Gerganov metal : fix loop bound in ggml_mem_ranges (#16412)
946f71ed9ade07e319859b5ce656144140e066fb 638d330246954e88dffc22ce01fec15e6894e544 2025-10-03T14:40:25+02:00 Sigbjørn Skjæret llama : fix shapes for bert/mpt q/k norm (#16409)
638d330246954e88dffc22ce01fec15e6894e544 84c8e305e8010a1a3d43bdd0a25f737ac67809a4 2025-10-03T13:49:08+02:00 Acly ggml : fix graph reallocation with multiple chunks (#16396)
84c8e305e8010a1a3d43bdd0a25f737ac67809a4 2aaf0a2a2056d75d0dd53ab8a181473760e6ab22 2025-10-03T12:51:40+02:00 Aleksander Grygier Fix missing messages on sibling navigation (#16408)
2aaf0a2a2056d75d0dd53ab8a181473760e6ab22 0e1f83855609d73beaf05d818640b6cfd39d287b 2025-10-03T05:50:46-05:00 Jeff Bolz vulkan: Replace uses of maxMemoryAllocationSize and VK_WHOLE_SIZE (#16354)
0e1f83855609d73beaf05d818640b6cfd39d287b ad126479c25cf983a0f994a08ba0911cf49ed62b 2025-10-03T04:52:46-05:00 Jeff Bolz vulkan: Fix FA coopmat1 invalid array indexing (#16365)
ad126479c25cf983a0f994a08ba0911cf49ed62b 77233277c912d495d1069543ca540c21a2f9e5b4 2025-10-03T11:45:16+02:00 Daniel Bevenius ci : change macos-13 to macos-15-intel (#16401)
77233277c912d495d1069543ca540c21a2f9e5b4 e308efda8e54e3f07578937a45a5d83624eb7970 2025-10-03T11:30:39+02:00 Aleksander Grygier Capture model name only after first token (streaming) or completed request (#16405)
e308efda8e54e3f07578937a45a5d83624eb7970 136bda78c5679b266362b39c58338fff46fd2592 2025-10-03T03:33:08-05:00 Jeff Bolz vulkan: in flash attention, bounds check against nem1 (don't rely on GGML_KQ_MASK_PAD) (#16316)
136bda78c5679b266362b39c58338fff46fd2592 5113efd34ceda709292de26c72716c49e024fb32 2025-10-03T09:11:34+02:00 Aleksander Grygier webui : Fix messages payload sent to chat completions (#16402)
5113efd34ceda709292de26c72716c49e024fb32 d64c8104f090b27b1f99e8da5995ffcfa6b726e2 2025-10-03T08:01:31+02:00 Pascal fix: track viewportHeight via window.innerHeight to avoid unwanted scrolling (#16356)
d64c8104f090b27b1f99e8da5995ffcfa6b726e2 ef07a4090672a3438d7f64f197795d7dc1c18957 2025-10-02T20:10:12+02:00 Sigbjørn Skjæret test-barrier : do not use more threads than physically available (#16389)
ef07a4090672a3438d7f64f197795d7dc1c18957 34fcc5a4ace8c69476ef2ea3857f39a60334acc4 2025-10-02T11:00:31-07:00 Reese Levine ggml webgpu: add support for soft_max, optimize rms_norm (#16357)
34fcc5a4ace8c69476ef2ea3857f39a60334acc4 91a2a5655658bb9ab77894716b82fae7ecb4b4d1 2025-10-02T19:43:22+02:00 Piotr Wilkin (ilintar) model : Apertus model implementation (#15852)
91a2a5655658bb9ab77894716b82fae7ecb4b4d1 72ee736c447be4ededb51ab97904b4d33c90c261 2025-10-02T21:29:56+08:00 R0CKSTAR musa: update compile flags (#16265)
72ee736c447be4ededb51ab97904b4d33c90c261 f09aefaa84d7f4d5df3f400f67944b94fef5b795 2025-10-02T13:51:36+02:00 Sigbjørn Skjæret ci : fix ubuntu-latest-cmake-rpc (disable ccache) (#16388)
f09aefaa84d7f4d5df3f400f67944b94fef5b795 bbd32bc0384fbfcf07369617de58856b1e0e95a3 2025-10-02T08:10:07Z Eve ci: update vulkan ci (#16294)
bbd32bc0384fbfcf07369617de58856b1e0e95a3 2be72c2b121ee99f33927149265ce6073ade9e59 2025-10-02T10:35:43+03:00 Georgi Gerganov ci : fix clean-up of old logs (#16381)
2be72c2b121ee99f33927149265ce6073ade9e59 95ce0985449c52fb9d6849b95563f7cf933ea0e3 2025-10-02T15:16:25+08:00 Neo Zhang Jianyu SYCL: Update to oneAPI 2025.2 (#16371)
95ce0985449c52fb9d6849b95563f7cf933ea0e3 c8dedc9999eccf7821a9fe5b29f10e8d075e2217 2025-10-02T05:52:59+02:00 uvos HIP: add IMbackK to codeowner (#16375)
c8dedc9999eccf7821a9fe5b29f10e8d075e2217 e95fec640f43623911a2cd5bda8b19b1898c530c 2025-10-01T23:32:39+02:00 uvos CI: reenable cdna in rocm docker builds (#16376)
e95fec640f43623911a2cd5bda8b19b1898c530c ded67b94446ef4f7fd988dbde7a12deef9870c13 2025-10-01T23:09:25+02:00 uvos HIP: Disable ROCWMMA fattn on CDNA when compiled against ROCWMMA 2.0.0 (#16221)
ded67b94446ef4f7fd988dbde7a12deef9870c13 1fe4e38cc20af058ed320bd46cac934991190056 2025-10-02T06:08:15+09:00 Shunta Saito llama : parameter conversion and loading fixes for PLaMo2 variants (#16075)
1fe4e38cc20af058ed320bd46cac934991190056 4201deae9c2ae4732db8957b6ce0808d02ec597c 2025-10-01T20:18:03+02:00 uvos ci: Properly install rocwmma for hip builds (#16305)
4201deae9c2ae4732db8957b6ce0808d02ec597c 764799279f801c696503bacca490b4358587d94c 2025-10-01T19:22:18+02:00 Adrien Gallouët common: introduce http.h for httplib-based client (#16373)
764799279f801c696503bacca490b4358587d94c 2a9b63383a448ec18c754dfdc6e95cb853940a52 2025-10-01T18:18:10+02:00 Aleksander Grygier Conversation action dialogs as singletons from Chat Sidebar + apply conditional rendering for Actions Dropdown for Chat Conversation Items (#16369)
2a9b63383a448ec18c754dfdc6e95cb853940a52 1104ca1a1c926b832274694a2773a17066982ad0 2025-10-01T15:54:42+02:00 Aleksander Grygier Improve code block color theming (#16325)
1104ca1a1c926b832274694a2773a17066982ad0 4f1575921cac9b489fe8f8bbf20aff985e7da45e 2025-10-01T14:09:52+02:00 Sigbjørn Skjæret ci : use registry cache for docker builds (#16366)
4f1575921cac9b489fe8f8bbf20aff985e7da45e 132d673554e65282e92505f4f77401ab971528bb 2025-10-01T12:08:16+02:00 Aleksander Grygier Add optional setting for showing "Model used:" information (#16337)
132d673554e65282e92505f4f77401ab971528bb aa9538a63aef35f0224b2502f13b19d650a8ce04 2025-10-01T07:56:36Z Eve vulkan: make ggml_vk_default_dispatcher support older vulkan headers (#16345)
aa9538a63aef35f0224b2502f13b19d650a8ce04 e74c92e84236b2bab3f3c77bee4ead94928be360 2025-10-01T07:40:26+02:00 Aleksander Grygier webui: Remove running `llama-server` within WebUI `dev.sh` script (#16363)
e74c92e84236b2bab3f3c77bee4ead94928be360 b2ba81dbe07b6dbea9c96b13346c66973dede32c 2025-09-30T16:24:36-04:00 Bartowski model : support GLM 4.6 (make a few NextN/MTP tensors not required) (#16359)
b2ba81dbe07b6dbea9c96b13346c66973dede32c bf6f3b3a1965d70e07ca94aab7b01268fe483e96 2025-09-30T21:41:42+02:00 Sigbjørn Skjæret ci : fix ccache key for ubuntu-cpu-cmake (#16355)
bf6f3b3a1965d70e07ca94aab7b01268fe483e96 7c156df4148eb524b22f7f363bfd2df00f264e0b 2025-09-30T19:52:41+02:00 Adrien Gallouët common : disable progress bar without a tty (#16352)
7c156df4148eb524b22f7f363bfd2df00f264e0b 16b0ca0d2e63fc1a0a43795f8552f9cb61d9f7a5 2025-09-30T10:45:45-07:00 lhez opencl: support pad_ext (#15888)
16b0ca0d2e63fc1a0a43795f8552f9cb61d9f7a5 8d78cd2613ccdeb3cc86f59bc8f9ddd31cfbd3ed 2025-09-30T19:18:54+02:00 Pascal Chatapi ignore empty sampling (#16330)
8d78cd2613ccdeb3cc86f59bc8f9ddd31cfbd3ed d1c84a662daa91be975863913a59975b11458141 2025-09-30T09:57:51-07:00 Reese Levine ggml webgpu: support for rope,div,sub,glu,scale,cont operators (#16187)
d1c84a662daa91be975863913a59975b11458141 364a7a6d4a786e98947c8a90430ea581213c0ba9 2025-09-30T09:55:13-07:00 lhez opencl: support ne3 in get_rows (#15866)
364a7a6d4a786e98947c8a90430ea581213c0ba9 2df5bcf357dba0c49b4df1d684b2ffc9e88b7054 2025-09-30T16:39:44+02:00 Adrien Gallouët common : remove common_has_curl() (#16351)
2df5bcf357dba0c49b4df1d684b2ffc9e88b7054 075c01567bb7e93965ae60b7e119182c3e68f3e9 2025-09-30T15:38:01+02:00 Sigbjørn Skjæret ci : disable ccache for android (#16348)
075c01567bb7e93965ae60b7e119182c3e68f3e9 a014310374a16f9204f2bcc1b458fc1eda67e469 2025-09-30T13:42:39+03:00 Georgi Gerganov ggml : bump version to 0.9.4 (ggml/1363)
98c8269abefdfa8fde47dfb2769ceebc8b704e86 2790ecc304e384d9075c55d0628d8bf440025dc4 2025-09-30T17:42:57+08:00 Yunzhe Jia server: adapt to calrt
2790ecc304e384d9075c55d0628d8bf440025dc4 f528e97d894b4d93934a0711a00253eea980e799 2025-09-30T17:37:58+08:00 Yunzhe Jia adapt to calrt
f528e97d894b4d93934a0711a00253eea980e799 dcbe998a6d8f13b6c9cb36bbe7b355ced2ac3842 2025-09-11T14:13:35+08:00 Yunzhe Jia add calrt mtmd support
a014310374a16f9204f2bcc1b458fc1eda67e469 35fb82497ec6c5904b0adb7e1c881a76c1c692db 2025-09-30T08:13:22Z anavp-nvidia cuda : Enable CUDA Graph usage for Nemotron Nano v2 (NemotronH) (#16328)
35fb82497ec6c5904b0adb7e1c881a76c1c692db 3c62aed89fbe3e15f6f82035e805a0a1add26306 2025-09-30T11:03:23+03:00 Georgi Gerganov metal : dynamic simdgroups for MV kernels (#16340)
3c62aed89fbe3e15f6f82035e805a0a1add26306 f1eb1cb1eba042b2d583234e80f65e2e225d8995 2025-09-30T09:36:33+02:00 Adrien Gallouët common : simplify etag tracking by removing json (#16342)
f1eb1cb1eba042b2d583234e80f65e2e225d8995 de41f2b7bffab7582944b213ce12b605f8cf6e0f 2025-09-30T09:07:20+02:00 Charles Xu kleidiai : fix work size and threads sync for fp16 (#16246)
de41f2b7bffab7582944b213ce12b605f8cf6e0f a74a0d69f34f52fa10d4f0a7ce749fb3490d0774 2025-09-29T22:30:16-07:00 lhez codeowners: add codeowners for opencl backend (#16344)
a74a0d69f34f52fa10d4f0a7ce749fb3490d0774 5f7e166cbf7b9ca928c7fad990098ef32358ac75 2025-09-29T19:26:34-05:00 Jeff Bolz tests: override test_set_rows::max_nmse_err to allow for occasional rounding differences (#16295)
5f7e166cbf7b9ca928c7fad990098ef32358ac75 d72f5f7ba260b546190338b0b76f2f152581424f 2025-09-29T18:49:47+02:00 Pascal Fix thinking blocks with quotes + add handling `[THINK]...[/THINK]` blocks (#16326)
d72f5f7ba260b546190338b0b76f2f152581424f b77e6c18e1a6fac5705ed95f03af5436d67484c1 2025-09-29T17:51:48+03:00 Georgi Gerganov ci : add AMD runners and workflows (#16249)
b77e6c18e1a6fac5705ed95f03af5436d67484c1 2ddd3f2356c313385fafc19a9f0ce678c8fe03ee 2025-09-29T22:50:44+08:00 alex-spacemit ggml: riscv: add riscv spacemit backend (#15288)
2ddd3f2356c313385fafc19a9f0ce678c8fe03ee 4d3d455d3c8719eb8f206de328d1b9ba191efd7c 2025-09-29T16:50:52+03:00 Georgi Gerganov sync : ggml
4d3d455d3c8719eb8f206de328d1b9ba191efd7c c9b1c06467aca8d30fafcab51292bcb285df5b0d 2025-09-29T16:49:11+03:00 Georgi Gerganov sync : whisper.cpp (ggml/1359)
c9b1c06467aca8d30fafcab51292bcb285df5b0d b6ae75afb49b23db3dfbc2b01e8aabfb047e6880 2025-09-26T17:34:42+02:00 Daniel Bevenius ggml : remove -dev suffix from release version (ggml/1355)
b6ae75afb49b23db3dfbc2b01e8aabfb047e6880 b6dff20e2fe352093039e2359370c6bb2b505e0b 2025-09-25T14:39:05+02:00 Daniel Bevenius ggml : bump version to 0.9.3 (ggml/1353)
b6dff20e2fe352093039e2359370c6bb2b505e0b 2db78c75e4ef7497313fda6dbbb3fcaf9ca0752d 2025-09-20T16:44:23+03:00 Georgi Gerganov ggml : prepare for development of 0.9.2-dev
2db78c75e4ef7497313fda6dbbb3fcaf9ca0752d 02463ab27b1379ff5e3d936ce8b3bfd356872ea6 2025-09-20T16:44:23+03:00 Georgi Gerganov ggml : bump version to 0.9.1
02463ab27b1379ff5e3d936ce8b3bfd356872ea6 adc76347d73b3d915e946efa5de8d0ad9f3904c2 2025-09-29T13:17:09+02:00 Rafal Lewczuk ggml-backend : add root cause in error message if loading backend library fails (#16172)
adc76347d73b3d915e946efa5de8d0ad9f3904c2 3a2bdcda0b31e51db954551e0cd49424133a84f3 2025-09-29T11:09:00+02:00 Sigbjørn Skjæret ggml : check cuda and metal argsort limits and add test (#16323)
3a2bdcda0b31e51db954551e0cd49424133a84f3 66bb7985c3fcefda7a74aae9f8321f70eb1646c4 2025-09-29T10:37:20+02:00 Aleksander Grygier Improve Mobile UI for dialogs and action dropdowns (#16222)
66bb7985c3fcefda7a74aae9f8321f70eb1646c4 2f61c0f5bf8a620ca4c3872408803ab38cfb9613 2025-09-29T09:08:41+02:00 Pascal fix: preserved zero values in chat settings inputs and textareas by switching to nullish coalescing for field values and default placeholders (#16312)
2f61c0f5bf8a620ca4c3872408803ab38cfb9613 3ffd0fae473c954bb3e67526b31262048fb508d4 2025-09-29T12:33:12+05:30 Vinkal llama-cli: prevent spurious assistant token (#16202)
3ffd0fae473c954bb3e67526b31262048fb508d4 a4a0aa5ea2a88e4858996199fefd5439f17b481c 2025-09-29T01:30:45-05:00 ddh0 perplexity : show more kl-divergence data (#16321)
a4a0aa5ea2a88e4858996199fefd5439f17b481c 92cd103f627015a95f2107f1c27dc218c7b8ec64 2025-09-29T08:41:28+03:00 Georgi Gerganov ggml : fix dependencies for ggml_set_rows (#16318)
92cd103f627015a95f2107f1c27dc218c7b8ec64 b887d2f3413ac231e3cb5925260c39902af4a70c 2025-09-28T23:50:37-05:00 Jeff Bolz vulkan: Fix validation failure in quantized flash attention (#16292)
b887d2f3413ac231e3cb5925260c39902af4a70c bd0af02fc96c2057726f33c0f0daf7bb8f3e462a 2025-09-28T23:15:03+02:00 Sigbjørn Skjæret ggml : fix GGML_F32_VEC_FMA argument order in ggml_vec_mad1_f32 (#16307)
bd0af02fc96c2057726f33c0f0daf7bb8f3e462a d9e0e7c8194dfd7d23bf3a86608c9ece68d77c93 2025-09-28T14:13:50-04:00 crat0z common : fix reasoning before forced tool call via tool_choice = required (#16264)
d9e0e7c8194dfd7d23bf3a86608c9ece68d77c93 0124ac989f7e7bf08803788f66dbe4106bdcdd58 2025-09-28T22:38:15+08:00 R0CKSTAR ci : fix musa docker build (#16306)
0124ac989f7e7bf08803788f66dbe4106bdcdd58 2811c65286ae954bec87049f75b86dc022006dcc 2025-09-28T19:25:58+08:00 Aaron Teo devops: switch to using ubuntu-22.04-s390x image (#16302)
2811c65286ae954bec87049f75b86dc022006dcc d8359f5fde480da030bf75c7711573c7c4d993ba 2025-09-28T12:04:46+01:00 Imad Saddik Fixed a few typos in the README of the LLaMA.cpp HTTP Server [no ci] (#16297)
d8359f5fde480da030bf75c7711573c7c4d993ba 6a2c6145a0b91b40eb3c3dba7b20ccc4b270490f 2025-09-28T01:38:37-05:00 Jeff Bolz vulkan: 64-bit im2col (#16135)
6a2c6145a0b91b40eb3c3dba7b20ccc4b270490f 3b53634fe35771e2e318227aa81585726bae7234 2025-09-28T09:34:44+03:00 Georgi Gerganov metal : extend mat-mat multiplication support (#16225)
3b53634fe35771e2e318227aa81585726bae7234 1384abf8b8d5894d32fada453ccf4d196ffba7de 2025-09-28T09:34:05+03:00 Georgi Gerganov metal : fuse non-sequential nodes (#16102)
1384abf8b8d5894d32fada453ccf4d196ffba7de e6d65fb02d553bd79cad94e517cdca18b687788d 2025-09-27T20:36:34-05:00 Jeff Bolz vulkan: handle mat_mul with A matrix > 4GB (#16176)
e6d65fb02d553bd79cad94e517cdca18b687788d 8656f5de688cddcaea1d6174535eb60ee23ef6a0 2025-09-27T16:43:39-04:00 Jeff Bolz vulkan: support arbitrary KV dimension in flash attention (#16160)
8656f5de688cddcaea1d6174535eb60ee23ef6a0 4807e8f96a61b2adccebd5e57444c94d18de7264 2025-09-27T22:41:03+02:00 Acly vulkan : make the vulkan.hpp dynamic dispatcher instance private (#16224)
4807e8f96a61b2adccebd5e57444c94d18de7264 c0bfc57af421f8fd63c946c13b7666aed82560e2 2025-09-27T19:56:40+02:00 Aleksander Grygier Show message actions by default (#16289)
c0bfc57af421f8fd63c946c13b7666aed82560e2 75a3a6c2cd0002ba40e2dcc92007bc9fdbc69f1a 2025-09-28T00:49:32+08:00 Aman Gupta CUDA: mul_mat_id for mmf for bs <= 64 for f16 and bs <= 32 for f32 (#16277)
75a3a6c2cd0002ba40e2dcc92007bc9fdbc69f1a 0499b29c6f64c705faaf5860dc4600fca23671f4 2025-09-27T18:45:07+02:00 Johannes Gäßler CUDA: refactor and deduplicate vector FA kernels (#16208)
0499b29c6f64c705faaf5860dc4600fca23671f4 234e2ff8ed09716fb553437596779399bee31b11 2025-09-27T19:26:46+03:00 Dmytro Minochkin vulkan: throw system error instead of SIGABRT during init on older devices (#16156)
234e2ff8ed09716fb553437596779399bee31b11 3f81b4e91c1d5f098148af117e3f13cf4b077f52 2025-09-27T18:17:08+02:00 Adrien Gallouët server : remove old LLAMA_SERVER_SSL (#16290)
3f81b4e91c1d5f098148af117e3f13cf4b077f52 ace6a54565444b6377bee8e7ac693238e7766279 2025-09-27T06:36:11-04:00 Jeff Bolz vulkan: support GET_ROWS for k-quants (#16235)
ace6a54565444b6377bee8e7ac693238e7766279 72b24d96c6888c609d562779a23787304ae4609c 2025-09-27T11:12:46+02:00 Adrien Gallouët build : add LLAMA_OPENSSL option (#16287)
72b24d96c6888c609d562779a23787304ae4609c 624207e676ab5eb3ce7af631902bb45fb73a8359 2025-09-27T02:58:29+05:30 Vinkal model : make minicpm embedding_scale, residual_scale and logit_scale optional with legacy defaults (#16273)
624207e676ab5eb3ce7af631902bb45fb73a8359 807e8c6d310952f2f5656afc63dab9d7083dcb5c 2025-09-27T02:03:33+08:00 Aaron Teo devops: add s390x & ppc64le CI (#15925)
807e8c6d310952f2f5656afc63dab9d7083dcb5c 1a189278944d030211f336e103e96b65f976c361 2025-09-26T19:25:29+02:00 Aleksander Grygier Enhance text file detection logic for file attachments (#16199)
1a189278944d030211f336e103e96b65f976c361 e0539eb6aed346d4b25a6ea019044e88771e7690 2025-09-26T18:35:42+02:00 Aleksander Grygier Allow viewing conversations even when llama server is down (#16255)
e0539eb6aed346d4b25a6ea019044e88771e7690 5d0a40f390732cbf85d8a3b7b0fc3cbebffe780a 2025-09-26T11:36:48-04:00 Isaac McFadyen webui: switch to hash-based routing (alternative of #16079) (#16157)
5d0a40f390732cbf85d8a3b7b0fc3cbebffe780a d12a9836597b1ae4440d64d5a6ed727d27ac0702 2025-09-26T15:59:07+02:00 Aleksander Grygier Always show message actions for mobile UI + improvements for user message sizing (#16076)
d12a9836597b1ae4440d64d5a6ed727d27ac0702 cc1cfa277b3aae1f6cc9180472072336597a78d4 2025-09-26T16:09:34+03:00 Radoslav Gerganov codeowners : add rgerganov as owner of RPC [no ci] (#16279)
cc1cfa277b3aae1f6cc9180472072336597a78d4 54dbc37053f7d75ea5b0631d5ee88f19391e4314 2025-09-26T15:00:44+02:00 Aleksei Nikiforov mtmd : fix uninitialized variable in bicubic_resize (#16275)
54dbc37053f7d75ea5b0631d5ee88f19391e4314 b995a10760cb93d23d617d76ecb82a5f95b5e0d3 2025-09-26T14:14:28+03:00 Georgi Gerganov metal : report OOM errors (#16274)
b995a10760cb93d23d617d76ecb82a5f95b5e0d3 4710dd31bbcef79d04f85a3a6a8c7d9439c5c79a 2025-09-26T13:12:19+02:00 Adrien Gallouët common : use cpp-httplib as a cURL alternative for downloads (#16185)
4710dd31bbcef79d04f85a3a6a8c7d9439c5c79a 9b26511857ac09ae69ab485168fe2d3ee5fb1d6e 2025-09-26T12:39:35+02:00 Adrien Gallouët build : fix build-ios-device (#16257)
9b26511857ac09ae69ab485168fe2d3ee5fb1d6e 00217cd41388328c93e9e9644921c4319bb03bcc 2025-09-26T18:27:25+08:00 Aaron Teo ggml-cpu: implement MXFP4 SIMD for s390x (#16193)
00217cd41388328c93e9e9644921c4319bb03bcc 3b337b01a1a85c2f5b49376e8c0bbdb3f521528e 2025-09-26T13:19:23+03:00 Radoslav Gerganov ci : create git tags for released docker images (#16008)
3b337b01a1a85c2f5b49376e8c0bbdb3f521528e a86a580a6692edd1da076d5422f944c344b4fe5e 2025-09-26T07:53:36+02:00 Daniel Bevenius codeowners : add danbev as owner of build-xcframework.sh [no ci] (#16268)
a86a580a6692edd1da076d5422f944c344b4fe5e 0f7c69689f4e681948a6005adea9bee9c08ff903 2025-09-26T08:56:38+08:00 R0CKSTAR musa: upgrade musa sdk to 4.3.0 (#16240)
0f7c69689f4e681948a6005adea9bee9c08ff903 835b2b915c52bcabcd688d025eacff9a07b65f52 2025-09-26T08:56:10+08:00 R0CKSTAR musa: fix build warnings (#15611)
835b2b915c52bcabcd688d025eacff9a07b65f52 b05a9d650f4da1e70e7e2cbe8fe44e61b39656db 2025-09-25T19:50:28+02:00 Sigbjørn Skjæret model : add GroveMoE support (#15510)
b05a9d650f4da1e70e7e2cbe8fe44e61b39656db 27052978e487957b3d39e3bd8fc8ee4aa304bff9 2025-09-25T23:38:10+08:00 Aaron Teo vendors: update miniaudio version (#16212)
27052978e487957b3d39e3bd8fc8ee4aa304bff9 077c94d0caf87fbd3cf3288dbb5c0fd9670294cf 2025-09-25T18:20:34+03:00 rtaluyev readme : update bindings (#16144)
077c94d0caf87fbd3cf3288dbb5c0fd9670294cf aa3ee0eb0b80efca126cedf9bcb4fb5864b46ce3 2025-09-25T22:35:05+08:00 Aman Gupta CUDA: add a fused top-K MoE kernel (#16130)
aa3ee0eb0b80efca126cedf9bcb4fb5864b46ce3 d0991da39d3c39b3980c24cdfccb9a4c95a46870 2025-09-25T12:02:36+02:00 Daniel Bevenius model-conversion : add embedding prompt file support (#15871)
d0991da39d3c39b3980c24cdfccb9a4c95a46870 aa719c2f886c445b78113bf1e5849f1fce4124a7 2025-09-25T11:36:47+02:00 Daniel Bevenius server : add support for external server for tests (#16243)
aa719c2f886c445b78113bf1e5849f1fce4124a7 4cdd0bb4537f9617e9efcfef6b9454fcefe2ff08 2025-09-25T17:22:55+08:00 junchao-zhao ggml : fix loongarch lsx compilation error (#15864)
4cdd0bb4537f9617e9efcfef6b9454fcefe2ff08 b5bd037832bcb8ed3086dfe26ce9090bea989af1 2025-09-25T11:12:27+02:00 Johannes Gäßler docs: fix typo [no ci] (#16244)
b5bd037832bcb8ed3086dfe26ce9090bea989af1 dfcd53f7ecb9bb897a9d752d09c59d10be47237a 2025-09-25T03:53:09-05:00 Douglas Hanley llama : add support for qwen3 reranker (#15824)
dfcd53f7ecb9bb897a9d752d09c59d10be47237a 4ea00794b8c995b6deaf4bac159c1778dc27419a 2025-09-25T11:30:16+03:00 Georgi Gerganov metal : fuse NORM + MUL + ADD, support non-multiples of 4 (#16220)
4ea00794b8c995b6deaf4bac159c1778dc27419a 02a6a82ae7c7ddd1819ae26b0cc36675879aecee 2025-09-25T11:29:42+03:00 Georgi Gerganov metal : relax reorder conditions (#16216)
02a6a82ae7c7ddd1819ae26b0cc36675879aecee c498fc82fe5b83fc8c6e1627286bdc1f93caddbf 2025-09-25T11:29:08+03:00 Georgi Gerganov metal : restore im2col perf (#16219)
c498fc82fe5b83fc8c6e1627286bdc1f93caddbf e7a5130a20cf45a3358308356c249734ca982143 2025-09-25T10:20:02+03:00 Radoslav Gerganov rpc : use ggml logging facilities
e7a5130a20cf45a3358308356c249734ca982143 bee378e0988b44bbe93b0768208080951b312363 2025-09-25T13:06:30+08:00 Aaron Teo codeowners: add ownership of zdnn backend [no ci] (#16232)
bee378e0988b44bbe93b0768208080951b312363 5fb557653b8756ac2b6c6a102b1e44abcadf552f 2025-09-25T05:06:06Z Eve ci: run the x64 and arm ci on the github machines instead (#16183)
5fb557653b8756ac2b6c6a102b1e44abcadf552f 4ae88d07d026e66b41e85afece74e88af54f4e66 2025-09-25T11:36:30+08:00 Aaron Teo devops: fix s390x docker release failure (#16231)
4ae88d07d026e66b41e85afece74e88af54f4e66 e789095502b337690c7616db32d7c679a5bd2533 2025-09-25T00:25:04+08:00 Aaron Teo codeowners: add ownership of zdnn backend [no ci] (#16229)
e789095502b337690c7616db32d7c679a5bd2533 f2a789e33490deb483a2694b066b37e45524bb79 2025-09-24T16:53:48+02:00 Johannes Gäßler llama: print memory breakdown on exit (#15860)
f2a789e33490deb483a2694b066b37e45524bb79 3a599719673c850647e3bb911ed6d91109bb91d2 2025-09-24T16:17:49+02:00 Acly ggml : split graph allocations according to backend max buffer size (#15815)
3a599719673c850647e3bb911ed6d91109bb91d2 63b54c81a620981be020184ab99e63a8e50e47cb 2025-09-24T13:42:26+02:00 Tarek Dakhran model : add label for LiquidAI LFM2-2.6B model (#16204)
63b54c81a620981be020184ab99e63a8e50e47cb 152729f8848b692e1ae53c197ccca92ef10a523b 2025-09-24T16:25:26+08:00 Jie Fu (傅杰) model-conversion : make causal-verify-logits fails with model names containing "." (#16215)
152729f8848b692e1ae53c197ccca92ef10a523b c0c59c1157b5aeded285a3b25d2463c866f583d3 2025-09-24T08:53:47+02:00 Uilian Ries common : add missing chrono header for common.cpp (#16211)
c0c59c1157b5aeded285a3b25d2463c866f583d3 7735706b939847df2c6c00b44c36f95a20137c61 2025-09-24T08:53:20+02:00 Sigbjørn Skjæret codeowners : match all requirements files (#16214)
7735706b939847df2c6c00b44c36f95a20137c61 4d9ea03d170cf504a40bf3a85788af84cccaee80 2025-09-24T14:46:52+08:00 Jie Fu (傅杰) model-conversion : run-org-model.py fails to run on mac m1 (#16213)
4d9ea03d170cf504a40bf3a85788af84cccaee80 8ba548dae251f8f2e3834ed5226b76b6e4f4a485 2025-09-24T08:10:09+02:00 Daniel Bevenius codeowners : use slash prefix for root files [no ci] (#16210)
8ba548dae251f8f2e3834ed5226b76b6e4f4a485 f505bd83ca7a43c4585ff3d59135e77eae9c793b 2025-09-24T12:19:23+08:00 Jie Fu (傅杰) model-conversion : fix the make targets in the README.md (#16209)
f505bd83ca7a43c4585ff3d59135e77eae9c793b 0889589dbe8c67dd518c58a57afbb02dde2dccbe 2025-09-23T20:41:40+03:00 Georgi Gerganov ci : disable AMD workflows + update NVIDIA workflows (#16200)
0889589dbe8c67dd518c58a57afbb02dde2dccbe 4e29084ba4104c4ea529fd3163bb6e76f64383df 2025-09-23T13:44:25+03:00 Georgi Gerganov ci : enable Vulkan workflow on Mac (#16194)
4e29084ba4104c4ea529fd3163bb6e76f64383df f6b4af3d04763b1e0130f5b5fce19c4bc6f83f1c 2025-09-23T01:58:12-07:00 Xiangyan Sun ggml-cpu: Respect cpumask settings (#16164)
f6b4af3d04763b1e0130f5b5fce19c4bc6f83f1c 264f1b51872c125e23fa0ac1da5e2a1170de9a08 2025-09-23T10:25:20+02:00 Sigbjørn Skjæret ggml : fix uninitialized is_on_grid in quantize_row_iq3_xxs_impl (#15928)
264f1b51872c125e23fa0ac1da5e2a1170de9a08 0bc7cc715472fe28822e57f036f0746592ed2c04 2025-09-23T14:53:05+08:00 Aaron Teo zdnn: refactor codebase + add docs (#16178)
0bc7cc715472fe28822e57f036f0746592ed2c04 4b9f4cb0f89a88de4bdf97727d0457b0c648804c 2025-09-23T08:13:22+02:00 Daniel Bevenius codeowners : add @danbev to model-conversion example [no ci] (#16190)
4b9f4cb0f89a88de4bdf97727d0457b0c648804c 85e72271ba1ce78adf34fd8997803c991e617ca6 2025-09-23T13:59:34+08:00 Aaron Teo devops: add s390x containers (#15915)
85e72271ba1ce78adf34fd8997803c991e617ca6 1d0125bcf1cbd7195ad0faf826a20bc7cec7d3f4 2025-09-23T05:59:03+02:00 Daniel Bevenius ggml-cpu : fix typo in gemm comments [no ci] (#16189)
1d0125bcf1cbd7195ad0faf826a20bc7cec7d3f4 351f3da39c85f59d581fc184f09283da7f099a3b 2025-09-22T12:40:10-06:00 Gabe Goodhart feat: Add conversion support in GraniteHybrid for non-hybrid (all attn) (#16177)
351f3da39c85f59d581fc184f09283da7f099a3b 3ecb2f671a2f49d56357f99d135a94e841759178 2025-09-23T01:57:46+08:00 Haiyue Wang clang-tidy : disable warning about performance enum size (#16127)
3ecb2f671a2f49d56357f99d135a94e841759178 432cf4304c5379bfbd1f3feed65ec205955b2f4b 2025-09-22T19:13:00+02:00 Sigbjørn Skjæret ggml : implement set_rows with i32 index (#16159)
432cf4304c5379bfbd1f3feed65ec205955b2f4b 37a23c17bdc9c99c9c6ad41168e4ced3724b72cd 2025-09-22T18:20:21+03:00 Georgi Gerganov codeowners : update + cleanup (#16174)
37a23c17bdc9c99c9c6ad41168e4ced3724b72cd 138c87ce8bd558b2cc134ada7316a3dad8eb67ac 2025-09-22T14:13:51+02:00 Adrien Gallouët common : enable `--offline` mode without curl support (#16137)
138c87ce8bd558b2cc134ada7316a3dad8eb67ac c6db9a10278f40b4b8d3f6931728f2cce2356daa 2025-09-22T10:53:13+02:00 Quentin Bramas webui : fix handling incomplete chunks (#16107)
c6db9a10278f40b4b8d3f6931728f2cce2356daa d05affbab7d1364fa7ac06c03cd33f03235ae840 2025-09-22T10:49:58+02:00 GideonSerf embedding : fix typos in README (#16171)
d05affbab7d1364fa7ac06c03cd33f03235ae840 4f324a556caa5be0be2261604ef4aab0faf36eb8 2025-09-22T16:48:42+08:00 Haiyue Wang common : remove unused local variables (#16140)
4f324a556caa5be0be2261604ef4aab0faf36eb8 a71ae3ba7a857394103f12e30b387c48242c84f2 2025-09-22T11:12:37+03:00 Georgi Gerganov ggml : extend ggml_can_fuse to work with non-sequential nodes (#16123)
a71ae3ba7a857394103f12e30b387c48242c84f2 05a2458121f9cdcc98ea6ffeeab6f23023136266 2025-09-22T11:12:09+03:00 Georgi Gerganov ggml : add ggml_op_is_empty (#16122)
05a2458121f9cdcc98ea6ffeeab6f23023136266 96fdca043be8fa733bbd59868a75517f92633376 2025-09-22T15:10:58+07:00 Xuan-Son Nguyen codeowners : update ownership for @ngxson and @allozuar (#16128)
96fdca043be8fa733bbd59868a75517f92633376 b2d980fce063fa3591c59ad50b946c8da66c294f 2025-09-22T17:04:01+09:00 Shin-myoung-serp Vulkan: add conv_transpose_2d operation (#16022)
b2d980fce063fa3591c59ad50b946c8da66c294f 5c6106a696af2b00ce01d14ba525979d5a32b199 2025-09-22T09:59:05+02:00 Sigbjørn Skjæret codeowners : claim responsibility for ci, models, gguf-py and convert (#16124)
5c6106a696af2b00ce01d14ba525979d5a32b199 ec65fb52f0cc890e5085a6c5995ab08a156265fb 2025-09-22T10:58:02+03:00 Georgi Gerganov contrib : update roles (#16113)
ec65fb52f0cc890e5085a6c5995ab08a156265fb 1d660d2fae42ea2e1d3569638e722bf7a37b6b19 2025-09-22T10:16:05+03:00 Georgi Gerganov ci : remove vulkaninfo calls (#16169)
1d660d2fae42ea2e1d3569638e722bf7a37b6b19 a20d810d79adfbf82e0eb703af6f27a0e2d1a539 2025-09-22T09:11:39+03:00 Georgi Gerganov ci : use smaller model (#16168)
a20d810d79adfbf82e0eb703af6f27a0e2d1a539 4d0a7cbc617e384fc355077a304c883b5c7d4fb6 2025-09-22T00:37:17-05:00 Jeff Bolz vulkan: add RTE variants of exp shader (#16165)
4d0a7cbc617e384fc355077a304c883b5c7d4fb6 9073a73d82a916cea0809de225ef5175c3a86e91 2025-09-22T08:31:40+03:00 Georgi Gerganov ci : adjust params for less runtime (#16167)
9073a73d82a916cea0809de225ef5175c3a86e91 51f5a45fbe575dcd54bdd2a339ef8e8424d1c12a 2025-09-22T07:22:43+02:00 Ruben Ortlam vulkan: vec dot matrix multiplication fix (#16151)
51f5a45fbe575dcd54bdd2a339ef8e8424d1c12a c4510dc9374e17dcb8726902ab5216067a92b3d3 2025-09-21T16:42:10-07:00 lhez opencl: fix concat crash on win arm64 with Adreno (#15944)
c4510dc9374e17dcb8726902ab5216067a92b3d3 da30ab5f8696cabb2d4620cdc0aa41a298c54fd6 2025-09-21T14:48:44-07:00 lhez opencl: initial `q8_0` mv support (#15732)
da30ab5f8696cabb2d4620cdc0aa41a298c54fd6 28baac9c9f491c872e2c37762d3bd90446b005e9 2025-09-21T19:00:27+03:00 Georgi Gerganov ci : add label for the RISC-V runner (#16150)
28baac9c9f491c872e2c37762d3bd90446b005e9 1eeb523c3e0c7ffbd59469f5463dcbdecba3535e 2025-09-21T16:50:45+03:00 Georgi Gerganov ci : migrate ggml ci to self-hosted runners (#16116)
1eeb523c3e0c7ffbd59469f5463dcbdecba3535e 5bb4a3edec297e74b0f7bd4ed5d0fdd12e28d858 2025-09-21T08:31:55+02:00 Giuseppe Scrivano vulkan: optimize UMA buffer operations and fix driver hangs (#16059)
5bb4a3edec297e74b0f7bd4ed5d0fdd12e28d858 7f766929ca8e8e01dcceb1c526ee584f7e5e1408 2025-09-21T01:23:37-05:00 Jeff Bolz vulkan: fix validation error about VK_PIPELINE_CREATE_CAPTURE_STATISTICS_BIT_KHR (#16086)
7f766929ca8e8e01dcceb1c526ee584f7e5e1408 405921dcefdd4e90ed948a4bf179007c2fa92b2d 2025-09-20T12:55:47+03:00 Georgi Gerganov sync : ggml
405921dcefdd4e90ed948a4bf179007c2fa92b2d fa6383ca7e7ccb8ca3bdfeb37e348ddc4113aa26 2025-09-16T06:16:52+02:00 Daniel Bevenius ggml : introduce semantic versioning (ggml/1336)
fa6383ca7e7ccb8ca3bdfeb37e348ddc4113aa26 803dac2e48ef3ba26a504eb27c4e77ec2d21f7d0 2025-09-10T17:21:11+02:00 Gregor Jasny CUDA : conditionally add cuda architectures (ggml/1341)
803dac2e48ef3ba26a504eb27c4e77ec2d21f7d0 459c0c2c1a400f960d7b8e8d94d31a8426f80986 2025-09-20T10:42:56+02:00 Ruben Ortlam vulkan: use vec dot for matrix matrix multiplications (#16056)
459c0c2c1a400f960d7b8e8d94d31a8426f80986 be79d9fdd95ab8955527c4aaa67b90e8b9516718 2025-09-20T07:56:30+02:00 Benni server: fix SSE and OpenAI compatibility for error messages when streaming (#16109)
be79d9fdd95ab8955527c4aaa67b90e8b9516718 f432d8d83e7407073634c5e4fd81a3d23a10827f 2025-09-19T15:15:21-07:00 ssweens llama-bench: add --devices and --list-devices support (#16039)
f432d8d83e7407073634c5e4fd81a3d23a10827f 4067f07fc5aa5722b87db303b561597004696f6c 2025-09-20T00:57:30+09:00 shun095 chat: Fix streaming parser for granite models (#15682)
4067f07fc5aa5722b87db303b561597004696f6c 4b8560ab56fdd9819358b47c338bbc8ec357c57e 2025-09-19T09:52:27+02:00 Aleksander Grygier feat: Improve mobile UI for Settings Dialog (#16084)
4b8560ab56fdd9819358b47c338bbc8ec357c57e 0dd58b6877f3dc106593d6bc68d98305f553c566 2025-09-19T13:02:51+07:00 Xuan-Son Nguyen chat : fix build on arm64 (#16101)
0dd58b6877f3dc106593d6bc68d98305f553c566 69ffd891631befa9e6b485fd646a16dab4f2c007 2025-09-19T11:31:56+07:00 Xuan-Son Nguyen ggml : refactor forward_dup for cpu backend (#16062)
69ffd891631befa9e6b485fd646a16dab4f2c007 246c0d9c795fb25da8268625d597580155a3672f 2025-09-18T23:07:26+02:00 Adrien Gallouët ggml-amx : fix ggml_amx_init() on generic Linux (#16049)
246c0d9c795fb25da8268625d597580155a3672f 3edd87cd055a45d885fa914d879d36d33ecfc3e1 2025-09-18T23:07:18+02:00 Adrien Gallouët cmake : fix static linking for OpenMP on Unix-like systems (#16031)
3edd87cd055a45d885fa914d879d36d33ecfc3e1 c0b45097c33e2667a94444f08cc9e36bec0a5e2e 2025-09-18T12:03:34-07:00 Shawn Gu opencl: optimize mxfp4 kernels (#16037)
c0b45097c33e2667a94444f08cc9e36bec0a5e2e 38dbdf4c057515ccea9bec0ca2518f86d5e4d28e 2025-09-18T13:46:17-05:00 Jeff Bolz rename optimize_graph to graph_optimize (#16082)
38dbdf4c057515ccea9bec0ca2518f86d5e4d28e 368560a1e3b9a3bc83af741b0b2bc9e46fb420d2 2025-09-18T11:26:03-07:00 Bowen Han CUDA: Optimize PAD_REFLECT_1D (#15957)
368560a1e3b9a3bc83af741b0b2bc9e46fb420d2 4ca088b036313c2d8e682f4cfeb7c29edd85d0b9 2025-09-18T19:28:32+02:00 Johannes Gäßler CUDA: fix compilation on CC 6.0 (#16091)
4ca088b036313c2d8e682f4cfeb7c29edd85d0b9 703f9e32c4eb3166f8d63007c26e31a1466c21af 2025-09-18T16:22:50+01:00 Eric Curtin Add resumable downloads for llama-server model loading (#15963)
703f9e32c4eb3166f8d63007c26e31a1466c21af ad6bd9083bc346afd4ecd2fbb83e0306c0141c99 2025-09-18T16:28:41+03:00 Georgi Gerganov metal : use function constants for mul_mv_ext kernels (#16074)
ad6bd9083bc346afd4ecd2fbb83e0306c0141c99 2b6b55a59f590a1e1eb2dcd09d5b8b6feb9cc748 2025-09-18T13:28:22+02:00 Sigbjørn Skjæret cuda : add missing F32<->I32 entries in ggml_cuda_cpy_fn (#16060)
2b6b55a59f590a1e1eb2dcd09d5b8b6feb9cc748 e58174cecbc45bf79bf653cd2c984395940c6ef4 2025-09-18T13:36:57+03:00 Radoslav Gerganov server : include usage statistics only when user request them (#16052)
e58174cecbc45bf79bf653cd2c984395940c6ef4 b213fce89bee8cb56b587b91e15a4278f8ed0180 2025-09-18T12:47:56+03:00 Georgi Gerganov llama : bump max seq limit from 64 to 256 (#15916)
b213fce89bee8cb56b587b91e15a4278f8ed0180 e00f3fd8fff2cf5a8c8c9f475034bd089c8bcce4 2025-09-18T12:33:45+03:00 Georgi Gerganov metal : improve F32, F16 and BF16 mat-vec multiplication (#16057)
e00f3fd8fff2cf5a8c8c9f475034bd089c8bcce4 f2f28380ea68939c0481df3e4216b698824a59df 2025-09-18T15:06:48+08:00 Jhen-Jie Hong metal : avoid call free for non-owned buffer (#16067)
f2f28380ea68939c0481df3e4216b698824a59df 62c3b645c56ad5288aa401901f043b050edac5a2 2025-09-18T10:03:24+03:00 Georgi Gerganov metal : handle nil cv during pipeline creation (#16065)
62c3b645c56ad5288aa401901f043b050edac5a2 d304f459d8619399eb232b1e3689379306f439d3 2025-09-18T09:26:33+08:00 Chenguang Li CANN: Remove print (#16044)
d304f459d8619399eb232b1e3689379306f439d3 0320ac5264279d74f8ee91bafa6c90e9ab9bbb91 2025-09-17T13:09:40-07:00 Reese Levine GGML WebGPU: Support for ADD, MUL, RMS_NORM, GET_ROWS operators (#16018)
0320ac5264279d74f8ee91bafa6c90e9ab9bbb91 a7a98e0fffed794396b3fbad4dcdbbc184963645 2025-09-17T20:38:12+03:00 Georgi Gerganov metal : refactor + optimize v2 (#15995)
a7a98e0fffed794396b3fbad4dcdbbc184963645 8f8f2274ee3601fecf6e2d57b52f701c81bede21 2025-09-17T19:29:13+02:00 Aleksander Grygier SvelteKit-based WebUI (#14839)
8f8f2274ee3601fecf6e2d57b52f701c81bede21 c959b676be29e93f8dbc3bd6056ceba812a9eb72 2025-09-18T00:18:21+07:00 Xuan-Son Nguyen convert : add Llama4ForCausalLM (#16042)
c959b676be29e93f8dbc3bd6056ceba812a9eb72 cd08fc3ecc0264b4414b68af3874a6c689ed60c1 2025-09-17T15:32:42+02:00 Johannes Gäßler CUDA: fix FA occupancy, optimize tile kernel (#15982)
cd08fc3ecc0264b4414b68af3874a6c689ed60c1 cb5bb6cc05119c24e7711ca2956cd0e6d409d396 2025-09-17T01:08:02-07:00 David Ribeiro Alves common : Fix corrupted memory error on json grammar initialization (#16038)
cb5bb6cc05119c24e7711ca2956cd0e6d409d396 a91d035b901e8a9edf810f63d130ee49adf27be2 2025-09-17T07:35:37Z Eve vulkan: automatically remove unsupported devices (#15976)
a91d035b901e8a9edf810f63d130ee49adf27be2 745cbcf2fe1eb88f8db615ac622f0b944d924ad6 2025-09-17T09:34:09+02:00 Daniel Bevenius ci : revert back to macos-13 for macOS-latest-cmake-x64 (#16040)
745cbcf2fe1eb88f8db615ac622f0b944d924ad6 1cbd80f8cf80a817715b1ccc5680fe2a3c5172c8 2025-09-17T15:30:55+08:00 Jie Fu (傅杰) llama-quant : fix the verification of attention layers for encoder-decoder models (#16023)
1cbd80f8cf80a817715b1ccc5680fe2a3c5172c8 85286f354813056f6c835046c0acfa3bf6ba9432 2025-09-17T15:29:00+08:00 Jie Fu (傅杰) examples : support encoder-decoder models in the simple example (#16002)
85286f354813056f6c835046c0acfa3bf6ba9432 d5fabe3682de515fd09d6c981f7a0d1b75614455 2025-09-17T00:01:58-07:00 Shane A model : add OLMo3 support (#16015)
d5fabe3682de515fd09d6c981f7a0d1b75614455 8ff206097c2bf3ca1c7aa95f9d6db779fc7bdd68 2025-09-17T14:33:08+08:00 Chenguang Li CANN: Optimize ggml_cann_set_device (#15935)
8ff206097c2bf3ca1c7aa95f9d6db779fc7bdd68 77475530b8bbea3bf578632507e1284cdfe2c8c0 2025-09-16T16:17:08+02:00 jacekpoplawski llama-bench: add --n-cpu-moe support (#15952)
77475530b8bbea3bf578632507e1284cdfe2c8c0 3913f8730ec6d6245480affc30ae3049107956f4 2025-09-16T15:27:52+02:00 Daniel Bevenius ci : use macos-latest for arm64 webgpu build (#16029)
3913f8730ec6d6245480affc30ae3049107956f4 76888d202ed2b835ae19ea9f9db6baf39e419297 2025-09-16T15:25:57+02:00 Daniel Bevenius ggml : fix padding in timestep embedding kernels (#15932)
76888d202ed2b835ae19ea9f9db6baf39e419297 f1fbffb5c0b34b2a68febb7da3fd0f8333f1ed4c 2025-09-16T13:41:38+02:00 Daniel Bevenius ci : upload xcframework artifact from ios-xcode-build job (#16010)
f1fbffb5c0b34b2a68febb7da3fd0f8333f1ed4c 51abc96bdc52ba8cd6ad78dcf12ed9a041d7b442 2025-09-15T23:59:19-07:00 Bowen Han fix: apply clang-format to CUDA macros (#16017)
51abc96bdc52ba8cd6ad78dcf12ed9a041d7b442 07808ebb07e2b1aa19032705e332679ddf967614 2025-09-16T05:57:16+02:00 Daniel Bevenius ci : update macos-latest* jobs to use macos-latest (#15938)
07808ebb07e2b1aa19032705e332679ddf967614 6d758839ff741d4966ca92b7f801b7a8b5b96364 2025-09-15T22:54:44-04:00 Yuri Khrustalev cmake : Do not install tools on iOS targets (#15903)
6d758839ff741d4966ca92b7f801b7a8b5b96364 3d4053f77f0f78ee2b791088c02af653ebee42dd 2025-09-16T10:38:28+08:00 Aman Gupta Add LLaDA-7b-MoE diffusion model (#16003)
3d4053f77f0f78ee2b791088c02af653ebee42dd dc381aa9a6dc45f00673471d34b8bddd30e77570 2025-09-15T16:28:31-06:00 Jake Karnes CUDA: fix im2col_3d to respect non-contiguous inputs (views) (#15956)
dc381aa9a6dc45f00673471d34b8bddd30e77570 10d197409bd9537ff302ad09966fe406882fef9d 2025-09-15T14:38:52-07:00 Diego Devesa docker : enable rocWMMA in ROCm images, add gfx1151 (#15997)
10d197409bd9537ff302ad09966fe406882fef9d b907255f4bd169b0dc7dca9553b4c54af5170865 2025-09-15T14:38:42-07:00 Diego Devesa releases : switch to rocWMMA develop branch, add gfx1151 (#15992)
b907255f4bd169b0dc7dca9553b4c54af5170865 28c39da7c645185ade5436767929d7ec33006033 2025-09-15T19:51:35+03:00 yael-works SYCL: Add COUNT_EQUAL operator support (#15991)
28c39da7c645185ade5436767929d7ec33006033 106220562aca42b6738b8f51acfce0db1b8a2fb6 2025-09-15T13:08:30+03:00 Nikolay Popov llama-run: Fix model download on Windows (#15988)
106220562aca42b6738b8f51acfce0db1b8a2fb6 a68f31edd71cc39141113f05f7133a3e9ece8c61 2025-09-15T17:35:11+08:00 Aman Gupta CUDA: some micro-optimizations in mmf.cuh for mul_mat_id (#15926)
a68f31edd71cc39141113f05f7133a3e9ece8c61 b8e09f08b9a91c0401bc67d17a17c90756420346 2025-09-15T02:54:57-05:00 ddh0 fix KLD percentile output (#15999)
b8e09f08b9a91c0401bc67d17a17c90756420346 6c019cb04e86e2dacfe62ce7666c64e9717dde1f 2025-09-14T23:00:59+02:00 Sigbjørn Skjæret model : add grok-2 support (#15539)
6c019cb04e86e2dacfe62ce7666c64e9717dde1f 9dcd200d57bc6f05a59a6a8df361d5d183af4124 2025-09-14T21:17:04+02:00 Sigbjørn Skjæret server : only attempt to enable thinking if using jinja (#15967)
9dcd200d57bc6f05a59a6a8df361d5d183af4124 0fa154e3502e940df914f03b41475a2b80b985b0 2025-09-14T22:02:32+03:00 Georgi Gerganov metal : remove memory pools (#15966)
0fa154e3502e940df914f03b41475a2b80b985b0 261e6a20ffdb79c4875e674b4f6b514bc73cff8f 2025-09-15T04:43:54+10:00 Adam rocm.Dockerfile: added gfx1200,gfx1201 architectures to support AMD Radeon RX 9000 series (#15994)
261e6a20ffdb79c4875e674b4f6b514bc73cff8f a0e13dcbe5bae7025660349ef3e4ead060e507f2 2025-09-14T16:56:28+02:00 Ruben Ortlam Vulkan: Clean up mul_mm shader (#15987)
a0e13dcbe5bae7025660349ef3e4ead060e507f2 a14bd350141fb42b8bf2dd2342cebc27bfdce399 2025-09-14T22:20:35+08:00 lcy build: fix the build failures of Windows HIP release job (#15984)
a14bd350141fb42b8bf2dd2342cebc27bfdce399 918b26f197f55d5d562446dfc876d0e637929d07 2025-09-14T15:33:22+03:00 Georgi Gerganov metal : fix kernel requirements (#15983)
918b26f197f55d5d562446dfc876d0e637929d07 9ecb88434644c865232bb665d2f6f05049fc6456 2025-09-14T12:28:18+03:00 Radoslav Gerganov rpc : fix regression when --device is used (#15981)
9ecb88434644c865232bb665d2f6f05049fc6456 d1c6f11f47bae063a68a6be8e4830c060a11b7bd 2025-09-14T02:21:59-07:00 Diego Devesa releases : update ROCM, add gfx1200, gfx1201, gfx1151 (#15972)
d1c6f11f47bae063a68a6be8e4830c060a11b7bd 6380d6a3e709cb02a8695afdd96b40e674477332 2025-09-14T12:10:07+03:00 Radoslav Gerganov doc : update documentation for --tensor-split (#15980)
6380d6a3e709cb02a8695afdd96b40e674477332 aa0c461efe3603639af1a1defed2438d9c16ca0f 2025-09-14T13:37:03+08:00 Aaron Teo ggml-zdnn: rm user mapped buffers (#15965)
aa0c461efe3603639af1a1defed2438d9c16ca0f b9c9c9f789cd57fb0b28b25223305613cd90fa10 2025-09-13T16:29:43+01:00 Jeff Bolz vulkan: fix failing dequant shaders (#15862)
b9c9c9f789cd57fb0b28b25223305613cd90fa10 50f4281a6f5c3a5d68bdeb12f904fa01e0e2ba91 2025-09-13T16:23:30+01:00 Jeff Bolz vulkan: initialize vulkan-hpp to allow using extension function pointers (#15705)
50f4281a6f5c3a5d68bdeb12f904fa01e0e2ba91 55758b00cae1451a0d789c50a5eb8c9bee42b9a0 2025-09-13T07:49:49-07:00 Diego Devesa llama : allow using iGPUs with --device (#15951)
55758b00cae1451a0d789c50a5eb8c9bee42b9a0 f161463a54d9f93d41246286aa4a9569a91d804d 2025-09-13T16:24:22+03:00 Georgi Gerganov metal : refactor kernel loading (#15964)
f161463a54d9f93d41246286aa4a9569a91d804d 84d7b2fca11d1be118ce776f6d72a486c4883b74 2025-09-13T13:54:28+03:00 Georgi Gerganov metal : allow ops to run concurrently (#15929)
84d7b2fca11d1be118ce776f6d72a486c4883b74 40be51152d4dc2d47444a4ed378285139859895b 2025-09-13T12:45:04+03:00 Georgi Gerganov metal : fix memory leaks (#15962)
40be51152d4dc2d47444a4ed378285139859895b 4bf5549269d99bac936a65892da2312cc71b2421 2025-09-13T02:39:52+08:00 Aaron Teo ggml-zdnn: fix #15414, activate FP16 and BF16 acceleration and incorrect zTensor free (#15839)
4bf5549269d99bac936a65892da2312cc71b2421 f4e664f838cc65d89fa845c48c372e43852112e4 2025-09-12T16:31:50+01:00 Eric Curtin Add docker protocol support for llama-server model loading (#15790)
f4e664f838cc65d89fa845c48c372e43852112e4 f088b6a84f6aed0abb619dbb9d375e726fc888a6 2025-09-12T23:16:32+08:00 Haiyue Wang context : remove redundant explicit casting to the same type (#15948)
f088b6a84f6aed0abb619dbb9d375e726fc888a6 304ac5693d1e2124f83e0584bc5eea6311d3d3b4 2025-09-12T17:02:55+03:00 Georgi Gerganov server : adjust prompt similarity thold + add logs (#15913)
304ac5693d1e2124f83e0584bc5eea6311d3d3b4 6c88ad8fa741a2182a2dcf8c5353ae4b5c66e656 2025-09-12T13:24:21+02:00 Ruben Ortlam Vulkan iGPU device selection overhaul and PCI ID API support (#15947)
6c88ad8fa741a2182a2dcf8c5353ae4b5c66e656 704d90c987cdf00751567b2088c4e54742aa2d3f 2025-09-12T09:06:20+02:00 Mathieu Baudier vulkan: Make device memory check more portable (#15939)
704d90c987cdf00751567b2088c4e54742aa2d3f 360d6533db39e11577afe9b0aece20c6b5ddaf1f 2025-09-12T09:15:12+08:00 Neo Zhang Jianyu Revert "sycl: add usage of enqueue_functions extension (#14244)" (#15910)
360d6533db39e11577afe9b0aece20c6b5ddaf1f 0e6ff0046f4a2983b2c77950aa75960fe4b4f0e2 2025-09-11T13:47:38-07:00 Diego Devesa ggml-backend : add GGML_BACKEND_DEVICE_TYPE_IGPU device type (#15797)
0e6ff0046f4a2983b2c77950aa75960fe4b4f0e2 df082f56309073ecf885eceaa21b86e8a487e61b 2025-09-11T21:19:58+02:00 Johannes Gäßler CUDA: larger SRAM reads for tile FA, AMD FP16 dot (#15927)
df082f56309073ecf885eceaa21b86e8a487e61b 24a6734daf6932ff29ba8c1ff0245c51d76f783e 2025-09-11T12:12:34-05:00 ddh0 nitpick : correct MB to MiB (#15934)
24a6734daf6932ff29ba8c1ff0245c51d76f783e 2b3efea9a4d91216850856fbb77075db26f6a6eb 2025-09-11T15:39:12+02:00 Daniel Bevenius ggml-cpu : add check for ARM MATMUL_INT8/i8mm support (#15922)
2b3efea9a4d91216850856fbb77075db26f6a6eb c0389dba43d50695f9d3f57dd1f1a14cbefc100c 2025-09-11T12:45:40+02:00 Charles Xu kleidiai: fix GGML_ASSERT(*cur_backend_id != -1) failed (#15614)
c0389dba43d50695f9d3f57dd1f1a14cbefc100c 00681dfc16ba4cebb9c7fbd2cf2656e06a0692a4 2025-09-11T15:59:37+08:00 hipudding CANN: Disable acl_graph for prefill stage (#15933)
00681dfc16ba4cebb9c7fbd2cf2656e06a0692a4 4f658855fa8f2e42b7ed9a5b298fa39a2e39b096 2025-09-10T22:04:03+02:00 Oliver Simons CUDA: Add `fastdiv` to `k_bin_bcast*`, giving 1-3% E2E performance (#15872)
4f658855fa8f2e42b7ed9a5b298fa39a2e39b096 6ab397e12ba8e9f776341cdae68f7ffb2f8d2cde 2025-09-11T02:51:51+08:00 Jie Fu (傅杰) llama : support T5 models with unequal number of encoder-decoder layers (#15909)
6ab397e12ba8e9f776341cdae68f7ffb2f8d2cde 9de447d94e1ae9d1a36e5a2e5bf47483352c0d9c 2025-09-10T19:08:59+02:00 Sigbjørn Skjæret graph : support non-contiguous Q in build_attn_mha (#15908)
9de447d94e1ae9d1a36e5a2e5bf47483352c0d9c 0f0a3c2851134d49955f3c85afbb0b1bb47c3e07 2025-09-10T17:31:40+02:00 Daniel Bevenius ggml-cpu : fix padding in ggml_timestep_embedding (#15917)
0f0a3c2851134d49955f3c85afbb0b1bb47c3e07 33daece86b65607451d0d4378d2d04ba6a20ad55 2025-09-10T17:52:35+03:00 Georgi Gerganov metal : make the backend async (#15906)
33daece86b65607451d0d4378d2d04ba6a20ad55 e7b6d83b524bbc24a1343d862de6dba8e8eddbd6 2025-09-10T15:39:57+02:00 Daniel Bevenius ci : add caching for ROCm installation in release workflow (#15924)
e7b6d83b524bbc24a1343d862de6dba8e8eddbd6 2cfef4d117d67ab1dec002915b48a15d11ee1973 2025-09-10T14:17:09+02:00 Daniel Bevenius tests : filter out no-ops from coverage report (#15900)
2cfef4d117d67ab1dec002915b48a15d11ee1973 09e72a037c77b6823fde9e1e4cf28e815b9c41ab 2025-09-10T12:51:28+01:00 j-k media : add transparent icon svg and png [no ci] (#15891)
09e72a037c77b6823fde9e1e4cf28e815b9c41ab 10d8b2b6b0ac2cae252a80b4daea5da55ab63c2f 2025-09-10T07:28:47-04:00 Jesse gitignore : Ignore vim swap files in tests (#15901)
10d8b2b6b0ac2cae252a80b4daea5da55ab63c2f 28b5f190ef1dbea5edf82dbc8b4407b721fadd13 2025-09-10T18:42:00+08:00 Chenguang Li CANN: Add ROPE sin/cos cache for reuse (#15912)
28b5f190ef1dbea5edf82dbc8b4407b721fadd13 86587da03bd78df8f4e7d8b111a0c1d2494d6ed0 2025-09-10T15:29:12+08:00 Chenguang Li CANN: implement LRU cache for ACL graphs (#15814)
86587da03bd78df8f4e7d8b111a0c1d2494d6ed0 ff02caf9eed261423289d1531a56536fbf57bfc2 2025-09-10T05:33:58+02:00 Daniel Bevenius llama : check returned fn ptrs from ggml_backend_reg_get_proc_address (#15893)
ff02caf9eed261423289d1531a56536fbf57bfc2 ae355f6f7108540297d8b7f7ae71d20fe610a0b7 2025-09-10T05:23:19+02:00 Daniel Bevenius ci : cache ROCm installation in windows-latest-cmake-hip (#15887)
ae355f6f7108540297d8b7f7ae71d20fe610a0b7 4f63cd705c7b6f457f36c63fdc053e07f6f3cc6b 2025-09-09T22:26:03+02:00 Ruben Ortlam vulkan: throw the oom error instead of no memory type found (#15905)
4f63cd705c7b6f457f36c63fdc053e07f6f3cc6b 17bc5a815f0bebc1844c99796760cd7df5e9b8d9 2025-09-09T07:41:15-05:00 Jeff Bolz vulkan: Fix OOB accesses in soft_max_back (#15861)
17bc5a815f0bebc1844c99796760cd7df5e9b8d9 ed54e32558ffe0f2c3b1d31f3227211fae05bd49 2025-09-09T14:04:43+02:00 Johannes Gäßler HIP: use v_dot2_f32_f16 instruction for FA (#15884)
ed54e32558ffe0f2c3b1d31f3227211fae05bd49 a972faebed5fdc4a3d2a844d92d476058c02e02d 2025-09-09T15:01:15+03:00 lksj92hs Workaround for subgroup arithmetic failing on MoltenVK with AMD GPUs (issue 15846) (#15886)
a972faebed5fdc4a3d2a844d92d476058c02e02d 550cf726e133fd0a069d991287fd3a2a3e3e1cbd 2025-09-09T14:38:02+08:00 Aman Gupta CUDA: Add mul_mat_id support for the mmf kernel (#15767)
550cf726e133fd0a069d991287fd3a2a3e3e1cbd c252ce67c4b99f056eeb18d42a289e28fee03475 2025-09-09T08:11:01+02:00 Johannes Gäßler CUDA: fix GET_ROWS for large tensors (#15882)
c252ce67c4b99f056eeb18d42a289e28fee03475 70cd37dbbebdb7a2f84f08207f18eabb0b291a55 2025-09-09T08:42:10+03:00 Georgi Gerganov contrib : add notes about merging PRs (#15881)
70cd37dbbebdb7a2f84f08207f18eabb0b291a55 acc1b008cfd95e63d5f99a370dbffb98e5a99d2c 2025-09-09T06:06:52+02:00 Daniel Bevenius requirements : update transformers/torch for Embedding Gemma (#15828)
acc1b008cfd95e63d5f99a370dbffb98e5a99d2c 7057faf64b514e991e2f70147f82bb13d544b1c0 2025-09-09T06:05:55+02:00 Piotr Wilkin (ilintar) model-conversion : add extra debugging support for model conversion (#15877)
7057faf64b514e991e2f70147f82bb13d544b1c0 fe1c92cd7bb491e9c5767c9de413f2b7dc1e832b 2025-09-08T16:14:32-05:00 Aldehir Rojas json : support `enum` values within `allOf` (#15830)
fe1c92cd7bb491e9c5767c9de413f2b7dc1e832b e68aa10d8f3d26fdad5b912540362d79de5460e3 2025-09-08T19:57:01+01:00 j-k media : add llama1 icon (#15878)
e68aa10d8f3d26fdad5b912540362d79de5460e3 0a16bf52e6874369cb4fd2bdc4863ef984b688e7 2025-09-08T13:10:07-05:00 Jeff Bolz vulkan: sort graph to allow more parallel execution (#15850)
0a16bf52e6874369cb4fd2bdc4863ef984b688e7 88021565f08e0b7c4e07ac089a15ec16fae9166c 2025-09-09T01:23:46+08:00 Aman Gupta CUDA: generate_cu_files.py - add missing mxfp4 (#15880)
88021565f08e0b7c4e07ac089a15ec16fae9166c 56920f56651908d5cce7a310dabf54ac4f6fbb7f 2025-09-08T10:59:48-04:00 Jesse chat : Deepseek V3.1 reasoning and tool calling support (OpenAI Style) (#15533)
56920f56651908d5cce7a310dabf54ac4f6fbb7f b0d52998b962bd2681c34bf52af993af79f178b8 2025-09-08T21:50:05+07:00 Xuan-Son Nguyen server : bring back timings_per_token (#15879)
b0d52998b962bd2681c34bf52af993af79f178b8 f28d4f4ac963f182ea9d0fe9e269f3f5f3782aaf 2025-09-08T13:56:51+03:00 Georgi Gerganov cuda : fix supports_op condition for get_rows when number of blocks is too large (#15868)
f28d4f4ac963f182ea9d0fe9e269f3f5f3782aaf 9fcb29f22f5c33c04c7f0daebb24057899d67a1a 2025-09-08T13:34:56+03:00 Georgi Gerganov metal : refactor + optimize (#15857)
9fcb29f22f5c33c04c7f0daebb24057899d67a1a 5ef22d281de9c5eaaf616874bc490b89241128cb 2025-09-08T17:33:01+07:00 Xuan-Son Nguyen ggml: allow casting between f32 and i32 (#15783)
5ef22d281de9c5eaaf616874bc490b89241128cb 233d773d02c37982badddf3994e9953a175f34da 2025-09-08T11:55:44+02:00 Sigbjørn Skjæret CUDA: non-contiguous src0 not supported for PAD (#15869)
233d773d02c37982badddf3994e9953a175f34da a885dcff11a7b73f9377812d6151f6b15d307de0 2025-09-08T09:44:34+02:00 Daniel Bevenius convert : force setting sliding_window from original config (#15867)
a885dcff11a7b73f9377812d6151f6b15d307de0 663027fd5490438ce9c27ea866a560e1e268d11f 2025-09-08T10:27:07+03:00 Georgi Gerganov batched-bench : fix llama_synchronize usage during prompt processing (#15835)
663027fd5490438ce9c27ea866a560e1e268d11f cf0e3ba1500bd23635b444f64ba23cbdb56c92ef 2025-09-08T10:26:36+03:00 Georgi Gerganov context : fix n_outputs during reserve (#15858)
cf0e3ba1500bd23635b444f64ba23cbdb56c92ef d413dca00360a7e4cb71441dacecfa32556fcc31 2025-09-08T10:25:33+03:00 Georgi Gerganov model : avoid ggml_cont_3d for fused QKV weights (#15662)
d413dca00360a7e4cb71441dacecfa32556fcc31 85ca66a74676e6d5df4433016488e039a4b464ae 2025-09-07T23:23:41-05:00 Jeff Bolz tests: large sizes for get_rows (#15687)
85ca66a74676e6d5df4433016488e039a4b464ae 3976dfbe00f02a62c0deca32c46138e4f0ca81d8 2025-09-08T10:03:29+08:00 Chenguang Li CANN: Stream sync between devices for acl_graph (#15809)
3976dfbe00f02a62c0deca32c46138e4f0ca81d8 d36e61c580bf7fc7879c443c542312a42b718e11 2025-09-07T13:50:26-05:00 Jeff Bolz vulkan: support im2col_3d (#15795)
d36e61c580bf7fc7879c443c542312a42b718e11 c97b5e5854b47b18a248d77edb693c63018a0865 2025-09-08T02:18:28+08:00 Aaron Teo ggml-cpu: clean up s390x SIMD (#15855)
c97b5e5854b47b18a248d77edb693c63018a0865 267e99867f09bec8bcc2e424ad9bcddd6cccf9d0 2025-09-07T12:00:49-05:00 Jeff Bolz vulkan: Support pad_ext (#15794)
267e99867f09bec8bcc2e424ad9bcddd6cccf9d0 3b15924d71237a43bb5ad71f5b885ee66a821342 2025-09-07T11:53:07-05:00 Jeff Bolz vulkan: Use larger loads in scalar/coopmat1 matmul (#15729)
3b15924d71237a43bb5ad71f5b885ee66a821342 79bc429262268ad2ac8a364cfe6c2d6b9c5f008a 2025-09-07T10:19:45+02:00 Daniel Bevenius ggml WebGPU: remove userdata from request adapter callback (#15527)
79bc429262268ad2ac8a364cfe6c2d6b9c5f008a c4df49a42d396bdf7344501813e7de53bc9e7bb3 2025-09-07T00:26:28+02:00 Johannes Gäßler CUDA: faster tile FA (Pascal/AMD), headsize 256 (#15769)
c4df49a42d396bdf7344501813e7de53bc9e7bb3 3c3635d2f20424d557b5b0605a2a356214ffe048 2025-09-06T16:08:43+02:00 Charles Xu kleidiai: generalize compute_forward_kv_cache to compute_forward_fp16 (#15817)
3c3635d2f20424d557b5b0605a2a356214ffe048 61bdfd5298a78593be649a1035ee2a120b13c4f0 2025-09-06T19:45:24+07:00 Xuan-Son Nguyen server : speed up tests (#15836)
61bdfd5298a78593be649a1035ee2a120b13c4f0 01806e77714ae8a78130d432945b959a0956c56f 2025-09-06T18:35:04+07:00 Xuan-Son Nguyen server : implement prompt processing progress report in stream mode (#15827)
01806e77714ae8a78130d432945b959a0956c56f 186415d59552bd5c90549cd8e9be3cc287621fd9 2025-09-06T13:28:44+02:00 Johannes Gäßler ggml-cpu: document use of "free" memory [no ci] (#15834)
186415d59552bd5c90549cd8e9be3cc287621fd9 fd621880f3fd908424e675a41715a2dc760247a2 2025-09-06T11:27:28+08:00 Aaron Teo ggml-cpu: drop support for nnpa intrinsics (#15821)
fd621880f3fd908424e675a41715a2dc760247a2 4281c7b315f8a904549fe527039b976e08098d1a 2025-09-05T17:32:39-06:00 Gabe Goodhart aLoRA Support (#15327)
4281c7b315f8a904549fe527039b976e08098d1a 5fac79cbc77b6d12c9feb5f34fc63586b35fd561 2025-09-06T01:21:15+02:00 Sigbjørn Skjæret ci : exempt correct research label (#15825)
5fac79cbc77b6d12c9feb5f34fc63586b35fd561 408ff524b40baf4f51a81d42a9828200dd4fcb6b 2025-09-05T14:31:24-06:00 Gabe Goodhart Thinking model disabled assistant prefill (#15404)
408ff524b40baf4f51a81d42a9828200dd4fcb6b 5143fa895e7725c5bd2135daf7d8f793d98fa91c 2025-09-05T19:43:59+01:00 Eric Curtin Implement --log-colors with always/never/auto (#15792)
5143fa895e7725c5bd2135daf7d8f793d98fa91c 3a550b5ca4565c9e28f63880d47840feb27d0ff6 2025-09-05T16:07:02+02:00 Johannes Gäßler CUDA: fastdiv, launch bounds for mmvq + q8_1 quant (#15802)
3a550b5ca4565c9e28f63880d47840feb27d0ff6 a81283820a466f2ace06ce4d4bc9512761f9365f 2025-09-05T14:49:21+02:00 Daniel Bevenius tests : add --list-ops and --show-coverage options (#15745)
a81283820a466f2ace06ce4d4bc9512761f9365f c610b6c11b1ef7d678671dcf15acd7187a7ad8f3 2025-09-05T11:34:28+02:00 Erik Scholz gguf: gguf_writer refactor (#15691)
c610b6c11b1ef7d678671dcf15acd7187a7ad8f3 5d6688de08e73acc2532d668380801ed79d704eb 2025-09-05T10:39:22+03:00 Georgi Gerganov kv-cache : fix SWA checks + disable cacheless iSWA (#15811)
dcbe998a6d8f13b6c9cb36bbe7b355ced2ac3842 87932ec016f0ec81e98a13ce5212851f8c12458a 2025-09-05T14:34:07+08:00 Yunzhe Jia add calrt API used in server side
5d6688de08e73acc2532d668380801ed79d704eb 4fd1242bef6cb2325b4ff1c1a80f3b54b64508a6 2025-09-05T04:36:23+02:00 Daniel Bevenius model-conversion : add --embeddings flag to modelcard.template [no ci] (#15801)
4fd1242bef6cb2325b4ff1c1a80f3b54b64508a6 b2426e469e2fdb6c44216d56baa4cfff4f39ae00 2025-09-05T01:24:08+02:00 ExtReMLapin chat : fixed crash when Hermes 2 <tool_call> had a newline before it (#15639)
b2426e469e2fdb6c44216d56baa4cfff4f39ae00 9e2b1e83c68a38ea0c64f726dd979439bd02189b 2025-09-05T01:22:22+02:00 Piotr Wilkin (ilintar) chat : nemotron thinking & toolcalling support (#15676)
9e2b1e83c68a38ea0c64f726dd979439bd02189b fb15d649ed14ab447eeab911e0c9d21e35fb243e 2025-09-05T01:05:12+02:00 Piotr Wilkin (ilintar) scripts : add Jinja tester PySide6 simple app (#15756)
fb15d649ed14ab447eeab911e0c9d21e35fb243e 856ed0947f27b4ec3ad269fceda0402fbab263d3 2025-09-04T18:10:29+02:00 Daniel Bevenius llama : add support for EmbeddingGemma 300m (#15798)
856ed0947f27b4ec3ad269fceda0402fbab263d3 d1e2adba65208d6de3d7f6f23b00c562ff5bb777 2025-09-04T09:53:22-06:00 Gabe Goodhart metal : Add template specialization for mul_mm_id w/ ne20 == 10 (#15799)
d1e2adba65208d6de3d7f6f23b00c562ff5bb777 c1c354e44c06d259679bb5bb7a8fa9f0b28480e4 2025-09-04T15:40:44+02:00 Daniel Bevenius llama : set n_outputs to 1 to avoid 0 outputs mean-pooling (#15791)
c1c354e44c06d259679bb5bb7a8fa9f0b28480e4 a68d9144262f1d0ef4f6ba7ad4a7e73e977ba78c 2025-09-04T20:20:14+08:00 Chenguang Li CANN: Refactor ND to NZ workspace to be per-device (#15763)
a68d9144262f1d0ef4f6ba7ad4a7e73e977ba78c badb80cadbc40e047b30c43611aba575fc8d6845 2025-09-04T11:50:23+02:00 Xuan-Son Nguyen server: add exceed_context_size_error type (#15780)
badb80cadbc40e047b30c43611aba575fc8d6845 0a1b3982cd0bd18730d50a693053b88c13fd04a6 2025-09-04T10:49:44+01:00 Eric Curtin Document the new max GPU layers default in help (#15771)
0a1b3982cd0bd18730d50a693053b88c13fd04a6 5421f63ab08ca1e1a093662a5ccd0117e461185f 2025-09-04T16:38:49+08:00 leejet ggml: add ops for WAN video model (cuda && cpu) (#15669)
5421f63ab08ca1e1a093662a5ccd0117e461185f 820bc9853100708011036e10f40b923968dd9b66 2025-09-04T15:12:30+08:00 hipudding CANN: Fix precision issue on 310I DUO multi-devices (#15784)
820bc9853100708011036e10f40b923968dd9b66 239b60e8986bbcb944f57311a02ac994431bf652 2025-09-04T08:30:28+02:00 rmatif opencl: add hs=40 to FA (#15758)
239b60e8986bbcb944f57311a02ac994431bf652 dff7551bfdbdd6e57c13e523d7dcca317640e907 2025-09-04T11:03:02+08:00 Chenguang Li CANN: fix acl_rstd allocation size in ggml_cann_rms_norm (#15760)
dff7551bfdbdd6e57c13e523d7dcca317640e907 0fce7a1248b74148c1eb0d368b7e18e8bcb96809 2025-09-03T22:55:10+02:00 Ruben Ortlam vulkan: fix mmv subgroup16 selection (#15775)
0fce7a1248b74148c1eb0d368b7e18e8bcb96809 8227695d7a3e5b357cb37fad263f00a8ca6db710 2025-09-03T13:33:15-05:00 Jeff Bolz vulkan: don't use std::string in load_shaders, to improve compile time (#15724)
8227695d7a3e5b357cb37fad263f00a8ca6db710 0014fb4add3a7d000c14b763538045c6170f57d9 2025-09-03T20:24:50+02:00 Daniel Bevenius vulkan : update ggml_vk_instance_validation_ext_available (#15666)
0014fb4add3a7d000c14b763538045c6170f57d9 661ae31c9c68201577e70278285b349a5a662caf 2025-09-04T03:22:55+09:00 Shin-myoung-serp ggml vulkan: add hardsigmoid and hardswish operations (#15762)
661ae31c9c68201577e70278285b349a5a662caf 407c23786dd0d3a503e9429eead96e611d3950c9 2025-09-03T19:59:16+02:00 Oliver Simons CUDA: Optimize `rms_norm_f32` kernel and its fused variants, giving 1-6% perf E2E (#15715)
407c23786dd0d3a503e9429eead96e611d3950c9 cdedb70a998cea7052560fe0b0615a839443564d 2025-09-03T18:28:36+02:00 Daniel Bevenius model-conversion : fix pyright errors (#15770)
cdedb70a998cea7052560fe0b0615a839443564d 2c8dac72eb6acd4e20c0da251535dfc46d35178b 2025-09-03T18:16:26+03:00 Georgi Gerganov sampling : optimize dist sampler (#15704)
2c8dac72eb6acd4e20c0da251535dfc46d35178b 40a751ea9a94364da73537b86502a808ebe1fc3a 2025-09-03T13:35:49+02:00 Daniel Bevenius llama : fix incorrect model type for Gemma 270M (#15764)
40a751ea9a94364da73537b86502a808ebe1fc3a 5eae9348835037046f33fafd852df7c952c95209 2025-09-03T12:50:47+02:00 Daniel Bevenius model-conversion : remove hardcoded /bin/bash shebangs [no ci] (#15765)
5eae9348835037046f33fafd852df7c952c95209 05c0380f2ae5c7193445e03ebc7b6de9ce49f1a6 2025-09-03T16:46:01+08:00 hipudding CANN: Add RoPE contiguous check for 310I DUP device (#15735)
05c0380f2ae5c7193445e03ebc7b6de9ce49f1a6 8c3fdf44ecf08335942f2ba558955f55e88c7991 2025-09-03T16:16:21+08:00 xctan ggml-cpu : optimize RVV kernels (#15720)
8c3fdf44ecf08335942f2ba558955f55e88c7991 f6da8cb86a28f0319b40d9d2a957a26a7d875f8c 2025-09-03T09:48:35+02:00 Daniel Bevenius model-conversion : add missing curl script [no ci] (#15761)
f6da8cb86a28f0319b40d9d2a957a26a7d875f8c 8a2234ea0c89f212190c176d741b7742f0082582 2025-09-03T14:08:22+08:00 hipudding CANN: Mask unsupported TRANSPOSE_1D operator (#15733)
8a2234ea0c89f212190c176d741b7742f0082582 3de008208b9b8a33f49f979097a99b4d59e6e521 2025-09-03T10:43:53+08:00 Chenguang Li CANN: Fix type float_t to float (#15736)
3de008208b9b8a33f49f979097a99b4d59e6e521 69db8a52e6dd0db81ec05c581150cc1e43b8ac46 2025-09-03T03:27:30+08:00 SnA1lGo fix: resolve unsigned int initialization warning for n_dims/size in gguf.cpp (#15754)
69db8a52e6dd0db81ec05c581150cc1e43b8ac46 c466abe1587bde458c806e2134e37750f2edf8fb 2025-09-02T19:40:37+02:00 Oliver Simons chore: Update `.clang-format` to use `BinPackArguments=true` (#15744)
c466abe1587bde458c806e2134e37750f2edf8fb 0a2a3841e8ebc570da343e8cf58a21c1010b41e7 2025-09-02T18:17:26+02:00 Johannes Gäßler llama: -fa 1/0/-1 aliases for -fa on/off/auto (#15746)
0a2a3841e8ebc570da343e8cf58a21c1010b41e7 9961d244f2df6baf40af2f1ddc0927f8d91578c8 2025-09-02T16:02:26+02:00 Ruben Ortlam vulkan: fix shaders gen when no integer dot is available (#15740)
9961d244f2df6baf40af2f1ddc0927f8d91578c8 25f1045f07cf0daf667d63e35618842e3174a8c7 2025-09-02T17:12:37+08:00 hipudding CANN: Resolve soft_max precision issue (#15730)
25f1045f07cf0daf667d63e35618842e3174a8c7 97669e40735d08db65ef094a8faae8e8411a97db 2025-09-02T01:37:01-05:00 Jeff Bolz vulkan: Fix macro parameter order for f32 matmul shaders (#15716)
97669e40735d08db65ef094a8faae8e8411a97db 2f853687b3bce15e143a22f678d1715060fd606c 2025-09-02T08:26:53+02:00 rmatif opencl: add attn sinks support for FA kernels (#15706)
2f853687b3bce15e143a22f678d1715060fd606c ef2af57ddf04ab367f6ba6e8ed100fc56785e4b7 2025-09-02T14:07:48+08:00 Chenguang Li CANN: Support eager execution mode under ACL graph compilation (#15712)
ef2af57ddf04ab367f6ba6e8ed100fc56785e4b7 5d804a4938d896f9089687a8b99911cdb43b0b94 2025-09-02T14:05:23+08:00 hipudding CANN: Support ext_factor in rope (#15710)
5d804a4938d896f9089687a8b99911cdb43b0b94 d4d8dbe383e8b9600cbe8b42016e3a4529b51219 2025-09-02T01:14:55+02:00 Johannes Gäßler ggml-backend: raise GGML_MAX_SPLIT_INPUTS (#15722)
d4d8dbe383e8b9600cbe8b42016e3a4529b51219 35a42edac84690990a75726898d975cd08d220c0 2025-09-01T22:17:42+03:00 Gilad S. vulkan: use memory budget extension to read memory usage (#15545)
35a42edac84690990a75726898d975cd08d220c0 fec7911f8febb22c27ce1acb12441800da24cc06 2025-09-01T14:01:10-05:00 Jeff Bolz vulkan: add missing clamps in new mul_mat_id paths (#15702)
fec7911f8febb22c27ce1acb12441800da24cc06 078ce23ea77988f2fe1a42afb18d58bc084d55fa 2025-09-01T20:58:35+02:00 Ruben Ortlam vulkan: disable large mmv subgroups on older Nvidia GPUs (#15717)
078ce23ea77988f2fe1a42afb18d58bc084d55fa a0c2b207c596d1092a08615de61ab56a7d63515f 2025-09-02T03:13:49+09:00 s-goto-11 ggml: SVE support for exponential functions (#15145)
a0c2b207c596d1092a08615de61ab56a7d63515f 4b20d8b7e31718d3fe8b4f12d220a9d19e4f1997 2025-09-01T23:43:16+05:30 Prashant Vithule ggml: aarch64: Implement SVE F16 kernels for vector functions (#15115)
4b20d8b7e31718d3fe8b4f12d220a9d19e4f1997 02c1813517412f3e00aa6ca7c0273fea64edb492 2025-09-01T23:53:31+08:00 Jie Fu (傅杰) convert : remove redundant code (#15708)
02c1813517412f3e00aa6ca7c0273fea64edb492 77dee9de97be75b7143a213bc48893e0c0b29af7 2025-09-01T16:19:07+02:00 Ruben Ortlam Vulkan: Add Integer Dot Product mul_mat_vec shader for legacy quants (#14903)
77dee9de97be75b7143a213bc48893e0c0b29af7 4795c91c32fec7165a1364763d4d4f0c93abf933 2025-09-01T14:28:49+02:00 Daniel Bevenius ggml : WebGPU add TRANSPOSE and RESHAPE to supported ops (#15695)
4795c91c32fec7165a1364763d4d4f0c93abf933 b66df9d9c942254d03209186ef24ed7c994a576e 2025-09-01T15:34:59+08:00 Jie Fu (傅杰) docs : add Hunyuan to models section (#15707)
b66df9d9c942254d03209186ef24ed7c994a576e b9382c3877c6067feccf182efe9449a2d1cb24c7 2025-09-01T06:55:06+05:30 Akarshan Biswas CUDA: fix build error from ambiguous __half conversions in conv2d (#15690)
b9382c3877c6067feccf182efe9449a2d1cb24c7 3dc7397a2799bdc07bccf637ab7ae5a1e786d1a4 2025-09-01T08:57:23+08:00 hipudding CANN: Optimize MUL_MAT_ID (#15658)
3dc7397a2799bdc07bccf637ab7ae5a1e786d1a4 e92d53b29e393fc4c0f9f1f7c3fe651be8d36faa 2025-09-01T08:57:00+08:00 hipudding CANN: fix RoPE cache issue on multi-device (#15629)
e92d53b29e393fc4c0f9f1f7c3fe651be8d36faa 0d161f021aa33ec0e90cce96f5d1a88925557327 2025-08-31T20:41:02+03:00 Georgi Gerganov sampling : optimize samplers by reusing bucket sort (#15665)
0d161f021aa33ec0e90cce96f5d1a88925557327 4efd5a83163ff383285b3a4c2106feabf5c69557 2025-08-31T20:11:58+03:00 Georgi Gerganov server : enable /slots by default and make it secure (#15630)
4efd5a83163ff383285b3a4c2106feabf5c69557 274966226f87f301ac132da898280ca3142b60e5 2025-08-31T19:43:30+03:00 Georgi Gerganov metal : fix checks for available FA kernels (#15700)
274966226f87f301ac132da898280ca3142b60e5 9777032dccd67bdc7785aeab7497014a8be8dacc 2025-08-31T08:47:05-07:00 Diego Devesa llama : fix fattn reserve call n_seqs parameter (#15699)
9777032dccd67bdc7785aeab7497014a8be8dacc 7d3c9f2b217acf0ce5db81ae83d3f375f49ab2c7 2025-08-31T06:49:03-07:00 Diego Devesa llama : separate compute buffer reserve from fattn check (#15696)
7d3c9f2b217acf0ce5db81ae83d3f375f49ab2c7 bbbf5ecccb35286521f735239d499eec4279a840 2025-08-31T15:30:20+02:00 Sigbjørn Skjæret ci : explicitly set fa off or on (#15692)
bbbf5ecccb35286521f735239d499eec4279a840 c37052ab4d6d1ae73c0e90bc6e560cc6409e1311 2025-08-31T03:13:27-05:00 Jeff Bolz vulkan: handle large sizes for get_rows (#15686)
c37052ab4d6d1ae73c0e90bc6e560cc6409e1311 5c16b9c87d840e4d5d55fa83c732c6b693346f40 2025-08-31T02:06:43-05:00 Jeff Bolz vulkan: mul_mat_id coopmat2 optimizations (#15546)
5c16b9c87d840e4d5d55fa83c732c6b693346f40 b97c9edc59d4a1b4069991aa670411190f4f3a3e 2025-08-31T08:46:42+02:00 Daniel Bevenius vulkan : remove unused portability_enumeration_ext variable (#15679)
b97c9edc59d4a1b4069991aa670411190f4f3a3e 94e82c7eadeb8fff0db4bfd1ab6d8cf65fa6f2e0 2025-08-31T01:30:54-05:00 Jeff Bolz vulkan: Allow fallback to sysmem memory when vidmem is full (#15649)
94e82c7eadeb8fff0db4bfd1ab6d8cf65fa6f2e0 4d74393bcc956ccd7df68a6a06d1a0575cfa712c 2025-08-31T01:27:57-05:00 Jeff Bolz vulkan: clamp matmul and FA results to the max finite value (#15652)
4d74393bcc956ccd7df68a6a06d1a0575cfa712c dd892555b0681b7f56d38780f6fdfe00a195160f 2025-08-30T18:03:42+02:00 Charles Xu ggml: update kleidiai to v1.13.0 (#15663)
dd892555b0681b7f56d38780f6fdfe00a195160f e81b8e4b7f5ab870836fad26d154a7507b341b36 2025-08-30T08:51:28-07:00 Diego Devesa Update build.md to remove MSVC arm64 notes (#15684)
e81b8e4b7f5ab870836fad26d154a7507b341b36 38ad381f9f5d4dd368a96d844fb19cf501ed9d22 2025-08-30T16:32:10+02:00 Johannes Gäßler llama: use FA + max. GPU layers by default (#15434)
38ad381f9f5d4dd368a96d844fb19cf501ed9d22 696fccf354e9dbdfbce135bc40b44c9dcc64dda9 2025-08-30T16:20:32+02:00 Johannes Gäßler CUDA: use FP32 arithmetic for conv2d (#15683)
696fccf354e9dbdfbce135bc40b44c9dcc64dda9 ef476916bba4b44f44be0c98babc1cb025968e75 2025-08-30T04:11:22-05:00 Jeff Bolz vulkan: Skip syncing for prealloc_y when it is reused (#15544)
ef476916bba4b44f44be0c98babc1cb025968e75 d82f6aa34a216f5df1945cdfe121ba5e6cd80be0 2025-08-30T10:18:35+08:00 Chenguang Li CANN: FIx compiler warnings (#15661)
d82f6aa34a216f5df1945cdfe121ba5e6cd80be0 3d16b29c3bb1ec816ac0e782f20d169097063919 2025-08-30T00:12:53+02:00 Sergey Alirzaev server : removed obsolete doc (#15670)
3d16b29c3bb1ec816ac0e782f20d169097063919 792b44f2ed9668cce7f267ff0ae4950ed9b4a5de 2025-08-29T22:04:08+02:00 Johannes Gäßler scripts: strip "AMD Instinct" from GPU name (#15668)
792b44f2ed9668cce7f267ff0ae4950ed9b4a5de 81017865ee444cf49ce0136f2be1e41a0270ff91 2025-08-29T19:25:40+02:00 ExtReMLapin server : add documentation for `parallel_tool_calls` param (#15647)
81017865ee444cf49ce0136f2be1e41a0270ff91 60e5eee31f1af9bb579ac45380e3857d610020b9 2025-08-29T21:30:06+08:00 Aman Gupta CUDA: fix bug in rms_norm fusion (#15660)
60e5eee31f1af9bb579ac45380e3857d610020b9 009b709d6efd24820ac67765ed339a72dc797814 2025-08-29T14:53:41+02:00 Piotr Wilkin (ilintar) chat : Seed OSS thinking + tool call support (#15552)
009b709d6efd24820ac67765ed339a72dc797814 e8d99dd0b67f2ecc1e45fca8074a3a18c3e036d2 2025-08-29T11:35:58+08:00 Aman Gupta CUDA: fuse adds, fuse add with rms norm (#15631)
e8d99dd0b67f2ecc1e45fca8074a3a18c3e036d2 a8bca68f727844e7dcf24a956003b3c2039ea563 2025-08-28T18:39:31-06:00 Gabe Goodhart nvidia nemotron nano v2 (nemotronh) (#15507)
a8bca68f727844e7dcf24a956003b3c2039ea563 c97dc093912ad014f6d22743ede0d4d7fd82365a 2025-08-28T15:27:36-05:00 Gabe Goodhart fix: Compute the full sum in llama-eval-callback, not just the sum of printed values (#15637)
c97dc093912ad014f6d22743ede0d4d7fd82365a 6c442f42ff25564a0cd6b1435d9abc1b0178eac5 2025-08-29T00:03:03+05:30 mnehete32 CUDA: add conv2d (#15635)
6c442f42ff25564a0cd6b1435d9abc1b0178eac5 73804145ab6c06888e314046abf08f66a0133679 2025-08-28T22:39:27+08:00 Aaron Teo ggml-cpu: fix invalid hsum build in debug s390x (#15634)
73804145ab6c06888e314046abf08f66a0133679 c8d0d14e77c3c45df5cbbddde9c2b4c377ec4e7a 2025-08-28T10:11:36-04:00 compilade ggml : fix SSM_SCAN for n_groups > 1 (#15625)
c8d0d14e77c3c45df5cbbddde9c2b4c377ec4e7a 84ab83cc0b4b7e769451ee48e4c7d1acef91ef25 2025-08-28T17:09:05+03:00 Georgi Gerganov kv-cache : fix find_slot to not search for continuous slot (#15638)
84ab83cc0b4b7e769451ee48e4c7d1acef91ef25 55042b3692cb1467c9ee15c62c4a9fbf180f89e3 2025-08-28T15:49:50+02:00 Sigbjørn Skjæret model : jina-embeddings-v3 support (#13693)
55042b3692cb1467c9ee15c62c4a9fbf180f89e3 8a4280ce431da6b33e5a95ae1fd61472c8c3f8cc 2025-08-28T19:23:22+08:00 Aman Gupta scripts: add sqlite3 check for compare-commits.sh (#15633)
8a4280ce431da6b33e5a95ae1fd61472c8c3f8cc 64387f6e95434b393ac3df285864692b7fd9c4d2 2025-08-28T12:27:02+03:00 Georgi Gerganov kv-cache : remove LLAMA_SET_ROWS checks (#15505)
64387f6e95434b393ac3df285864692b7fd9c4d2 d35a1e8c41f747548775225973a99507896a8c61 2025-08-28T10:56:41+02:00 Aleksei Nikiforov gguf-py: byteswapping improvements (#12851)
d35a1e8c41f747548775225973a99507896a8c61 46d9caa27a0281150e8cf082308c0f9e7576ebe5 2025-08-28T01:48:20-06:00 Joshua Cogliati cli : change log to warning to explain reason for stopping (#15604)
46d9caa27a0281150e8cf082308c0f9e7576ebe5 5a0e3ef6f00c658fbae53797f02d5a360ebf8fec 2025-08-28T09:26:48+02:00 Daniel Bevenius model-conversion : add mmproj conversion target (#15628)
5a0e3ef6f00c658fbae53797f02d5a360ebf8fec fbef0fad7a7c765939f6c9e322fa05cd52cf0c15 2025-08-27T17:32:36-07:00 matiaslin cuda: Add cublasLt_static linking when GGML_STATIC is enabled (#15622)
fbef0fad7a7c765939f6c9e322fa05cd52cf0c15 da54f9f1a2db07aaae390024ac466e7867685d94 2025-08-27T20:58:09+02:00 Johannes Gäßler server: higher timeout for tests (#15621)
da54f9f1a2db07aaae390024ac466e7867685d94 47373271f971aa5a0a6462b286f4a7b5bd4ba644 2025-08-27T15:48:07+03:00 Georgi Gerganov presets : add qwen3-30B-a3b FIM (#15616)
47373271f971aa5a0a6462b286f4a7b5bd4ba644 1bded5a3b3376b2aa3ba2f11ade5910c550f354b 2025-08-27T13:58:54+02:00 uvos HIP: Enable support for ggml_backend_cuda_register_host_buffer (#15615)
1bded5a3b3376b2aa3ba2f11ade5910c550f354b 1e7489745a74996fc36e8fd05b73aa16bc184e0c 2025-08-27T13:55:12+03:00 Georgi Gerganov kv-cache : better estimate of n_kv for multi-sequence batches (#15610)
1e7489745a74996fc36e8fd05b73aa16bc184e0c 1cf123a343ab7ca5586aacb9e0a1d2de7fe33be4 2025-08-27T17:21:41+08:00 Chenguang Li CANN: refactor mask handling and improve performance in FA (#15561)
1cf123a343ab7ca5586aacb9e0a1d2de7fe33be4 fcca2182a18c786c57d02d1d1927204b133f1fdc 2025-08-27T16:44:22+08:00 xctan ggml-cpu : add basic RVV support for vector f32 ops (#15057)
fcca2182a18c786c57d02d1d1927204b133f1fdc 86076f92de1a547ef87c304facca3b4b9fae6c21 2025-08-27T10:28:53+02:00 Daniel Bevenius common : add -m to bash completion for --model [no ci] (#15591)
86076f92de1a547ef87c304facca3b4b9fae6c21 bcbddcd54f0d5c22eab180831fdea6484107112f 2025-08-27T08:36:05+02:00 rmatif OpenCL: add fused group_norm/norm, mul, add (#15314)
87932ec016f0ec81e98a13ce5212851f8c12458a 0115cfb7c1dec0753aecb34f3af4338bf9de8eeb 2025-08-27T14:29:18+08:00 Yunzhe Jia fix merge problem
bcbddcd54f0d5c22eab180831fdea6484107112f 8b696861364360770e9f61a3422d32941a477824 2025-08-26T13:14:38-07:00 Diego Devesa tests : fix test-opt with GGML_BACKEND_DL (#15599)
8b696861364360770e9f61a3422d32941a477824 8ce3ff1d91245e158d98d8062cd64b0dd98dcfe3 2025-08-27T00:27:49+05:30 Akarshan Biswas SYCL: fix rms_norm_mul_add for tensor dim not a multiple of sg_size (#15592)
8ce3ff1d91245e158d98d8062cd64b0dd98dcfe3 44b1efa41acd4df3f56ee0e46f898135ecd1a054 2025-08-26T20:05:50+02:00 fidoriel mtmd : fix mtmd ios build (#15579)
44b1efa41acd4df3f56ee0e46f898135ecd1a054 a6a58d64785cb458ed9de52f391aa38142d38d64 2025-08-26T15:42:49Z Eve tests: add performance test for mul mat id (#15543)
a6a58d64785cb458ed9de52f391aa38142d38d64 0373486dbc0dccbdcb3b5fdd65759d88cec06196 2025-08-26T21:05:25+05:30 shalinib-ibm llamafile: PowerPC Sgemm Optimization (#15558)
0373486dbc0dccbdcb3b5fdd65759d88cec06196 62cef26ac5b6b7acb635d3dc963813b43952dc2b 2025-08-26T17:45:17+03:00 Georgi Gerganov graph : fix assert in memory-less build_attn (#15590)
62cef26ac5b6b7acb635d3dc963813b43952dc2b 8f5afa94c4f929da71f560db7c9f38ef6a783d95 2025-08-26T16:12:29+02:00 Daniel Bevenius model-conversion : add qat-q4 quantization targets (#15588)
8f5afa94c4f929da71f560db7c9f38ef6a783d95 b3964c1e890ef8c947afb36a5124ce6fcb2136d4 2025-08-26T16:01:20+02:00 Johannes Gäßler CUDA: return -1 for nonexistent compiled arch (#15587)
b3964c1e890ef8c947afb36a5124ce6fcb2136d4 79a546220c719e6a70627b243a478ab8d84dc9e1 2025-08-26T14:22:14+03:00 Georgi Gerganov metal : optimize FA vec for large sequences and BS <= 8 (#15566)
79a546220c719e6a70627b243a478ab8d84dc9e1 85cc1ae998e4898d9fa992cb9b8620338cee97bf 2025-08-26T12:54:19+02:00 Xuan-Son Nguyen mtmd : support Kimi VL model (#15458)
85cc1ae998e4898d9fa992cb9b8620338cee97bf 1d8d83deaa48d4a5491820d58ff1c0d8cf9d196c 2025-08-26T12:47:00+03:00 Georgi Gerganov context : print graph stats for memory-less contexts (#15586)
1d8d83deaa48d4a5491820d58ff1c0d8cf9d196c c4e9239064a564de7b94ee2b401ae907235a8fca 2025-08-26T12:46:15+03:00 Georgi Gerganov metal : improve `MUL_MAT_ID` (#15541)
c4e9239064a564de7b94ee2b401ae907235a8fca 39842a7f73012eb42816ca4f26411782bd3da7c5 2025-08-26T16:05:55+08:00 tc-mb model : support MiniCPM-V 4.5 (#15575)
0115cfb7c1dec0753aecb34f3af4338bf9de8eeb 3a617cb18121a85eed17ac5585788810c5d9c1e0 0d5a470223fc90b6b6807921d68011ff06ae7f9e 2025-08-26T15:19:56+08:00 Yunzhe Jia Merge branch 'master' into dev
39842a7f73012eb42816ca4f26411782bd3da7c5 0fd90db5858e325358a5fbdaa4e327ee2a79d0d4 2025-08-26T09:08:08+02:00 Sigbjørn Skjæret gguf-py : remove erroneous FFN_GATE entry (#15583)
0fd90db5858e325358a5fbdaa4e327ee2a79d0d4 4c37636b3ea96f2574eeb7668b93fcc0e64b05dd 2025-08-26T08:51:43+02:00 Sigbjørn Skjæret metal : remove contiguous assertion for src0 in IM2COL (#15577)
4c37636b3ea96f2574eeb7668b93fcc0e64b05dd 34bdbbd7c2b70b848718e95bc48010f6aecd2816 2025-08-26T13:15:33+07:00 Yoshi_likes_e4 Add a warning for special devices (#15563)
34bdbbd7c2b70b848718e95bc48010f6aecd2816 74f52f77f28a5ad6d6075231afcb8d1ad763ca32 2025-08-25T23:42:44-05:00 Jeff Bolz vulkan: Remove splitting for mul_mat_id (#15568)
74f52f77f28a5ad6d6075231afcb8d1ad763ca32 f7207b0415986dd7f48447149da7de3a82338276 2025-08-26T05:21:22+08:00 Qeeweew CUDA: Accelerate MXFP4 table lookup using `__byte_perm` (#15451)
f7207b0415986dd7f48447149da7de3a82338276 4d917cd4f64cc37744e76d084659475819fb0728 2025-08-25T14:18:09-07:00 lhez opencl: fix support ops condition for `rms_norm` (#15560)
4d917cd4f64cc37744e76d084659475819fb0728 886b97a5d693550c2da470c091d9d27bf38398f8 2025-08-25T17:56:59+02:00 Ruben Ortlam vulkan: fix min subgroup 16 condition for mmid subgroup optimization (#15565)
886b97a5d693550c2da470c091d9d27bf38398f8 111f8d06f0b9169059779a35f655b343242ccbb6 2025-08-25T10:47:16-05:00 Jeff Bolz tests: Generate unique input values for count_equal (#15487)
111f8d06f0b9169059779a35f655b343242ccbb6 5eff6ec9b1220b599a43b594b1110487ab6aca08 2025-08-25T11:27:34-04:00 Ihar Hrachyshka metal: fix regression when no metal devices are present (#15531)
5eff6ec9b1220b599a43b594b1110487ab6aca08 dfd9b5f6c7586c88588f06a644c131bec071a0a1 2025-08-25T17:23:40+02:00 Johannes Gäßler CUDA: MoE helper in device code, better tile sizes (#15525)
dfd9b5f6c7586c88588f06a644c131bec071a0a1 5a6bc6b1a6cb665a944426c2055794950e524bf5 2025-08-25T15:00:43+02:00 Daniel Bevenius model-conversion : set pooling type to none in logits.cpp (#15564)
5a6bc6b1a6cb665a944426c2055794950e524bf5 6b64f74b55628e4193f4fb00313f07dbd8556528 2025-08-25T14:25:25+02:00 Daniel Bevenius model-conversion : add model card template for embeddings [no ci] (#15557)
6b64f74b55628e4193f4fb00313f07dbd8556528 0d5a470223fc90b6b6807921d68011ff06ae7f9e 2025-08-25T13:56:43+03:00 Georgi Gerganov batched-bench : fix unified KV cache handling + pp timing (#15562)
3a617cb18121a85eed17ac5585788810c5d9c1e0 c42293848dd9f03eba9a6c1b85a600b398f06541 2025-08-13T10:58:59+08:00 Yunzhe Jia add calrt_decode
c42293848dd9f03eba9a6c1b85a600b398f06541 1cbf442f50a154aac0bf35d7b8b3436a2cdfd6f5 2025-08-06T15:46:06+08:00 Yunzhe Jia sync with calrt API
1cbf442f50a154aac0bf35d7b8b3436a2cdfd6f5 ba67d6c03fed3193987a4ef13050e6e2a4451df4 2025-07-24T15:50:19+08:00 Yunzhe Jia 1.sync with calrt prefill,decode,kv_update op 2.add hw pattern untile function
ba67d6c03fed3193987a4ef13050e6e2a4451df4 8f52c6f8abb2ed9ad967cc0bfb90acb073011193 2025-06-26T17:42:32+08:00 Yunzhe Jia llama-calrt: infer-op: copy data from output buffer to dst-tensor.data
8f52c6f8abb2ed9ad967cc0bfb90acb073011193 d2f325130c4ed77a3dcff2c23a926587fb08e2cc 2025-06-26T15:10:45+08:00 Yunzhe Jia Squashed commit of the following:
d2f325130c4ed77a3dcff2c23a926587fb08e2cc 6391ee7ffd97e723dfbdcc32f001e1b95a63cba6 2025-06-17T11:53:33+08:00 Yunzhe Jia calrt: add input_token in graph; input_token will be copy to calrt_in_buffer
6391ee7ffd97e723dfbdcc32f001e1b95a63cba6 b9850050a5b5147cb2e6720b98ed8c1e8e02eff9 2025-06-13T10:58:06+08:00 Yunzhe Jia update .gitignore to update cal_test.gguf
b9850050a5b5147cb2e6720b98ed8c1e8e02eff9 933b205c32551848589b8339437d778cb4f2a46d 2025-06-06T17:25:52+08:00 Yunzhe Jia calrt: add call chain for using calrt::infer
933b205c32551848589b8339437d778cb4f2a46d 33fea9a8592fd338abe279b89350a3af2e0ff1f7 2025-06-12T17:47:19+08:00 Yunzhe Jia gguf-py: add cal_test.py
33fea9a8592fd338abe279b89350a3af2e0ff1f7 806f05a353d322e97d97e02f910de2b408a8b4ab 2025-06-06T17:25:52+08:00 Yunzhe Jia calrt: add load calbin
806f05a353d322e97d97e02f910de2b408a8b4ab ec9e0301fef6476df83e94842c3b625501c95566 2025-05-30T09:45:37+08:00 Yunzhe Jia add calrt demo
Can't render this file because it contains an unexpected character in line 249 and column 129.
File diff suppressed because it is too large Load Diff
File diff suppressed because it is too large Load Diff
@@ -0,0 +1,10 @@
file:.git/config core.repositoryformatversion=0
file:.git/config core.filemode=true
file:.git/config core.bare=false
file:.git/config core.logallrefupdates=true
file:.git/config remote.origin.url=http://192.168.10.26:1000/yunzhe/llama.cpp.git
file:.git/config remote.origin.fetch=+refs/heads/*:refs/remotes/origin/*
file:.git/config branch.master.remote=origin
file:.git/config branch.master.merge=refs/heads/master
file:.git/config branch.dev.remote=origin
file:.git/config branch.dev.merge=refs/heads/dev
File diff suppressed because it is too large Load Diff
@@ -0,0 +1,241 @@
commit c44438579a1cc573cbdb2519dda46ccd04ddc817
Merge: 207ca38c f06f10a5
Author: Bomeng Wang <wangbomeng@calculet.tech>
AuthorDate: Thu Apr 9 10:37:03 2026 +0800
Commit: Bomeng Wang <wangbomeng@calculet.tech>
CommitDate: Thu Apr 9 10:37:03 2026 +0800
WIP on dev: 207ca38c delet extra printf
tools/server/server.cpp | 22 +++++++++++++---------
1 file changed, 13 insertions(+), 9 deletions(-)
diff --cc tools/server/server.cpp
index 868d17b4,868d17b4..d2a035ba
--- a/tools/server/server.cpp
+++ b/tools/server/server.cpp
@@@ -1875,7 -1875,7 +1875,7 @@@ struct server_slot
GGML_ASSERT(task);
auto previous_msg = chat_msg;
-- SRV_DBG("Parsing chat message: %s\n", generated_text.c_str());
++ //SRV_DBG("Parsing chat message: %s\n", generated_text.c_str());
auto new_msg = common_chat_parse(
generated_text,
/* is_partial= */ stop != STOP_TYPE_EOS,
@@@ -1920,13 -1920,13 +1920,17 @@@
}
void print_timings() const {
-- const double t_prompt = t_prompt_processing / n_prompt_tokens_processed;
-- const double n_prompt_second = 1e3 / t_prompt_processing * n_prompt_tokens_processed;
++ const double t_copyout_total = t_inference_outcopy / 32 * 31;
++ const double t_copyout_decode = (t_inference_outcopy - t_prefill_inference_outcopy) / 32 * 31;
++ const double t_copyout_prefill = t_prefill_inference_outcopy / 32 * 31;
-- const double t_gen = t_token_generation / n_decoded;
-- const double n_gen_second = 1e3 / t_token_generation * n_decoded;
++ const double t_prompt = (t_prompt_processing - t_copyout_prefill) / n_prompt_tokens_processed;
++ const double n_prompt_second = 1e3 / (t_prompt_processing - t_copyout_prefill) * n_prompt_tokens_processed;
-- const double t_total = t_prompt_processing + t_token_generation;
++ const double t_gen = (t_token_generation - t_copyout_decode) / n_decoded;
++ const double n_gen_second = 1e3 / (t_token_generation - t_copyout_decode) * n_decoded;
++
++ const double t_total = t_prompt_processing + t_token_generation -t_copyout_total ;
const double t_framework_other = t_total - t_inference_accumulated - t_inference_incopy - t_inference_outcopy - t_sampling_accumulated - t_unknown;
const double t_prompt_inference = t_prefill_inference_accumulated / n_prompt_tokens_processed;
@@@ -1950,9 -1950,9 +1954,9 @@@
" [Device] Unknown : %10.2f ms \n"
" [CPU] Sampling: %10.2f ms \n"
" [CPU] Fw Ovhd : %10.2f ms (Batch Prep, Logic, etc.)\n",
-- t_prompt_processing, n_prompt_tokens_processed, t_prompt, n_prompt_second,
-- t_token_generation, n_decoded, t_gen, n_gen_second,
-- t_prompt_processing + t_token_generation, n_prompt_tokens_processed + n_decoded,
++ t_prompt_processing - t_copyout_prefill , n_prompt_tokens_processed, t_prompt, n_prompt_second,
++ t_token_generation - t_copyout_decode , n_decoded, t_gen, n_gen_second,
++ t_prompt_processing + t_token_generation - t_copyout_total, n_prompt_tokens_processed + n_decoded,
t_inference_accumulated, t_prefill_inference_accumulated, t_prompt_inference, t_inference_accumulated - t_prefill_inference_accumulated, t_gen_inference,
t_inference_incopy, t_prefill_inference_incopy, t_prompt_incopy, t_inference_incopy - t_prefill_inference_incopy, t_gen_incopy,
t_inference_outcopy, t_prefill_inference_outcopy, t_prompt_outcopy, t_inference_outcopy - t_prefill_inference_outcopy, t_gen_outcopy,
commit 2a67be2e31c4b7b28fa3937893ec9e86bf5d9f4d
Merge: 99dd308a 294f5e41
Author: Bomeng Wang <wangbomeng@calculet.tech>
AuthorDate: Mon Apr 27 11:41:25 2026 +0800
Commit: Bomeng Wang <wangbomeng@calculet.tech>
CommitDate: Mon Apr 27 11:41:25 2026 +0800
WIP on (no branch): 99dd308a server: fix max_seq_len
common/common.cpp | 90 ++++++++++++++++++++++++++---------------------------
src/llama-calrt.cpp | 14 +++++++--
2 files changed, 57 insertions(+), 47 deletions(-)
diff --cc common/common.cpp
index 625b369b,625b369b..898d4452
--- a/common/common.cpp
+++ b/common/common.cpp
@@@ -1058,51 -1058,51 +1058,51 @@@ struct common_init_result common_init_f
params.sampling.dry_penalty_last_n = llama_n_ctx(lctx);
}
-- if (params.warmup) {
-- LOG_WRN("%s: warming up the model with an empty run - please wait ... (--no-warmup to disable)\n", __func__);
--
-- llama_set_warmup(lctx, true);
--
-- std::vector<llama_token> tmp;
-- llama_token bos = llama_vocab_bos(vocab);
-- llama_token eos = llama_vocab_eos(vocab);
--
-- // some models (e.g. T5) don't have a BOS token
-- if (bos != LLAMA_TOKEN_NULL) {
-- tmp.push_back(bos);
-- }
-- if (eos != LLAMA_TOKEN_NULL) {
-- tmp.push_back(eos);
-- }
-- if (tmp.empty()) {
-- tmp.push_back(0);
-- }
--
-- if (llama_model_has_encoder(model)) {
-- #ifdef USE_CALRT
-- //calrt_encode(cal_ctx, llama_batch_get_one(tmp.data(), tmp.size()));
-- #else
-- llama_encode(lctx, llama_batch_get_one(tmp.data(), tmp.size()));
-- #endif
-- llama_token decoder_start_token_id = llama_model_decoder_start_token(model);
-- if (decoder_start_token_id == LLAMA_TOKEN_NULL) {
-- decoder_start_token_id = bos;
-- }
-- tmp.clear();
-- tmp.push_back(decoder_start_token_id);
-- }
-- if (llama_model_has_decoder(model)) {
-- #ifdef USE_CALRT
-- calrt_decode(cal_ctx, llama_batch_get_one(tmp.data(), std::min(tmp.size(), (size_t) params.n_batch)));
-- #else
-- llama_decode(lctx, llama_batch_get_one(tmp.data(), std::min(tmp.size(), (size_t) params.n_batch)));
-- #endif
-- }
-- llama_memory_clear(llama_get_memory(lctx), true);
-- llama_synchronize(lctx);
-- llama_perf_context_reset(lctx);
-- llama_set_warmup(lctx, false);
-- }
++ // if (params.warmup) {
++ // LOG_WRN("%s: warming up the model with an empty run - please wait ... (--no-warmup to disable)\n", __func__);
++
++ // llama_set_warmup(lctx, true);
++
++ // std::vector<llama_token> tmp;
++ // llama_token bos = llama_vocab_bos(vocab);
++ // llama_token eos = llama_vocab_eos(vocab);
++
++ // // some models (e.g. T5) don't have a BOS token
++ // if (bos != LLAMA_TOKEN_NULL) {
++ // tmp.push_back(bos);
++ // }
++ // if (eos != LLAMA_TOKEN_NULL) {
++ // tmp.push_back(eos);
++ // }
++ // if (tmp.empty()) {
++ // tmp.push_back(0);
++ // }
++
++ // if (llama_model_has_encoder(model)) {
++ // #ifdef USE_CALRT
++ // //calrt_encode(cal_ctx, llama_batch_get_one(tmp.data(), tmp.size()));
++ // #else
++ // llama_encode(lctx, llama_batch_get_one(tmp.data(), tmp.size()));
++ // #endif
++ // llama_token decoder_start_token_id = llama_model_decoder_start_token(model);
++ // if (decoder_start_token_id == LLAMA_TOKEN_NULL) {
++ // decoder_start_token_id = bos;
++ // }
++ // tmp.clear();
++ // tmp.push_back(decoder_start_token_id);
++ // }
++ // if (llama_model_has_decoder(model)) {
++ // #ifdef USE_CALRT
++ // calrt_decode(cal_ctx, llama_batch_get_one(tmp.data(), std::min(tmp.size(), (size_t) params.n_batch)));
++ // #else
++ // llama_decode(lctx, llama_batch_get_one(tmp.data(), std::min(tmp.size(), (size_t) params.n_batch)));
++ // #endif
++ // }
++ // llama_memory_clear(llama_get_memory(lctx), true);
++ // llama_synchronize(lctx);
++ // llama_perf_context_reset(lctx);
++ // llama_set_warmup(lctx, false);
++ // }
iparams.model.reset(model);
iparams.context.reset(lctx);
diff --cc src/llama-calrt.cpp
index 9f41c955,9f41c955..e8dc07c6
--- a/src/llama-calrt.cpp
+++ b/src/llama-calrt.cpp
@@@ -43,6 -43,6 +43,16 @@@ std::unique_ptr<calrt::VirtualDevice> i
throw std::runtime_error("failed to create vdevice");
}
++ uint64_t commitId = 0;
++ uint32_t rdata = 0;
++ vDev->GetDevice()->ReadReg(0x0a238254, rdata);
++ commitId |=(((uint64_t)rdata) << 32);
++ vDev->GetDevice()->ReadReg(0x0a238258, rdata);
++ commitId |=((uint64_t)rdata);
++
++ LLAMA_LOG_INFO("CalcoreRT: =================== CalcoreRT Version: %016llx ====================\n", commitId);
++ LLAMA_LOG_INFO("CalRT: =================== CalRT Version %s ====================\n", calrt::calrt_version());
++
return vDev;
}
@@@ -664,7 -664,7 +674,7 @@@ calrt::CalbinModel * calrt_context::get
}
if (smodelName.empty()) {
-- LLAMA_LOG_ERROR("submodel who's name contains %s not found", name.c_str());
++ //LLAMA_LOG_ERROR("submodel who's name contains %s not found", name.c_str());
return nullptr;
}
@@@ -681,7 -681,7 +691,7 @@@ calrt::CalbinModel * calrt_context::get
}
if (smodelName.empty()) {
-- LLAMA_LOG_ERROR("submodel who's name contains %s not found", name1.c_str(), name2.c_str());
++ //LLAMA_LOG_ERROR("submodel who's name contains %s not found", name1.c_str(), name2.c_str());
return nullptr;
}
commit 81d4fd2c584e6df9199181e44b77fc3d939c0a67
Merge: efa1876b 499f6ff4
Author: Bomeng Wang <wangbomeng@calculet.tech>
AuthorDate: Thu Apr 30 16:18:01 2026 +0800
Commit: Bomeng Wang <wangbomeng@calculet.tech>
CommitDate: Thu Apr 30 16:18:01 2026 +0800
WIP on (no branch): efa1876b update version print
src/llama-calrt.cpp | 2 +-
1 file changed, 1 insertion(+), 1 deletion(-)
diff --cc src/llama-calrt.cpp
index 0dd65366,0dd65366..845d1df3
--- a/src/llama-calrt.cpp
+++ b/src/llama-calrt.cpp
@@@ -133,7 -133,7 +133,7 @@@ int calrt_context::decode(const llama_b
// require that all tokens are output
if (n_outputs_all != n_tokens_all) {
LLAMA_LOG_ERROR(
-- "%s: pooled embedding requires that all tokens are output (n_outputs_all = %d, n_tokens_all = %d)\n",
++ "%s: pooled embedding requires that all tokens are eoutput (n_outputs_all = %d, n_tokens_all = %d)\n",
__func__, n_outputs_all, n_tokens_all);
return -1;
}
@@ -0,0 +1,26 @@
commit 1d248d956f6cbcf5fdd4169d5467678ead035fe2
Author: wangbomeng <wangbomeng@calculet.tech>
AuthorDate: Tue Mar 24 02:17:22 2026 +0800
Commit: wangbomeng <wangbomeng@calculet.tech>
CommitDate: Tue Mar 24 02:17:22 2026 +0800
calrt: add slice
---
src/llama-calrt.cpp | 4 ++++
1 file changed, 4 insertions(+)
diff --git a/src/llama-calrt.cpp b/src/llama-calrt.cpp
index 5bbdd52e..e038a4c2 100644
--- a/src/llama-calrt.cpp
+++ b/src/llama-calrt.cpp
@@ -564,6 +564,10 @@ void calrt_context::calrt_infer(calrt_seqs_info & seqs) {
// makeup_ubatch(ubatch);
copy_data_to_ibuf(*pIbuf, ubatch, model_name);
+ //only copy promt tokens
+ //pObuf->SliceTensorByName(pObuf->GetTensorByName("outputs[0]")->GetDataPtr(),"outputs[0]", 0, cur_seq_len * sizeof(ggml_bf16_t));
+ pObuf->GetTensorByName("outputs[0]")->SliceTensor(0, cur_seq_len * sizeof(ggml_bf16_t));
+
calrt::infer(vdev, model, pIbuf.get(), pObuf.get());
pObuf->Wait();
+135
View File
@@ -0,0 +1,135 @@
dev@{2026-06-01T14:16:30+08:00} fd9bd632f346085920d523dd307a3e4c11cc0a05 refs/heads/dev@{2026-06-01T14:16:30+08:00} pull: Fast-forward
origin/dev@{2026-06-01T14:16:30+08:00} fd9bd632f346085920d523dd307a3e4c11cc0a05 refs/remotes/origin/dev@{2026-06-01T14:16:30+08:00} pull: fast-forward
HEAD@{2026-06-01T14:16:30+08:00} fd9bd632f346085920d523dd307a3e4c11cc0a05 HEAD@{2026-06-01T14:16:30+08:00} pull: Fast-forward
dev@{2026-06-01T11:48:36+08:00} e08e473cf292ba73789769b993bb35bcdfc31689 refs/heads/dev@{2026-06-01T11:48:36+08:00} pull: Fast-forward
HEAD@{2026-06-01T11:48:36+08:00} e08e473cf292ba73789769b993bb35bcdfc31689 HEAD@{2026-06-01T11:48:36+08:00} pull: Fast-forward
origin/dev@{2026-06-01T11:48:32+08:00} e08e473cf292ba73789769b993bb35bcdfc31689 refs/remotes/origin/dev@{2026-06-01T11:48:32+08:00} fetch origin: fast-forward
dev@{2026-05-28T14:23:50+08:00} d1bc743c10080fed1253686ce01749b42611ded4 refs/heads/dev@{2026-05-28T14:23:50+08:00} pull: Fast-forward
HEAD@{2026-05-28T14:23:50+08:00} d1bc743c10080fed1253686ce01749b42611ded4 HEAD@{2026-05-28T14:23:50+08:00} pull: Fast-forward
origin/dev@{2026-05-28T14:23:46+08:00} d1bc743c10080fed1253686ce01749b42611ded4 refs/remotes/origin/dev@{2026-05-28T14:23:46+08:00} fetch origin: fast-forward
dev@{2026-05-27T10:34:19+08:00} 2f201160b1960fd7be18b70d5770599d7082dd2f refs/heads/dev@{2026-05-27T10:34:19+08:00} pull: Fast-forward
HEAD@{2026-05-27T10:34:19+08:00} 2f201160b1960fd7be18b70d5770599d7082dd2f HEAD@{2026-05-27T10:34:19+08:00} pull: Fast-forward
origin/dev@{2026-05-27T10:34:07+08:00} 2f201160b1960fd7be18b70d5770599d7082dd2f refs/remotes/origin/dev@{2026-05-27T10:34:07+08:00} fetch origin: fast-forward
origin/runtime_replace@{2026-05-27T10:34:07+08:00} ebce9e1a548c2329aa97f53b8b2ad50d968088dc refs/remotes/origin/runtime_replace@{2026-05-27T10:34:07+08:00} fetch origin: storing head
dev@{2026-05-22T14:52:55+08:00} 33d96dae28e17208ef61a71dba40cda3c04f135a refs/heads/dev@{2026-05-22T14:52:55+08:00} pull: Fast-forward
HEAD@{2026-05-22T14:52:55+08:00} 33d96dae28e17208ef61a71dba40cda3c04f135a HEAD@{2026-05-22T14:52:55+08:00} pull: Fast-forward
origin/dev@{2026-05-22T14:52:52+08:00} 33d96dae28e17208ef61a71dba40cda3c04f135a refs/remotes/origin/dev@{2026-05-22T14:52:52+08:00} fetch origin: fast-forward
dev@{2026-05-21T14:08:18+08:00} 37f068d87cc2d0a0b40ce978031fc9932fc89077 refs/heads/dev@{2026-05-21T14:08:18+08:00} pull: Fast-forward
HEAD@{2026-05-21T14:08:18+08:00} 37f068d87cc2d0a0b40ce978031fc9932fc89077 HEAD@{2026-05-21T14:08:18+08:00} pull: Fast-forward
stash@{2026-05-21T14:08:14+08:00} 1921024604db640f09ade83c8a437ebf15bde360 refs/stash@{2026-05-21T14:08:14+08:00} WIP on dev: d028722a replace cparam.n_ubatch with n_ubatch()
HEAD@{2026-05-21T14:08:14+08:00} d028722a12c5a463cc97207787cfd03d7a2590b0 HEAD@{2026-05-21T14:08:14+08:00} reset: moving to HEAD
origin/dev@{2026-05-21T14:07:59+08:00} 37f068d87cc2d0a0b40ce978031fc9932fc89077 refs/remotes/origin/dev@{2026-05-21T14:07:59+08:00} pull: fast-forward
dev@{2026-05-20T14:42:24+08:00} d028722a12c5a463cc97207787cfd03d7a2590b0 refs/heads/dev@{2026-05-20T14:42:24+08:00} pull: Fast-forward
origin/dev@{2026-05-20T14:42:24+08:00} d028722a12c5a463cc97207787cfd03d7a2590b0 refs/remotes/origin/dev@{2026-05-20T14:42:24+08:00} pull: fast-forward
HEAD@{2026-05-20T14:42:24+08:00} d028722a12c5a463cc97207787cfd03d7a2590b0 HEAD@{2026-05-20T14:42:24+08:00} pull: Fast-forward
dev@{2026-05-20T11:49:02+08:00} 63442fde8dc285817f725bd6c5fae80f478a3813 refs/heads/dev@{2026-05-20T11:49:02+08:00} pull: Fast-forward
HEAD@{2026-05-20T11:49:02+08:00} 63442fde8dc285817f725bd6c5fae80f478a3813 HEAD@{2026-05-20T11:49:02+08:00} pull: Fast-forward
origin/dev@{2026-05-20T11:48:59+08:00} 63442fde8dc285817f725bd6c5fae80f478a3813 refs/remotes/origin/dev@{2026-05-20T11:48:59+08:00} fetch origin: fast-forward
dev@{2026-05-15T14:40:31+08:00} a43741244a646d3f8fa3ff01bb9b7d059223d0a5 refs/heads/dev@{2026-05-15T14:40:31+08:00} pull: Fast-forward
HEAD@{2026-05-15T14:40:31+08:00} a43741244a646d3f8fa3ff01bb9b7d059223d0a5 HEAD@{2026-05-15T14:40:31+08:00} pull: Fast-forward
origin/dev@{2026-05-15T14:40:27+08:00} a43741244a646d3f8fa3ff01bb9b7d059223d0a5 refs/remotes/origin/dev@{2026-05-15T14:40:27+08:00} fetch origin: fast-forward
dev@{2026-04-30T16:18:07+08:00} fabcc7dac4b34d83fe430980bb364b81087c7ee9 refs/heads/dev@{2026-04-30T16:18:07+08:00} pull: Fast-forward
HEAD@{2026-04-30T16:18:07+08:00} fabcc7dac4b34d83fe430980bb364b81087c7ee9 HEAD@{2026-04-30T16:18:07+08:00} pull: Fast-forward
HEAD@{2026-04-30T16:18:04+08:00} 6d55eae7e76b768acfcec045b8e84cded8ae3b55 HEAD@{2026-04-30T16:18:04+08:00} checkout: moving from efa1876bb8b2a449a55054a8c3745892f2c0f262 to dev
stash@{2026-04-30T16:18:01+08:00} 81d4fd2c584e6df9199181e44b77fc3d939c0a67 refs/stash@{2026-04-30T16:18:01+08:00} WIP on (no branch): efa1876b update version print
origin/dev@{2026-04-30T16:17:46+08:00} fabcc7dac4b34d83fe430980bb364b81087c7ee9 refs/remotes/origin/dev@{2026-04-30T16:17:46+08:00} fetch origin: fast-forward
origin/dev-ben@{2026-04-30T16:17:46+08:00} 1bec0db5a675ddc60fb793be2a746e8f3c8855dc refs/remotes/origin/dev-ben@{2026-04-30T16:17:46+08:00} fetch origin: storing head
HEAD@{2026-04-27T11:41:28+08:00} efa1876bb8b2a449a55054a8c3745892f2c0f262 HEAD@{2026-04-27T11:41:28+08:00} checkout: moving from 99dd308adb8488fa869bb669e3335e646a938eff to v0.2.2
stash@{2026-04-27T11:41:25+08:00} 2a67be2e31c4b7b28fa3937893ec9e86bf5d9f4d refs/stash@{2026-04-27T11:41:25+08:00} WIP on (no branch): 99dd308a server: fix max_seq_len
origin/dev@{2026-04-27T11:40:53+08:00} efa1876bb8b2a449a55054a8c3745892f2c0f262 refs/remotes/origin/dev@{2026-04-27T11:40:53+08:00} fetch --tags: fast-forward
HEAD@{2026-04-22T16:07:08+08:00} 99dd308adb8488fa869bb669e3335e646a938eff HEAD@{2026-04-22T16:07:08+08:00} checkout: moving from 6d55eae7e76b768acfcec045b8e84cded8ae3b55 to v0.2.1
origin/dev@{2026-04-22T16:06:57+08:00} 99dd308adb8488fa869bb669e3335e646a938eff refs/remotes/origin/dev@{2026-04-22T16:06:57+08:00} fetch --tags: fast-forward
HEAD@{2026-04-17T22:58:19+08:00} 6d55eae7e76b768acfcec045b8e84cded8ae3b55 HEAD@{2026-04-17T22:58:19+08:00} checkout: moving from dev to v0.2.0
origin/dev@{2026-04-17T22:58:07+08:00} 96b4e267e562f44e76ec6c965ee0fa361f0439bf refs/remotes/origin/dev@{2026-04-17T22:58:07+08:00} fetch --tags: fast-forward
origin/dev-ot@{2026-04-17T22:58:07+08:00} 99962021f2dd1994dbbf90d5712f0ca2633f20f8 refs/remotes/origin/dev-ot@{2026-04-17T22:58:07+08:00} fetch --tags: storing head
origin/test-cicd@{2026-04-17T22:58:07+08:00} 795179beb5bba728e0ccf0a7e80a5ec5ef36e92a refs/remotes/origin/test-cicd@{2026-04-17T22:58:07+08:00} fetch --tags: storing head
dev@{2026-04-10T14:59:56+08:00} 6d55eae7e76b768acfcec045b8e84cded8ae3b55 refs/heads/dev@{2026-04-10T14:59:56+08:00} pull: Fast-forward
HEAD@{2026-04-10T14:59:56+08:00} 6d55eae7e76b768acfcec045b8e84cded8ae3b55 HEAD@{2026-04-10T14:59:56+08:00} pull: Fast-forward
origin/dev@{2026-04-10T14:59:55+08:00} 6d55eae7e76b768acfcec045b8e84cded8ae3b55 refs/remotes/origin/dev@{2026-04-10T14:59:55+08:00} pull: fast-forward
dev@{2026-04-10T09:39:08+08:00} 6f54682df62b8ec6bb4154b99c47b5becda3291f refs/heads/dev@{2026-04-10T09:39:08+08:00} pull: Fast-forward
HEAD@{2026-04-10T09:39:08+08:00} 6f54682df62b8ec6bb4154b99c47b5becda3291f HEAD@{2026-04-10T09:39:08+08:00} pull: Fast-forward
origin/dev@{2026-04-10T09:39:05+08:00} 6f54682df62b8ec6bb4154b99c47b5becda3291f refs/remotes/origin/dev@{2026-04-10T09:39:05+08:00} fetch origin: fast-forward
origin/dev@{2026-04-09T21:01:57+08:00} a2d5bf362d6c9a546f9deadf4f8975605a915d33 refs/remotes/origin/dev@{2026-04-09T21:01:57+08:00} update by push
dev@{2026-04-09T21:01:46+08:00} a2d5bf362d6c9a546f9deadf4f8975605a915d33 refs/heads/dev@{2026-04-09T21:01:46+08:00} commit: server: comment fixed time
HEAD@{2026-04-09T21:01:46+08:00} a2d5bf362d6c9a546f9deadf4f8975605a915d33 HEAD@{2026-04-09T21:01:46+08:00} commit: server: comment fixed time
dev@{2026-04-09T19:50:45+08:00} bd3a57a11aa008e0b5dc2a30f82fcd3a02587208 refs/heads/dev@{2026-04-09T19:50:45+08:00} pull: Fast-forward
HEAD@{2026-04-09T19:50:45+08:00} bd3a57a11aa008e0b5dc2a30f82fcd3a02587208 HEAD@{2026-04-09T19:50:45+08:00} pull: Fast-forward
origin/dev@{2026-04-09T19:50:41+08:00} bd3a57a11aa008e0b5dc2a30f82fcd3a02587208 refs/remotes/origin/dev@{2026-04-09T19:50:41+08:00} fetch origin: fast-forward
dev@{2026-04-09T17:48:39+08:00} 74d437ab1456831573def7ca385a74d0ca460c37 refs/heads/dev@{2026-04-09T17:48:39+08:00} pull: Fast-forward
HEAD@{2026-04-09T17:48:39+08:00} 74d437ab1456831573def7ca385a74d0ca460c37 HEAD@{2026-04-09T17:48:39+08:00} pull: Fast-forward
origin/dev@{2026-04-09T17:48:33+08:00} 74d437ab1456831573def7ca385a74d0ca460c37 refs/remotes/origin/dev@{2026-04-09T17:48:33+08:00} fetch origin: fast-forward
origin/dev@{2026-04-09T15:08:58+08:00} 0cd44929b442860dc0e5f88976108be82350f9dc refs/remotes/origin/dev@{2026-04-09T15:08:58+08:00} update by push
dev@{2026-04-09T15:08:50+08:00} 0cd44929b442860dc0e5f88976108be82350f9dc refs/heads/dev@{2026-04-09T15:08:50+08:00} commit: rm calculet0.txt
HEAD@{2026-04-09T15:08:50+08:00} 0cd44929b442860dc0e5f88976108be82350f9dc HEAD@{2026-04-09T15:08:50+08:00} commit: rm calculet0.txt
dev@{2026-04-09T15:08:21+08:00} b8153b6b8f244b223c9f4c2940ae1f212634519e refs/heads/dev@{2026-04-09T15:08:21+08:00} pull: Fast-forward
HEAD@{2026-04-09T15:08:21+08:00} b8153b6b8f244b223c9f4c2940ae1f212634519e HEAD@{2026-04-09T15:08:21+08:00} pull: Fast-forward
origin/dev@{2026-04-09T15:08:13+08:00} b8153b6b8f244b223c9f4c2940ae1f212634519e refs/remotes/origin/dev@{2026-04-09T15:08:13+08:00} fetch origin: fast-forward
dev@{2026-04-09T10:37:06+08:00} 622a22991089c6debd5f4b57738f3df3a0bda8b5 refs/heads/dev@{2026-04-09T10:37:06+08:00} pull: Fast-forward
HEAD@{2026-04-09T10:37:06+08:00} 622a22991089c6debd5f4b57738f3df3a0bda8b5 HEAD@{2026-04-09T10:37:06+08:00} pull: Fast-forward
stash@{2026-04-09T10:37:03+08:00} c44438579a1cc573cbdb2519dda46ccd04ddc817 refs/stash@{2026-04-09T10:37:03+08:00} WIP on dev: 207ca38c delet extra printf
HEAD@{2026-04-09T10:37:03+08:00} 207ca38c751f7e6c251833eb11e89a2a0bb0fd07 HEAD@{2026-04-09T10:37:03+08:00} reset: moving to HEAD
origin/dev@{2026-04-09T10:36:56+08:00} 622a22991089c6debd5f4b57738f3df3a0bda8b5 refs/remotes/origin/dev@{2026-04-09T10:36:56+08:00} fetch origin: fast-forward
origin/dev@{2026-04-09T09:49:10+08:00} 5f47a738ba56a37d0ff281a16212f41979568e35 refs/remotes/origin/dev@{2026-04-09T09:49:10+08:00} fetch origin: fast-forward
dev@{2026-04-08T19:16:32+08:00} 207ca38c751f7e6c251833eb11e89a2a0bb0fd07 refs/heads/dev@{2026-04-08T19:16:32+08:00} pull: Fast-forward
HEAD@{2026-04-08T19:16:32+08:00} 207ca38c751f7e6c251833eb11e89a2a0bb0fd07 HEAD@{2026-04-08T19:16:32+08:00} pull: Fast-forward
origin/dev@{2026-04-08T19:16:29+08:00} 207ca38c751f7e6c251833eb11e89a2a0bb0fd07 refs/remotes/origin/dev@{2026-04-08T19:16:29+08:00} fetch origin: fast-forward
origin/dev@{2026-04-08T16:58:41+08:00} da724f3e2a8af2c2537e3edcff41e9415ac66fef refs/remotes/origin/dev@{2026-04-08T16:58:41+08:00} update by push
dev@{2026-04-08T16:58:32+08:00} da724f3e2a8af2c2537e3edcff41e9415ac66fef refs/heads/dev@{2026-04-08T16:58:32+08:00} commit: calrt: add MapBuf
HEAD@{2026-04-08T16:58:32+08:00} da724f3e2a8af2c2537e3edcff41e9415ac66fef HEAD@{2026-04-08T16:58:32+08:00} commit: calrt: add MapBuf
dev@{2026-04-08T13:59:59+08:00} 18814f9bf1a423ebe8f32d6043c9cbc5b21b0218 refs/heads/dev@{2026-04-08T13:59:59+08:00} pull: Fast-forward
HEAD@{2026-04-08T13:59:59+08:00} 18814f9bf1a423ebe8f32d6043c9cbc5b21b0218 HEAD@{2026-04-08T13:59:59+08:00} pull: Fast-forward
origin/dev@{2026-04-08T13:59:54+08:00} 18814f9bf1a423ebe8f32d6043c9cbc5b21b0218 refs/remotes/origin/dev@{2026-04-08T13:59:54+08:00} fetch origin: fast-forward
dev@{2026-04-03T21:11:05+08:00} e126c21ed7b793b648d63533ea7ee30885f5a82a refs/heads/dev@{2026-04-03T21:11:05+08:00} pull: Fast-forward
HEAD@{2026-04-03T21:11:05+08:00} e126c21ed7b793b648d63533ea7ee30885f5a82a HEAD@{2026-04-03T21:11:05+08:00} pull: Fast-forward
HEAD@{2026-04-03T21:11:01+08:00} 5603e050af07173589f3b8850121263d86da01fd HEAD@{2026-04-03T21:11:01+08:00} checkout: moving from 39edc6ec2e9560ccb20a2b8e547f58102bb268c1 to dev
HEAD@{2026-04-03T15:55:06+08:00} 39edc6ec2e9560ccb20a2b8e547f58102bb268c1 HEAD@{2026-04-03T15:55:06+08:00} checkout: moving from 41e6636ea1fb3884e41fb2023f92b0e7262ef09b to v0.1.1
HEAD@{2026-04-03T15:55:03+08:00} 41e6636ea1fb3884e41fb2023f92b0e7262ef09b HEAD@{2026-04-03T15:55:03+08:00} checkout: moving from dev to v0.0.1
origin/dev@{2026-04-03T15:54:45+08:00} e126c21ed7b793b648d63533ea7ee30885f5a82a refs/remotes/origin/dev@{2026-04-03T15:54:45+08:00} fetch --tags: fast-forward
dev@{2026-04-01T14:28:01+08:00} 5603e050af07173589f3b8850121263d86da01fd refs/heads/dev@{2026-04-01T14:28:01+08:00} pull: Fast-forward
HEAD@{2026-04-01T14:28:01+08:00} 5603e050af07173589f3b8850121263d86da01fd HEAD@{2026-04-01T14:28:01+08:00} pull: Fast-forward
HEAD@{2026-04-01T14:27:40+08:00} 41e6636ea1fb3884e41fb2023f92b0e7262ef09b HEAD@{2026-04-01T14:27:40+08:00} checkout: moving from 39edc6ec2e9560ccb20a2b8e547f58102bb268c1 to dev
origin/dev@{2026-04-01T14:08:20+08:00} 5603e050af07173589f3b8850121263d86da01fd refs/remotes/origin/dev@{2026-04-01T14:08:20+08:00} fetch --tags: fast-forward
HEAD@{2026-04-01T14:06:50+08:00} 39edc6ec2e9560ccb20a2b8e547f58102bb268c1 HEAD@{2026-04-01T14:06:50+08:00} commit: add t_incopy t_outcopy
HEAD@{2026-04-01T10:44:20+08:00} 2006831fd6ea8a8e16518b81bcee29fb674676ea HEAD@{2026-04-01T10:44:20+08:00} checkout: moving from 41e6636ea1fb3884e41fb2023f92b0e7262ef09b to v0.1.0
HEAD@{2026-04-01T10:39:36+08:00} 41e6636ea1fb3884e41fb2023f92b0e7262ef09b HEAD@{2026-04-01T10:39:36+08:00} checkout: moving from dev to v0.1.0
HEAD@{2026-04-01T10:39:18+08:00} 41e6636ea1fb3884e41fb2023f92b0e7262ef09b HEAD@{2026-04-01T10:39:18+08:00} checkout: moving from 41e6636ea1fb3884e41fb2023f92b0e7262ef09b to dev
origin/dev@{2026-04-01T10:37:22+08:00} 1e8a16cd0e3ad3c9a0f8746852a0a38c6e52322e refs/remotes/origin/dev@{2026-04-01T10:37:22+08:00} fetch --tags: fast-forward
HEAD@{2026-03-27T08:34:06+08:00} 41e6636ea1fb3884e41fb2023f92b0e7262ef09b HEAD@{2026-03-27T08:34:06+08:00} checkout: moving from 1d248d956f6cbcf5fdd4169d5467678ead035fe2 to v0.0.1
origin/dev@{2026-03-27T08:34:00+08:00} e4eaab700333490e80ebefc8d023f6c1adfcc312 refs/remotes/origin/dev@{2026-03-27T08:34:00+08:00} fetch --tags: fast-forward
HEAD@{2026-03-25T09:14:58+08:00} 1d248d956f6cbcf5fdd4169d5467678ead035fe2 HEAD@{2026-03-25T09:14:58+08:00} checkout: moving from 41e6636ea1fb3884e41fb2023f92b0e7262ef09b to v0.2.0
origin/dev@{2026-03-25T09:12:44+08:00} 3c08ebf0e442cd730ddffd959ec676f9caf31c82 refs/remotes/origin/dev@{2026-03-25T09:12:44+08:00} fetch: fast-forward
HEAD@{2026-03-18T14:57:33+08:00} 41e6636ea1fb3884e41fb2023f92b0e7262ef09b HEAD@{2026-03-18T14:57:33+08:00} checkout: moving from dev to v0.5
HEAD@{2026-03-17T16:17:54+08:00} 41e6636ea1fb3884e41fb2023f92b0e7262ef09b HEAD@{2026-03-17T16:17:54+08:00} checkout: moving from 41e6636ea1fb3884e41fb2023f92b0e7262ef09b to dev
HEAD@{2026-03-17T16:14:45+08:00} 41e6636ea1fb3884e41fb2023f92b0e7262ef09b HEAD@{2026-03-17T16:14:45+08:00} checkout: moving from dev to tags/v0.5
origin/dev@{2026-03-12T16:37:18+08:00} 41e6636ea1fb3884e41fb2023f92b0e7262ef09b refs/remotes/origin/dev@{2026-03-12T16:37:18+08:00} update by push
dev@{2026-03-12T16:36:07+08:00} 41e6636ea1fb3884e41fb2023f92b0e7262ef09b refs/heads/dev@{2026-03-12T16:36:07+08:00} commit: server: correct the max_seq_len judgment
HEAD@{2026-03-12T16:36:07+08:00} 41e6636ea1fb3884e41fb2023f92b0e7262ef09b HEAD@{2026-03-12T16:36:07+08:00} commit: server: correct the max_seq_len judgment
origin/dev@{2026-03-12T16:10:47+08:00} d0a1b2c758440720d42fa108b3444f54593daa73 refs/remotes/origin/dev@{2026-03-12T16:10:47+08:00} update by push
dev@{2026-03-12T16:10:28+08:00} d0a1b2c758440720d42fa108b3444f54593daa73 refs/heads/dev@{2026-03-12T16:10:28+08:00} commit: calrt: comment out dump
HEAD@{2026-03-12T16:10:28+08:00} d0a1b2c758440720d42fa108b3444f54593daa73 HEAD@{2026-03-12T16:10:28+08:00} commit: calrt: comment out dump
dev@{2026-03-12T11:47:42+08:00} b37b7d9756feb3dac2db526eeab38b572a095d47 refs/heads/dev@{2026-03-12T11:47:42+08:00} pull: Fast-forward
origin/dev@{2026-03-12T11:47:42+08:00} b37b7d9756feb3dac2db526eeab38b572a095d47 refs/remotes/origin/dev@{2026-03-12T11:47:42+08:00} pull: fast-forward
HEAD@{2026-03-12T11:47:42+08:00} b37b7d9756feb3dac2db526eeab38b572a095d47 HEAD@{2026-03-12T11:47:42+08:00} pull: Fast-forward
dev@{2026-03-10T16:07:47+08:00} 7ddafbdcb9426ae3af016925b8b596f11e8742d0 refs/heads/dev@{2026-03-10T16:07:47+08:00} pull: Fast-forward
origin/dev@{2026-03-10T16:07:47+08:00} 7ddafbdcb9426ae3af016925b8b596f11e8742d0 refs/remotes/origin/dev@{2026-03-10T16:07:47+08:00} pull: fast-forward
HEAD@{2026-03-10T16:07:47+08:00} 7ddafbdcb9426ae3af016925b8b596f11e8742d0 HEAD@{2026-03-10T16:07:47+08:00} pull: Fast-forward
origin/dev@{2026-03-09T15:03:51+08:00} b2c45d8ddefb7ec09435231c8ec5b736fabf9c91 refs/remotes/origin/dev@{2026-03-09T15:03:51+08:00} update by push
dev@{2026-03-09T15:03:26+08:00} b2c45d8ddefb7ec09435231c8ec5b736fabf9c91 refs/heads/dev@{2026-03-09T15:03:26+08:00} commit: clart: past_kv_len = n_tokens
HEAD@{2026-03-09T15:03:26+08:00} b2c45d8ddefb7ec09435231c8ec5b736fabf9c91 HEAD@{2026-03-09T15:03:26+08:00} commit: clart: past_kv_len = n_tokens
dev@{2026-03-09T11:35:56+08:00} c6ea3f0d2468e3b8eab5de80bacee7fe4c9dd3d7 refs/heads/dev@{2026-03-09T11:35:56+08:00} pull: Fast-forward
HEAD@{2026-03-09T11:35:56+08:00} c6ea3f0d2468e3b8eab5de80bacee7fe4c9dd3d7 HEAD@{2026-03-09T11:35:56+08:00} pull: Fast-forward
origin/dev@{2026-03-09T11:34:55+08:00} c6ea3f0d2468e3b8eab5de80bacee7fe4c9dd3d7 refs/remotes/origin/dev@{2026-03-09T11:34:55+08:00} pull: fast-forward
dev@{2026-03-06T15:09:58+08:00} f8fba66b657c51a1df1efc7267bfea9f6140cebf refs/heads/dev@{2026-03-06T15:09:58+08:00} pull: Fast-forward
HEAD@{2026-03-06T15:09:58+08:00} f8fba66b657c51a1df1efc7267bfea9f6140cebf HEAD@{2026-03-06T15:09:58+08:00} pull: Fast-forward
origin/dev@{2026-03-06T15:09:57+08:00} f8fba66b657c51a1df1efc7267bfea9f6140cebf refs/remotes/origin/dev@{2026-03-06T15:09:57+08:00} pull: fast-forward
dev@{2026-03-06T12:00:10+08:00} e672e02ca1a582f9e3a9d011d9e1b4fea4942a25 refs/heads/dev@{2026-03-06T12:00:10+08:00} pull: Fast-forward
origin/dev@{2026-03-06T12:00:10+08:00} e672e02ca1a582f9e3a9d011d9e1b4fea4942a25 refs/remotes/origin/dev@{2026-03-06T12:00:10+08:00} pull: fast-forward
HEAD@{2026-03-06T12:00:10+08:00} e672e02ca1a582f9e3a9d011d9e1b4fea4942a25 HEAD@{2026-03-06T12:00:10+08:00} pull: Fast-forward
dev@{2026-03-06T11:14:08+08:00} 7a3a9a0e76bb5f530beafcfe52e87e388e93117a refs/heads/dev@{2026-03-06T11:14:08+08:00} pull: Fast-forward
HEAD@{2026-03-06T11:14:08+08:00} 7a3a9a0e76bb5f530beafcfe52e87e388e93117a HEAD@{2026-03-06T11:14:08+08:00} pull: Fast-forward
origin/dev@{2026-03-06T11:14:07+08:00} 7a3a9a0e76bb5f530beafcfe52e87e388e93117a refs/remotes/origin/dev@{2026-03-06T11:14:07+08:00} pull: fast-forward
dev@{2026-02-28T14:50:17+08:00} 583c387efaf7bc030574e554088de79d09a27fbd refs/heads/dev@{2026-02-28T14:50:17+08:00} branch: Created from refs/remotes/origin/dev
HEAD@{2026-02-28T14:50:17+08:00} 583c387efaf7bc030574e554088de79d09a27fbd HEAD@{2026-02-28T14:50:17+08:00} checkout: moving from master to dev
master@{2026-02-28T14:50:13+08:00} 0d5a470223fc90b6b6807921d68011ff06ae7f9e refs/heads/master@{2026-02-28T14:50:13+08:00} clone: from http://192.168.10.26:1000/yunzhe/llama.cpp.git
origin@{2026-02-28T14:50:13+08:00} 0d5a470223fc90b6b6807921d68011ff06ae7f9e refs/remotes/origin/HEAD@{2026-02-28T14:50:13+08:00} clone: from http://192.168.10.26:1000/yunzhe/llama.cpp.git
HEAD@{2026-02-28T14:50:13+08:00} 0d5a470223fc90b6b6807921d68011ff06ae7f9e HEAD@{2026-02-28T14:50:13+08:00} clone: from http://192.168.10.26:1000/yunzhe/llama.cpp.git
1 dev@{2026-06-01T14:16:30+08:00} fd9bd632f346085920d523dd307a3e4c11cc0a05 refs/heads/dev@{2026-06-01T14:16:30+08:00} pull: Fast-forward
2 origin/dev@{2026-06-01T14:16:30+08:00} fd9bd632f346085920d523dd307a3e4c11cc0a05 refs/remotes/origin/dev@{2026-06-01T14:16:30+08:00} pull: fast-forward
3 HEAD@{2026-06-01T14:16:30+08:00} fd9bd632f346085920d523dd307a3e4c11cc0a05 HEAD@{2026-06-01T14:16:30+08:00} pull: Fast-forward
4 dev@{2026-06-01T11:48:36+08:00} e08e473cf292ba73789769b993bb35bcdfc31689 refs/heads/dev@{2026-06-01T11:48:36+08:00} pull: Fast-forward
5 HEAD@{2026-06-01T11:48:36+08:00} e08e473cf292ba73789769b993bb35bcdfc31689 HEAD@{2026-06-01T11:48:36+08:00} pull: Fast-forward
6 origin/dev@{2026-06-01T11:48:32+08:00} e08e473cf292ba73789769b993bb35bcdfc31689 refs/remotes/origin/dev@{2026-06-01T11:48:32+08:00} fetch origin: fast-forward
7 dev@{2026-05-28T14:23:50+08:00} d1bc743c10080fed1253686ce01749b42611ded4 refs/heads/dev@{2026-05-28T14:23:50+08:00} pull: Fast-forward
8 HEAD@{2026-05-28T14:23:50+08:00} d1bc743c10080fed1253686ce01749b42611ded4 HEAD@{2026-05-28T14:23:50+08:00} pull: Fast-forward
9 origin/dev@{2026-05-28T14:23:46+08:00} d1bc743c10080fed1253686ce01749b42611ded4 refs/remotes/origin/dev@{2026-05-28T14:23:46+08:00} fetch origin: fast-forward
10 dev@{2026-05-27T10:34:19+08:00} 2f201160b1960fd7be18b70d5770599d7082dd2f refs/heads/dev@{2026-05-27T10:34:19+08:00} pull: Fast-forward
11 HEAD@{2026-05-27T10:34:19+08:00} 2f201160b1960fd7be18b70d5770599d7082dd2f HEAD@{2026-05-27T10:34:19+08:00} pull: Fast-forward
12 origin/dev@{2026-05-27T10:34:07+08:00} 2f201160b1960fd7be18b70d5770599d7082dd2f refs/remotes/origin/dev@{2026-05-27T10:34:07+08:00} fetch origin: fast-forward
13 origin/runtime_replace@{2026-05-27T10:34:07+08:00} ebce9e1a548c2329aa97f53b8b2ad50d968088dc refs/remotes/origin/runtime_replace@{2026-05-27T10:34:07+08:00} fetch origin: storing head
14 dev@{2026-05-22T14:52:55+08:00} 33d96dae28e17208ef61a71dba40cda3c04f135a refs/heads/dev@{2026-05-22T14:52:55+08:00} pull: Fast-forward
15 HEAD@{2026-05-22T14:52:55+08:00} 33d96dae28e17208ef61a71dba40cda3c04f135a HEAD@{2026-05-22T14:52:55+08:00} pull: Fast-forward
16 origin/dev@{2026-05-22T14:52:52+08:00} 33d96dae28e17208ef61a71dba40cda3c04f135a refs/remotes/origin/dev@{2026-05-22T14:52:52+08:00} fetch origin: fast-forward
17 dev@{2026-05-21T14:08:18+08:00} 37f068d87cc2d0a0b40ce978031fc9932fc89077 refs/heads/dev@{2026-05-21T14:08:18+08:00} pull: Fast-forward
18 HEAD@{2026-05-21T14:08:18+08:00} 37f068d87cc2d0a0b40ce978031fc9932fc89077 HEAD@{2026-05-21T14:08:18+08:00} pull: Fast-forward
19 stash@{2026-05-21T14:08:14+08:00} 1921024604db640f09ade83c8a437ebf15bde360 refs/stash@{2026-05-21T14:08:14+08:00} WIP on dev: d028722a replace cparam.n_ubatch with n_ubatch()
20 HEAD@{2026-05-21T14:08:14+08:00} d028722a12c5a463cc97207787cfd03d7a2590b0 HEAD@{2026-05-21T14:08:14+08:00} reset: moving to HEAD
21 origin/dev@{2026-05-21T14:07:59+08:00} 37f068d87cc2d0a0b40ce978031fc9932fc89077 refs/remotes/origin/dev@{2026-05-21T14:07:59+08:00} pull: fast-forward
22 dev@{2026-05-20T14:42:24+08:00} d028722a12c5a463cc97207787cfd03d7a2590b0 refs/heads/dev@{2026-05-20T14:42:24+08:00} pull: Fast-forward
23 origin/dev@{2026-05-20T14:42:24+08:00} d028722a12c5a463cc97207787cfd03d7a2590b0 refs/remotes/origin/dev@{2026-05-20T14:42:24+08:00} pull: fast-forward
24 HEAD@{2026-05-20T14:42:24+08:00} d028722a12c5a463cc97207787cfd03d7a2590b0 HEAD@{2026-05-20T14:42:24+08:00} pull: Fast-forward
25 dev@{2026-05-20T11:49:02+08:00} 63442fde8dc285817f725bd6c5fae80f478a3813 refs/heads/dev@{2026-05-20T11:49:02+08:00} pull: Fast-forward
26 HEAD@{2026-05-20T11:49:02+08:00} 63442fde8dc285817f725bd6c5fae80f478a3813 HEAD@{2026-05-20T11:49:02+08:00} pull: Fast-forward
27 origin/dev@{2026-05-20T11:48:59+08:00} 63442fde8dc285817f725bd6c5fae80f478a3813 refs/remotes/origin/dev@{2026-05-20T11:48:59+08:00} fetch origin: fast-forward
28 dev@{2026-05-15T14:40:31+08:00} a43741244a646d3f8fa3ff01bb9b7d059223d0a5 refs/heads/dev@{2026-05-15T14:40:31+08:00} pull: Fast-forward
29 HEAD@{2026-05-15T14:40:31+08:00} a43741244a646d3f8fa3ff01bb9b7d059223d0a5 HEAD@{2026-05-15T14:40:31+08:00} pull: Fast-forward
30 origin/dev@{2026-05-15T14:40:27+08:00} a43741244a646d3f8fa3ff01bb9b7d059223d0a5 refs/remotes/origin/dev@{2026-05-15T14:40:27+08:00} fetch origin: fast-forward
31 dev@{2026-04-30T16:18:07+08:00} fabcc7dac4b34d83fe430980bb364b81087c7ee9 refs/heads/dev@{2026-04-30T16:18:07+08:00} pull: Fast-forward
32 HEAD@{2026-04-30T16:18:07+08:00} fabcc7dac4b34d83fe430980bb364b81087c7ee9 HEAD@{2026-04-30T16:18:07+08:00} pull: Fast-forward
33 HEAD@{2026-04-30T16:18:04+08:00} 6d55eae7e76b768acfcec045b8e84cded8ae3b55 HEAD@{2026-04-30T16:18:04+08:00} checkout: moving from efa1876bb8b2a449a55054a8c3745892f2c0f262 to dev
34 stash@{2026-04-30T16:18:01+08:00} 81d4fd2c584e6df9199181e44b77fc3d939c0a67 refs/stash@{2026-04-30T16:18:01+08:00} WIP on (no branch): efa1876b update version print
35 origin/dev@{2026-04-30T16:17:46+08:00} fabcc7dac4b34d83fe430980bb364b81087c7ee9 refs/remotes/origin/dev@{2026-04-30T16:17:46+08:00} fetch origin: fast-forward
36 origin/dev-ben@{2026-04-30T16:17:46+08:00} 1bec0db5a675ddc60fb793be2a746e8f3c8855dc refs/remotes/origin/dev-ben@{2026-04-30T16:17:46+08:00} fetch origin: storing head
37 HEAD@{2026-04-27T11:41:28+08:00} efa1876bb8b2a449a55054a8c3745892f2c0f262 HEAD@{2026-04-27T11:41:28+08:00} checkout: moving from 99dd308adb8488fa869bb669e3335e646a938eff to v0.2.2
38 stash@{2026-04-27T11:41:25+08:00} 2a67be2e31c4b7b28fa3937893ec9e86bf5d9f4d refs/stash@{2026-04-27T11:41:25+08:00} WIP on (no branch): 99dd308a server: fix max_seq_len
39 origin/dev@{2026-04-27T11:40:53+08:00} efa1876bb8b2a449a55054a8c3745892f2c0f262 refs/remotes/origin/dev@{2026-04-27T11:40:53+08:00} fetch --tags: fast-forward
40 HEAD@{2026-04-22T16:07:08+08:00} 99dd308adb8488fa869bb669e3335e646a938eff HEAD@{2026-04-22T16:07:08+08:00} checkout: moving from 6d55eae7e76b768acfcec045b8e84cded8ae3b55 to v0.2.1
41 origin/dev@{2026-04-22T16:06:57+08:00} 99dd308adb8488fa869bb669e3335e646a938eff refs/remotes/origin/dev@{2026-04-22T16:06:57+08:00} fetch --tags: fast-forward
42 HEAD@{2026-04-17T22:58:19+08:00} 6d55eae7e76b768acfcec045b8e84cded8ae3b55 HEAD@{2026-04-17T22:58:19+08:00} checkout: moving from dev to v0.2.0
43 origin/dev@{2026-04-17T22:58:07+08:00} 96b4e267e562f44e76ec6c965ee0fa361f0439bf refs/remotes/origin/dev@{2026-04-17T22:58:07+08:00} fetch --tags: fast-forward
44 origin/dev-ot@{2026-04-17T22:58:07+08:00} 99962021f2dd1994dbbf90d5712f0ca2633f20f8 refs/remotes/origin/dev-ot@{2026-04-17T22:58:07+08:00} fetch --tags: storing head
45 origin/test-cicd@{2026-04-17T22:58:07+08:00} 795179beb5bba728e0ccf0a7e80a5ec5ef36e92a refs/remotes/origin/test-cicd@{2026-04-17T22:58:07+08:00} fetch --tags: storing head
46 dev@{2026-04-10T14:59:56+08:00} 6d55eae7e76b768acfcec045b8e84cded8ae3b55 refs/heads/dev@{2026-04-10T14:59:56+08:00} pull: Fast-forward
47 HEAD@{2026-04-10T14:59:56+08:00} 6d55eae7e76b768acfcec045b8e84cded8ae3b55 HEAD@{2026-04-10T14:59:56+08:00} pull: Fast-forward
48 origin/dev@{2026-04-10T14:59:55+08:00} 6d55eae7e76b768acfcec045b8e84cded8ae3b55 refs/remotes/origin/dev@{2026-04-10T14:59:55+08:00} pull: fast-forward
49 dev@{2026-04-10T09:39:08+08:00} 6f54682df62b8ec6bb4154b99c47b5becda3291f refs/heads/dev@{2026-04-10T09:39:08+08:00} pull: Fast-forward
50 HEAD@{2026-04-10T09:39:08+08:00} 6f54682df62b8ec6bb4154b99c47b5becda3291f HEAD@{2026-04-10T09:39:08+08:00} pull: Fast-forward
51 origin/dev@{2026-04-10T09:39:05+08:00} 6f54682df62b8ec6bb4154b99c47b5becda3291f refs/remotes/origin/dev@{2026-04-10T09:39:05+08:00} fetch origin: fast-forward
52 origin/dev@{2026-04-09T21:01:57+08:00} a2d5bf362d6c9a546f9deadf4f8975605a915d33 refs/remotes/origin/dev@{2026-04-09T21:01:57+08:00} update by push
53 dev@{2026-04-09T21:01:46+08:00} a2d5bf362d6c9a546f9deadf4f8975605a915d33 refs/heads/dev@{2026-04-09T21:01:46+08:00} commit: server: comment fixed time
54 HEAD@{2026-04-09T21:01:46+08:00} a2d5bf362d6c9a546f9deadf4f8975605a915d33 HEAD@{2026-04-09T21:01:46+08:00} commit: server: comment fixed time
55 dev@{2026-04-09T19:50:45+08:00} bd3a57a11aa008e0b5dc2a30f82fcd3a02587208 refs/heads/dev@{2026-04-09T19:50:45+08:00} pull: Fast-forward
56 HEAD@{2026-04-09T19:50:45+08:00} bd3a57a11aa008e0b5dc2a30f82fcd3a02587208 HEAD@{2026-04-09T19:50:45+08:00} pull: Fast-forward
57 origin/dev@{2026-04-09T19:50:41+08:00} bd3a57a11aa008e0b5dc2a30f82fcd3a02587208 refs/remotes/origin/dev@{2026-04-09T19:50:41+08:00} fetch origin: fast-forward
58 dev@{2026-04-09T17:48:39+08:00} 74d437ab1456831573def7ca385a74d0ca460c37 refs/heads/dev@{2026-04-09T17:48:39+08:00} pull: Fast-forward
59 HEAD@{2026-04-09T17:48:39+08:00} 74d437ab1456831573def7ca385a74d0ca460c37 HEAD@{2026-04-09T17:48:39+08:00} pull: Fast-forward
60 origin/dev@{2026-04-09T17:48:33+08:00} 74d437ab1456831573def7ca385a74d0ca460c37 refs/remotes/origin/dev@{2026-04-09T17:48:33+08:00} fetch origin: fast-forward
61 origin/dev@{2026-04-09T15:08:58+08:00} 0cd44929b442860dc0e5f88976108be82350f9dc refs/remotes/origin/dev@{2026-04-09T15:08:58+08:00} update by push
62 dev@{2026-04-09T15:08:50+08:00} 0cd44929b442860dc0e5f88976108be82350f9dc refs/heads/dev@{2026-04-09T15:08:50+08:00} commit: rm calculet0.txt
63 HEAD@{2026-04-09T15:08:50+08:00} 0cd44929b442860dc0e5f88976108be82350f9dc HEAD@{2026-04-09T15:08:50+08:00} commit: rm calculet0.txt
64 dev@{2026-04-09T15:08:21+08:00} b8153b6b8f244b223c9f4c2940ae1f212634519e refs/heads/dev@{2026-04-09T15:08:21+08:00} pull: Fast-forward
65 HEAD@{2026-04-09T15:08:21+08:00} b8153b6b8f244b223c9f4c2940ae1f212634519e HEAD@{2026-04-09T15:08:21+08:00} pull: Fast-forward
66 origin/dev@{2026-04-09T15:08:13+08:00} b8153b6b8f244b223c9f4c2940ae1f212634519e refs/remotes/origin/dev@{2026-04-09T15:08:13+08:00} fetch origin: fast-forward
67 dev@{2026-04-09T10:37:06+08:00} 622a22991089c6debd5f4b57738f3df3a0bda8b5 refs/heads/dev@{2026-04-09T10:37:06+08:00} pull: Fast-forward
68 HEAD@{2026-04-09T10:37:06+08:00} 622a22991089c6debd5f4b57738f3df3a0bda8b5 HEAD@{2026-04-09T10:37:06+08:00} pull: Fast-forward
69 stash@{2026-04-09T10:37:03+08:00} c44438579a1cc573cbdb2519dda46ccd04ddc817 refs/stash@{2026-04-09T10:37:03+08:00} WIP on dev: 207ca38c delet extra printf
70 HEAD@{2026-04-09T10:37:03+08:00} 207ca38c751f7e6c251833eb11e89a2a0bb0fd07 HEAD@{2026-04-09T10:37:03+08:00} reset: moving to HEAD
71 origin/dev@{2026-04-09T10:36:56+08:00} 622a22991089c6debd5f4b57738f3df3a0bda8b5 refs/remotes/origin/dev@{2026-04-09T10:36:56+08:00} fetch origin: fast-forward
72 origin/dev@{2026-04-09T09:49:10+08:00} 5f47a738ba56a37d0ff281a16212f41979568e35 refs/remotes/origin/dev@{2026-04-09T09:49:10+08:00} fetch origin: fast-forward
73 dev@{2026-04-08T19:16:32+08:00} 207ca38c751f7e6c251833eb11e89a2a0bb0fd07 refs/heads/dev@{2026-04-08T19:16:32+08:00} pull: Fast-forward
74 HEAD@{2026-04-08T19:16:32+08:00} 207ca38c751f7e6c251833eb11e89a2a0bb0fd07 HEAD@{2026-04-08T19:16:32+08:00} pull: Fast-forward
75 origin/dev@{2026-04-08T19:16:29+08:00} 207ca38c751f7e6c251833eb11e89a2a0bb0fd07 refs/remotes/origin/dev@{2026-04-08T19:16:29+08:00} fetch origin: fast-forward
76 origin/dev@{2026-04-08T16:58:41+08:00} da724f3e2a8af2c2537e3edcff41e9415ac66fef refs/remotes/origin/dev@{2026-04-08T16:58:41+08:00} update by push
77 dev@{2026-04-08T16:58:32+08:00} da724f3e2a8af2c2537e3edcff41e9415ac66fef refs/heads/dev@{2026-04-08T16:58:32+08:00} commit: calrt: add MapBuf
78 HEAD@{2026-04-08T16:58:32+08:00} da724f3e2a8af2c2537e3edcff41e9415ac66fef HEAD@{2026-04-08T16:58:32+08:00} commit: calrt: add MapBuf
79 dev@{2026-04-08T13:59:59+08:00} 18814f9bf1a423ebe8f32d6043c9cbc5b21b0218 refs/heads/dev@{2026-04-08T13:59:59+08:00} pull: Fast-forward
80 HEAD@{2026-04-08T13:59:59+08:00} 18814f9bf1a423ebe8f32d6043c9cbc5b21b0218 HEAD@{2026-04-08T13:59:59+08:00} pull: Fast-forward
81 origin/dev@{2026-04-08T13:59:54+08:00} 18814f9bf1a423ebe8f32d6043c9cbc5b21b0218 refs/remotes/origin/dev@{2026-04-08T13:59:54+08:00} fetch origin: fast-forward
82 dev@{2026-04-03T21:11:05+08:00} e126c21ed7b793b648d63533ea7ee30885f5a82a refs/heads/dev@{2026-04-03T21:11:05+08:00} pull: Fast-forward
83 HEAD@{2026-04-03T21:11:05+08:00} e126c21ed7b793b648d63533ea7ee30885f5a82a HEAD@{2026-04-03T21:11:05+08:00} pull: Fast-forward
84 HEAD@{2026-04-03T21:11:01+08:00} 5603e050af07173589f3b8850121263d86da01fd HEAD@{2026-04-03T21:11:01+08:00} checkout: moving from 39edc6ec2e9560ccb20a2b8e547f58102bb268c1 to dev
85 HEAD@{2026-04-03T15:55:06+08:00} 39edc6ec2e9560ccb20a2b8e547f58102bb268c1 HEAD@{2026-04-03T15:55:06+08:00} checkout: moving from 41e6636ea1fb3884e41fb2023f92b0e7262ef09b to v0.1.1
86 HEAD@{2026-04-03T15:55:03+08:00} 41e6636ea1fb3884e41fb2023f92b0e7262ef09b HEAD@{2026-04-03T15:55:03+08:00} checkout: moving from dev to v0.0.1
87 origin/dev@{2026-04-03T15:54:45+08:00} e126c21ed7b793b648d63533ea7ee30885f5a82a refs/remotes/origin/dev@{2026-04-03T15:54:45+08:00} fetch --tags: fast-forward
88 dev@{2026-04-01T14:28:01+08:00} 5603e050af07173589f3b8850121263d86da01fd refs/heads/dev@{2026-04-01T14:28:01+08:00} pull: Fast-forward
89 HEAD@{2026-04-01T14:28:01+08:00} 5603e050af07173589f3b8850121263d86da01fd HEAD@{2026-04-01T14:28:01+08:00} pull: Fast-forward
90 HEAD@{2026-04-01T14:27:40+08:00} 41e6636ea1fb3884e41fb2023f92b0e7262ef09b HEAD@{2026-04-01T14:27:40+08:00} checkout: moving from 39edc6ec2e9560ccb20a2b8e547f58102bb268c1 to dev
91 origin/dev@{2026-04-01T14:08:20+08:00} 5603e050af07173589f3b8850121263d86da01fd refs/remotes/origin/dev@{2026-04-01T14:08:20+08:00} fetch --tags: fast-forward
92 HEAD@{2026-04-01T14:06:50+08:00} 39edc6ec2e9560ccb20a2b8e547f58102bb268c1 HEAD@{2026-04-01T14:06:50+08:00} commit: add t_incopy t_outcopy
93 HEAD@{2026-04-01T10:44:20+08:00} 2006831fd6ea8a8e16518b81bcee29fb674676ea HEAD@{2026-04-01T10:44:20+08:00} checkout: moving from 41e6636ea1fb3884e41fb2023f92b0e7262ef09b to v0.1.0
94 HEAD@{2026-04-01T10:39:36+08:00} 41e6636ea1fb3884e41fb2023f92b0e7262ef09b HEAD@{2026-04-01T10:39:36+08:00} checkout: moving from dev to v0.1.0
95 HEAD@{2026-04-01T10:39:18+08:00} 41e6636ea1fb3884e41fb2023f92b0e7262ef09b HEAD@{2026-04-01T10:39:18+08:00} checkout: moving from 41e6636ea1fb3884e41fb2023f92b0e7262ef09b to dev
96 origin/dev@{2026-04-01T10:37:22+08:00} 1e8a16cd0e3ad3c9a0f8746852a0a38c6e52322e refs/remotes/origin/dev@{2026-04-01T10:37:22+08:00} fetch --tags: fast-forward
97 HEAD@{2026-03-27T08:34:06+08:00} 41e6636ea1fb3884e41fb2023f92b0e7262ef09b HEAD@{2026-03-27T08:34:06+08:00} checkout: moving from 1d248d956f6cbcf5fdd4169d5467678ead035fe2 to v0.0.1
98 origin/dev@{2026-03-27T08:34:00+08:00} e4eaab700333490e80ebefc8d023f6c1adfcc312 refs/remotes/origin/dev@{2026-03-27T08:34:00+08:00} fetch --tags: fast-forward
99 HEAD@{2026-03-25T09:14:58+08:00} 1d248d956f6cbcf5fdd4169d5467678ead035fe2 HEAD@{2026-03-25T09:14:58+08:00} checkout: moving from 41e6636ea1fb3884e41fb2023f92b0e7262ef09b to v0.2.0
100 origin/dev@{2026-03-25T09:12:44+08:00} 3c08ebf0e442cd730ddffd959ec676f9caf31c82 refs/remotes/origin/dev@{2026-03-25T09:12:44+08:00} fetch: fast-forward
101 HEAD@{2026-03-18T14:57:33+08:00} 41e6636ea1fb3884e41fb2023f92b0e7262ef09b HEAD@{2026-03-18T14:57:33+08:00} checkout: moving from dev to v0.5
102 HEAD@{2026-03-17T16:17:54+08:00} 41e6636ea1fb3884e41fb2023f92b0e7262ef09b HEAD@{2026-03-17T16:17:54+08:00} checkout: moving from 41e6636ea1fb3884e41fb2023f92b0e7262ef09b to dev
103 HEAD@{2026-03-17T16:14:45+08:00} 41e6636ea1fb3884e41fb2023f92b0e7262ef09b HEAD@{2026-03-17T16:14:45+08:00} checkout: moving from dev to tags/v0.5
104 origin/dev@{2026-03-12T16:37:18+08:00} 41e6636ea1fb3884e41fb2023f92b0e7262ef09b refs/remotes/origin/dev@{2026-03-12T16:37:18+08:00} update by push
105 dev@{2026-03-12T16:36:07+08:00} 41e6636ea1fb3884e41fb2023f92b0e7262ef09b refs/heads/dev@{2026-03-12T16:36:07+08:00} commit: server: correct the max_seq_len judgment
106 HEAD@{2026-03-12T16:36:07+08:00} 41e6636ea1fb3884e41fb2023f92b0e7262ef09b HEAD@{2026-03-12T16:36:07+08:00} commit: server: correct the max_seq_len judgment
107 origin/dev@{2026-03-12T16:10:47+08:00} d0a1b2c758440720d42fa108b3444f54593daa73 refs/remotes/origin/dev@{2026-03-12T16:10:47+08:00} update by push
108 dev@{2026-03-12T16:10:28+08:00} d0a1b2c758440720d42fa108b3444f54593daa73 refs/heads/dev@{2026-03-12T16:10:28+08:00} commit: calrt: comment out dump
109 HEAD@{2026-03-12T16:10:28+08:00} d0a1b2c758440720d42fa108b3444f54593daa73 HEAD@{2026-03-12T16:10:28+08:00} commit: calrt: comment out dump
110 dev@{2026-03-12T11:47:42+08:00} b37b7d9756feb3dac2db526eeab38b572a095d47 refs/heads/dev@{2026-03-12T11:47:42+08:00} pull: Fast-forward
111 origin/dev@{2026-03-12T11:47:42+08:00} b37b7d9756feb3dac2db526eeab38b572a095d47 refs/remotes/origin/dev@{2026-03-12T11:47:42+08:00} pull: fast-forward
112 HEAD@{2026-03-12T11:47:42+08:00} b37b7d9756feb3dac2db526eeab38b572a095d47 HEAD@{2026-03-12T11:47:42+08:00} pull: Fast-forward
113 dev@{2026-03-10T16:07:47+08:00} 7ddafbdcb9426ae3af016925b8b596f11e8742d0 refs/heads/dev@{2026-03-10T16:07:47+08:00} pull: Fast-forward
114 origin/dev@{2026-03-10T16:07:47+08:00} 7ddafbdcb9426ae3af016925b8b596f11e8742d0 refs/remotes/origin/dev@{2026-03-10T16:07:47+08:00} pull: fast-forward
115 HEAD@{2026-03-10T16:07:47+08:00} 7ddafbdcb9426ae3af016925b8b596f11e8742d0 HEAD@{2026-03-10T16:07:47+08:00} pull: Fast-forward
116 origin/dev@{2026-03-09T15:03:51+08:00} b2c45d8ddefb7ec09435231c8ec5b736fabf9c91 refs/remotes/origin/dev@{2026-03-09T15:03:51+08:00} update by push
117 dev@{2026-03-09T15:03:26+08:00} b2c45d8ddefb7ec09435231c8ec5b736fabf9c91 refs/heads/dev@{2026-03-09T15:03:26+08:00} commit: clart: past_kv_len = n_tokens
118 HEAD@{2026-03-09T15:03:26+08:00} b2c45d8ddefb7ec09435231c8ec5b736fabf9c91 HEAD@{2026-03-09T15:03:26+08:00} commit: clart: past_kv_len = n_tokens
119 dev@{2026-03-09T11:35:56+08:00} c6ea3f0d2468e3b8eab5de80bacee7fe4c9dd3d7 refs/heads/dev@{2026-03-09T11:35:56+08:00} pull: Fast-forward
120 HEAD@{2026-03-09T11:35:56+08:00} c6ea3f0d2468e3b8eab5de80bacee7fe4c9dd3d7 HEAD@{2026-03-09T11:35:56+08:00} pull: Fast-forward
121 origin/dev@{2026-03-09T11:34:55+08:00} c6ea3f0d2468e3b8eab5de80bacee7fe4c9dd3d7 refs/remotes/origin/dev@{2026-03-09T11:34:55+08:00} pull: fast-forward
122 dev@{2026-03-06T15:09:58+08:00} f8fba66b657c51a1df1efc7267bfea9f6140cebf refs/heads/dev@{2026-03-06T15:09:58+08:00} pull: Fast-forward
123 HEAD@{2026-03-06T15:09:58+08:00} f8fba66b657c51a1df1efc7267bfea9f6140cebf HEAD@{2026-03-06T15:09:58+08:00} pull: Fast-forward
124 origin/dev@{2026-03-06T15:09:57+08:00} f8fba66b657c51a1df1efc7267bfea9f6140cebf refs/remotes/origin/dev@{2026-03-06T15:09:57+08:00} pull: fast-forward
125 dev@{2026-03-06T12:00:10+08:00} e672e02ca1a582f9e3a9d011d9e1b4fea4942a25 refs/heads/dev@{2026-03-06T12:00:10+08:00} pull: Fast-forward
126 origin/dev@{2026-03-06T12:00:10+08:00} e672e02ca1a582f9e3a9d011d9e1b4fea4942a25 refs/remotes/origin/dev@{2026-03-06T12:00:10+08:00} pull: fast-forward
127 HEAD@{2026-03-06T12:00:10+08:00} e672e02ca1a582f9e3a9d011d9e1b4fea4942a25 HEAD@{2026-03-06T12:00:10+08:00} pull: Fast-forward
128 dev@{2026-03-06T11:14:08+08:00} 7a3a9a0e76bb5f530beafcfe52e87e388e93117a refs/heads/dev@{2026-03-06T11:14:08+08:00} pull: Fast-forward
129 HEAD@{2026-03-06T11:14:08+08:00} 7a3a9a0e76bb5f530beafcfe52e87e388e93117a HEAD@{2026-03-06T11:14:08+08:00} pull: Fast-forward
130 origin/dev@{2026-03-06T11:14:07+08:00} 7a3a9a0e76bb5f530beafcfe52e87e388e93117a refs/remotes/origin/dev@{2026-03-06T11:14:07+08:00} pull: fast-forward
131 dev@{2026-02-28T14:50:17+08:00} 583c387efaf7bc030574e554088de79d09a27fbd refs/heads/dev@{2026-02-28T14:50:17+08:00} branch: Created from refs/remotes/origin/dev
132 HEAD@{2026-02-28T14:50:17+08:00} 583c387efaf7bc030574e554088de79d09a27fbd HEAD@{2026-02-28T14:50:17+08:00} checkout: moving from master to dev
133 master@{2026-02-28T14:50:13+08:00} 0d5a470223fc90b6b6807921d68011ff06ae7f9e refs/heads/master@{2026-02-28T14:50:13+08:00} clone: from http://192.168.10.26:1000/yunzhe/llama.cpp.git
134 origin@{2026-02-28T14:50:13+08:00} 0d5a470223fc90b6b6807921d68011ff06ae7f9e refs/remotes/origin/HEAD@{2026-02-28T14:50:13+08:00} clone: from http://192.168.10.26:1000/yunzhe/llama.cpp.git
135 HEAD@{2026-02-28T14:50:13+08:00} 0d5a470223fc90b6b6807921d68011ff06ae7f9e HEAD@{2026-02-28T14:50:13+08:00} clone: from http://192.168.10.26:1000/yunzhe/llama.cpp.git
+17
View File
@@ -0,0 +1,17 @@
refs/heads/dev commit fd9bd632f346085920d523dd307a3e4c11cc0a05 2026-06-01T14:15:35+08:00 llama-bench: fix device-info
refs/heads/master commit 0d5a470223fc90b6b6807921d68011ff06ae7f9e 2025-08-25T11:15:06+02:00 convert : update Ernie 4.5 dense architecture name (#15555)
refs/remotes/origin/HEAD commit 0d5a470223fc90b6b6807921d68011ff06ae7f9e 2025-08-25T11:15:06+02:00 convert : update Ernie 4.5 dense architecture name (#15555)
refs/remotes/origin/dev commit fd9bd632f346085920d523dd307a3e4c11cc0a05 2026-06-01T14:15:35+08:00 llama-bench: fix device-info
refs/remotes/origin/dev-ben commit 1bec0db5a675ddc60fb793be2a746e8f3c8855dc 2026-04-30T16:02:59+08:00 bench: support 2 calbins
refs/remotes/origin/dev-ot commit 99962021f2dd1994dbbf90d5712f0ca2633f20f8 2026-04-17T14:48:33+08:00 calrt: add onetoken slice and untile_prefill
refs/remotes/origin/master commit 0d5a470223fc90b6b6807921d68011ff06ae7f9e 2025-08-25T11:15:06+02:00 convert : update Ernie 4.5 dense architecture name (#15555)
refs/remotes/origin/runtime_replace commit ebce9e1a548c2329aa97f53b8b2ad50d968088dc 2026-05-27T09:38:00+08:00 Refactor cal-llm integration by removing runtime capacity loading and adjusting request handling
refs/remotes/origin/test-cicd commit 795179beb5bba728e0ccf0a7e80a5ec5ef36e92a 2026-04-14T16:03:22+08:00 add ci yaml
refs/stash commit 1921024604db640f09ade83c8a437ebf15bde360 2026-05-21T14:08:14+08:00 WIP on dev: d028722a replace cparam.n_ubatch with n_ubatch()
refs/tags/v0.0.1 commit 41e6636ea1fb3884e41fb2023f92b0e7262ef09b 2026-03-12T16:36:07+08:00 server: correct the max_seq_len judgment
refs/tags/v0.1.0 tag 818a7215a8cc9e3d35999ea6e4187c5a1367c997 2026-04-01T10:42:55+08:00 add slice and infer/copy time
refs/tags/v0.1.1 tag bf461bb42c632b810c2c27b8b4291eaa5ef72f22 2026-04-01T14:07:32+08:00 add t_incopy t_outcopy
refs/tags/v0.2.0 tag f0dd7128023f2e18cb9a831180dc26adf360cbe9 2026-04-10T17:16:43+08:00 Show-260410
refs/tags/v0.2.1 tag 85f6fcd7f0ef420b171625a2a1ebc431ab9156a0 2026-04-21T15:51:33+08:00 support onetoken
refs/tags/v0.2.2 tag d55872adc99aa7b35c9a32b27fb5a77cfe665c05 2026-04-27T11:39:35+08:00 Show-260427
refs/tags/v0.3.0 tag 92460d41d588c6993c5a438c578afeeafc08ad78 2026-04-29T15:09:33+08:00 test llama-cli
1 refs/heads/dev commit fd9bd632f346085920d523dd307a3e4c11cc0a05 2026-06-01T14:15:35+08:00 llama-bench: fix device-info
2 refs/heads/master commit 0d5a470223fc90b6b6807921d68011ff06ae7f9e 2025-08-25T11:15:06+02:00 convert : update Ernie 4.5 dense architecture name (#15555)
3 refs/remotes/origin/HEAD commit 0d5a470223fc90b6b6807921d68011ff06ae7f9e 2025-08-25T11:15:06+02:00 convert : update Ernie 4.5 dense architecture name (#15555)
4 refs/remotes/origin/dev commit fd9bd632f346085920d523dd307a3e4c11cc0a05 2026-06-01T14:15:35+08:00 llama-bench: fix device-info
5 refs/remotes/origin/dev-ben commit 1bec0db5a675ddc60fb793be2a746e8f3c8855dc 2026-04-30T16:02:59+08:00 bench: support 2 calbins
6 refs/remotes/origin/dev-ot commit 99962021f2dd1994dbbf90d5712f0ca2633f20f8 2026-04-17T14:48:33+08:00 calrt: add onetoken slice and untile_prefill
7 refs/remotes/origin/master commit 0d5a470223fc90b6b6807921d68011ff06ae7f9e 2025-08-25T11:15:06+02:00 convert : update Ernie 4.5 dense architecture name (#15555)
8 refs/remotes/origin/runtime_replace commit ebce9e1a548c2329aa97f53b8b2ad50d968088dc 2026-05-27T09:38:00+08:00 Refactor cal-llm integration by removing runtime capacity loading and adjusting request handling
9 refs/remotes/origin/test-cicd commit 795179beb5bba728e0ccf0a7e80a5ec5ef36e92a 2026-04-14T16:03:22+08:00 add ci yaml
10 refs/stash commit 1921024604db640f09ade83c8a437ebf15bde360 2026-05-21T14:08:14+08:00 WIP on dev: d028722a replace cparam.n_ubatch with n_ubatch()
11 refs/tags/v0.0.1 commit 41e6636ea1fb3884e41fb2023f92b0e7262ef09b 2026-03-12T16:36:07+08:00 server: correct the max_seq_len judgment
12 refs/tags/v0.1.0 tag 818a7215a8cc9e3d35999ea6e4187c5a1367c997 2026-04-01T10:42:55+08:00 add slice and infer/copy time
13 refs/tags/v0.1.1 tag bf461bb42c632b810c2c27b8b4291eaa5ef72f22 2026-04-01T14:07:32+08:00 add t_incopy t_outcopy
14 refs/tags/v0.2.0 tag f0dd7128023f2e18cb9a831180dc26adf360cbe9 2026-04-10T17:16:43+08:00 Show-260410
15 refs/tags/v0.2.1 tag 85f6fcd7f0ef420b171625a2a1ebc431ab9156a0 2026-04-21T15:51:33+08:00 support onetoken
16 refs/tags/v0.2.2 tag d55872adc99aa7b35c9a32b27fb5a77cfe665c05 2026-04-27T11:39:35+08:00 Show-260427
17 refs/tags/v0.3.0 tag 92460d41d588c6993c5a438c578afeeafc08ad78 2026-04-29T15:09:33+08:00 test llama-cli
@@ -0,0 +1,25 @@
commit 1921024604db640f09ade83c8a437ebf15bde360
Merge: d028722a 5af229fe
Author: Bomeng Wang <wangbomeng@calculet.tech>
AuthorDate: Thu May 21 14:08:14 2026 +0800
Commit: Bomeng Wang <wangbomeng@calculet.tech>
CommitDate: Thu May 21 14:08:14 2026 +0800
WIP on dev: d028722a replace cparam.n_ubatch with n_ubatch()
tools/server/server.cpp | 2 +-
1 file changed, 1 insertion(+), 1 deletion(-)
diff --cc tools/server/server.cpp
index 91ffc6da,91ffc6da..592ca765
--- a/tools/server/server.cpp
+++ b/tools/server/server.cpp
@@@ -4191,7 -4191,7 +4191,7 @@@ struct server_context
break;
}
}
-- dump_content("\n", "prompt");
++ //dump_content("\n", "prompt");
// SLT_INF(slot, "new slot.prompt.tokens: %s\n", slot.slot.prompt.tokens.str().c_str());
+14
View File
@@ -0,0 +1,14 @@
refs/tags/v0.0.1 commit 41e6636ea1fb3884e41fb2023f92b0e7262ef09b server: correct the max_seq_len judgment server: correct the max_seq_len judgment
refs/tags/v0.1.0 tag 818a7215a8cc9e3d35999ea6e4187c5a1367c997 2006831fd6ea8a8e16518b81bcee29fb674676ea wangbomeng <wangbomeng@calculet.tech> 2026-04-01T10:42:55+08:00 add slice and infer/copy time add slice and infer/copy time
refs/tags/v0.1.1 tag bf461bb42c632b810c2c27b8b4291eaa5ef72f22 39edc6ec2e9560ccb20a2b8e547f58102bb268c1 Bomeng Wang <wangbomeng@calculet.tech> 2026-04-01T14:07:32+08:00 add t_incopy t_outcopy add t_incopy t_outcopy
refs/tags/v0.2.0 tag f0dd7128023f2e18cb9a831180dc26adf360cbe9 6d55eae7e76b768acfcec045b8e84cded8ae3b55 Bomeng Wang <wangbomeng@calculet.tech> 2026-04-10T17:16:43+08:00 Show-260410 Show-260410
refs/tags/v0.2.1 tag 85f6fcd7f0ef420b171625a2a1ebc431ab9156a0 99dd308adb8488fa869bb669e3335e646a938eff wangbomeng <wangbomeng@calculet.tech> 2026-04-21T15:51:33+08:00 support onetoken support onetoken
refs/tags/v0.2.2 tag d55872adc99aa7b35c9a32b27fb5a77cfe665c05 efa1876bb8b2a449a55054a8c3745892f2c0f262 wangbomeng <wangbomeng@calculet.tech> 2026-04-27T11:39:35+08:00 Show-260427 Show-260427
refs/tags/v0.3.0 tag 92460d41d588c6993c5a438c578afeeafc08ad78 a339954cc2a145a80c5ea349e7896211916cbed9 wangbomeng <wangbomeng@calculet.tech> 2026-04-29T15:09:33+08:00 test llama-cli test llama-cli
1 refs/tags/v0.0.1 commit 41e6636ea1fb3884e41fb2023f92b0e7262ef09b server: correct the max_seq_len judgment server: correct the max_seq_len judgment
2 refs/tags/v0.1.0 tag 818a7215a8cc9e3d35999ea6e4187c5a1367c997 2006831fd6ea8a8e16518b81bcee29fb674676ea wangbomeng <wangbomeng@calculet.tech> 2026-04-01T10:42:55+08:00 add slice and infer/copy time add slice and infer/copy time
3 refs/tags/v0.1.1 tag bf461bb42c632b810c2c27b8b4291eaa5ef72f22 39edc6ec2e9560ccb20a2b8e547f58102bb268c1 Bomeng Wang <wangbomeng@calculet.tech> 2026-04-01T14:07:32+08:00 add t_incopy t_outcopy add t_incopy t_outcopy
4 refs/tags/v0.2.0 tag f0dd7128023f2e18cb9a831180dc26adf360cbe9 6d55eae7e76b768acfcec045b8e84cded8ae3b55 Bomeng Wang <wangbomeng@calculet.tech> 2026-04-10T17:16:43+08:00 Show-260410 Show-260410
5 refs/tags/v0.2.1 tag 85f6fcd7f0ef420b171625a2a1ebc431ab9156a0 99dd308adb8488fa869bb669e3335e646a938eff wangbomeng <wangbomeng@calculet.tech> 2026-04-21T15:51:33+08:00 support onetoken support onetoken
6 refs/tags/v0.2.2 tag d55872adc99aa7b35c9a32b27fb5a77cfe665c05 efa1876bb8b2a449a55054a8c3745892f2c0f262 wangbomeng <wangbomeng@calculet.tech> 2026-04-27T11:39:35+08:00 Show-260427 Show-260427
7 refs/tags/v0.3.0 tag 92460d41d588c6993c5a438c578afeeafc08ad78 a339954cc2a145a80c5ea349e7896211916cbed9 wangbomeng <wangbomeng@calculet.tech> 2026-04-29T15:09:33+08:00 test llama-cli test llama-cli
@@ -0,0 +1,9 @@
3b14ed556c15529fe1f94b649f49db7156dfaf67 dde8b8228081769c8d8f1e0751d47fa7875f8423 2026-05-14T14:34:25+08:00 Yunzhe Jia - Removed references to CALRT from clip.h, mtmd-helper.cpp, mtmd-helper.h, mtmd.cpp, and mtmd.h. - Updated server.cpp to conditionally include CAL-LLM support. - Introduced option LLAMA_SERVER_USE_CAL_LLM in CMakeLists.txt to enable CAL-LLM integration. - Refactored server context to handle CAL-LLM requests and responses. - Updated image processing logic to remove CALRT-specific implementations. - Ensured compatibility with existing llama functionality while integrating new CAL-LLM features.
81a2cbd4cef5d28334ff513d6b69e593d9d1cb49 3b14ed556c15529fe1f94b649f49db7156dfaf67 2026-05-14T16:06:37+08:00 Yunzhe Jia Enhance CMake configuration for cal-llm integration by updating paths and adding library properties
b35bda124ccd4ed581dd6088d3ffa4931c2809b6 81a2cbd4cef5d28334ff513d6b69e593d9d1cb49 2026-05-15T09:19:31+08:00 Yunzhe Jia Implement vocab-only model initialization and enhance cal-llm backend error handling
2716130010c58f1cdd9d94f0e2f8e047bc92dc66 b35bda124ccd4ed581dd6088d3ffa4931c2809b6 2026-05-18T08:40:54+08:00 Yunzhe Jia fix n_ctx_slot error by adding runtime capacity loading for cal-llm
ddd60c928224b52eb4e1e60e01e8a1ecbb80ee45 2716130010c58f1cdd9d94f0e2f8e047bc92dc66 2026-05-20T09:22:40+08:00 Yunzhe Jia Add cal-llm backend profiling support with command-line option
38ca6895815671a87ceec86b4aa4eb976580ce76 ddd60c928224b52eb4e1e60e01e8a1ecbb80ee45 2026-05-20T16:37:13+08:00 Yunzhe Jia Add support for cal-llm profile dumping to JSONL file
9985688f7fa96f755882f96a2cd8a18114fdc42d 38ca6895815671a87ceec86b4aa4eb976580ce76 2026-05-25T09:05:49+08:00 Yunzhe Jia Refactor CalrtEngineConfig initialization by removing redundant parameters
e850ff4de25ad1221abc9bf3bb30df252ccd9c36 9985688f7fa96f755882f96a2cd8a18114fdc42d 2026-05-26T10:59:45+08:00 Yunzhe Jia Enhance cal-llm integration by adding runtime checks for CALRT_LIBRARY and updating link settings for Linux and Windows
ebce9e1a548c2329aa97f53b8b2ad50d968088dc e850ff4de25ad1221abc9bf3bb30df252ccd9c36 2026-05-27T09:38:00+08:00 Yunzhe Jia Refactor cal-llm integration by removing runtime capacity loading and adjusting request handling
1 3b14ed556c15529fe1f94b649f49db7156dfaf67 dde8b8228081769c8d8f1e0751d47fa7875f8423 2026-05-14T14:34:25+08:00 Yunzhe Jia - Removed references to CALRT from clip.h, mtmd-helper.cpp, mtmd-helper.h, mtmd.cpp, and mtmd.h. - Updated server.cpp to conditionally include CAL-LLM support. - Introduced option LLAMA_SERVER_USE_CAL_LLM in CMakeLists.txt to enable CAL-LLM integration. - Refactored server context to handle CAL-LLM requests and responses. - Updated image processing logic to remove CALRT-specific implementations. - Ensured compatibility with existing llama functionality while integrating new CAL-LLM features.
2 81a2cbd4cef5d28334ff513d6b69e593d9d1cb49 3b14ed556c15529fe1f94b649f49db7156dfaf67 2026-05-14T16:06:37+08:00 Yunzhe Jia Enhance CMake configuration for cal-llm integration by updating paths and adding library properties
3 b35bda124ccd4ed581dd6088d3ffa4931c2809b6 81a2cbd4cef5d28334ff513d6b69e593d9d1cb49 2026-05-15T09:19:31+08:00 Yunzhe Jia Implement vocab-only model initialization and enhance cal-llm backend error handling
4 2716130010c58f1cdd9d94f0e2f8e047bc92dc66 b35bda124ccd4ed581dd6088d3ffa4931c2809b6 2026-05-18T08:40:54+08:00 Yunzhe Jia fix n_ctx_slot error by adding runtime capacity loading for cal-llm
5 ddd60c928224b52eb4e1e60e01e8a1ecbb80ee45 2716130010c58f1cdd9d94f0e2f8e047bc92dc66 2026-05-20T09:22:40+08:00 Yunzhe Jia Add cal-llm backend profiling support with command-line option
6 38ca6895815671a87ceec86b4aa4eb976580ce76 ddd60c928224b52eb4e1e60e01e8a1ecbb80ee45 2026-05-20T16:37:13+08:00 Yunzhe Jia Add support for cal-llm profile dumping to JSONL file
7 9985688f7fa96f755882f96a2cd8a18114fdc42d 38ca6895815671a87ceec86b4aa4eb976580ce76 2026-05-25T09:05:49+08:00 Yunzhe Jia Refactor CalrtEngineConfig initialization by removing redundant parameters
8 e850ff4de25ad1221abc9bf3bb30df252ccd9c36 9985688f7fa96f755882f96a2cd8a18114fdc42d 2026-05-26T10:59:45+08:00 Yunzhe Jia Enhance cal-llm integration by adding runtime checks for CALRT_LIBRARY and updating link settings for Linux and Windows
9 ebce9e1a548c2329aa97f53b8b2ad50d968088dc e850ff4de25ad1221abc9bf3bb30df252ccd9c36 2026-05-27T09:38:00+08:00 Yunzhe Jia Refactor cal-llm integration by removing runtime capacity loading and adjusting request handling
File diff suppressed because it is too large Load Diff
@@ -0,0 +1 @@
795179beb5bba728e0ccf0a7e80a5ec5ef36e92a 6d55eae7e76b768acfcec045b8e84cded8ae3b55 2026-04-14T16:03:22+08:00 Yunzhe Jia add ci yaml
1 795179beb5bba728e0ccf0a7e80a5ec5ef36e92a 6d55eae7e76b768acfcec045b8e84cded8ae3b55 2026-04-14T16:03:22+08:00 Yunzhe Jia add ci yaml
@@ -0,0 +1,15 @@
diff --git a/.gitlab-ci.yml b/.gitlab-ci.yml
new file mode 100644
index 00000000..7057d0b9
--- /dev/null
+++ b/.gitlab-ci.yml
@@ -0,0 +1,8 @@
+test_runner:
+ tags:
+ - linux
+ - shell
+ script:
+ - hostname
+ - whoami
+ - pwd
\ No newline at end of file
@@ -0,0 +1,21 @@
unreachable blob e038a4c25d5589550680bf5bb556145f1524ae17
unreachable commit c44438579a1cc573cbdb2519dda46ccd04ddc817
unreachable commit 294f5e41db9f2ee14fa7e511b1774c6271c7c7ec
unreachable tree d05ebc0cfd0118f3de55beba48f69d50b0236ab3
unreachable commit 2a67be2e31c4b7b28fa3937893ec9e86bf5d9f4d
unreachable commit f06f10a592284d02a0e68019abab18f637cb738f
unreachable tree f97cd4efe5089af1e4ae43fff089474026826723
unreachable tree 7da9aa44884fc6465f3599ea65a384f5d3488dd9
unreachable tree 10c752119ebf43ef7db7420d0544d4d43a3eb118
unreachable tree 83ee7a4aafcded51d3dd499bc716fbf2c01fbae1
unreachable tree 50fb5c0cb4964d5a0e2dc56c0624e9ac1e0d4769
unreachable tag 0d02ad428fa1d0c94b686f2dfad558546272853c
unreachable commit 1d248d956f6cbcf5fdd4169d5467678ead035fe2
unreachable blob 845d1df3b3e3ac5df45404b08909c5941ea49e54
unreachable tree 6366e9b97d774c07aa96d9bab859bf96171149ec
unreachable tree a16b7f888c02ca271dada7503efc236b4c5312bd
unreachable commit 499f6ff441d26b9a720c3d3403bde14695257b9d
unreachable blob d2a035baeb46f868c72592d48a64c5ede41efee9
unreachable tree afd0cfa9b1c70459cc7fca20691a1b262958aa11
unreachable commit 81d4fd2c584e6df9199181e44b77fc3d939c0a67
unreachable blob e8dc07c6fe6282ff3d7d4e43210b3491982d10f0
@@ -0,0 +1 @@
## dev...origin/dev
@@ -0,0 +1 @@
[ERROR | 2026-04-09 17:13:21.535] /home/wangbomeng/calrt/hostrt/src/device/calrt_device.cpp:801 | Calrt Error --> CalrtErrorTimeout: Failed to deploy weights to Device
@@ -0,0 +1 @@
[ERROR | 2026-04-09 17:13:30.735] /home/wangbomeng/calrt/hostrt/src/device/calrt_device.cpp:801 | Calrt Error --> CalrtErrorTimeout: Failed to deploy weights to Device
@@ -0,0 +1 @@
[ERROR | 2026-04-09 17:13:44.088] /home/wangbomeng/calrt/hostrt/src/device/calrt_device.cpp:801 | Calrt Error --> CalrtErrorTimeout: Failed to deploy weights to Device
@@ -0,0 +1 @@
[ERROR | 2026-04-09 17:14:27.852] /home/wangbomeng/calrt/hostrt/src/device/calrt_device.cpp:801 | Calrt Error --> CalrtErrorTimeout: Failed to deploy weights to Device
@@ -0,0 +1,2 @@
[ERROR | 2026-02-26 03:12:40.709] /home/wangbomeng/calrt/hostrt/src/device/calrt_driver.cpp:595 | Calrt Error --> CalrtErrorNoDevice: No valid Calculet PCIe devices found
[ERROR | 2026-02-26 03:12:40.709] /home/wangbomeng/calrt/hostrt/src/device/calrt_pcie_device.cpp:15 | Calrt Error --> CalrtErrorDeviceUnavailable: No available device
@@ -0,0 +1,2 @@
[ERROR | 2026-04-17 14:54:27.428] /home/wangbomeng/calrt/hostrt/src/deploy/calrt_calbin.cpp:92 | Calrt Error --> CalrtErrorInvalidValue: Invalid directory path: /home/wangbomeng/cal-llama/llama.cpp/../../models/onetoken/Qwen2.5-0.5B-Instruct-dynamic-W8A8-W4AF16_4096_fa/calbin/.
[ERROR | 2026-04-17 14:54:27.429] /home/wangbomeng/calrt/hostrt/src/deploy/calrt_deploy.cpp:19 | Calrt Error --> CalrtErrorAssert: Calbin pointer is nullptr
@@ -0,0 +1,2 @@
[ERROR | 2026-04-17 14:54:43.619] /home/wangbomeng/calrt/hostrt/src/deploy/calrt_calbin.cpp:92 | Calrt Error --> CalrtErrorInvalidValue: Invalid directory path: /home/wangbomeng/cal-llama/llama.cpp/../../models/onetoken/Qwen2.5-0.5B-Instruct-dynamic-W8A8-W4AF16_4096_fa/.
[ERROR | 2026-04-17 14:54:43.619] /home/wangbomeng/calrt/hostrt/src/deploy/calrt_deploy.cpp:19 | Calrt Error --> CalrtErrorAssert: Calbin pointer is nullptr
@@ -0,0 +1,2 @@
[ERROR | 2026-04-09 14:44:16.521] /home/wangbomeng/calrt/hostrt/src/deploy/calrt_calbin.cpp:117 | Calrt Error --> CalrtErrorInvalidCalbin: Calbin is lack of global memory description. [/home/wangbomeng/cal-llama/llama.cpp/../../models/Qwen2.5-0.5B-Instruct-dynamic-W8A8-W4AF16_4096_fa/]
[ERROR | 2026-04-09 14:44:16.522] /home/wangbomeng/calrt/hostrt/src/deploy/calrt_deploy.cpp:19 | Calrt Error --> CalrtErrorAssert: Calbin pointer is nullptr
@@ -0,0 +1 @@
[ERROR | 2026-04-10 18:16:06.612] /home/wangbomeng/calrt/hostrt/src/device/calrt_pcie_device.cpp:15 | Calrt Error --> CalrtErrorDeviceUnavailable: No available device
@@ -0,0 +1 @@
[ERROR | 2026-04-10 18:16:24.002] /home/wangbomeng/calrt/hostrt/src/device/calrt_pcie_device.cpp:15 | Calrt Error --> CalrtErrorDeviceUnavailable: No available device
@@ -0,0 +1 @@
[ERROR | 2026-04-10 18:22:25.241] /home/wangbomeng/calrt/hostrt/src/device/calrt_pcie_device.cpp:15 | Calrt Error --> CalrtErrorDeviceUnavailable: No available device
@@ -0,0 +1 @@
[ERROR | 2026-04-10 18:29:41.324] /home/wangbomeng/calrt/hostrt/src/device/calrt_pcie_device.cpp:15 | Calrt Error --> CalrtErrorDeviceUnavailable: No available device
@@ -0,0 +1 @@
[ERROR | 2026-04-10 19:07:23.510] /home/wangbomeng/calrt/hostrt/src/device/calrt_pcie_device.cpp:15 | Calrt Error --> CalrtErrorDeviceUnavailable: No available device
@@ -0,0 +1,2 @@
[ERROR | 2026-05-13 12:24:24.246] Calrt Error --> CalrtErrorInvalidValue: Invalid directory path: .
[ERROR | 2026-05-13 12:24:24.247] Calrt Error --> CalrtErrorAssert: Calbin pointer is nullptr
@@ -0,0 +1,2 @@
[ERROR | 2026-05-13 14:04:18.231] Calrt Error --> CalrtErrorInvalidValue: Invalid directory path: .
[ERROR | 2026-05-13 14:04:18.232] Calrt Error --> CalrtErrorAssert: Calbin pointer is nullptr
@@ -0,0 +1 @@
[ERROR | 2026-02-06 01:46:15.373] /home/wangbomeng/calrt/hostrt/src/device/calrt_device.cpp:114 | Calrt Error --> CalrtErrorTimeout: Failed to Configure Model [DeepSeek-R1-Distill-Qwen-7B-decode64-W8A8-W4AF16-2layers-Dynamic_Input_with_KVcache-clib] to Device at step --> Set up Global Data
@@ -0,0 +1,2 @@
[ERROR | 2026-05-13 14:07:04.980] Calrt Error --> CalrtErrorInvalidValue: Invalid directory path: .
[ERROR | 2026-05-13 14:07:04.981] Calrt Error --> CalrtErrorAssert: Calbin pointer is nullptr
@@ -0,0 +1,757 @@
timestamp,model,prompt,content
2026-04-09 20:45:22,deepseek,Result only: 2 + 2 = ?,"**Solution:**
We need to find the result of \(2 + 2\).
1. **Addition:**
\[
2 + + 2 = 4
\]
**Final Answer:**
\boxed{4}"
2026-04-09 20:51:29,deepseek,who are you?,"As an AI language model, I don't have personal characteristics or emotions. However, I was created by Alibaba Cloud to assist with various tasks such as understanding human speech and providing information on different subjects. If you need help with something specific, feel free to ask!"
2026-04-09 20:51:30,deepseek,Result only: 2 + 2 = ?,The result of 2 + 2 is 4.
2026-04-09 20:51:31,deepseek,who are you?,"As an AI language model, I don't have personal characteristics or emotions. However, I was created by Alibaba Cloud to assist with various tasks such as understanding human speech and providing information on different subjects. If you need help with something specific, feel free to ask!"
2026-04-09 20:51:32,deepseek,Result only: 2 + 2 = ?,"I am a program that was created by Alibaba Cloud. I was trained on large amounts of text data to understand natural language.
My purpose is to assist users in understanding the meaning of words and phrases, as well as providing information about various topics. I can answer questions on many different subjects such as science, history, culture, etc."
2026-04-09 20:51:33,deepseek,Result only: 2 + 2 = ?,"I am a program that was created by Alibaba Cloud. I was trained on large amounts of text data to understand natural language.
My purpose is to assist users in understanding the meaning of words and phrases, as well as providing information about various topics. I can answer questions on many different subjects such as science, history, culture, etc."
2026-04-09 20:51:39,deepseek,用C++写冒泡排序,"当然!以下是一个简单的C++实现冒泡排序:
```cpp
#include <iostream>
using namespace std;
void bubbleSort(int arr[], int n) {
for (int i = 0; i < n - 1; i++) {
bool swapped = false;
for (int j = 0; j < n - i - 1 && !swapped; j++) {
if (arr[j + 1] < arr[j]) {
swapped = true;
swap(arr[j], arr[j + 1]);
}
}
}
}
void printArray(int arr[], int size) {
for (int i = 0; i < size - 1; i++) {
cout << arr[i] << "" "";
}
}
int main() {
int arr[] = {42, 86, 37, 59, 21};
bubbleSort(arr, sizeof(arr) / sizeof(int));
printArray(arr, sizeof(arr) / sizeof(int));
return 0;
}
```
这段代码首先定义了一个函数 `bubbleSort`,它接受一个整数数组和它的大小。然后调用这个函数对数组进行排序,并打印排序后的结果。
当你运行这段代码时,你会看到以下输出:
```
21
59
37
42
86
```
这表明排序成功地完成了。注意,这里使用了 `bubbleSort` 函数来实现冒泡排序,而不是使用 `sort()` 方法。"
2026-04-09 20:51:44,deepseek,用C++写冒泡排序,"当然!以下是一个简单的C++实现冒泡排序:
```cpp
#include <iostream>
using namespace std;
void bubbleSort(int arr[], int n) {
for (int i = 0; i < n - 1; i++) {
bool swapped = false;
for (int j = 0; j < n - i - 1 && !swapped; j++) {
if (arr[j] > arr[j + 1]) {
swapped = true;
swap(arr[j], arr[j + 1]);
}
}
}
}
void printArray(int arr[], int size) {
for (int i = 0; i < size - 1; i++) {
cout << arr[i] << "" "";
}
}
int main() {
int arr[] = {42, 86, 37, 59, 21};
int n = sizeof(arr) / sizeof(arr[0]);
bubbleSort(arr, n);
cout << ""Sorted array is: \n"";
printArray(arr, n);
}
```
这段代码首先定义了一个冒泡排序函数,然后在主函数中调用这个函数并打印出排序后的数组。你可以将 `arr[]` 和 `n` 的值设置为你自己的数组或列表。
注意:这个实现是按升序排序的,如果你需要按降序排序,请使用 `sort()` 函数。"
2026-04-09 20:51:49,deepseek,用C++写冒泡排序,"当然!以下是一个简单的C++实现冒泡排序:
```cpp
#include <iostream>
using namespace std;
void bubbleSort(int arr[], int n) {
for (int i = 0; i < n - 1; i++) {
bool swapped = false;
for (int j = 0; j < n - i - 1 && !swapped; j++) {
if (arr[j] > arr[j + 1]) {
swapped = true;
swap(arr[j], arr[j + 1]);
}
}
}
}
void printArray(int arr[], int size) {
for (int i = 0; i < size - 1; i++) {
cout << arr[i] << "" "";
}
}
int main() {
int arr[] = {42, 86, 37, 59, 21};
int n = sizeof(arr) / sizeof(arr[0]);
bubbleSort(arr, n);
cout << ""Sorted array is: \n"";
printArray(arr, n);
}
```
这段代码首先定义了一个冒泡排序函数,然后在主函数中调用这个函数并打印出排序后的数组。你可以将 `arr[]` 和 `n` 的值设置为你自己的数组或列表。
注意:这个实现是按升序排序的,如果你需要按降序排序,请使用 `sort()` 函数。"
2026-04-09 20:51:50,deepseek,who are you?,"As an AI language model, I don't have personal characteristics or emotions. However, I was created by Alibaba Cloud to assist with various tasks such as understanding human speech and providing information on different subjects. If you need help with something specific, feel free to ask!"
2026-04-09 20:51:50,deepseek,Result only: 2 + 2 = ?,The result of 2 + 2 is 4.
2026-04-09 20:51:51,deepseek,who are you?,"As an AI language model, I don't have personal characteristics or emotions. However, I was created by Alibaba Cloud to assist with various tasks such as understanding human speech and providing information on different subjects. If you need help with something specific, feel free to ask!"
2026-04-09 20:51:52,deepseek,who are you?,"As an AI language model, I don't have personal characteristics or emotions. However, I was trained on a large corpus of text data to understand human speech and respond appropriately. My purpose is to assist users in finding information, answer questions, and provide helpful responses to their inquiries. Is there anything specific you would like me to help you with?"
2026-04-09 20:51:54,deepseek,Result only: 2 + 2 = ?,"I am a program that was created by Alibaba Cloud. I was trained on large amounts of text data to understand natural language.
My purpose is to assist users in understanding and generating human-like responses to their questions or prompts. I can answer a wide range of topics, including science, history, culture, etc.
However, please note that my knowledge may be limited by the amount of training data I was trained on."
2026-04-09 20:51:59,deepseek,用C++写冒泡排序,"当然!以下是一个简单的C++实现冒泡排序:
```cpp
#include <iostream>
using namespace std;
void bubbleSort(int arr[], int n) {
for (int i = 0; i < n - 1; i++) {
bool swapped = false;
for (int j = 0; j < n - i - 1 && !swapped; j++) {
if (arr[j + 1] < arr[j]) {
swapped = true;
swap(arr[j], arr[j + 1]);
}
}
}
}
void printArray(int arr[], int size) {
for (int i = 0; i < size - 1; i++) {
cout << arr[i] << "" "";
}
}
int main() {
int arr[] = {42, 86, 37, 59, 21};
bubbleSort(arr, sizeof(arr) / sizeof(int));
printArray(arr, sizeof(arr) / sizeof(int));
return 0;
}
```
这段代码首先定义了一个函数 `bubbleSort`,它接受一个整数数组和它的大小。然后调用这个函数对数组进行排序,并打印排序后的结果。
当你运行这段代码时,你会看到以下输出:
```
21
59
37
42
86
```
这表明排序成功地完成了。注意,这里使用了 `bubbleSort` 函数来实现冒泡排序,而不是使用 `sort()` 方法。"
2026-04-09 20:52:05,deepseek,用C++写冒泡排序,"当然!以下是一个简单的C++实现冒泡排序:
```cpp
#include <iostream>
using namespace std;
void bubbleSort(int arr[], int n) {
for (int i = 0; i < n - 1; i++) {
bool swapped = false;
for (int j = 0; j < n - i - 1 && !swapped; j++) {
if (arr[j] > arr[j + 1]) {
swapped = true;
swap(arr[j], arr[j + 1]);
}
}
}
}
void printArray(int arr[], int size) {
for (int i = 0; i < size - 1; i++) {
cout << arr[i] << "" "";
}
}
int main() {
int arr[] = {42, 86, 37, 59, 21};
int n = sizeof(arr) / sizeof(arr[0]);
bubbleSort(arr, n);
cout << ""Sorted array is: \n"";
printArray(arr, n);
}
```
这段代码首先定义了一个冒泡排序函数,然后在主函数中调用这个函数并打印出排序后的数组。你可以将 `arr[]` 和 `n` 的值设置为你自己的数组或列表。
注意:这个实现是按升序排序的,如果你需要按降序排序,请使用 `sort()` 函数。"
2026-04-09 20:52:06,deepseek,who are you?,"As an AI language model, I don't have personal characteristics or emotions. However, I was created by Alibaba Cloud to assist with various tasks such as understanding human speech and providing information on different subjects. If you need help with something specific, feel free to ask!"
2026-04-09 20:52:11,deepseek,用C++写冒泡排序,"当然!以下是一个简单的C++实现冒泡排序:
```cpp
#include <iostream>
using namespace std;
void bubbleSort(int arr[], int n) {
for (int i = 0; i < n - 1; i++) {
bool swapped = false;
for (int j = 0; j < n - i - 1 && !swapped; j++) {
if (arr[j + 1] < arr[j]) {
swapped = true;
swap(arr[j], arr[j + 1]);
}
}
}
}
void printArray(int arr[], int size) {
for (int i = 0; i < size - 1; i++) {
cout << arr[i] << "" "";
}
}
int main() {
int arr[] = {42, 86, 37, 59, 21};
bubbleSort(arr, sizeof(arr) / sizeof(int));
printArray(arr, sizeof(arr) / sizeof(int));
return 0;
}
```
这段代码首先定义了一个函数 `bubbleSort`,它接受一个整数数组和它的大小。然后调用这个函数对数组进行排序,并打印排序后的结果。
当你运行这段代码时,你会看到以下输出:
```
21
59
37
42
86
```
这表明排序成功地完成了。注意,这里使用了 `bubbleSort` 函数来实现冒泡排序,而不是使用 `sort()` 方法。"
2026-04-09 20:52:11,deepseek,Result only: 2 + 2 = ?,The result of 2 + 2 is 4.
2026-04-09 20:52:12,deepseek,who are you?,"As an AI language model, I don't have personal characteristics or emotions. However, I was created by Alibaba Cloud to assist with various tasks such as understanding human speech and providing information on different subjects. If you need help with something specific, feel free to ask!"
2026-04-09 20:52:14,deepseek,who are you?,"As an AI language model, I don't have personal characteristics or emotions. However, I was trained on a large corpus of text data to understand human speech and respond appropriately. My purpose is to assist users in finding information, answer questions, and provide helpful responses to their inquiries. Is there anything specific you would like me to help you with?"
2026-04-09 20:52:15,deepseek,Result only: 2 + 2 = ?,"I am a program that was created by Alibaba Cloud. I was trained on large amounts of text data to understand natural language.
My purpose is to assist users in understanding and generating human-like responses to their questions or prompts. I can answer a wide range of topics, including science, history, culture, etc.
However, please note that my knowledge may be limited by the amount of training data I was trained on."
2026-04-09 20:52:16,deepseek,who are you?,"As an AI language model, I don't have personal characteristics or emotions. However, I was created by Alibaba Cloud to assist with various tasks such as understanding human speech and providing information on different subjects. If you need help with something specific, feel free to ask!"
2026-04-09 20:52:16,deepseek,Result only: 2 + 2 = ?,The result of 2 + 2 is 4.
2026-04-09 20:52:17,deepseek,who are you?,"As an AI language model, I don't have personal characteristics or emotions. However, I was created by Alibaba Cloud to assist with various tasks such as understanding human speech and providing information on different subjects. If you need help with something specific, feel free to ask!"
2026-04-09 20:52:23,deepseek,用C++写冒泡排序,"当然!以下是一个简单的C++实现冒泡排序:
```cpp
#include <iostream>
using namespace std;
void bubbleSort(int arr[], int n) {
for (int i = 0; i < n - 1; i++) {
bool swapped = false;
for (int j = 0; j < n - i - 1 && !swapped; j++) {
if (arr[j + 1] < arr[j]) {
swapped = true;
swap(arr[j], arr[j + 1]);
}
}
}
}
void printArray(int arr[], int size) {
for (int i = 0; i < size - 1; i++) {
cout << arr[i] << "" "";
}
}
int main() {
int arr[] = {42, 86, 37, 59, 21};
bubbleSort(arr, sizeof(arr) / sizeof(int));
printArray(arr, sizeof(arr) / sizeof(int));
return 0;
}
```
这段代码首先定义了一个函数 `bubbleSort`,它接受一个整数数组和它的大小。然后调用这个函数对数组进行排序,并打印排序后的结果。
当你运行这段代码时,你会看到以下输出:
```
21
59
37
42
86
```
这表明排序成功地完成了。注意,这里使用了 `bubbleSort` 函数来实现冒泡排序,而不是使用 `sort()` 方法。"
2026-04-09 20:52:28,deepseek,用C++写冒泡排序,"当然!以下是一个简单的C++实现冒泡排序:
```cpp
#include <iostream>
using namespace std;
void bubbleSort(int arr[], int n) {
for (int i = 0; i < n - 1; i++) {
bool swapped = false;
for (int j = 0; j < n - i - 1 && !swapped; j++) {
if (arr[j] > arr[j + 1]) {
swapped = true;
swap(arr[j], arr[j + 1]);
}
}
}
}
void printArray(int arr[], int size) {
for (int i = 0; i < size - 1; i++) {
cout << arr[i] << "" "";
}
}
int main() {
int arr[] = {42, 86, 37, 59, 21};
int n = sizeof(arr) / sizeof(arr[0]);
bubbleSort(arr, n);
cout << ""Sorted array is: \n"";
printArray(arr, n);
}
```
这段代码首先定义了一个冒泡排序函数,然后在主函数中调用这个函数并打印出排序后的数组。你可以将 `arr[]` 和 `n` 的值设置为你自己的数组或列表。
注意:这个实现是按升序排序的,如果你需要按降序排序,请使用 `sort()` 函数。"
2026-04-09 20:52:32,deepseek,Result only: 2 + 2 = ?,"```cpp
#include <iostream>
using namespace std;
void bubbleSort(int arr[], int n) {
for (int i = 0; i < n - 1; i++) {
bool swapped = false;
for (int j = 0; j < n - i - 1 && !swapped; j++) {
if (arr[j + 1] < arr[j]) {
swapped = true;
swap(arr[j], arr[j + 1]);
}
}
}
}
void swap(int a, int b) {
int temp = a;
a = b;
b = temp;
}
int main() {
int arr[] = {42, 37, 56, 29, 8};
bubbleSort(arr, sizeof(arr)/sizeof(arr[0]));
for (int i = 0; i < sizeof(arr); i++) {
cout << ""arr["" << i << ""] = "" << arr[i] << endl;
}
return 0;
}
```
这段代码首先定义了一个`bubbleSort`函数,用于对数组进行冒泡排序。然后在主函数中调用这个函数并打印出排序后的数组。"
2026-04-09 20:52:37,deepseek,Result only: 2 + 2 = ?,"```cpp
#include <iostream>
using namespace std;
void bubbleSort(int arr[], int n) {
for (int i = 0; i < n - 1; i++) {
bool swapped = false;
for (int j = 0; j < n - i - 1 && !swapped; j++) {
if (arr[j + 1] < arr[j]) {
swapped = true;
swap(arr[j], arr[j + 1]);
}
}
}
}
void swap(int a, int b) {
int temp = a;
a = b;
b = temp;
}
int main() {
int arr[] = {42, 37, 56, 29, 8};
bubbleSort(arr, sizeof(arr)/sizeof(arr[0]));
for (int i = 0; i < sizeof(arr); i++) {
cout << ""arr["" << i << ""] = "" << arr[i] << endl;
}
return 0;
}
```
这段代码首先定义了一个`bubbleSort`函数,用于对数组进行冒泡排序。然后在主函数中调用这个函数并打印出排序后的数组。"
2026-04-09 20:52:38,deepseek,who are you?,"As an AI language model, I don't have personal characteristics or emotions. However, I was created by Alibaba Cloud to assist with various tasks such as understanding human speech and providing information on different subjects. If you need help with something specific, feel free to ask!"
2026-04-09 20:52:39,deepseek,who are you?,"As an AI language model, I don't have personal characteristics or emotions. However, I was trained on a large corpus of text data to understand human speech and respond appropriately. My purpose is to assist users in finding information, answer questions, and provide helpful responses to their inquiries. Is there anything specific you would like me to help you with?"
2026-04-09 20:52:39,deepseek,Result only: 2 + 2 = ?,The result of 2 + 2 is 4.
2026-04-09 20:52:39,deepseek,Result only: 2 + 2 = ?,The result of 2 + 2 is 4.
2026-04-09 20:52:40,deepseek,who are you?,"As an AI language model, I don't have personal characteristics or emotions. However, I was created by Alibaba Cloud to assist with various tasks such as understanding human speech and providing information on different subjects. If you need help with something specific, feel free to ask!"
2026-04-09 20:52:41,deepseek,Result only: 2 + 2 = ?,"I am a program that was created by Alibaba Cloud. I was trained on large amounts of text data to understand natural language.
My purpose is to assist users in understanding the meaning of words and phrases, as well as providing information about various topics. I can answer questions on many different subjects such as science, history, culture, etc."
2026-04-09 20:52:43,deepseek,Result only: 2 + 2 = ?,"I am a program that was created by Alibaba Cloud. I was trained on large amounts of text data to understand natural language.
My purpose is to assist users in understanding the meaning of words and phrases, as well as providing information about various topics. I can answer questions on many different subjects such as science, history, culture, etc."
2026-04-09 20:52:48,deepseek,用C++写冒泡排序,"当然!以下是一个简单的C++实现冒泡排序:
```cpp
#include <iostream>
using namespace std;
void bubbleSort(int arr[], int n) {
for (int i = 0; i < n - 1; i++) {
bool swapped = false;
for (int j = 0; j < n - i - 1 && !swapped; j++) {
if (arr[j + 1] < arr[j]) {
swapped = true;
swap(arr[j], arr[j + 1]);
}
}
}
}
void printArray(int arr[], int size) {
for (int i = 0; i < size - 1; i++) {
cout << arr[i] << "" "";
}
}
int main() {
int arr[] = {42, 86, 37, 59, 21};
bubbleSort(arr, sizeof(arr) / sizeof(int));
printArray(arr, sizeof(arr) / sizeof(int));
return 0;
}
```
这段代码首先定义了一个函数 `bubbleSort`,它接受一个整数数组和它的大小。然后调用这个函数对数组进行排序,并打印排序后的结果。
当你运行这段代码时,你会看到以下输出:
```
21
59
37
42
86
```
这表明排序成功地完成了。注意,这里使用了 `bubbleSort` 函数来实现冒泡排序,而不是使用 `sort()` 方法。"
2026-04-09 20:52:53,deepseek,用C++写冒泡排序,"当然!以下是一个简单的C++实现冒泡排序:
```cpp
#include <iostream>
using namespace std;
void bubbleSort(int arr[], int n) {
for (int i = 0; i < n - 1; i++) {
bool swapped = false;
for (int j = 0; j < n - i - 1 && !swapped; j++) {
if (arr[j] > arr[j + 1]) {
swapped = true;
swap(arr[j], arr[j + 1]);
}
}
}
}
void printArray(int arr[], int size) {
for (int i = 0; i < size - 1; i++) {
cout << arr[i] << "" "";
}
}
int main() {
int arr[] = {42, 86, 37, 59, 21};
int n = sizeof(arr) / sizeof(arr[0]);
bubbleSort(arr, n);
cout << ""Sorted array is: \n"";
printArray(arr, n);
}
```
这段代码首先定义了一个冒泡排序函数,然后在主函数中调用这个函数并打印出排序后的数组。你可以将 `arr[]` 和 `n` 的值设置为你自己的数组或列表。
注意:这个实现是按升序排序的,如果你需要按降序排序,请使用 `sort()` 函数。"
2026-04-09 20:52:58,deepseek,用C++写冒泡排序,"当然!以下是一个简单的C++实现冒泡排序:
```cpp
#include <iostream>
using namespace std;
void bubbleSort(int arr[], int n) {
for (int i = 0; i < n - 1; i++) {
bool swapped = false;
for (int j = 0; j < n - i - 1 && !swapped; j++) {
if (arr[j] > arr[j + 1]) {
swapped = true;
swap(arr[j], arr[j + 1]);
}
}
}
}
void printArray(int arr[], int size) {
for (int i = 0; i < size - 1; i++) {
cout << arr[i] << "" "";
}
}
int main() {
int arr[] = {42, 86, 37, 59, 21};
int n = sizeof(arr) / sizeof(arr[0]);
bubbleSort(arr, n);
cout << ""Sorted array is: \n"";
printArray(arr, n);
}
```
这段代码首先定义了一个冒泡排序函数,然后在主函数中调用这个函数并打印出排序后的数组。你可以将 `arr[]` 和 `n` 的值设置为你自己的数组或列表。
注意:这个实现是按升序排序的,如果你需要按降序排序,请使用 `sort()` 函数。"
2026-04-09 20:53:03,deepseek,用C++写冒泡排序,"当然!以下是一个简单的C++实现冒泡排序:
```cpp
#include <iostream>
using namespace std;
void bubbleSort(int arr[], int n) {
for (int i = 0; i < n - 1; i++) {
bool swapped = false;
for (int j = 0; j < n - i - 1 && !swapped; j++) {
if (arr[j] > arr[j + 1]) {
swapped = true;
swap(arr[j], arr[j + 1]);
}
}
}
}
void printArray(int arr[], int size) {
for (int i = 0; i < size - 1; i++) {
cout << arr[i] << "" "";
}
}
int main() {
int arr[] = {42, 86, 37, 59, 21};
int n = sizeof(arr) / sizeof(arr[0]);
bubbleSort(arr, n);
cout << ""Sorted array is: \n"";
printArray(arr, n);
}
```
这段代码首先定义了一个冒泡排序函数,然后在主函数中调用这个函数并打印出排序后的数组。你可以将 `arr[]` 和 `n` 的值设置为你自己的数组或列表。
注意:这个实现是按升序排序的,如果你需要按降序排序,请使用 `sort()` 函数。"
2026-04-09 20:53:04,deepseek,who are you?,"As an AI language model, I don't have personal characteristics or emotions. However, I was created by Alibaba Cloud to assist with various tasks such as understanding human speech and providing information on different subjects. If you need help with something specific, feel free to ask!"
2026-04-09 20:53:06,deepseek,who are you?,"As an AI language model, I don't have personal characteristics or emotions. However, I was trained on a large corpus of text data to understand human speech and respond appropriately. My purpose is to assist users in finding information, answer questions, and provide helpful responses to their inquiries. Is there anything specific you would like me to help you with?"
2026-04-09 20:53:06,deepseek,Result only: 2 + 2 = ?,The result of 2 + 2 is 4.
2026-04-09 20:53:12,deepseek,用C++写冒泡排序,"当然!以下是一个简单的C++实现冒泡排序:
```cpp
#include <iostream>
using namespace std;
void bubbleSort(int arr[], int n) {
for (int i = 0; i < n - 1; i++) {
bool swapped = false;
for (int j = 0; j < n - i - 1 && !swapped; j++) {
if (arr[j + 1] < arr[j]) {
swapped = true;
swap(arr[j], arr[j + 1]);
}
}
}
}
void printArray(int arr[], int size) {
for (int i = 0; i < size - 1; i++) {
cout << arr[i] << "" "";
}
}
int main() {
int arr[] = {42, 86, 37, 59, 21};
bubbleSort(arr, sizeof(arr) / sizeof(int));
printArray(arr, sizeof(arr) / sizeof(int));
return 0;
}
```
这段代码首先定义了一个函数 `bubbleSort`,它接受一个整数数组和它的大小。然后调用这个函数对数组进行排序,并打印排序后的结果。
当你运行这段代码时,你会看到以下输出:
```
21
59
37
42
86
```
这表明排序成功地完成了。注意,这里使用了 `bubbleSort` 函数来实现冒泡排序,而不是使用 `sort()` 方法。"
2026-04-09 20:53:13,deepseek,who are you?,"As an AI language model, I don't have personal characteristics or emotions. However, I was created by Alibaba Cloud to assist with various tasks such as understanding human speech and providing information on different subjects. If you need help with something specific, feel free to ask!"
2026-04-09 20:53:18,deepseek,用C++写冒泡排序,"当然!以下是一个简单的C++实现冒泡排序:
```cpp
#include <iostream>
using namespace std;
void bubbleSort(int arr[], int n) {
for (int i = 0; i < n - 1; i++) {
bool swapped = false;
for (int j = 0; j < n - i - 1 && !swapped; j++) {
if (arr[j + 1] < arr[j]) {
swapped = true;
swap(arr[j], arr[j + 1]);
}
}
}
}
void printArray(int arr[], int size) {
for (int i = 0; i < size - 1; i++) {
cout << arr[i] << "" "";
}
}
int main() {
int arr[] = {42, 86, 37, 59, 21};
bubbleSort(arr, sizeof(arr) / sizeof(int));
printArray(arr, sizeof(arr) / sizeof(int));
return 0;
}
```
这段代码首先定义了一个函数 `bubbleSort`,它接受一个整数数组和它的大小。然后调用这个函数对数组进行排序,并打印排序后的结果。
当你运行这段代码时,你会看到以下输出:
```
21
59
37
42
86
```
这表明排序成功地完成了。注意,这里使用了 `bubbleSort` 函数来实现冒泡排序,而不是使用 `sort()` 方法。"
2026-04-09 20:53:19,deepseek,who are you?,"As an AI language model, I don't have personal characteristics or emotions. However, I was created by Alibaba Cloud to assist with various tasks such as understanding human speech and providing information on different subjects. If you need help with something specific, feel free to ask!"
2026-04-09 20:53:20,deepseek,Result only: 2 + 2 = ?,"I am a program that was created by Alibaba Cloud. I was trained on large amounts of text data to understand natural language.
My purpose is to assist users in understanding the meaning of words and phrases, as well as providing information about various topics. I can answer questions on many different subjects such as science, history, culture, etc."
2026-04-09 20:53:22,deepseek,Result only: 2 + 2 = ?,"I am a program that was created by Alibaba Cloud. I was trained on large amounts of text data to understand natural language.
My purpose is to assist users in understanding the meaning of words and phrases, as well as providing information about various topics. I can answer questions on many different subjects such as science, history, culture, etc."
2026-04-09 20:54:50,deepseek,who are you?,"As an AI language model, I don't have personal characteristics or emotions. However, I was created by Alibaba Cloud to assist with various tasks such as understanding human speech and providing information on different subjects. If you need help with something specific, feel free to ask!"
2026-04-09 20:54:52,deepseek,who are you?,"As an AI language model, I don't have personal characteristics or emotions. However, I was trained on a large corpus of text data to understand human speech and respond appropriately. My purpose is to assist users in finding information, answer questions, and provide helpful responses to their inquiries. Is there anything specific you would like me to help you with?"
2026-04-09 20:54:52,deepseek,Result only: 2 + 2 = ?,The result of 2 + 2 is 4.
2026-04-09 20:54:53,deepseek,who are you?,"As an AI language model, I don't have personal characteristics or emotions. However, I was created by Alibaba Cloud to assist with various tasks such as understanding human speech and providing information on different subjects. If you need help with something specific, feel free to ask!"
2026-04-09 20:54:54,deepseek,who are you?,"As an AI language model, I don't have personal characteristics or emotions. However, I was trained on a large corpus of text data to understand human speech and respond appropriately. My purpose is to assist users in finding information, answer questions, and provide helpful responses to their inquiries. Is there anything specific you would like me to help you with?"
2026-04-09 20:55:00,deepseek,用C++写冒泡排序,"当然!以下是一个简单的C++实现冒泡排序:
```cpp
#include <iostream>
using namespace std;
void bubbleSort(int arr[], int n) {
for (int i = 0; i < n - 1; i++) {
bool swapped = false;
for (int j = 0; j < n - i - 1 && !swapped; j++) {
if (arr[j + 1] < arr[j]) {
swapped = true;
swap(arr[j], arr[j + 1]);
}
}
}
}
void printArray(int arr[], int size) {
for (int i = 0; i < size - 1; i++) {
cout << arr[i] << "" "";
}
}
int main() {
int arr[] = {42, 86, 37, 59, 21};
bubbleSort(arr, sizeof(arr) / sizeof(int));
printArray(arr, sizeof(arr) / sizeof(int));
return 0;
}
```
这段代码首先定义了一个函数 `bubbleSort`,它接受一个整数数组和它的大小。然后调用这个函数对数组进行排序,并打印排序后的结果。
当你运行这段代码时,你会看到以下输出:
```
21
59
37
42
86
```
这表明排序成功地完成了。注意,这里使用了 `bubbleSort` 函数来实现冒泡排序,而不是使用 `sort()` 方法。"
@@ -0,0 +1,56 @@
timestamp,model,prompt_tokens,completion_tokens,memory_usage,Decode_TPS,TTFT,Prefill_TPS,Power
2026-04-09 20:45:22,deepseek,0,0,0.00,23.91,6825.40,4.92,0.0
2026-04-09 20:51:29,deepseek,0,0,0.00,59.74,992.52,135.36,0.0
2026-04-09 20:51:30,deepseek,0,0,0.00,68.42,280.02,166.64,0.0
2026-04-09 20:51:31,deepseek,0,0,0.00,61.29,968.68,102.74,0.0
2026-04-09 20:51:32,deepseek,0,0,0.00,58.27,1185.11,55.38,0.0
2026-04-09 20:51:33,deepseek,0,0,0.00,58.86,1173.51,54.70,0.0
2026-04-09 20:51:39,deepseek,0,0,0.00,59.75,5444.75,134.78,0.0
2026-04-09 20:51:44,deepseek,0,0,0.00,58.33,5195.43,56.47,0.0
2026-04-09 20:51:49,deepseek,0,0,0.00,58.48,5182.05,55.88,0.0
2026-04-09 20:51:50,deepseek,0,0,0.00,59.30,998.41,102.51,0.0
2026-04-09 20:51:50,deepseek,0,0,0.00,67.88,281.08,167.49,0.0
2026-04-09 20:51:51,deepseek,0,0,0.00,59.00,1003.37,102.08,0.0
2026-04-09 20:51:52,deepseek,0,0,0.00,60.20,1179.14,61.43,0.0
2026-04-09 20:51:54,deepseek,0,0,0.00,58.57,1452.12,55.78,0.0
2026-04-09 20:51:59,deepseek,0,0,0.00,59.20,5494.71,134.54,0.0
2026-04-09 20:52:05,deepseek,0,0,0.00,59.09,5128.28,56.06,0.0
2026-04-09 20:52:06,deepseek,0,0,0.00,59.89,989.41,102.55,0.0
2026-04-09 20:52:11,deepseek,0,0,0.00,58.91,5521.71,134.37,0.0
2026-04-09 20:52:11,deepseek,0,0,0.00,68.55,279.02,167.79,0.0
2026-04-09 20:52:12,deepseek,0,0,0.00,59.41,996.76,102.55,0.0
2026-04-09 20:52:14,deepseek,0,0,0.00,58.96,1203.77,60.64,0.0
2026-04-09 20:52:15,deepseek,0,0,0.00,59.56,1428.35,55.30,0.0
2026-04-09 20:52:16,deepseek,0,0,0.00,60.37,982.14,102.67,0.0
2026-04-09 20:52:16,deepseek,0,0,0.00,64.42,291.03,168.09,0.0
2026-04-09 20:52:17,deepseek,0,0,0.00,60.28,983.46,102.65,0.0
2026-04-09 20:52:23,deepseek,0,0,0.00,58.94,5518.77,134.08,0.0
2026-04-09 20:52:28,deepseek,0,0,0.00,58.40,5189.08,56.20,0.0
2026-04-09 20:52:32,deepseek,0,0,0.00,60.69,4252.66,55.44,0.0
2026-04-09 20:52:37,deepseek,0,0,0.00,60.73,4250.03,55.34,0.0
2026-04-09 20:52:38,deepseek,0,0,0.00,59.74,991.43,102.86,0.0
2026-04-09 20:52:39,deepseek,0,0,0.00,59.41,1194.67,60.75,0.0
2026-04-09 20:52:39,deepseek,0,0,0.00,67.50,282.35,167.13,0.0
2026-04-09 20:52:39,deepseek,0,0,0.00,68.31,208.95,53.67,0.0
2026-04-09 20:52:40,deepseek,0,0,0.00,59.73,991.69,102.68,0.0
2026-04-09 20:52:41,deepseek,0,0,0.00,57.97,1191.25,54.97,0.0
2026-04-09 20:52:43,deepseek,0,0,0.00,58.64,1177.89,54.49,0.0
2026-04-09 20:52:48,deepseek,0,0,0.00,58.84,5529.13,132.03,0.0
2026-04-09 20:52:53,deepseek,0,0,0.00,59.30,5111.05,55.32,0.0
2026-04-09 20:52:58,deepseek,0,0,0.00,59.84,5064.89,55.70,0.0
2026-04-09 20:53:03,deepseek,0,0,0.00,59.32,5108.60,56.92,0.0
2026-04-09 20:53:04,deepseek,0,0,0.00,59.50,995.28,102.62,0.0
2026-04-09 20:53:06,deepseek,0,0,0.00,59.00,1202.87,60.73,0.0
2026-04-09 20:53:06,deepseek,0,0,0.00,66.86,283.58,168.29,0.0
2026-04-09 20:53:12,deepseek,0,0,0.00,58.23,5584.67,134.29,0.0
2026-04-09 20:53:13,deepseek,0,0,0.00,59.57,996.59,99.92,0.0
2026-04-09 20:53:18,deepseek,0,0,0.00,58.22,5588.45,130.54,0.0
2026-04-09 20:53:19,deepseek,0,0,0.00,59.45,996.10,102.61,0.0
2026-04-09 20:53:20,deepseek,0,0,0.00,58.73,1175.90,55.09,0.0
2026-04-09 20:53:22,deepseek,0,0,0.00,57.73,1196.31,54.57,0.0
2026-04-09 20:54:50,deepseek,0,0,0.00,59.82,991.33,135.35,0.0
2026-04-09 20:54:52,deepseek,0,0,0.00,58.50,1212.90,61.50,0.0
2026-04-09 20:54:52,deepseek,0,0,0.00,67.32,282.36,168.05,0.0
2026-04-09 20:54:53,deepseek,0,0,0.00,60.54,979.87,102.39,0.0
2026-04-09 20:54:54,deepseek,0,0,0.00,60.26,1177.81,61.65,0.0
2026-04-09 20:55:00,deepseek,0,0,0.00,58.50,5559.24,134.86,0.0
@@ -0,0 +1,148 @@
=== Starting llama-server test ===
filename: test_case_short.json
version: 1.0
find 3 test cases
✔ llama-server is ready (attempt 1/10)
=== Round 1 start: 3 samples (with replacement) ===
[Round 1 | Progress: 1/3]
Prompt:
who are you?
Response(stream):
[ANSWER] As an AI language model, I don't have personal characteristics or emotions. However, I was created by Alibaba Cloud to assist with various tasks such as understanding human speech and providing information on different subjects. If you need help with something specific, feel free to ask!
================================================================================
[Round 1 | 1/3]
prompt_tokens=0, completion_tokens=0, decode_tps=59.82, ttft=991.33 ms, prefill_tps=135.35
================================================================================
[Round 1 | Progress: 2/3]
Prompt:
who are you?
Response(stream):
[ANSWER] As an AI language model, I don't have personal characteristics or emotions. However, I was trained on a large corpus of text data to understand human speech and respond appropriately. My purpose is to assist users in finding information, answer questions, and provide helpful responses to their inquiries. Is there anything specific you would like me to help you with?
================================================================================
[Round 1 | 2/3]
prompt_tokens=0, completion_tokens=0, decode_tps=58.50, ttft=1212.90 ms, prefill_tps=61.50
================================================================================
[Round 1 | Progress: 3/3]
Prompt:
Result only: 2 + 2 = ?
Response(stream):
[ANSWER] The result of 2 + 2 is 4.
================================================================================
[Round 1 | 3/3]
prompt_tokens=0, completion_tokens=0, decode_tps=67.32, ttft=282.36 ms, prefill_tps=168.05
================================================================================
=== Round 1 done: 3/3 success ===
=== Round 2 start: 3 samples (with replacement) ===
[Round 2 | Progress: 1/3]
Prompt:
who are you?
Response(stream):
[ANSWER] As an AI language model, I don't have personal characteristics or emotions. However, I was created by Alibaba Cloud to assist with various tasks such as understanding human speech and providing information on different subjects. If you need help with something specific, feel free to ask!
================================================================================
[Round 2 | 1/3]
prompt_tokens=0, completion_tokens=0, decode_tps=60.54, ttft=979.87 ms, prefill_tps=102.39
================================================================================
[Round 2 | Progress: 2/3]
Prompt:
who are you?
Response(stream):
[ANSWER] As an AI language model, I don't have personal characteristics or emotions. However, I was trained on a large corpus of text data to understand human speech and respond appropriately. My purpose is to assist users in finding information, answer questions, and provide helpful responses to their inquiries. Is there anything specific you would like me to help you with?
================================================================================
[Round 2 | 2/3]
prompt_tokens=0, completion_tokens=0, decode_tps=60.26, ttft=1177.81 ms, prefill_tps=61.65
================================================================================
[Round 2 | Progress: 3/3]
Prompt:
用C++写冒泡排序
Response(stream):
[ANSWER] 当然!以下是一个简单的C++实现冒泡排序:
```cpp
#include <iostream>
using namespace std;
void bubbleSort(int arr[], int n) {
for (int i = 0; i < n - 1; i++) {
bool swapped = false;
for (int j = 0; j < n - i - 1 && !swapped; j++) {
if (arr[j + 1] < arr[j]) {
swapped = true;
swap(arr[j], arr[j + 1]);
}
}
}
}
void printArray(int arr[], int size) {
for (int i = 0; i < size - 1; i++) {
cout << arr[i] << " ";
}
}
int main() {
int arr[] = {42, 86, 37, 59, 21};
bubbleSort(arr, sizeof(arr) / sizeof(int));
printArray(arr, sizeof(arr) / sizeof(int));
return 0;
}
```
这段代码首先定义了一个函数 `bubbleSort`,它接受一个整数数组和它的大小。然后调用这个函数对数组进行排序,并打印排序后的结果。
当你运行这段代码时,你会看到以下输出:
```
21
59
37
42
86
```
这表明排序成功地完成了。注意,这里使用了 `bubbleSort` 函数来实现冒泡排序,而不是使用 `sort()` 方法。
================================================================================
[Round 2 | 3/3]
prompt_tokens=0, completion_tokens=0, decode_tps=58.50, ttft=5559.24 ms, prefill_tps=134.86
================================================================================
=== Round 2 done: 3/3 success ===
=== Round 3 start: 3 samples (with replacement) ===
[Round 3 | Progress: 1/3]
Prompt:
用C++写冒泡排序
Response(stream):
[ANSWER] 当然!以下是一个简单的C++实现冒泡排序:
```cpp
#include <iostream>
using namespace std;
void bubbleSort(int arr[], int n) {
for (int i = 0; i < n - 1; i++) {
bool swapped = false;
for (int j = 0; j < n - i - 1 && !swapped; j++) {
if (arr[j] > arr[j + 1]) {
swapped = true;
swap(arr[j], arr[j + 1]);
}
}
}
}
void printArray(int arr[], int size)
@@ -0,0 +1,90 @@
#include <vector>
#include <iostream>
#include <iomanip> // 用于格式化输出
using namespace std;
int main() {
// --------------------- 1. 初始化输入图像 ---------------------
// 假设输入图像形状为 [3, 896, 896](通道优先:C×H×W
const int C = 3; // 通道数(RGB
const int H = 896; // 图像高度
const int W = 896; // 图像宽度
vector<float> inp_raw(C * H * W, 1.0f); // 示例:全1数据(实际需替换为真实图像数据)
// --------------------- 2. 分块参数计算 ---------------------
const int num_patches_h = 14; // Height方向分块数
const int num_patches_w = 14; // Width方向分块数
const int patch_h = H / num_patches_h; // 单个Patch的高度(64
const int patch_w = W / num_patches_w; // 单个Patch的宽度(64
// --------------------- 3. 提取每个Patch的统计特征(示例:均值) ---------------------
// patch_means[ph][pw][c] 存储第ph行、第pw列Patch的第c通道均值
vector<vector<vector<float>>> patch_means(
num_patches_h,
vector<vector<float>>(num_patches_w, vector<float>(C))
);
for (int c = 0; c < C; ++c) {
for (int ph = 0; ph < num_patches_h; ++ph) {
for (int pw = 0; pw < num_patches_w; ++pw) {
float sum = 0.0f;
int count = 0;
// 遍历Patch内所有像素
for (int h = ph * patch_h; h < (ph + 1) * patch_h; ++h) {
for (int w = pw * patch_w; w < (pw + 1) * patch_w; ++w) {
int idx = c * H * W + h * W + w; // 计算inp_raw中像素的索引
sum += inp_raw[idx];
count++;
}
}
patch_means[ph][pw][c] = sum / count; // 计算该Patch的通道均值
}
}
}
// --------------------- 4. 构建目标维度:4096×2×3×14×14 ---------------------
const int batch_size = 4096; // Batch大小
const int num_views = 2; // 视角/分支数(如时间步、参考帧与当前帧)
// 目标数组形状:[batch_size, num_views, C, num_patches_h, num_patches_w]
vector<float> target(
batch_size * num_views * C * num_patches_h * num_patches_w
);
// 填充目标数组:每个Batch元素、视角、通道、Patch位置均使用对应Patch的均值
for (int n = 0; n < batch_size; ++n) {
for (int m = 0; m < num_views; ++m) {
for (int c = 0; c < C; ++c) {
for (int ph = 0; ph < num_patches_h; ++ph) {
for (int pw = 0; pw < num_patches_w; ++pw) {
// 计算目标数组的一维索引
int target_idx = n * num_views * C * num_patches_h * num_patches_w
+ m * C * num_patches_h * num_patches_w
+ c * num_patches_h * num_patches_w
+ ph * num_patches_w + pw;
target[target_idx] = patch_means[ph][pw][c];
}
}
}
}
}
// --------------------- 5. 验证输出(可选) ---------------------
cout << "目标数组总元素数: " << target.size() << "(预期: "
<< batch_size * num_views * C * num_patches_h * num_patches_w << "" << endl;
// 打印第一个Batch、第一个视角、第一个通道的所有Patch值(前几个)
cout << "\n第一个Batch、第一个视角、第一个通道的Patch均值(前20个):" << endl;
for (int ph = 0; ph < min(5, num_patches_h); ++ph) { // 只打印前5个Patch的行
for (int pw = 0; pw < min(5, num_patches_w); ++pw) { // 只打印前5个Patch的列
int idx = 0 * num_views * C * num_patches_h * num_patches_w
+ 0 * C * num_patches_h * num_patches_w
+ 0 * num_patches_h * num_patches_w
+ ph * num_patches_w + pw;
cout << fixed << setprecision(2) << target[idx] << "\t";
}
cout << endl;
}
return 0;
}
@@ -0,0 +1,124 @@
#include <iostream>
#include <vector>
#include <cmath>
#include <cassert>
// 辅助函数:打印张量形状信息
void print_shape(const std::vector<int>& shape) {
std::cout << "[";
for (size_t i = 0; i < shape.size(); ++i) {
std::cout << shape[i];
if (i != shape.size() - 1) std::cout << ", ";
}
std::cout << "]" << std::endl;
}
// 核心函数:将 3x896x896 图像转换为 4096x2x3x14x14 Patches
void image_to_patches(
const float* input_data, // 输入图像指针 [3, 896, 896]
float* output_data, // 输出 patches 指针 [4096, 2, 3, 14, 14]
int img_c, int img_h, int img_w, // 输入图像维度: 3, 896, 896
int patch_h, int patch_w, // Patch 尺寸: 14, 14
int target_n, int target_t // 目标维度: 4096, 2
) {
// 计算每行的 patch 数量
int patches_per_row = img_w / patch_w; // 896 / 14 = 64
int patches_per_col = img_h / patch_h; // 896 / 14 = 64
// 校验目标 N 是否匹配
assert(patches_per_row * patches_per_col == target_n && "计算出的 Patch 总数与目标的 N=4096 不符!");
// 遍历每一个 Patch
for (int p_idx = 0; p_idx < target_n; ++p_idx) {
// 计算当前 patch 在原图上的起始坐标
int row = p_idx / patches_per_row;
int col = p_idx % patches_per_row;
int start_y = row * patch_h;
int start_x = col * patch_w;
// 遍历时间/副本维度 T (0 到 1)
for (int t = 0; t < target_t; ++t) {
// 遍历 RGB 三个通道
for (int c = 0; c < img_c; ++c) {
// 遍历 Patch 内部像素
for (int ph = 0; ph < patch_h; ++ph) {
for (int pw = 0; pw < patch_w; ++pw) {
// --- 输入索引计算 [C, H, W] ---
int in_y = start_y + ph;
int in_x = start_x + pw;
// 防止越界 (虽然这里整除刚好不会越界)
if (in_y >= img_h || in_x >= img_w) continue;
size_t input_idx = (size_t)c * img_h * img_w +
(size_t)in_y * img_w +
(size_t)in_x;
// --- 输出索引计算 [N, T, C, h, w] ---
size_t output_idx = 0;
output_idx += (size_t)p_idx * target_t * img_c * patch_h * patch_w;
output_idx += (size_t)t * img_c * patch_h * patch_w;
output_idx += (size_t)c * patch_h * patch_w;
output_idx += (size_t)ph * patch_w;
output_idx += (size_t)pw;
// 赋值
output_data[output_idx] = input_data[input_idx];
}
}
}
}
}
}
int main() {
// 1. 定义输入和输出形状
const int IMG_C = 3;
const int IMG_H = 896;
const int IMG_W = 896;
const int PATCH_H = 14;
const int PATCH_W = 14;
const int TARGET_N = 4096; // 64 * 64
const int TARGET_T = 2;
// 2. 分配内存
// 输入大小: 3 * 896 * 896 = 2,408,448
std::vector<float> input_image(IMG_C * IMG_H * IMG_W, 0.0f);
// 输出大小: 4096 * 2 * 3 * 14 * 14 = 4,825,344
// 注意:输出大小是输入的两倍,因为 T=2 维度相当于存了两份所有的 patches
std::vector<float> output_patches(TARGET_N * TARGET_T * IMG_C * PATCH_H * PATCH_W, 0.0f);
// 3. 填充一些测试数据 (例如给 R 通道赋值为 1.0)
for (int i = 0; i < IMG_H * IMG_W; ++i) {
input_image[i] = 1.0f; // R channel part (simplified indexing for init)
}
std::cout << "Input Image Shape: ";
print_shape({IMG_C, IMG_H, IMG_W});
std::cout << "Input Element Count: " << input_image.size() << std::endl;
// 4. 执行转换
image_to_patches(
input_image.data(),
output_patches.data(),
IMG_C, IMG_H, IMG_W,
PATCH_H, PATCH_W,
TARGET_N, TARGET_T
);
std::cout << "Output Patches Shape: ";
print_shape({TARGET_N, TARGET_T, IMG_C, PATCH_H, PATCH_W});
std::cout << "Output Element Count: " << output_patches.size() << std::endl;
// 5. 简单验证:检查第一个 patch 的第一个像素是否拷贝成功
// 根据我们的索引计算,output[0, 0, 0, 0, 0] 应该等于 input[0, 0, 0]
float test_val = output_patches[0];
std::cout << "Verification: output_patches[0] = " << test_val << " (Expected 1.0)" << std::endl;
return 0;
}
@@ -0,0 +1,54 @@
std::vector<float> inp_raw;
// 补充:OPENAI_CLIP的均值和标准差(来自图2,对应RGB通道)
const std::vector<float> OPENAI_CLIP_MEAN = {0.48145466f, 0.4578275f, 0.40821073f};
const std::vector<float> OPENAI_CLIP_STD = {0.26862954f, 0.26130258f, 0.27577711f};
// set input pixel values
if (!imgs.is_audio) {
size_t nelem = 0;
for (const auto & img : imgs.entries) {
nelem += img->nx * img->ny * 3; // 总元素数=图片数×宽×高×3通道
}
inp_raw.resize(nelem); // 预分配内存
for (size_t i = 0; i < imgs.entries.size(); i++) {
const int nx = imgs.entries[i]->nx; // 图像宽度
const int ny = imgs.entries[i]->ny; // 图像高度
const int n = nx * ny; // 单通道像素总数(宽×高)
for (int b = 0; b < batch_size; b++) { // 遍历批次(假设batch_size ≤ 图片数)
// 当前样本在inp_raw中的起始地址(3通道,每通道n像素)
float* batch_entry = inp_raw.data() + b * (3 * n);
for (int y = 0; y < ny; y++) { // 遍历行
for (int x = 0; x < nx; x++) { // 遍历列
// 源图像中当前像素的RGB起始索引(假设buf按RGB顺序存储)
size_t base_src = 3 * (y * nx + x);
// 目标通道内的像素索引(行优先,同原代码)
size_t base_dst = y * nx + x;
// -------------------------- 核心:缩放+标准化 --------------------------
// 1. 读取原始RGB值(假设buf为0-255的整数,转为float
float r = static_cast<float>(imgs.entries[b]->buf[base_src]); // R通道
float g = static_cast<float>(imgs.entries[b]->buf[base_src + 1]); // G通道
float b_val = static_cast<float>(imgs.entries[b]->buf[base_src + 2]); // B通道(避名)
// 2. 缩放:×1/255(归一化到0-1
r *= (1.0f / 255.0f);
g *= (1.0f / 255.0f);
b_val *= (1.0f / 255.0f);
// 3. 标准化:(x - mean) / std(使用CLIP的均值和标准差)
r = (r - OPENAI_CLIP_MEAN[0]) / OPENAI_CLIP_STD[0]; // R通道标准化
g = (g - OPENAI_CLIP_MEAN[1]) / OPENAI_CLIP_STD[1]; // G通道标准化
b_val = (b_val - OPENAI_CLIP_MEAN[2]) / OPENAI_CLIP_STD[2]; // B通道标准化
// ----------------------------------------------------------------------
// 存入batch_entry(通道顺序:R→0~n-1G→n~2n-1B→2n~3n-1,与原代码一致)
batch_entry[base_dst] = r; // R通道
batch_entry[1 * n + base_dst] = g; // G通道(1×n偏移)
batch_entry[2 * n + base_dst] = b_val; // B通道(2×n偏移)
}
}
}
}
}
@@ -0,0 +1,25 @@
commit author_date author subject original_path blob recovered_file
1f0d5bb0453f93ffa51faf68237c89251c2e0c40 2026-04-09T17:38:37+08:00 wangbomeng add --device-info calculet0_103149_run.txt 153d97e98aa350a5645e6e532a626a6c3a2c2582 calculet0_103149_run.txt--1f0d5bb0453f
1f0d5bb0453f93ffa51faf68237c89251c2e0c40 2026-04-09T17:38:37+08:00 wangbomeng add --device-info calculet0_103264_run.txt 6483ceddec9ab053c30408811ab1ea1ab4f994e2 calculet0_103264_run.txt--1f0d5bb0453f
1f0d5bb0453f93ffa51faf68237c89251c2e0c40 2026-04-09T17:38:37+08:00 wangbomeng add --device-info calculet0_103409_run.txt 93dd36245ab2d87ef6bac3a12e364d187b75e739 calculet0_103409_run.txt--1f0d5bb0453f
1f0d5bb0453f93ffa51faf68237c89251c2e0c40 2026-04-09T17:38:37+08:00 wangbomeng add --device-info calculet0_103634_run.txt 08ef62c34cc3b76ee69ef6da872a9dfce677416f calculet0_103634_run.txt--1f0d5bb0453f
aa54a7c637f2c92d924a5f35386975b1c27de898 2026-02-27T01:30:36+08:00 wangbomeng Add bf16_to_fp32 calculet0_12456_run.txt 53a62a721a90b134cf8716e63c605bdc81dbcf0a calculet0_12456_run.txt--aa54a7c637f2
aa54a7c637f2c92d924a5f35386975b1c27de898 2026-02-27T01:30:36+08:00 wangbomeng Add bf16_to_fp32 calculet0_7518_run.txt f6fbf904abe4e169256125cb55108011867b14d3 calculet0_7518_run.txt--aa54a7c637f2
96b4e267e562f44e76ec6c965ee0fa361f0439bf 2026-04-17T15:33:01+08:00 wangbomeng merge dev-ot calculet0_141241_run.txt 4041e6c79f47735912d13065a9d25f1769c40a31 calculet0_141241_run.txt--96b4e267e562
96b4e267e562f44e76ec6c965ee0fa361f0439bf 2026-04-17T15:33:01+08:00 wangbomeng merge dev-ot calculet0_141410_run.txt 3cbcee285c6767e4ee5d5157d8b089f9461b4429 calculet0_141410_run.txt--96b4e267e562
82842cfc3fa3d5c004c4540aeff8a81f38509bee 2026-04-09T15:06:26+08:00 wangbomeng server: fix limit tokens to max_seq_len calculet0_17323_run.txt 1972792c0d6ccb12cdfcc15d0a89b97a8a267bc6 calculet0_17323_run.txt--82842cfc3fa3
b6f29ec8140028619efaa50aa6e73146cecf631d 2026-04-13T11:23:31+08:00 wangbomeng server: fix context-shift calculet0_353163_run.txt 07d78dec4e31d5e3991a5b177c2ab20d65b10c82 calculet0_353163_run.txt--b6f29ec81400
b6f29ec8140028619efaa50aa6e73146cecf631d 2026-04-13T11:23:31+08:00 wangbomeng server: fix context-shift calculet0_353335_run.txt 0ae27da7d33585241abbb0887fc996924900be9b calculet0_353335_run.txt--b6f29ec81400
b6f29ec8140028619efaa50aa6e73146cecf631d 2026-04-13T11:23:31+08:00 wangbomeng server: fix context-shift calculet0_354076_run.txt 967ff2a3b2c001408a7c656cff31285a50caea1f calculet0_354076_run.txt--b6f29ec81400
b6f29ec8140028619efaa50aa6e73146cecf631d 2026-04-13T11:23:31+08:00 wangbomeng server: fix context-shift calculet0_354399_run.txt 499d1d40ed576135de276c6ec7633b706f00b23c calculet0_354399_run.txt--b6f29ec81400
b6f29ec8140028619efaa50aa6e73146cecf631d 2026-04-13T11:23:31+08:00 wangbomeng server: fix context-shift calculet0_354593_run.txt fe58a1e2f9f394f7ca3cf345525015b8ae78c934 calculet0_354593_run.txt--b6f29ec81400
7800c772d44a7415640ec1669a691232939927cf 2026-05-13T15:23:54+08:00 wangbomeng try passkey and embedding calculet0_6145_run.txt 3f01e318dd0c5f149b28fb5208b61d562171cb21 calculet0_6145_run.txt--7800c772d44a
7800c772d44a7415640ec1669a691232939927cf 2026-05-13T15:23:54+08:00 wangbomeng try passkey and embedding calculet0_6728_run.txt 41b92eb616c878a624ca8becec9b31a5b4a55598 calculet0_6728_run.txt--7800c772d44a
7800c772d44a7415640ec1669a691232939927cf 2026-05-13T15:23:54+08:00 wangbomeng try passkey and embedding calculet0_7810_run.txt fd06c70f0f31126e830e1e8ea87d6293aa8a1008 calculet0_7810_run.txt--7800c772d44a
af8055f5f033a730e7e1fe80185b18b7e9473966 2026-04-10T14:58:19+08:00 wangbomeng add annotations llama_content_logs.csv 2678215008d62e9f675cd50602bf6bbfbc13bc2a llama_content_logs.csv--af8055f5f033
af8055f5f033a730e7e1fe80185b18b7e9473966 2026-04-10T14:58:19+08:00 wangbomeng add annotations llama_perf_logs.csv 16550f041a99c3e40d0a9142a3b9e5fe195b0d25 llama_perf_logs.csv--af8055f5f033
af8055f5f033a730e7e1fe80185b18b7e9473966 2026-04-10T14:58:19+08:00 wangbomeng add annotations log.1 490d2f80e290ff8accd02254a0f0e2e34fcb801c log.1--af8055f5f033
005112c51e00d998b457337ca3dad53fc46e2d0b 2026-04-24T16:24:31+08:00 wangbomeng clip: add image_to_patches; calrt: vision copy data from bf16 to fp32 patch1.cpp b0a73d9ae2679bd2ea840730375fc6d4b4c71c67 patch1.cpp--005112c51e00
005112c51e00d998b457337ca3dad53fc46e2d0b 2026-04-24T16:24:31+08:00 wangbomeng clip: add image_to_patches; calrt: vision copy data from bf16 to fp32 patch2.cpp de563ce2bc5072c1a6d470f2977cc31cad5b4ce1 patch2.cpp--005112c51e00
005112c51e00d998b457337ca3dad53fc46e2d0b 2026-04-24T16:24:31+08:00 wangbomeng clip: add image_to_patches; calrt: vision copy data from bf16 to fp32 patch3.cpp 811336a8abe5d07b117a8b023c0ad0a883e080ee patch3.cpp--005112c51e00
6d5e83902bdd3142a8ff0d3db19f02a8619e95a0 2026-03-27T00:57:11+08:00 wangbomeng server: printf calrt commit ID server_old.cpp f3b335e70e6453cd35ea056f503d7204292363d8 server_old.cpp--6d5e83902bdd
1 commit author_date author subject original_path blob recovered_file
2 1f0d5bb0453f93ffa51faf68237c89251c2e0c40 2026-04-09T17:38:37+08:00 wangbomeng add --device-info calculet0_103149_run.txt 153d97e98aa350a5645e6e532a626a6c3a2c2582 calculet0_103149_run.txt--1f0d5bb0453f
3 1f0d5bb0453f93ffa51faf68237c89251c2e0c40 2026-04-09T17:38:37+08:00 wangbomeng add --device-info calculet0_103264_run.txt 6483ceddec9ab053c30408811ab1ea1ab4f994e2 calculet0_103264_run.txt--1f0d5bb0453f
4 1f0d5bb0453f93ffa51faf68237c89251c2e0c40 2026-04-09T17:38:37+08:00 wangbomeng add --device-info calculet0_103409_run.txt 93dd36245ab2d87ef6bac3a12e364d187b75e739 calculet0_103409_run.txt--1f0d5bb0453f
5 1f0d5bb0453f93ffa51faf68237c89251c2e0c40 2026-04-09T17:38:37+08:00 wangbomeng add --device-info calculet0_103634_run.txt 08ef62c34cc3b76ee69ef6da872a9dfce677416f calculet0_103634_run.txt--1f0d5bb0453f
6 aa54a7c637f2c92d924a5f35386975b1c27de898 2026-02-27T01:30:36+08:00 wangbomeng Add bf16_to_fp32 calculet0_12456_run.txt 53a62a721a90b134cf8716e63c605bdc81dbcf0a calculet0_12456_run.txt--aa54a7c637f2
7 aa54a7c637f2c92d924a5f35386975b1c27de898 2026-02-27T01:30:36+08:00 wangbomeng Add bf16_to_fp32 calculet0_7518_run.txt f6fbf904abe4e169256125cb55108011867b14d3 calculet0_7518_run.txt--aa54a7c637f2
8 96b4e267e562f44e76ec6c965ee0fa361f0439bf 2026-04-17T15:33:01+08:00 wangbomeng merge dev-ot calculet0_141241_run.txt 4041e6c79f47735912d13065a9d25f1769c40a31 calculet0_141241_run.txt--96b4e267e562
9 96b4e267e562f44e76ec6c965ee0fa361f0439bf 2026-04-17T15:33:01+08:00 wangbomeng merge dev-ot calculet0_141410_run.txt 3cbcee285c6767e4ee5d5157d8b089f9461b4429 calculet0_141410_run.txt--96b4e267e562
10 82842cfc3fa3d5c004c4540aeff8a81f38509bee 2026-04-09T15:06:26+08:00 wangbomeng server: fix limit tokens to max_seq_len calculet0_17323_run.txt 1972792c0d6ccb12cdfcc15d0a89b97a8a267bc6 calculet0_17323_run.txt--82842cfc3fa3
11 b6f29ec8140028619efaa50aa6e73146cecf631d 2026-04-13T11:23:31+08:00 wangbomeng server: fix context-shift calculet0_353163_run.txt 07d78dec4e31d5e3991a5b177c2ab20d65b10c82 calculet0_353163_run.txt--b6f29ec81400
12 b6f29ec8140028619efaa50aa6e73146cecf631d 2026-04-13T11:23:31+08:00 wangbomeng server: fix context-shift calculet0_353335_run.txt 0ae27da7d33585241abbb0887fc996924900be9b calculet0_353335_run.txt--b6f29ec81400
13 b6f29ec8140028619efaa50aa6e73146cecf631d 2026-04-13T11:23:31+08:00 wangbomeng server: fix context-shift calculet0_354076_run.txt 967ff2a3b2c001408a7c656cff31285a50caea1f calculet0_354076_run.txt--b6f29ec81400
14 b6f29ec8140028619efaa50aa6e73146cecf631d 2026-04-13T11:23:31+08:00 wangbomeng server: fix context-shift calculet0_354399_run.txt 499d1d40ed576135de276c6ec7633b706f00b23c calculet0_354399_run.txt--b6f29ec81400
15 b6f29ec8140028619efaa50aa6e73146cecf631d 2026-04-13T11:23:31+08:00 wangbomeng server: fix context-shift calculet0_354593_run.txt fe58a1e2f9f394f7ca3cf345525015b8ae78c934 calculet0_354593_run.txt--b6f29ec81400
16 7800c772d44a7415640ec1669a691232939927cf 2026-05-13T15:23:54+08:00 wangbomeng try passkey and embedding calculet0_6145_run.txt 3f01e318dd0c5f149b28fb5208b61d562171cb21 calculet0_6145_run.txt--7800c772d44a
17 7800c772d44a7415640ec1669a691232939927cf 2026-05-13T15:23:54+08:00 wangbomeng try passkey and embedding calculet0_6728_run.txt 41b92eb616c878a624ca8becec9b31a5b4a55598 calculet0_6728_run.txt--7800c772d44a
18 7800c772d44a7415640ec1669a691232939927cf 2026-05-13T15:23:54+08:00 wangbomeng try passkey and embedding calculet0_7810_run.txt fd06c70f0f31126e830e1e8ea87d6293aa8a1008 calculet0_7810_run.txt--7800c772d44a
19 af8055f5f033a730e7e1fe80185b18b7e9473966 2026-04-10T14:58:19+08:00 wangbomeng add annotations llama_content_logs.csv 2678215008d62e9f675cd50602bf6bbfbc13bc2a llama_content_logs.csv--af8055f5f033
20 af8055f5f033a730e7e1fe80185b18b7e9473966 2026-04-10T14:58:19+08:00 wangbomeng add annotations llama_perf_logs.csv 16550f041a99c3e40d0a9142a3b9e5fe195b0d25 llama_perf_logs.csv--af8055f5f033
21 af8055f5f033a730e7e1fe80185b18b7e9473966 2026-04-10T14:58:19+08:00 wangbomeng add annotations log.1 490d2f80e290ff8accd02254a0f0e2e34fcb801c log.1--af8055f5f033
22 005112c51e00d998b457337ca3dad53fc46e2d0b 2026-04-24T16:24:31+08:00 wangbomeng clip: add image_to_patches; calrt: vision copy data from bf16 to fp32 patch1.cpp b0a73d9ae2679bd2ea840730375fc6d4b4c71c67 patch1.cpp--005112c51e00
23 005112c51e00d998b457337ca3dad53fc46e2d0b 2026-04-24T16:24:31+08:00 wangbomeng clip: add image_to_patches; calrt: vision copy data from bf16 to fp32 patch2.cpp de563ce2bc5072c1a6d470f2977cc31cad5b4ce1 patch2.cpp--005112c51e00
24 005112c51e00d998b457337ca3dad53fc46e2d0b 2026-04-24T16:24:31+08:00 wangbomeng clip: add image_to_patches; calrt: vision copy data from bf16 to fp32 patch3.cpp 811336a8abe5d07b117a8b023c0ad0a883e080ee patch3.cpp--005112c51e00
25 6d5e83902bdd3142a8ff0d3db19f02a8619e95a0 2026-03-27T00:57:11+08:00 wangbomeng server: printf calrt commit ID server_old.cpp f3b335e70e6453cd35ea056f503d7204292363d8 server_old.cpp--6d5e83902bdd
@@ -0,0 +1,287 @@
ebce9e1a548c2329aa97f53b8b2ad50d968088dc e850ff4de25ad1221abc9bf3bb30df252ccd9c36 2026-05-27T09:38:00+08:00 Yunzhe Jia origin/runtime_replace Refactor cal-llm integration by removing runtime capacity loading and adjusting request handling
e850ff4de25ad1221abc9bf3bb30df252ccd9c36 9985688f7fa96f755882f96a2cd8a18114fdc42d 2026-05-26T10:59:45+08:00 Yunzhe Jia Enhance cal-llm integration by adding runtime checks for CALRT_LIBRARY and updating link settings for Linux and Windows
9985688f7fa96f755882f96a2cd8a18114fdc42d 38ca6895815671a87ceec86b4aa4eb976580ce76 2026-05-25T09:05:49+08:00 Yunzhe Jia Refactor CalrtEngineConfig initialization by removing redundant parameters
38ca6895815671a87ceec86b4aa4eb976580ce76 ddd60c928224b52eb4e1e60e01e8a1ecbb80ee45 2026-05-20T16:37:13+08:00 Yunzhe Jia Add support for cal-llm profile dumping to JSONL file
ddd60c928224b52eb4e1e60e01e8a1ecbb80ee45 2716130010c58f1cdd9d94f0e2f8e047bc92dc66 2026-05-20T09:22:40+08:00 Yunzhe Jia Add cal-llm backend profiling support with command-line option
c931ef3163940227c9b6291e04216245cce21429 a43741244a646d3f8fa3ff01bb9b7d059223d0a5 2026-05-18T17:34:37+08:00 wangbomeng calrt: fix prefill_by_ids.fix create_buf
2716130010c58f1cdd9d94f0e2f8e047bc92dc66 b35bda124ccd4ed581dd6088d3ffa4931c2809b6 2026-05-18T08:40:54+08:00 Yunzhe Jia fix n_ctx_slot error by adding runtime capacity loading for cal-llm
a43741244a646d3f8fa3ff01bb9b7d059223d0a5 b2003d6c90ef0fa26ab9e930ba3e22b355eb3d39 2026-05-15T14:39:53+08:00 wangbomeng run llama-passkey successfully, fix llama-bench, copy 3 times input to infer qwen2.5vl
b35bda124ccd4ed581dd6088d3ffa4931c2809b6 81a2cbd4cef5d28334ff513d6b69e593d9d1cb49 2026-05-15T09:19:31+08:00 Yunzhe Jia Implement vocab-only model initialization and enhance cal-llm backend error handling
81a2cbd4cef5d28334ff513d6b69e593d9d1cb49 3b14ed556c15529fe1f94b649f49db7156dfaf67 2026-05-14T16:06:37+08:00 Yunzhe Jia Enhance CMake configuration for cal-llm integration by updating paths and adding library properties
3b14ed556c15529fe1f94b649f49db7156dfaf67 dde8b8228081769c8d8f1e0751d47fa7875f8423 2026-05-14T14:34:25+08:00 Yunzhe Jia - Removed references to CALRT from clip.h, mtmd-helper.cpp, mtmd-helper.h, mtmd.cpp, and mtmd.h. - Updated server.cpp to conditionally include CAL-LLM support. - Introduced option LLAMA_SERVER_USE_CAL_LLM in CMakeLists.txt to enable CAL-LLM integration. - Refactored server context to handle CAL-LLM requests and responses. - Updated image processing logic to remove CALRT-specific implementations. - Ensured compatibility with existing llama functionality while integrating new CAL-LLM features.
fabcc7dac4b34d83fe430980bb364b81087c7ee9 1e9787962f20a7e82c71589ac1dd0585454e4bfe 2026-04-30T16:17:17+08:00 wangbomeng calrt: fix encode dump
f584311c716dd078c4b737eebbfda97fe12b7274 a339954cc2a145a80c5ea349e7896211916cbed9 2026-04-30T16:05:15+08:00 wangbomeng calrt: fix encode dump
1bec0db5a675ddc60fb793be2a746e8f3c8855dc 465df20c3e1f3f58d0f5531c796e0941a49c32b0 2026-04-30T16:02:59+08:00 wangbomeng origin/dev-ben bench: support 2 calbins
465df20c3e1f3f58d0f5531c796e0941a49c32b0 a339954cc2a145a80c5ea349e7896211916cbed9 2026-04-30T09:08:12+08:00 wangbomeng support one calbin
431ad6f1c787f1b47e9e7be14b2e1a7d8565485c efa1876bb8b2a449a55054a8c3745892f2c0f262 2026-04-27T16:52:15+08:00 wangbomeng update calrt_infer
4a2a3181f1cea170105c771e6ba69d851b82b937 e3ea5541259f35871c3e995331770aaca297e9ec 2026-04-26T10:56:02+08:00 wangbomeng add calrt-version
e3ea5541259f35871c3e995331770aaca297e9ec 0b8e43943846a1cd05c26c9186b9ef778ebae6e2 2026-04-26T10:55:48+08:00 wangbomeng add calrt-version
5eb46fffbd2e260c540fb112314ad67bbb8f56b6 005112c51e00d998b457337ca3dad53fc46e2d0b 2026-04-24T16:24:51+08:00 wangbomeng clip: add image_to_patches; calrt: vision copy data from bf16 to fp32
005112c51e00d998b457337ca3dad53fc46e2d0b 509670642e8090a1713f5d73590b549be827aaef 2026-04-24T16:24:31+08:00 wangbomeng clip: add image_to_patches; calrt: vision copy data from bf16 to fp32
5d219bfcef239c1e3ddd1baecc0514a9462ff6a8 6787a53ab9b4897c5a7b51a4062d7b90e6697d35 2026-04-24T09:31:32+08:00 wangbomeng calrt: recover base = batch_index * dict_len
6787a53ab9b4897c5a7b51a4062d7b90e6697d35 e1a76abf66178ea85656479a5e19aea7785c09f4 2026-04-24T09:22:02+08:00 wangbomeng calrt:input of multimodel from fp32 to bf16
e1a76abf66178ea85656479a5e19aea7785c09f4 99dd308adb8488fa869bb669e3335e646a938eff 2026-04-22T16:29:22+08:00 wangbomeng calrt:add CalcoreRT version print
99962021f2dd1994dbbf90d5712f0ca2633f20f8 9af6682ef101c6d006c743c703cf150ac25f466f 2026-04-17T14:48:33+08:00 wangbomeng origin/dev-ot calrt: add onetoken slice and untile_prefill
e24f775ee26ea5249d5ff6cd23b8a0a17fe1438d a206460e610aef995e36e50b33e8bd41fe477541 2026-04-15T10:01:09+08:00 wangbomeng calrt: add copy_data_to_ibuf for vision model
a206460e610aef995e36e50b33e8bd41fe477541 d8b2aaa00049978cebac15041f960d75b552f97b 2026-04-14T10:23:43+08:00 wangbomeng calrt: support mixture of prefill_by_ids and prefill_by_embeds
0cd44929b442860dc0e5f88976108be82350f9dc b8153b6b8f244b223c9f4c2940ae1f212634519e 2026-04-09T15:08:50+08:00 Bomeng Wang rm calculet0.txt
9626239f5a9e568c9975d67dd6745fef90279a87 da724f3e2a8af2c2537e3edcff41e9415ac66fef 2026-04-08T17:47:04+08:00 wangbomeng calrt: fix MapBuf
da724f3e2a8af2c2537e3edcff41e9415ac66fef 18814f9bf1a423ebe8f32d6043c9cbc5b21b0218 2026-04-08T16:58:32+08:00 Bomeng Wang calrt: add MapBuf
bbee06d6d851e3f84f75b578047967d7e0e4a8dc e126c21ed7b793b648d63533ea7ee30885f5a82a 2026-04-08T11:29:36+08:00 wangbomeng calrt: add test time print
5603e050af07173589f3b8850121263d86da01fd 1e8a16cd0e3ad3c9a0f8746852a0a38c6e52322e 2026-04-01T05:57:55+08:00 wangbomeng calrt: add t_incopy and t_outcopy
1e8a16cd0e3ad3c9a0f8746852a0a38c6e52322e 893e52bda0fee99bbda1521ea733a760bc4201f1 2026-04-01T10:14:22+08:00 wangbomeng calrt: fix slice and add infer/copy time
6d5e83902bdd3142a8ff0d3db19f02a8619e95a0 e4eaab700333490e80ebefc8d023f6c1adfcc312 2026-03-27T00:57:11+08:00 wangbomeng server: printf calrt commit ID
e4eaab700333490e80ebefc8d023f6c1adfcc312 aeacc23a883400db0ebffb50e23355ada054da66 2026-03-25T09:03:55+08:00 wangbomeng calrt: prefil to prefill
aeacc23a883400db0ebffb50e23355ada054da66 cbaa7492663630132adeddccd9fec5e44ffa3336 2026-03-25T08:49:22+08:00 wangbomeng calrt: add slice only on decode
3c08ebf0e442cd730ddffd959ec676f9caf31c82 613bc2b9a9d7af92efbe42d876ffcdb244f7a00e 2026-03-24T02:43:03+08:00 wangbomeng calrt: comment LOG_ERROR in untile_decode_cpy
613bc2b9a9d7af92efbe42d876ffcdb244f7a00e 4e194ecc6c4b8ebe4c72d93f6055e3605dbfcefa 2026-03-24T02:30:12+08:00 wangbomeng calrt: fix max_seq_len judgment
4e194ecc6c4b8ebe4c72d93f6055e3605dbfcefa 16cbf81a731f5839a2f6b0eb9d8539826353748b 2026-03-24T01:59:03+08:00 wangbomeng calrt: fix ubatch.embd cpy
16cbf81a731f5839a2f6b0eb9d8539826353748b 8b4e17d990c23025148c4abadefe1010a0dd0734 2026-03-23T09:38:21+08:00 wangbomeng calrt: fix model_name of untile_cpy
6dacdd2cf9574214ca272a86674e7bd7ba21c4f0 3e6ad64467771224f072e5bad90e270951ba4cdf 2026-03-23T14:42:28+08:00 wangbomeng calrt: add multimodal
3e6ad64467771224f072e5bad90e270951ba4cdf b37b7d9756feb3dac2db526eeab38b572a095d47 2026-03-23T14:36:41+08:00 wangbomeng calrt: add multimodal
d0a1b2c758440720d42fa108b3444f54593daa73 b37b7d9756feb3dac2db526eeab38b572a095d47 2026-03-12T16:10:28+08:00 Bomeng Wang calrt: comment out dump
7ddafbdcb9426ae3af016925b8b596f11e8742d0 059009eeaf20a569abfbac5eb37dad3bb9376428 2026-03-10T07:13:04+08:00 wangbomeng calrt: commented out cal_ctx->encode(batch)
059009eeaf20a569abfbac5eb37dad3bb9376428 1b073661d1311b5300173993b9f31ee7241d8606 2026-03-10T07:04:22+08:00 wangbomeng calrt: add multimodel
6295273c5866b9249bacdedbfc3a31877e6e6a85 c6ea3f0d2468e3b8eab5de80bacee7fe4c9dd3d7 2026-03-10T06:54:41+08:00 wangbomeng arg: update hf_repo url to https://download.calculet.tech:9443
f8fba66b657c51a1df1efc7267bfea9f6140cebf db4a61d2234c2f457b42ecc3f7219a1e1a35508a 2026-03-06T15:06:36+08:00 Yunzhe Jia fix calrt_install include path
e672e02ca1a582f9e3a9d011d9e1b4fea4942a25 27b82f64252779ad160a3fa76bd378c39421de36 7a3a9a0e76bb5f530beafcfe52e87e388e93117a 2026-03-06T11:47:09+08:00 Yunzhe Jia Merge branch 'dev' of http://192.168.10.26:1000/yunzhe/llama.cpp into dev
27b82f64252779ad160a3fa76bd378c39421de36 0bd95719fed2f0247c8d0199dd897d24157dfae6 2026-03-06T11:42:45+08:00 Yunzhe Jia adapt to calrt_objs target
7a3a9a0e76bb5f530beafcfe52e87e388e93117a 583c387efaf7bc030574e554088de79d09a27fbd 2026-03-05T07:24:59+08:00 wangbomeng calrt_infer: fix past_kv_len
aa0a17d719326a63e0d6fea60aa0ced44e7abc33 fa332e773da681f3e77d6ffe83a87edb557f758b 2026-02-27T01:40:11+08:00 wangbomeng calrt: add bf16_to_fp32
49fea70a20f550bfdb59d0ffe041b54919c22447 74a118df31b6a4acc8876b2a2db90d2395cc6ec3 2026-01-28T09:11:16+08:00 Yunzhe Jia adapt to new calbin test_case
74a118df31b6a4acc8876b2a2db90d2395cc6ec3 98e8f9acfe87cd93646482cb2d942b8a132f0852 2026-01-13T14:32:47+08:00 Yunzhe Jia sync with calrt update
8c8152a04036bb0d4756a4e08e54f514dae4e64d 5d2387931528fbe04aa8d66de935147efb65ca4d 2025-12-09T14:40:04+08:00 Yunzhe Jia adapt to calrt csr
e6285a748657add8d974b78ca920c5b41753ee12 6b1ecdbbe3cc72ed8888be38f9e934cfd79b9fbb 2025-11-27T16:58:35+08:00 Yunzhe Jia adapt to calrt
240d9bb75241c91896afe125f2fc74698a7395f3 7eeb241aad429a68fb8cfa3ba85d000fb2348cd2 2025-11-24T12:03:00+08:00 Yunzhe Jia adapt to calrt modification
cd5e3b57541ecc52421130742f4d89acbcf77cd4 87c9efc3b297b8a498716b1db3d061842e6fc85b 2025-11-02T18:14:04+02:00 Georgi Gerganov server : support unified cache across slots (#16736)
8da3c0e200a586f768ada6f38745acb01380174c c22473b580807929fd9e3a3344a48e8cfbe6c88f 2025-10-31T13:50:33+02:00 Georgi Gerganov batch : fix consistency checks for the input positions (#16890)
c22473b580807929fd9e3a3344a48e8cfbe6c88f 0f715b4e759acceccb9f437cfd2a988fff85514a 2025-10-31T10:54:19+02:00 Georgi Gerganov server : don't print user inputs to console (#16871)
13002a08960e51a76c4d696165b5d7638d2f2b99 6eb208d17ea29bb60295d9a2b5e7122dfb8f4b55 2025-10-31T12:46:31+08:00 l3utterfly ggml-hexagon: respect input size when getting/setting tensor data (#16836)
63d2fc46e17a06be5b4b5823a5ada088317f1f0a a2e0088d9242bd9e57f8b852b05a6e47843b5a45 2025-10-22T13:47:09-07:00 Max Krasnyansky Add experimental ggml-hexagon backend for the Hexagon NPU (#16547)
9b9201f65a22c02cee8e300f58f480a588591227 19a5a3edfd306516cc419679d69d6435943b6816 2025-10-22T16:58:23+02:00 Pascal webui: introduce OpenAI-compatible model selector in JSON payload (#16562)
4926419c4d74a1cf724e7163d937eb72f36e7b26 6ea37f57391d27736c35cd3c20c1f990b7952b74 2025-10-21T16:43:14+08:00 Aman Gupta ggml: add ggml_can_fuse_subgraph (#16662)
79068501fac9a74cca7129a8e5a8281b410a853e 0e4a0cf2fae667d3efcf52f2f52398779d986b1d 2025-10-20T14:21:12+02:00 Aleksander Grygier Prevent premature submission on IME input (#16673)
f4ce81c45e7bd910e36bf44c253fc5255c49b1e4 17304cbcc1dd24de7741cbe57925d58e90a98ac1 2025-10-15T23:05:56+09:00 Sam/Samuel metal: optimise `GGML_OP_SUM` (#16559)
f9bc66c3ebcfddb5f09e4b21253623caeb8e414a a31cf36ad946a13b3a646bf0dadf2a481e89f944 2025-10-13T08:52:22+08:00 hipudding CANN: Update several operators to support FP16 data format (#16251)
12bbc3fa50b6df03318a4451c9a2210200a0b28d 9d0882840e6c3fb62965d03af0e22880ea90e012 2025-10-08T22:18:41+02:00 Pascal refactor: centralize CoT parsing in backend for streaming mode (#16394)
e29acf74fea996014380d59d31aa504ae8964258 128d522c04286e019666bd6ee4d18e3fbf8772e2 2025-10-04T11:42:56+02:00 Acly vulkan : incremental shader builds (#16341)
34fcc5a4ace8c69476ef2ea3857f39a60334acc4 91a2a5655658bb9ab77894716b82fae7ecb4b4d1 2025-10-02T19:43:22+02:00 Piotr Wilkin (ilintar) model : Apertus model implementation (#15852)
98c8269abefdfa8fde47dfb2769ceebc8b704e86 2790ecc304e384d9075c55d0628d8bf440025dc4 2025-09-30T17:42:57+08:00 Yunzhe Jia server: adapt to calrt
2790ecc304e384d9075c55d0628d8bf440025dc4 f528e97d894b4d93934a0711a00253eea980e799 2025-09-30T17:37:58+08:00 Yunzhe Jia adapt to calrt
f528e97d894b4d93934a0711a00253eea980e799 dcbe998a6d8f13b6c9cb36bbe7b355ced2ac3842 2025-09-11T14:13:35+08:00 Yunzhe Jia add calrt mtmd support
66bb7985c3fcefda7a74aae9f8321f70eb1646c4 2f61c0f5bf8a620ca4c3872408803ab38cfb9613 2025-09-29T09:08:41+02:00 Pascal fix: preserved zero values in chat settings inputs and textareas by switching to nullish coalescing for field values and default placeholders (#16312)
2f61c0f5bf8a620ca4c3872408803ab38cfb9613 3ffd0fae473c954bb3e67526b31262048fb508d4 2025-09-29T12:33:12+05:30 Vinkal llama-cli: prevent spurious assistant token (#16202)
cd08fc3ecc0264b4414b68af3874a6c689ed60c1 cb5bb6cc05119c24e7711ca2956cd0e6d409d396 2025-09-17T01:08:02-07:00 David Ribeiro Alves common : Fix corrupted memory error on json grammar initialization (#16038)
3d4053f77f0f78ee2b791088c02af653ebee42dd dc381aa9a6dc45f00673471d34b8bddd30e77570 2025-09-15T16:28:31-06:00 Jake Karnes CUDA: fix im2col_3d to respect non-contiguous inputs (views) (#15956)
fd621880f3fd908424e675a41715a2dc760247a2 4281c7b315f8a904549fe527039b976e08098d1a 2025-09-05T17:32:39-06:00 Gabe Goodhart aLoRA Support (#15327)
5fac79cbc77b6d12c9feb5f34fc63586b35fd561 408ff524b40baf4f51a81d42a9828200dd4fcb6b 2025-09-05T14:31:24-06:00 Gabe Goodhart Thinking model disabled assistant prefill (#15404)
dcbe998a6d8f13b6c9cb36bbe7b355ced2ac3842 87932ec016f0ec81e98a13ce5212851f8c12458a 2025-09-05T14:34:07+08:00 Yunzhe Jia add calrt API used in server side
fb15d649ed14ab447eeab911e0c9d21e35fb243e 856ed0947f27b4ec3ad269fceda0402fbab263d3 2025-09-04T18:10:29+02:00 Daniel Bevenius llama : add support for EmbeddingGemma 300m (#15798)
5d804a4938d896f9089687a8b99911cdb43b0b94 d4d8dbe383e8b9600cbe8b42016e3a4529b51219 2025-09-02T01:14:55+02:00 Johannes Gäßler ggml-backend: raise GGML_MAX_SPLIT_INPUTS (#15722)
886b97a5d693550c2da470c091d9d27bf38398f8 111f8d06f0b9169059779a35f655b343242ccbb6 2025-08-25T10:47:16-05:00 Jeff Bolz tests: Generate unique input values for count_equal (#15487)
4afb0a746f22abaa545b3ebdb76a400d7da3a713 e288693669cf9d0a71e2f2b8bd57305f06340257 2025-08-22T08:10:14Z 65a server : Support multimodal completion and embeddings prompts in JSON format (#15108)
5e6229a8409ac786e62cb133d09f1679a9aec13e e2c1bfff5305c661ac53e9d57cb732ff626a2242 2025-08-15T19:50:52+02:00 Daniel Bevenius common : fix double bos, use common_chat_templates for add_bos and add_eos (#15326)
ff27f80a74bbe5303acd511a6781a1de6d619b3c d3248d9b6557c75d59954c594bb53cf517591e91 2025-08-15T21:11:22+08:00 Aaron Teo ggml: initial IBM zDNN backend (#14975)
3a617cb18121a85eed17ac5585788810c5d9c1e0 c42293848dd9f03eba9a6c1b85a600b398f06541 2025-08-13T10:58:59+08:00 Yunzhe Jia add calrt_decode
c42293848dd9f03eba9a6c1b85a600b398f06541 1cbf442f50a154aac0bf35d7b8b3436a2cdfd6f5 2025-08-06T15:46:06+08:00 Yunzhe Jia sync with calrt API
1cbf442f50a154aac0bf35d7b8b3436a2cdfd6f5 ba67d6c03fed3193987a4ef13050e6e2a4451df4 2025-07-24T15:50:19+08:00 Yunzhe Jia 1.sync with calrt prefill,decode,kv_update op 2.add hw pattern untile function
f906275537d14c8fc7c6976d944233771fd6672c a9f7541ec25c4c8547daf5ff48700ad2836e2b7d 2025-08-02T10:12:41+02:00 Johannes Gäßler server: enable token array inputs for OAI API (#15001)
41e78c567e9a8c652e405f4f909deb598deecd31 ad4a700117d1746799d2d6599e526e2c3a7938d2 2025-07-30T18:07:11+02:00 Daniel Bevenius server : add support for `embd_normalize` parameter (#14964)
a118d80233d3bf92569c051346fd2638f87bf202 61550f8231dc0aa478e2f537c5009ede6878ce22 2025-07-30T00:25:05-05:00 Douglas Hanley embeddings: fix extraction of CLS pooling results (#14927)
d1aa0cc5d13ec3fa553de5d298f9166679e58479 c8ade30036139e32108fee53d8b7164dbfda4bee 2025-07-22T13:33:37+01:00 Ed Addario imatrix: add option to display importance score statistics for a given imatrix file (#12718)
6c9ee3b17e19dcc82ab93d52ae46fdd0226d4777 cd465d823c378853f1f6570eebfb77f69c7e1d39 2025-07-21T19:03:19+02:00 rmatif opencl: add conv2d kernel (#14403)
021cc28bef4dd7d0bf9c91dbbd0803caa6cb15f2 d498af3d5a00f96bdd37b534860f03a6d9e98d39 2025-07-18T13:35:32+02:00 Oliver Simons cuda : Fix Gemma3n not executed as CUDA_GRAPH on NVGPUs (#14741)
d9b691081c04ec5fb0daa9d2b979f915c142963d ad57d3edd2f48cf6dc41a98fd9b303435ecb4fb0 2025-07-17T09:49:15+03:00 Georgi Gerganov kv-cache : opt mask set input (#14600)
0aedae00e6fb48680324a5ac5da9cba0e35de6b5 6bdda13981d6c8189b7dc4f9fb8ecb91c21529f8 2025-07-10T18:20:13-06:00 Gabe Goodhart model : Granite Four (#13550)
cb9178f885d1986cc0b12feb26ff426bc8a3556c 4a5686da22057867c23bd4a6be941ddc8c51e585 2025-07-09T23:09:28+02:00 Xuan-Son Nguyen llama : remove llm_graph_input_one (#14603)
4a5686da22057867c23bd4a6be941ddc8c51e585 98bab638fb28cf95a5a66dd2d51b40d6c8f6d69a 2025-07-09T14:59:57-04:00 compilade llama : support Jamba hybrid Transformer-Mamba models (#7531)
bac8bed248d15419137c5bc7f834582397baaebc b81510a7b78f7c5a6f069c4f3d0e569b9d287913 2025-07-05T07:18:09+03:00 Georgi Gerganov eval-callback : check for empty input (#14539)
5d46babdc2d4675d96ebcf23cac098a02f0d30cc e17991c466ac835b2c71bd813c1ca7ff8dd97b94 2025-07-02T13:10:24-04:00 compilade llama : initial Mamba-2 support (#9126)
55a1c5a5fdefef808e95aabd3d5563af1068cc80 12a81af45f0dbbab24bd819a15f57c03ceb1be90 2025-07-02T20:34:24+08:00 Aman Gupta CUDA: add softmax broadcast (#14475)
8846aace4934ad29651ea61b8c7e3f6b0556e3d2 a01047b041aa04aeea351933658433ed004516ab 2025-06-26T19:34:02+02:00 Xuan-Son Nguyen model : gemma3n text-only (#14400)
ba67d6c03fed3193987a4ef13050e6e2a4451df4 8f52c6f8abb2ed9ad967cc0bfb90acb073011193 2025-06-26T17:42:32+08:00 Yunzhe Jia llama-calrt: infer-op: copy data from output buffer to dst-tensor.data
8f52c6f8abb2ed9ad967cc0bfb90acb073011193 d2f325130c4ed77a3dcff2c23a926587fb08e2cc 2025-06-26T15:10:45+08:00 Yunzhe Jia Squashed commit of the following:
72c6bc3f3d0cf3bf160dddf1b803fed52bcbb0a3 defe2158dd5e250b4ef53994057a4ec03131a263 2025-06-23T19:56:19+08:00 Molly Sophia llama : better rwkv chat template and add missing `inputs.use_jinja` setting (#14336)
d2f325130c4ed77a3dcff2c23a926587fb08e2cc 6391ee7ffd97e723dfbdcc32f001e1b95a63cba6 2025-06-17T11:53:33+08:00 Yunzhe Jia calrt: add input_token in graph; input_token will be copy to calrt_in_buffer
edc4a29effe716956fdfd2bc5b9cba2a6d8492f8 ed3290ab34493fd3d2e0f925f816a401da4f2dfd 2025-06-19T00:08:14-05:00 Gabe Goodhart memory : Hybrid recurrent cache (#13979)
b9912ac570de8945ae9383c9ca8291027bf287dd 00ba7726100d7e1941d9f5a06f56a7559945b33c 2025-06-15T09:18:37+03:00 Georgi Gerganov batch : auto-gen positions + verify multi-sequence input (#14177)
b9850050a5b5147cb2e6720b98ed8c1e8e02eff9 933b205c32551848589b8339437d778cb4f2a46d 2025-06-06T17:25:52+08:00 Yunzhe Jia calrt: add call chain for using calrt::infer
dad5c44398b78467943ed0a603ea427fe9f6fc62 55f6b9fa6563f6ae49113f9abdc980c12348cc1c 2025-06-10T18:20:14-04:00 compilade kv-cache : avoid modifying recurrent cells when setting inputs (#13834)
056eb74534ffd3efc50a9b854156eb6876a52a44 247e5c6e447707bb4539bdf1913d206088a8fc69 2025-06-09T11:20:06+08:00 Yuanhao Ji CANN: Enable labeler for Ascend NPU (#13914)
33fea9a8592fd338abe279b89350a3af2e0ff1f7 806f05a353d322e97d97e02f910de2b408a8b4ab 2025-06-06T17:25:52+08:00 Yunzhe Jia calrt: add load calbin
806f05a353d322e97d97e02f910de2b408a8b4ab ec9e0301fef6476df83e94842c3b625501c95566 2025-05-30T09:45:37+08:00 Yunzhe Jia add calrt demo
663445b0deb21fb602176da030d4154197a4fca6 7675c555a13c9f473249e59a54db35032ce8e0fc 2025-06-02T10:12:20+01:00 Atharva Dubey sycl: quantize and reorder the input to q8_1 when reorder is enabled (#13826)
c962ae3382a1e759c8517a229549ee53685313a1 a3938fb53d0b5183db4f5a6db21fd9122a0e4780 2025-05-28T22:33:54+08:00 Sky server: fix remove 'image_url'/'input_audio' json-object effectlly for 'llama_params' in multimodal-model-mode (#13853)
bc583e3c63c04a11d287c108ea9e6a515ead0423 72b090da2c50e540143fd312a2f9aa5f151e6136 2025-05-27T14:06:10+02:00 Xuan-Son Nguyen mtmd : support Qwen 2.5 Omni (input audio+vision, no audio output) (#13784)
4f81b33e324b1669b282eb81104e4a1131be7dce cdf94a18023c92f41808ec874ba577d914674717 2025-05-27T09:40:59+03:00 Georgi Gerganov llama : validate seq id batch input (#13809)
6f180b915c9ed9ec0c240b5dcd64644988fb5e82 03f582ae8fccecff225c30a2802461b44761e822 2025-05-26T21:10:36+05:30 Akarshan Biswas SYCL: Add non contiguous support in RMS_NORM and NORM kernels (#13611)
2d38b6e4004fb1c341723e657fb1e71a4d3fb473 e121edc4324a640be11b7e567edd39b721b0f8e4 2025-05-26T10:20:18+08:00 Bizhao Shi CANN: Add the basic supports of Flash Attention kernel (#13627)
f5cd27b71da3ac375a04a41643d14fc779a8057b a2d02d5793fd9af7a7224773456501691b95fd02 2025-05-25T01:48:08+01:00 Olivier Chafik `server`: streaming of tool calls and thoughts when `--jinja` is on (#12379)
9ecf3e66a38f20e41d221f62f05b17f70d040839 faaaff5f947064d13ef8b98659d81a1384c3e57b 2025-05-23T11:03:47+02:00 Xuan-Son Nguyen server : support audio input (#13714)
797990c4bca0dca5be295c63e3fb2800dc0a69c2 ab86335760ebb441574eb47f886fa1ee302e2131 2025-05-22T20:42:48+02:00 Xuan-Son Nguyen mtmd : add ultravox audio input (#13623)
3cc1f1f1d24472a6558c942b1c78989ff4b0e569 c753d7bed0dc2cc2d5c42dfa9806cba91748392e 2025-05-15T14:24:50+02:00 Xuan-Son Nguyen webui : handle PDF input (as text or image) + convert pasted long content to file (#13562)
bf7937112058f2815fc3825a9ff7b536ecafa3bb d590cd4c244e5f260c42c290b83a358b9d86d763 2025-05-13T15:31:12+02:00 Sigbjørn Skjæret scripts : support arbitrary input file formats in compare-llama-bench.py (#13455)
d590cd4c244e5f260c42c290b83a358b9d86d763 1e2809bc4b5d8db2a9ed12ac872eca832c53f5fd 2025-05-13T07:12:01-06:00 Gabe Goodhart model : Granite MoE shared (#13269)
33eff4024084d1f0c8441b79f7208a52fad79858 17512a94d636c4b6c1332370acb3e5af3ca70918 2025-05-09T19:29:37+02:00 Xuan-Son Nguyen server : vision support via libmtmd (#12898)
8c83449cb780c201839653812681c3a4cf17feed 1a844be132dbe865358e1de81136920c1d35ac73 2025-05-08T15:37:29+02:00 Xuan-Son Nguyen server : (webui) revamp the input area, plus many small UI improvements (#13365)
27aa2595321c4d9cc4086a8e67bdea204b8309b0 9fdfcdaeddd1ef57c6d041b89cd8fb7048a0f028 2025-05-04T23:43:42+02:00 Xuan-Son Nguyen mtmd : add C public API (#13184)
e84773ab604fe0d935d03741df003716398dc57b fab647e8842c5f80da7e8f2c625dab6a0e19e5d4 2025-05-02T14:20:27+06:00 Shakil Ahmed mtmd-cli : fix out_of_range when input image path is empty (#13244)
cdf76586b23c67abd3ca064ee2c084c57ae240bd 7d3af70b089bb349b5d17eb01839224c99ec1952 2025-04-29T16:00:27+02:00 Johannes Gäßler CUDA: fix non-cont. inputs for batched mat mul (#13155)
43ddab6eeeaab5a04fe5a364af0bafb0e4d35065 1831f538f720d1d99fba146f24f0a8e970838cc4 2025-04-28T21:00:20+03:00 Ville Vesilehto fix(rpc): Improve input validation and error handling (#13069)
d2b2031e5f11b826dcc718138642f147a2009665 5fa9e63be82225fb3249c76f39ddda3e5bdec0a3 2025-04-28T14:20:56+02:00 Xuan-Son Nguyen llama : (mrope) allow using normal 1D position for text token (#13138)
5fa9e63be82225fb3249c76f39ddda3e5bdec0a3 a4c340f974f9b7ac0c1aae897aabaa54549a97e5 2025-04-28T12:18:59+02:00 Xuan-Son Nguyen clip : refactor set input for cgraph + fix qwen2.5vl input (#13136)
ca2bb89eac2097ab4620448737e58af8452e444b 2d451c80590b9ac250322769ac13d3b4870dbcf7 2025-04-27T16:10:34+08:00 HimariO clip : Add Qwen2.5VL support (#12402)
6408210082cc0a61b992b487be7e2ff2efbb9e36 aff9d107b066c9d464f7ab1324280acfdcebf569 2025-04-18T16:02:55-04:00 Daniel Tang main : Fix Ctrl+D/newline handling (#12951)
75afa0ae31f0a51aaadcc5ff146eb7a32a7f9088 c772d549264c1be058411312a54049e0dc86a037 2025-04-14T17:53:53+05:30 Akarshan Biswas SYCL: Fix im2col (#12910)
8ca6e1c3a4deb6bb27ee294bfd5706098d94ae88 656babd6c21a3b9b3622324cfcc80a2ab78da25b 2025-04-08T14:14:59+05:00 characharm server : webui : Improve Chat Input with Auto-Sizing Textarea (#12785)
1466621e738779eefe1bb672e17dc55d63d166bb 82974011f312057b446c27267105bd7ad3810599 2025-04-07T23:06:44+02:00 Xuan-Son Nguyen llama : Support llama 4 text-only (#12791)
e04643063b3d240b8c0fdba98677dff6ba346784 dbb3a4739e53226346c772dd72666e68b78dc583 2025-03-20T14:57:43Z Woof Dog webui : Prevent rerendering on textarea input (#12299)
c522ce4143a2b5c277f1e5f65cd570dbd0626466 081bee8c643b1f6302e9edfe789ce2d5f0be6c77 2025-03-14T10:47:44+02:00 Georgi Gerganov graph : simplify attn input build for unified KV cache (#12381)
e0dbec0bc6cd4b6230cda7a6ed1e9dac08d1600b 2048b5913d51beab82dfe29955f9008130b936c0 2025-03-13T12:35:44+02:00 Georgi Gerganov llama : refactor llama_context, llama_kv_cache, llm_build_context (#12181)
2048b5913d51beab82dfe29955f9008130b936c0 f08f4b3187b691bb08a8884ed39ebaa94e956707 2025-03-13T06:10:05-04:00 Ishaan Gandhi server : fix crash when using verbose output with input tokens that are not in printable range (#12178) (#12338)
b58934c1836b5ea51dbacbe899eee125775e77c9 63e489c025d61c7ca5ec06c5d10f36e2b76aaa1d 2025-02-19T00:01:44+02:00 igardev server : (webui) Enable communication with parent html (if webui is in iframe) (#11940)
c48f630d1c1942fce08aa7cb18a53ace443cd611 bd6e55bfd3f3af3e5705cf87a10e5178cef7c3c1 2025-02-13T14:46:59+01:00 Daniel Bevenius llama : add --completion-bash option (#11846)
2d219b389e8c8c40bce547b08c8aa7add60fde1f 333820d7491cd31c707a340ff23b984a84e40154 2025-02-07T08:55:47-05:00 Christian Fillion vocab : ignore invalid UTF-8 input in the BPE tokenizer (#11729)
b7552cfcbc7defccd8bdefd0a7b9c47d145ed3d7 225bbbfa39930cda38a2e5d1f3e5b38226732009 2025-02-07T09:15:22+01:00 Daniel Bevenius common : add default embeddings presets (#11677)
466ea66f338d63109540dae1df97ccfdbf4cd08f 5f0db9522f347b095f84c3033d6c1c1895402e25 2025-01-25T07:26:01+08:00 jiahao su CANN: Add Ascend CANN build ci (#10217)
aea8ddd5165d525a449e2fc3839db77a71f4a318 9f7add1cde670ff744b791f5ed6649e86a0c586c 2025-01-20T10:38:32-06:00 Jeff Bolz vulkan: fix coopmat2 validation failures (#11284)
6390a998bfc63241fde8509022b0768a71bf20bb 44e18ef93995f3040660750b527e5becf85899d0 2025-01-18T18:20:57+08:00 LostRuins Concedo tts : add guide tokens support (#11186)
44e18ef93995f3040660750b527e5becf85899d0 3edfa7d3753c29e44b964c0ff424d2ea8d5fdee6 2025-01-18T02:26:50-06:00 Jeff Bolz vulkan: fix coopmat2 flash attention for non-contiguous inputs (#11281)
437e05f714cdd67757405221578d3f95f8228b63 ca001f6656c1c3d29ef479b3aa5d669453e63be5 2025-01-13T17:16:39+03:30 ebraminio server : (UI) Support for RTL text as models input or output (#11208)
1bf839b1e8b9d043306c65eddd9021fe4337733e f7cd13301c2a88f97073fd119072b4cc92c08df1 2025-01-08T18:47:05Z Eric Curtin Enhance user input handling for llama-run (#11138)
db68c93b57bfdf6da1fbdae81080382d6998cbc9 c31fc8b966817b2f0b277fd28e04a189e388972a 2024-12-19T03:50:12+01:00 Daniel Bevenius ggml : improve inputs log sched_print_assignments (ggml/1053)
7ae33a616f44ecc081f3dcb589be20962d1d4a92 ebdee9478ca7ba65497b9b96f7457698c6ee5115 2024-12-23T01:09:58+03:00 Billel Mokeddem llama : add Falcon3 support (#10883)
0bf2d10c5514ff61b99897a4a5054f846e384e1e 7bbb5acf125d1d2840cac7d31b9aaa72210dd5ec 2024-12-18T19:27:21+02:00 Georgi Gerganov tts : add OuteTTS support (#10784)
46828872c31b25df16169cbbf5c2225fa9cb0675 6b064c92b4c0228e333193c167f2c98d2ec8d9bc 2024-12-18T09:55:09+01:00 Xuan Son Nguyen server : (embeddings) using same format for "input" and "content" (#10872)
ce8784bdb153ff7794dde5a50b0ebfa51baa6171 e52522b8694ae73abf12feb18d29168674aa1c1b 2024-12-08T23:04:29+01:00 Xuan Son Nguyen server : fix format_infill (#10724)
3573fa8e7b7f0865638b52b4e9b4d2006f0558a2 d9c3ba2b7749c00df477599aa141a98b4521aa2c 2024-12-07T20:21:09+01:00 Xuan Son Nguyen server : (refactor) no more json in server_task input (#10691)
605fa66c509f9f117bd654cf0b9b3ea08bb86e80 b7420131bf8ab3e067bc660439ab1ab18be7edbd 2024-11-28T15:25:24+08:00 leo-pony CANN: Fix SOC_TYPE compile bug (#10519)
9a4b79bcfa4338b922fa8cf903bd5ac058aaf46f 7066b4cce2898993e943ad6af5d8f1de5840c8e9 2024-11-26T18:08:37+08:00 Shanshan Shen CANN: Improve the Inferencing Performance for Ascend NPU Device (#10454)
cce5a9007572c6e9fa522296b77571d2e5071357 dc39012cbaf8752fabecaeb60af78ccdd1dfb73b 2024-11-24T18:03:25+02:00 Georgi Gerganov flake.lock: Update (#10470)
2eb76b2a5e4ea395b971a419c95b473ab6f253e4 9b75f03cd2ec9cc482084049d87a0f08f9f01517 2024-11-18T16:08:20+02:00 Georgi Gerganov flake.lock: Update (#10346)
bcdb7a23862b61aa307fc462fadfe1e2e653d010 f245cc28d4eb900efad0bc740145f58d713c6e4f 2024-11-16T18:26:54+05:00 MaggotHATE server: (web UI) Add samplers sequence customization (#10255)
9901068ac78838745e604fffb4601d315a610456 231f9360d94446cd083b6b116f63991b1328c484 2024-11-15T05:48:49-04:00 Xuan Son Nguyen server : (web UI) add copy button for code block, fix api key (#10242)
4b3a9212b602be3d4e2e3ca26efd796cef13c55e 505f33274d60676320216b662a97672a76ec600e 2024-11-10T21:45:25+02:00 Georgi Gerganov flake.lock: Update (#10243)
505f33274d60676320216b662a97672a76ec600e 160687b3ed002eee83a04de83a9cd752f928ced1 2024-11-11T00:42:25+05:00 MaggotHATE server : (web UI) Add back sampler settings (#10239)
e89213492d3e01705739789733f0f2d250b4c449 8fc393f246c550d2481e53323a47644a94e8d01f 2024-11-09T12:47:50+05:30 amritahs-ibm ggml : optimize llamafile cpu matrix multiplication for ppc64le (#10156)
07028f9d74d895da2ca4a1956624e3f07e04e620 524afeec9dad7d765ce91f5cf30c73703867cb47 2024-10-28T17:41:24+02:00 Georgi Gerganov flake.lock: Update (#10063)
958367bf530d943a902afa1ce1c342476098576b 40f2555797f97314de749873cdc29dc102be66e2 2024-10-24T21:51:22+02:00 Xuan Son Nguyen server : refactor slot input data, move tokenizer to HTTP thread (#10023)
873279b1592e433c4d9eb5065091cc98473c7bee c8c07d658a6cefc5a50cfdf6be7d726503612303 2024-10-20T00:22:59Z github-actions[bot] flake.lock: Update
19d900a7565b8f6b0a708836a57d26966cb9efe2 11d47057a51f3d9b9231e6b57d0ca36020c0ee99 2024-10-22T15:31:06+02:00 Daniel Bevenius llama : rename batch to ubatch (#9950)
bc219750845a59166d79f0d4ee3da1993b369b8a 1db8c84fc62857e1e45c1c7ea93bcd5344cb3d31 2024-10-21T09:37:12+03:00 Georgi Gerganov speculative : fix handling of some input params (#9963)
92be9f12164f18ce845a5bab60cefa5f7fec6836 edc265661cd707327297b6ec4d83423c43cb50a5 2024-10-13T06:11:26+03:00 Georgi Gerganov flake.lock: Update (#9870)
6279dac039ddeb6d5ebd125a6274fd3c37a77ba8 d5ac8cf2f2e30459489e6721a17d15b92a0c42a6 2024-10-07T19:35:42+03:00 Georgi Gerganov flake.lock: Update (#9753)
ace4f4be37abed4801fbd54a94cf38a7ae462416 8277a817f18967581b02b2248989d773e8e99998 2024-09-30T17:48:49+03:00 Georgi Gerganov flake.lock: Update (#9680)
9a913110cf471a8287ac06c43cbe307d3cf6df99 43bcdd9703ec19af7d2a519640b5ed6f4aac3d53 2024-09-28T12:08:43Z nopperl llama : add support for Chameleon (#8543)
3d6bf6919f7b10726421779cd344f2da05421c68 904837e0cb2f5f01bf5d5901b7aa57a026860ae4 2024-09-25T01:06:52-06:00 Gabe Goodhart llama : add IBM Granite MoE architecture (#9438)
f3979df762b75a2b1c0f622a2cd15d1bc60f037f 1e7b9299c6ccb5bbc55d3db7cfa9b51f3ab09b59 2024-09-23T18:43:40+03:00 Georgi Gerganov flake.lock: Update (#9586)
722ec1eb51ed53be2ab1ef31c6a1da8261803c71 6026da52d6942b253df835070619775d849d0258 2024-09-20T08:38:10+02:00 Sigbjørn Skjæret perplexity : do not escape input data by default (#9548)
e6b7801bd189d102d901d3e72035611a25456ef1 e665744317c77fc3483fc5224fe6d586b5166b33 2024-09-12T19:46:43+08:00 Dou Xinpeng cann: Add host buffer type for Ascend NPU (#9406)
cb9c933eb2a0d2b514556bdcb934b56dfe5d6771 6cd4e034442f71718563e600070c2b6fc389e100 2024-09-11T01:46:59+03:00 Georgi Gerganov flake.lock: Update (#9360)
d2d3200b385970cb2a4658fd9342a3b1212bdb46 51d964a4efdb0e8d43f5b85a775951185f6b641e 2024-08-09T20:21:56+08:00 Mengqing Cao cann : add Ascend NPU support (whisper/2336)
faf69d4237c9ae4d7f572b4674d1002463e8acd3 e536426ded3fb4a8cd13626e53508cd92928d6c2 2024-09-08T00:33:13+03:00 Georgi Gerganov llama : sanitize invalid tokens (#9357)
7605ae7daf31c02211bcfec2f46635ef6ec4b98a 8962422b1c6f9b8b15f5aeaea42600bcc2d44177 2024-09-04T02:36:43+03:00 Georgi Gerganov flake.lock: Update (#9261)
9c1ba557335c3cab46807e6478eb7d17a63361f1 c6d4cb46559b359d2682cf2a002e7fe01bb7a767 2024-09-02T16:51:01+05:30 Tushar build(nix): Package gguf-py (#5664)
1d1ccce67613674c75c9c7e3fa4c1e24e428ba48 9fe94ccac92693d4ae1bc283ff0574e8b3f4e765 2024-08-29T07:28:14+03:00 Georgi Gerganov flake.lock: Update (#9162)
18eaf29f4c5f7c8e89412f3a9a0392a9e4e01d75 554b049068de24201d19dde2fa83e35389d4585d 2024-08-19T10:10:21+03:00 Radoslav Gerganov rpc : prevent crashes on invalid input (#9040)
ee2984bdaf10c14d440ad873a049bcc09b786d9b c8ddce85606d9fb6e30745b6e4fe103eecadc73f 2024-08-16T14:06:30+03:30 Farbod Bijary py : fix wrong input type for raw_dtype in ggml to gguf scripts (#8928)
268c5660062270a2c19a36fc655168aa287aaec2 7e72aa74fd676a093eb9970e761085ec22734c71 2024-07-30T23:35:30+03:00 Someone nix: cuda: rely on propagatedBuildInputs (#8772)
9f77d899b7b0d56496f679e54b797da6199fed8e 203b7f1531303a060730ec1d1e01920e70302398 2024-07-22T14:32:02+03:00 Ivan Filipov ggml: add support for float16 input tensors in pooling operations (ggml/895)
bfb4c74981f0a40d757b450b596a9fe4ca983d26 2b1f616b208a4a21c4ee7a7eb85d822ff1d787af 2024-07-27T16:36:44+08:00 wangshuai09 cann: Fix Multi-NPU execution error (#8710)
1bdd8ae19f50bc6f108fa247e90688e5c60559fc da3913d8f9475b0d4bcbeb4936c724af4eade092 2024-07-17T19:23:50+08:00 hipudding [CANN] Add Ascend NPU backend (#6035)
aaab2419eaa17ab3aa38f4ba49c7eea406999e99 73cf442e7bc9baca7b3e213b261551812f1676c9 2024-07-14T18:54:02+03:00 Georgi Gerganov flake.lock: Update (#8475)
6af51c0d96e6268769fc05c98d5b1a5e832c0017 f53226245f421bd01b47cce43a47e791de82c636 2024-07-12T14:48:04+03:00 Georgi Gerganov main : print error on empty input (#8456)
7fdb6f73e35605c8dbc39e9f19cd9ed84dbc87f2 a130eccef42b75a84da270411cefeed45c153e30 2024-07-09T01:36:38+03:00 Georgi Gerganov flake.lock: Update (#8342)
fde13b3bb9f569f07fd8af74696ee48a43d05131 470939d483d1c89b7292f78bac1fd27c42c171ce 2024-07-02T11:09:52-05:00 John Balis feat: cuda implementation for `ggml_conv_transpose_1d` (ggml/854)
6f63d646c1a06a6e09f721009a2676864ae04e31 51d2ebadbbf365b894f3888361df42dbacb12b7a 2024-07-04T18:38:58+02:00 Daniel Bevenius tokenize : add --show-count (token) option (#8299)
a27152b602b369e76f85b7cb7b872a321b7218f7 3e2618bc7bf9e9fbf58c32cc3c8dd7d5df1de27e 2024-07-02T22:56:46+02:00 MistApproach fix: add missing short command line argument -mli for multiline-input (#8261)
ab3679112d4c49a215a3d31550a7720b202e9015 97877eb10bd8e7f8023420b5b5300bcbdadd62dc 2024-06-27T18:37:29+03:00 Georgi Gerganov flake.lock: Update (#8071)
0c7b3595b9e5ad2355818e259f06b0dc3f0065b3 7b2f4a7d193ef2475259bbe7656fcccfab4b1217 2024-06-15T18:53:40+02:00 Xuan Son Nguyen Add `cvector-generator` example (#7514)
10ceba354a3b152ff425e9fa97f9caaef99a46b1 e95beeb1fc4621826ddd616776dbdf717366bf5c 2024-06-10T02:04:50+03:00 Georgi Gerganov flake.lock: Update (#7838)
1669810d7c2446af8425aa54ff6611bf6f14646c 7c4e5b7eae26581869e782015d9deca947c34997 2024-06-03T00:13:12+03:00 Georgi Gerganov flake.lock: Update (#7686)
2ac95c9d5678d05e253691fb1f26471675bff5ad 750f60c03e4d3f53fa51910551ce87a3d508d2d7 2024-06-01T21:50:18+05:30 HanishKVC SimpleChat: Simple histogram/repeatMatching driven garbageTrimming, Settings UI, Streaming mode, OpenAi Compat (Model, Authorization Bearer), Save/Restore session, Auto Settings UI (#7548)
dff451cfa1f297348751ce6b538670e1ae9a7d5b d298382ad977ec89c8de7b57459b9d7965d2c272 2024-05-26T18:54:56+03:00 Georgi Gerganov flake.lock: Update (#7540)
b9adcbbf92fc7096bee23fe61496d25652ebf765 9588f196b1d7b21bdff013fcf958c249576b2619 2024-05-26T06:26:34+05:30 HanishKVC SimpleChat Completion Mode flexibility and cleanup, Settings gMe, Optional sliding window (#7480)
d041d2ceaaf50e058622d92921b3e680ffa4e9e7 27891f6db03de6e3fd5941983838c29bef253352 2024-05-24T18:59:06+03:00 Georgi Gerganov flake.lock: Update (#7232)
1e374365d170b7f692fd7753c145e21bc14486c8 197ff91462dd05bb9a3be03578114abf0c355536 2024-05-22T23:23:21+05:30 HanishKVC SimpleChat: a simple and dumb web front end for testing /chat/completions and /completions end points and try chat (#7350)
e932094d58f513d5996c3efc9f6fed8238894c57 2789baf480ba7dc9281b65f601f0918e58920f54 2024-05-20T08:56:05+03:00 Georgi Gerganov server : return error on too large embedding input (#7389)
e23b974f4cf9270d05062d446f406e3ff55d9451 854d365abab7194b5013a523f72da19860c3c550 2024-05-19T20:51:03+10:00 Brian labeler.yml: Use settings from ggerganov/llama.cpp [no ci] (#7363)
22842164bcae3251b81ad9e497a16ef66833cb9e 47345248827f426038098d016ed11975021b4919 2024-05-09T12:56:00+02:00 Sigbjørn Skjæret gguf-py : add special token modification capability (#7166)
b3a995b416e13ae3123a117a743e11d0ede0ca4c bcdee0daa7c5e8e086b719e5eb4073b00df70e01 2024-05-06T18:36:06+03:00 Georgi Gerganov flake.lock: Update (#7079)
6e472f58e40cd4acf6023e15c75a2700535c5f0b 4dba7e8114d84241c842b986e008af8b88d1a019 2024-04-28T00:18:27Z github-actions[bot] flake.lock: Update
e9b4a1bf68c18beff4e33f23ea62c1245b296915 5cf5e7d490dfdd2e70bface2d35dfd14aa44b4fb 2024-04-21T00:17:47Z github-actions[bot] flake.lock: Update
17e98d4c96a583d420f12046bc92102381dbd28e 1958f7e06ca2d2e3ab5698cc67513ba359144d8e 2024-04-15T17:12:26+08:00 Neo Zhang Jianyu fix mul_mat_id() for new input, make the ut pass (#6682)
b909236c0bf0b6e872af95df9490492ecec310ac e0717e751e12af13f4eedaae8bbbd608e40d7e54 2024-04-07T21:25:30+03:00 Georgi Gerganov flake.lock: Update (#6517)
f87f7b898651339fe173ddf016ca826163e899d8 33a52448061cfd2ea44da9e6cb30b2ec22e2f6d0 2024-04-01T19:05:57+03:00 Georgi Gerganov flake.lock: Update (#6402)
d39b308eaf0ac91c2e1f432bf66751193a470a56 c87397664964e5a2a21de1877d504b23a2a35332 2024-03-27T19:14:28+01:00 hutli nix: moved blas availability check to package inputs so it is still overridable
557410b8f06380560155ac7fcb8316d71ddc9837 55c1b2a3bbd470e9e2a3a0618b92cf64a885f806 2024-03-26T10:46:41-04:00 compilade llama : greatly reduce output buffer memory usage (#6122)
b06c16ef9f81d84da520232c125d4d8a1d273736 1f2fd4e727a707f85d58e0b56075c3e6334d18d8 2024-03-25T18:52:45+01:00 Christian Kögler nix: fix blas support (#6281)
43139cc528909c3de8c144ed174e09a1f7912a80 2f34b865b62b1d2b5eb8a27885e4de220deeacbd 2024-03-25T17:22:27+02:00 Georgi Gerganov flake.lock: Update (#6266)
2d15886bb092c3b780c676b5cc57ff3337af9c83 d199ca79f279e84ebe27caafe0aa59c461d88969 2024-03-17T06:37:44Z github-actions[bot] flake.lock: Update
5e1b7f94a03e0b3b8e4578625bbdadc7bbd2b93c ac9ee6a4ad740bc1ee484ede43e9f92b5af244c1 2024-03-18T16:33:44+01:00 slaren backend : set max split inputs to GGML_MAX_SRC (#6137)
2bf8d0f7c4cc1235755ad06961ca761e458c5e55 496bc79bc2b79bfd6124b8687a8dbd6a646e9b06 2024-03-18T11:03:04+01:00 slaren backend : offload large batches to GPU (#6083)
f30ea47a87ed4446ad55adb265755dc9102956a2 d8fd0ccf6ac8b07791ffd1575eed436930854ae3 2024-03-13T18:54:21+01:00 slaren llama : add pipeline parallelism support (#6017)
c78541479cf835dd9eb568ccd9a2083198a7203d 621e86b331f8b0e71f79fd82a4ae1cd54c3e4396 2024-03-10T16:43:08+02:00 Georgi Gerganov nix: update flake.lock (#5969)
c2101a2e909ac7c08976d414e64e96c90ee5fa9e 515f7d0d4fce41c752fc253acf30707c3be2531e 2024-03-08T17:31:00-05:00 compilade llama : support Mamba Selective State Space Models (#5328)
21b08674331e1ea1b599f17c5ca91f0ed173be31 6a87ac3a52668e117d97bcea07b529c93188b303 2024-03-05T16:08:35+08:00 Neo Zhang Jianyu [SYCL] fix mul_mat fault in CI/unit-test (#5862)
29ae62d2ae163e2b68aa0ad3bf2ab4636de0c957 e0843afe1b37890b631bc7d3d2da2ed36c862b91 2024-03-04T22:31:20+02:00 Georgi Gerganov llama : fix embeddings (#5796)
fa974646e1a2024fc7dc9e6f27cf1f2f5d4a3763 9731134296af3a6839cd682e51d9c2109a871de5 2024-03-03T06:11:31+02:00 Georgi Gerganov flake.lock: Update (#5842)
2774b0c97427ee3ad3e2ee121354d078794e89d9 5f706718566e3a5147916dc381f3b99de0ffad47 2024-02-25T20:41:35+01:00 slaren add google magika inference example (ggml/748)
c39373398803c669056304090050fe3f44b41bf9 e3965cf35aac00d4e24998c8a3d0093ae1d98bd3 2024-02-25T00:17:11Z github-actions[bot] flake.lock: Update
9e359a4f47c1b2dceb99e29706c9f7403d32ab5e 4c4cb30736582cacb1a164a9d4bc8e17b1014be7 2024-02-24T19:16:04+01:00 Pierrick Hymbert server: continue to update other slots on embedding concurrent request (#5699)
580111d42b3b6ad0a390bfb267d6e3077506eb31 88c46cbdac05cebd936511b1d3c74112e721615f 2024-02-21T05:08:22-08:00 postmasters llama : add `gemma` model (#5631)
c8e0d7efeb7634ecc2e9832e879ab9fca4510e71 8f1be0d42f23016cb6819dbae01126699c4bd9bc 2024-02-18T00:17:07Z github-actions[bot] flake.lock: Update
97a336507ed9b971d72262bec7e2b8b7016a054a c88c74f967028ae3d5ebade40ae586d20a961abc 2024-02-11T00:17:31Z github-actions[bot] flake.lock: Update
9392ebd49ea5ae236a55b47cbf6a13247e8a3b8c 5ed26e1fc9fab4ce96ecf2d84183fe45bdcab0d4 2024-02-04T00:17:24Z github-actions[bot] flake.lock: Update
a4b07c057a553b1ac253051efc3f040351e2eae1 549a1e6cd5b39fe0dc3d4ea5515c65f17797a31e 2024-01-29T14:00:10+02:00 Georgi Gerganov gguf : add input validation, prevent integer overflows (ggml/709)
1387ea21178f9f154944013d4dd9764b54c69deb 26d607608d794efa56df3bdb6043a2f94c1d632c 2024-01-24T12:48:14+01:00 slaren llama : pre-allocate input tensors in a separate buffer (#5100)
942c0107a7301434c0a5e7da46bc4cf2393aa556 b43ebde3b0ccbc42d9dd782b32e2fd8eb35b43b5 2024-01-21T05:17:27+02:00 Georgi Gerganov flake.lock: Update (#5054)
c37b3474e61d609d43cccc3bde5d559e80e4f5d1 158f8c9e21302114bac3c646f80ea85b52ffa0bd 2024-01-16T19:13:54+02:00 Georgi Gerganov flake.lock: update flake-parts, flake-parts/nixpkgs-lib, and nixpkgs (#4920)
6efb8eb30e7025b168f3fda3ff83b9b386428ad6 36e5a08b203542dca53cca4eaf172c5dc4bbc991 2024-01-09T13:46:46-05:00 Austin convert.py : fix vanilla LLaMA model conversion (#4818)
880e352277fc017df4d5794f0c21c44e1eae2b84 66f35a2f48e1965a13835a523e677223dbf148be 2023-12-21T18:07:34+01:00 howlger py : open merges file as 'utf-8' (#4566)
52c8bc3cf312e1caf02d37bfb9d9d865cbe33594 e4b76bbe316ee50fb17d9ac29e654c0edf830eba 2023-12-05T15:05:51+05:00 MaggotHATE sampling : custom samplers order (#4285)
71e3718abdb2771b50c9606d3a7569623a0b0afe 238657db2364cfb728c694470a4a81702afea760 2023-11-01T08:04:02+02:00 Georgi Gerganov llama : refactor graph build code (#3837)
34b2a5e1ee4fe6295fb4420eb91131d743694c65 6961c4bd0b5176e10ab03b35394f1e9eab761792 2023-10-26T22:53:37+03:00 Georgi Gerganov server : do not release slot on image input (#3798)
438c2ca83045a00ef244093d27e9ed41a8cb4ea9 9e70cc03229df19ca2d28ce23cc817198f897278 2023-10-22T22:53:08+03:00 Georgi Gerganov server : parallel decoding and multimodal (#3677)
d3956aea53369455008159cc405ed4c496976692 22c69a27945e7acf9690dd3210d316f22182751c 2023-10-22T20:09:51+02:00 vvhg1 main : escape prompt for cfg_negative_prompt and consecutive inputs in main with interactive (#3623)
d1031cf49c3b958b915fd558e23453471c29ac33 8cf19d60dc93809db8e51fedc811595eed9134c5 2023-10-20T21:07:23+03:00 Georgi Gerganov sampling : refactor init to use llama_sampling_params (#3696)
1a159553f921a9209fed8c714494e57b3649f232 281ef73c258cc1eebec8a64264240432d5878c4b 2023-10-17T17:11:01+02:00 staviq tokenizer : special token handling (#3538)
0e76a8992c8200237bbc6471a53fb8796b3872f7 2db94d98eda56982d80238840b0652b4137a2a84 2023-09-28T20:40:11+02:00 xaedes train : finetune LORA (#2632)
ec893798b7a2a803466cc8f063051499ec3d96f7 45855b3f1c7bdd0320aa632334d0b3e8965c26c4 2023-09-28T19:04:36+03:00 Georgi Gerganov llama : custom attention mask + parallel decoding + no context swaps (#3228)
80834daecf4b9021770361a6d5e1b9c7a60e6854 a40f2b656fab364ce0aff98dbefe9bd9c3721cc9 2023-09-20T22:48:22+09:00 kang flake : Restore default package's buildInputs (#3262)
4fe09dfe665c58a753dc9eb638dd4dca1cd35488 80291a1d02a07f7f66666fb576c5b1e75aa48b46 2023-09-16T03:02:13+08:00 Meng Zhang llama : add support for StarCoder model architectures (#3187)
44c117f41ee01c5ac8fb86bba041f08d8b87b46d 43033b7bb4858da4f591715b3babdf906c9b7cbc 2023-08-28T21:51:47+02:00 xaedes train : mem usage and other improvements (#2439)
edd4c1481708fcd788b0e423268304fd26e2b125 1591e2e590762011b43b10a9b6e04f13f98f2aa5 2023-08-27T14:19:19+03:00 Georgi Gerganov llama : more tokenizer fixes (#2810)
50526f37eba0b28336700890242ff282b949cd83 04f4b1eb10f3e25750ca3e530265ce2841730e6b 2023-08-26T12:53:52-04:00 Cebtenzzre llama : use std::abs in llama_sample_tail_free (#2800)
b8ad1b66b23f9b2e6e4531e9a62753323036a556 f5fe98d11bdf9e7797bcfb05c0c3601ffc4b9d26 2023-08-23T02:12:12-05:00 Xiao-Yong Jin server : allow json array in prompt or content for direct token input (#2306)
2d7baaf50f3277e65cf71071f61ea34823d14c30 f3c3b4b1672d860800639c87d3b5d17564692469 2023-08-08T06:44:48-05:00 AustinMroz vim : streaming and more (#2495)
0c06204fb39aa5560e883e0ae74be9518c57d88e 1fed755b1fb9babb6dbc1b4023e492950cd5a5be 2023-07-25T07:19:11-05:00 Xiao-Yong Jin main : add `--in-prefix-bos` to prefix BOS to user inputs; keep EOS (#2304)
9cf022a1889e50113fd348dc96b4557fc75a6296 e782c9e735f93ab4767ffc37462c523b73a17ddc 2023-07-21T09:42:21+02:00 Przemysław Pawełczyk make : fix embdinput library and server examples building on MSYS2 (#2235)
c48c525f8711780f3f7c59bf92f1760f38317218 206e01de117cc65ed8713ac9fdebc57ba4532ec3 2023-07-15T02:40:05+08:00 Shangning Xu examples : fixed path typos in embd-input (#2214)
5656d10599bd756dc0f17284e418e704200b43f3 1d1630996920f889cdc08de26cebf2415958540e 2023-07-10T11:49:56-04:00 Evan Miller mpi : add support for distributed inference via MPI (#2099)
7f0e9a775ecc4c6ade271c217f63d6dc93e79eaa b472f3fca558b6335adbd87210ed58cfb5da37cb 2023-07-04T18:33:33-05:00 Nigel Bosch embd-input: Fix input embedding example unsigned int seed (#2105)
79f634a19d1c32a6cfb1befc21551ee684fced6b 04606a159947566b27810508433e6ca5dbc684ba 2023-07-01T18:46:00+03:00 Georgi Gerganov embd-input : fix returning ptr to temporary
cfa0750bc9dbc2d957a91b8ed09ab0035d8f3d4e 9d23589d638dc74577d5ff880e6d4248b795f12e 2023-06-28T23:53:37+08:00 ningshanwutuobang llama : support input embeddings directly (#1910)
794db3e7b982fee37e3995db9c3a216a57ff65e3 5ddf7ea1fb42bac21026de2f77e0f9c069b92234 2023-06-17T07:53:04-04:00 Randall Fitzgerald Server Example Refactor and Improvements (#1570)
e32089b2c20b1b87b22912f4a8b93fe01647d5b9 2347e45e7bdb09c9a7d74b2c0bc86c2b65f0c343 2023-06-13T21:04:40+02:00 xaedes train : improved training-from-scratch example (#1652)
fa84c4b3e80199a5683438f062009c031a06c4fa 12b063f0ecf280e98028e444fc492ee6222cdcdc 2023-06-11T08:19:17-06:00 Kerfuffle Fix issue where interactive mode crashes when input exceeds ctx size (#1789)
f954edda935a70a14cf0cc45ecc7fe7d60cf3e4b f048af0230ad5381bb20b9e3c1467ec6fc7debdf 2023-05-13T14:56:40+02:00 xaedes ggml : implement backward pass for llama + small training-llama-from-scratch example (#1360)
41654efea879bbdf4fd794e13335929d4cf0eb90 56551bc11f46b2716fdf61bb48ac28414889dc0a 2023-05-08T19:45:48-07:00 DannyDaemonic Interface improvements and `--multiline-input` (previously `--author-mode`) (#1040)
2edbdb0f99336cb41f0995061c7602ed54beb863 20fbf2a2a08d8edefe9b3435fa86f8b2f63f8588 2023-05-04T23:41:12+08:00 44670 main : add --in-suffix option (#1318)
e2cd5069999181a9e4a22cf420e0491878b3062f 2d099e5193d73f800b646c39e2fad08c1c1f1096 2023-05-02T18:13:26+02:00 Ron Evans main : switch input_noecho to input_echo to remove negation (#979)
f4d277ae17247ee51129ef1a9ff74d377cc90b1b c9a59b70a54e0bc05777df287feaea3dbe0310c4 2023-04-14T17:19:17+02:00 Tomáš Pazdiora main : alternative instruct mode (Vicuna support, etc.) (#863)
723dac55fa2ba7adc6e3fc8609781d1ad0378906 0f07cacb05f49704d35a39aa27cfd4b419eb6f8d 2023-04-14T00:03:03-07:00 comex py : new conversion script (#545)
95ea26f6e92d620a5437f576b80868aee7f808d6 82d146df9b43cf677e0dbce20b03cf864958a0cc 2023-04-13T14:46:23+02:00 SebastianApel benchmark : add tool for timing q4_0 matrix multiplication (#653)
f963b63afa0e057cfb9eba4d88407c6a0850a0d8 aaf3b23debc1fe1a06733c8c6468fb84233cc44f 2023-04-08T12:24:37-07:00 comex Rewrite loading code to try to satisfy everyone:
aaf3b23debc1fe1a06733c8c6468fb84233cc44f f2d1c472946dee2aba9077e8df73346796752b10 2023-04-08T17:49:39+02:00 Tomáš Pazdiora fix for windows utf-8 input (#840)
7b8dbcb78b2f65c4676e41da215800d65846edd0 4b8efff0e3945090379aa2f897ff125c8f9cdbae 2023-03-28T17:09:55+03:00 anzz1 main.cpp fixes, refactoring (#571)
33e35b8fe8f09adcac0632e9cece62e1dd629f7d 19726169b379bebc96189673a19b89ab1d307659 2023-03-26T07:25:46+02:00 Harald Fernengel Exit from interactive mode if input stream is bad (#491)
2f7bf7dd7cd7299874d582f7f34834418abf4057 34ab5268432fd287caa68d60bdd8aef411def3fa 2023-03-25T23:38:11+02:00 anzz1 CMake / CI additions (#497)
34ab5268432fd287caa68d60bdd8aef411def3fa c2b25b6912662d2637d9c6e6df3a5de931e0d7ce 2023-03-25T22:29:22+02:00 anzz1 (Windows) Set console to UTF-8 on init (#420)
e899bf54b291e8c84173a0e534a2c262f3f63229 fbd4d38c647f82b2598291ea9b8d0c09ac1ffb8c 2023-03-25T14:42:09+02:00 anzz1 bounds checking for input prefix (#492)
fbd4d38c647f82b2598291ea9b8d0c09ac1ffb8c 58e6c9f36f97d0a3e287b97256dc5f6b0e9fb5ae 2023-03-25T14:03:19+02:00 anzz1 feat: '--in-prefix STRING' option (#426)
04c6f5ed6fafd63601fa06757877ed5ccf9d5991 7a9b6c3a8bdc1cb75fefc826dfaa7331eb63695d 2023-03-24T23:17:58+02:00 Georgi Gerganov Immediately start processing the prompt before user input has been provided (#476)
2e17dfd80a473099dacc0f41c9146d233c6a5972 20a1a4e09c522a80e2a0db51643d25fa38326065 2023-03-23T15:22:47-05:00 rabidcopy Replace EOS with newline to prevent context/memory being flushed by EOS in interactive mode (#333)
305ba6f0e6daa3796aad9dd18053a1945dd4cc58 4122dffff958cd137175b58f1f27c0913528d7ba 2023-03-22T18:16:35+01:00 tjohnman Don't force immediate interactive without `-i` (#354)
16ffc013c62f22bdaa3cdc022d7a13fd952d73fc 486ae645fd3eda8b9d7413d5ff34fb65a3e337fb 2023-03-21T09:42:25-07:00 comex Importer for GPTQ quantized LLaMA models (#301)
5c19c70ba631a8f5d54feb6634e0eea178911a84 24568371ae0d7caf85164abe4753f36a7dba0288 2023-03-19T13:44:30-06:00 Rickey Bowers Jr fix coloring of last `n_batch` of prompt, and refactor line input (#221)
Can't render this file because it contains an unexpected character in line 155 and column 170.
@@ -0,0 +1,632 @@
f131bf1908b8c5dd1f49d7ae7f616506fc471666 33d96dae28e17208ef61a71dba40cda3c04f135a 2026-05-27T09:38:51+08:00 wangbomeng fix patch of qwen2.5vl,n_patch of minicpm = 64,fix n_ctx_slot,comment out M-ROPE
2716130010c58f1cdd9d94f0e2f8e047bc92dc66 b35bda124ccd4ed581dd6088d3ffa4931c2809b6 2026-05-18T08:40:54+08:00 Yunzhe Jia fix n_ctx_slot error by adding runtime capacity loading for cal-llm
ecf01a17651cd7b1e8b85fd6075e83831463ee23 99d2078e89305035d87d966cee7987c7d50b3925 2026-04-09T09:47:55+08:00 Yunzhe Jia fix n_parallel problem
1f5accb8d0056e6099cd5b772b1cb787dd590a13 2759ccdb4adc8568add4316780d5e675519b0775 2025-11-04T05:04:59Z Noah Fix garbled output with REPACK at high thread counts (#16956)
bcfa87622ae46be6345a8e3dfdbdc5ba5414042b a2054e3a8ff0da3978a4acc18c349ff58554d336 2025-11-03T00:41:08+01:00 Sascha Rogmann feat(webui): improve LaTeX rendering with currency detection (#16508)
cd5e3b57541ecc52421130742f4d89acbcf77cd4 87c9efc3b297b8a498716b1db3d061842e6fc85b 2025-11-02T18:14:04+02:00 Georgi Gerganov server : support unified cache across slots (#16736)
2f68ce7cfd20e9e7098514bf730e5389b7bba908 e4a71599e5846110159955dec0008eb4aa24222b 2025-11-01T19:49:51+01:00 Pascal webui: auto-refresh /props on inference start to resync model metadata (#16784)
d3dc9dd898be805c23a408cc36daed5b3bf29221 bea04522ff1a0d8559ccfd353aa018dcfbb608cc 2025-11-01T06:13:26+01:00 Oliver Simons CUDA: Remove unneded bias/gate dims in fused mmvq (#16858)
0de0a01576772032008a689afc4d7c80685074c4 e58d585604bbbbbc24f8149effe444621b5191c6 2025-10-31T21:20:47+01:00 Piotr Wilkin (ilintar) model : Minimax M2 (#16831)
b52edd25586fabb70f0c21b274473b307cf14499 517b7170e1a4d733583c4b07c5b7a49acc05911c 2025-10-30T18:42:57+02:00 Georgi Gerganov server : remove n_past (#16818)
8b11deea4663f29d3e042ce1056ba643264cd5f1 b9ce94017729465895402cbcfffb51fa926c15e3 2025-10-30T04:34:15+01:00 Oliver Simons Hide latency of bias and gate-loading (#16847)
b9ce94017729465895402cbcfffb51fa926c15e3 3464bdac37027c5e9661621fc75ffcef3c19c6ef 2025-10-29T15:13:10-05:00 Jeff Bolz vulkan: Fuse rope+set_rows (#16769)
bcf5bda6f5df559565d11d7c8e8295c1159a85ec 3eb2be1ca5f37480aeb16102970d9e65f43347fe 2025-10-29T14:39:03+01:00 Ruben Ortlam Vulkan MMQ Integer Dot Refactor and K-Quant support (#16536)
3eb2be1ca5f37480aeb16102970d9e65f43347fe e41bcce8f0b53032a1fed275cd253e931c041cf6 2025-10-29T06:29:12-07:00 Max Krasnyansky Hexagon Op queue & dispatch optimizations (#16820)
338074c383c81366320d176d83b94b0a567ee0c2 851553ea6b24cb39fd5fd188b437d777cb411de8 2025-10-29T08:14:39+02:00 YaelLogic sycl: add RMS_NORM_BACK operation support (#16808)
85a7d8677bf2200981e52f744a21d5267964ffcf a8ca18b4b815a2abdbecb958ee5f4c542d69aac7 2025-10-28T20:19:44+02:00 Georgi Gerganov memory : remove KV cache size padding (#16812)
1c1409e13169d0ced4b1b4d39fb5b268b7525091 7a0e900e3615fa46c074a7fdf900b47d3c0a1c7e 2025-10-28T03:51:41-07:00 Sam Malayek embedding: add raw option for --embd-output-format (#16541)
3479efd112b3910d2d008ad08fe4cb4895605903 463bbf20bfbe0da10ac58984d4d62bed5a49362a 2025-10-28T10:54:53+08:00 Chenguang Li CANN: Improve device ID handling and aclnnArange checks (#16752)
ad8d36beffd791db10c94eb9e964afb891e3ca55 c053e18a66dd95dc340aa61317877c2a41d4e3cf 2025-10-28T03:50:33+02:00 tamarPal sycl: add SSM_CONV operation support (#16800)
5a4ff43e7dd049e35942bc3d12361dab2f155544 10640e31aab0819f31c1e1f2d008b019ee737232 2025-10-27T13:51:28-07:00 Diego Devesa llama : disable pipeline parallelism if compute buffer allocation fails (#16748)
55945d2ef51b93821d4b6f4a9b994393344a90db 0bcb40b48c6fc6f17ba9672625e526ab2574344b 2025-10-25T03:39:37+08:00 leejet ggml: fix CUDA grid launch condition for large block_nums.y in binbcast (#16742)
fe6a9882acf5c02f96624ed8f80144100d7006cb 061f0eff02dc9a82f7bd850db3bd70b8a0b5e87a 2025-10-23T17:07:31+05:30 Prajwal B Mehendarkar Manually link -lbsd to resolve flock symbol on AIX (#16610)
9de9672adb0f4ca4e39483ac3ffed52b3f70a55d 63d2fc46e17a06be5b4b5823a5ada088317f1f0a 2025-10-22T20:05:15-05:00 Matthew Michel sycl: use async memory allocation to fix crashes during graph recording (#16644)
d8eaa26e4d9228df3aa46a930db60c8eaab67c1b 9285325ce0174631c3cd6121d56084adc4ef2d8f 2025-10-22T12:01:22+02:00 Acly tests : fix test-thread-safety when compiling with multiple backends (#16699)
6de8ed75196c7cd98c1f34bbf3a7452451ba8ac2 84bf3c677857279037adf67cdcfd89eaa4ca9281 2025-10-21T01:21:12+03:00 YehuditE sycl : add PAD_REFLECT_D1 operator support (#16145)
13f2cfad4170c096c51a02c24a6a158cb47f1480 06332e28672356b964d6dfc2ba4657e20581cd43 2025-10-20T12:41:13+02:00 Aleksander Grygier Enable per-conversation loading states to allow having parallel conversations (#16327)
06332e28672356b964d6dfc2ba4657e20581cd43 72d53e6c4decee8b339e49aed8cc0e234b9639dc 2025-10-20T16:27:09+08:00 takuya kodama llama-batch: fix build fails with `-Werror=missing-braces` (#16614)
342c728d031d50673feded797520a44127d73379 ababae7e1ec3e9cfdab0322ee55ea3389e82a4d5 2025-10-17T18:01:23+08:00 muggle-stack ggml : fix SpaceMit IME array out-of-bounds in task assignment (#16629)
9ad4f1931ee0f3b41d9355245ef744786aaae0aa 79967ec596c0dacfd2251b085a57e79df292b1cc 2025-10-17T02:33:58-04:00 Ilia Ilmer metal : add `CONV_TRANSPOSE_2D` (#16542)
683fa6ba4ed3a23b939d3e11e6dc860bd47a0ccf b22572e97dc51757d3ebe917a5a283385010ec68 2025-10-16T16:28:41+02:00 Pascal fix: added a normalization step for MathJax-style \[\] and \(\) delimiters (#16599)
6f5d924637a15abedb111cbbffd7da5f31c81855 adc9b60f190c1016a09f439862fa1cbb302262ac 2025-10-16T01:11:33-04:00 takasurazeem common : Update the docs on -t --threads (#16236)
adc9b60f190c1016a09f439862fa1cbb302262ac ee50ee1eadff58777ae746827b04de7ba0befc55 2025-10-16T13:10:32+08:00 takuya kodama ggml-cpu: replace putenv with setenv for const-correctness (#16573)
7ea15bb64c81e3813eb0babf9a57e1bc5697f569 9c7185dd28416cf67f5e3b268381f311b5e3da56 2025-10-14T07:51:36-05:00 Jeff Bolz vulkan: Improve build time for MSVC (#16545)
1fb9504eb744969a990bfe4cfcf1d3d7a479541c 3f750f8d760ab5a61491e6a9409072dfeee4b4d7 2025-10-13T10:55:32+02:00 Pascal fix: add remark plugin to render raw HTML as literal text (#16505)
f9bc66c3ebcfddb5f09e4b21253623caeb8e414a a31cf36ad946a13b3a646bf0dadf2a481e89f944 2025-10-13T08:52:22+08:00 hipudding CANN: Update several operators to support FP16 data format (#16251)
d00cbea63c671cd85a57adaa50abf60b3b87d86f 8328fd4bae76fc027f8ca0e9a05acd3788dabe3f 2025-10-09T18:54:51+03:00 Georgi Gerganov server : host-memory prompt caching (#16391)
e08db4259521de493b7aeb49dadf29ebd1ee966a 12bbc3fa50b6df03318a4451c9a2210200a0b28d 2025-10-09T08:39:18+02:00 Saba Fallah model: EmbeddingGemma Adding Support for SentenceTransformers Dense Modules (#16367)
12bbc3fa50b6df03318a4451c9a2210200a0b28d 9d0882840e6c3fb62965d03af0e22880ea90e012 2025-10-08T22:18:41+02:00 Pascal refactor: centralize CoT parsing in backend for streaming mode (#16394)
b2c08c9ec4cd59ed88c1ebdd94f109af5ccc978e 7fdd16b432d247121fe5fe7b21f8805f85266c85 2025-10-08T10:57:53+03:00 Georgi Gerganov metal : mark FA blocks (#16372)
74b8fc17f92ada295a648e3c5eb28f46bca7d892 aeaf8a36f06b5810f5ae4bbefe26edb33925cf5e 2025-10-07T13:48:56-07:00 Reese Levine ggml webgpu: profiling, CI updates, reworking of command submission (#16452)
1d6092fc72f4d10f4486ac95edfd414bc08b62b8 8ae32dc9ecd7aeebf3a5b43557e0552a0a04cd4f 2025-10-07T08:22:35+03:00 Georgi Gerganov tests : add -INF blocks to the KQ mask in the FA tests (#16380)
ca71fb9b368e3db96e028f80c4c9df6b6b370edd 35266573b968e1c947b367782fb4b3eddbb4f3c0 2025-10-05T06:57:47-06:00 Gabe Goodhart model : Granite docling + Idefics3 preprocessing (SmolVLM) (#16206)
35266573b968e1c947b367782fb4b3eddbb4f3c0 86df2c9ae4f2f1ee63d2558a9dc797b98524639b 2025-10-04T20:59:31-07:00 Reese Levine ggml webgpu: actually add softmax, fix rms_norm offset (#16400)
86df2c9ae4f2f1ee63d2558a9dc797b98524639b f39283960b58a92ecc0c72567711318b20e22b55 2025-10-04T20:04:27Z Eve vulkan: use a more appropriate amount of threads when generating shaders (#16418)
0e1f83855609d73beaf05d818640b6cfd39d287b ad126479c25cf983a0f994a08ba0911cf49ed62b 2025-10-03T04:52:46-05:00 Jeff Bolz vulkan: Fix FA coopmat1 invalid array indexing (#16365)
d64c8104f090b27b1f99e8da5995ffcfa6b726e2 ef07a4090672a3438d7f64f197795d7dc1c18957 2025-10-02T20:10:12+02:00 Sigbjørn Skjæret test-barrier : do not use more threads than physically available (#16389)
2a9b63383a448ec18c754dfdc6e95cb853940a52 1104ca1a1c926b832274694a2773a17066982ad0 2025-10-01T15:54:42+02:00 Aleksander Grygier Improve code block color theming (#16325)
f1eb1cb1eba042b2d583234e80f65e2e225d8995 de41f2b7bffab7582944b213ce12b605f8cf6e0f 2025-09-30T09:07:20+02:00 Charles Xu kleidiai : fix work size and threads sync for fp16 (#16246)
5f7e166cbf7b9ca928c7fad990098ef32358ac75 d72f5f7ba260b546190338b0b76f2f152581424f 2025-09-29T18:49:47+02:00 Pascal Fix thinking blocks with quotes + add handling `[THINK]...[/THINK]` blocks (#16326)
c0bfc57af421f8fd63c946c13b7666aed82560e2 75a3a6c2cd0002ba40e2dcc92007bc9fdbc69f1a 2025-09-28T00:49:32+08:00 Aman Gupta CUDA: mul_mat_id for mmf for bs <= 64 for f16 and bs <= 32 for f32 (#16277)
624207e676ab5eb3ce7af631902bb45fb73a8359 807e8c6d310952f2f5656afc63dab9d7083dcb5c 2025-09-27T02:03:33+08:00 Aaron Teo devops: add s390x & ppc64le CI (#15925)
9b26511857ac09ae69ab485168fe2d3ee5fb1d6e 00217cd41388328c93e9e9644921c4319bb03bcc 2025-09-26T18:27:25+08:00 Aaron Teo ggml-cpu: implement MXFP4 SIMD for s390x (#16193)
a86a580a6692edd1da076d5422f944c344b4fe5e 0f7c69689f4e681948a6005adea9bee9c08ff903 2025-09-26T08:56:38+08:00 R0CKSTAR musa: upgrade musa sdk to 4.3.0 (#16240)
0f7c69689f4e681948a6005adea9bee9c08ff903 835b2b915c52bcabcd688d025eacff9a07b65f52 2025-09-26T08:56:10+08:00 R0CKSTAR musa: fix build warnings (#15611)
f2a789e33490deb483a2694b066b37e45524bb79 3a599719673c850647e3bb911ed6d91109bb91d2 2025-09-24T16:17:49+02:00 Acly ggml : split graph allocations according to backend max buffer size (#15815)
3a599719673c850647e3bb911ed6d91109bb91d2 63b54c81a620981be020184ab99e63a8e50e47cb 2025-09-24T13:42:26+02:00 Tarek Dakhran model : add label for LiquidAI LFM2-2.6B model (#16204)
1eeb523c3e0c7ffbd59469f5463dcbdecba3535e 5bb4a3edec297e74b0f7bd4ed5d0fdd12e28d858 2025-09-21T08:31:55+02:00 Giuseppe Scrivano vulkan: optimize UMA buffer operations and fix driver hangs (#16059)
69ffd891631befa9e6b485fd646a16dab4f2c007 246c0d9c795fb25da8268625d597580155a3672f 2025-09-18T23:07:26+02:00 Adrien Gallouët ggml-amx : fix ggml_amx_init() on generic Linux (#16049)
d304f459d8619399eb232b1e3689379306f439d3 0320ac5264279d74f8ee91bafa6c90e9ab9bbb91 2025-09-17T13:09:40-07:00 Reese Levine GGML WebGPU: Support for ADD, MUL, RMS_NORM, GET_ROWS operators (#16018)
cd08fc3ecc0264b4414b68af3874a6c689ed60c1 cb5bb6cc05119c24e7711ca2956cd0e6d409d396 2025-09-17T01:08:02-07:00 David Ribeiro Alves common : Fix corrupted memory error on json grammar initialization (#16038)
d5fabe3682de515fd09d6c981f7a0d1b75614455 8ff206097c2bf3ca1c7aa95f9d6db779fc7bdd68 2025-09-17T14:33:08+08:00 Chenguang Li CANN: Optimize ggml_cann_set_device (#15935)
f161463a54d9f93d41246286aa4a9569a91d804d 84d7b2fca11d1be118ce776f6d72a486c4883b74 2025-09-13T13:54:28+03:00 Georgi Gerganov metal : allow ops to run concurrently (#15929)
704d90c987cdf00751567b2088c4e54742aa2d3f 360d6533db39e11577afe9b0aece20c6b5ddaf1f 2025-09-12T09:15:12+08:00 Neo Zhang Jianyu Revert "sycl: add usage of enqueue_functions extension (#14244)" (#15910)
0f0a3c2851134d49955f3c85afbb0b1bb47c3e07 33daece86b65607451d0d4378d2d04ba6a20ad55 2025-09-10T17:52:35+03:00 Georgi Gerganov metal : make the backend async (#15906)
a972faebed5fdc4a3d2a844d92d476058c02e02d 550cf726e133fd0a069d991287fd3a2a3e3e1cbd 2025-09-09T14:38:02+08:00 Aman Gupta CUDA: Add mul_mat_id support for the mmf kernel (#15767)
e68aa10d8f3d26fdad5b912540362d79de5460e3 0a16bf52e6874369cb4fd2bdc4863ef984b688e7 2025-09-08T13:10:07-05:00 Jeff Bolz vulkan: sort graph to allow more parallel execution (#15850)
b0d52998b962bd2681c34bf52af993af79f178b8 f28d4f4ac963f182ea9d0fe9e269f3f5f3782aaf 2025-09-08T13:56:51+03:00 Georgi Gerganov cuda : fix supports_op condition for get_rows when number of blocks is too large (#15868)
fd621880f3fd908424e675a41715a2dc760247a2 4281c7b315f8a904549fe527039b976e08098d1a 2025-09-05T17:32:39-06:00 Gabe Goodhart aLoRA Support (#15327)
d1e2adba65208d6de3d7f6f23b00c562ff5bb777 c1c354e44c06d259679bb5bb7a8fa9f0b28480e4 2025-09-04T15:40:44+02:00 Daniel Bevenius llama : set n_outputs to 1 to avoid 0 outputs mean-pooling (#15791)
c1c354e44c06d259679bb5bb7a8fa9f0b28480e4 a68d9144262f1d0ef4f6ba7ad4a7e73e977ba78c 2025-09-04T20:20:14+08:00 Chenguang Li CANN: Refactor ND to NZ workspace to be per-device (#15763)
661ae31c9c68201577e70278285b349a5a662caf 407c23786dd0d3a503e9429eead96e611d3950c9 2025-09-03T19:59:16+02:00 Oliver Simons CUDA: Optimize `rms_norm_f32` kernel and its fused variants, giving 1-6% perf E2E (#15715)
02c1813517412f3e00aa6ca7c0273fea64edb492 77dee9de97be75b7143a213bc48893e0c0b29af7 2025-09-01T16:19:07+02:00 Ruben Ortlam Vulkan: Add Integer Dot Product mul_mat_vec shader for legacy quants (#14903)
0d161f021aa33ec0e90cce96f5d1a88925557327 4efd5a83163ff383285b3a4c2106feabf5c69557 2025-08-31T20:11:58+03:00 Georgi Gerganov server : enable /slots by default and make it secure (#15630)
c37052ab4d6d1ae73c0e90bc6e560cc6409e1311 5c16b9c87d840e4d5d55fa83c732c6b693346f40 2025-08-31T02:06:43-05:00 Jeff Bolz vulkan: mul_mat_id coopmat2 optimizations (#15546)
792b44f2ed9668cce7f267ff0ae4950ed9b4a5de 81017865ee444cf49ce0136f2be1e41a0270ff91 2025-08-29T19:25:40+02:00 ExtReMLapin server : add documentation for `parallel_tool_calls` param (#15647)
e8d99dd0b67f2ecc1e45fca8074a3a18c3e036d2 a8bca68f727844e7dcf24a956003b3c2039ea563 2025-08-28T18:39:31-06:00 Gabe Goodhart nvidia nemotron nano v2 (nemotronh) (#15507)
c8d0d14e77c3c45df5cbbddde9c2b4c377ec4e7a 84ab83cc0b4b7e769451ee48e4c7d1acef91ef25 2025-08-28T17:09:05+03:00 Georgi Gerganov kv-cache : fix find_slot to not search for continuous slot (#15638)
64387f6e95434b393ac3df285864692b7fd9c4d2 d35a1e8c41f747548775225973a99507896a8c61 2025-08-28T10:56:41+02:00 Aleksei Nikiforov gguf-py: byteswapping improvements (#12851)
a6a58d64785cb458ed9de52f391aa38142d38d64 0373486dbc0dccbdcb3b5fdd65759d88cec06196 2025-08-26T21:05:25+05:30 shalinib-ibm llamafile: PowerPC Sgemm Optimization (#15558)
0115cfb7c1dec0753aecb34f3af4338bf9de8eeb 3a617cb18121a85eed17ac5585788810c5d9c1e0 0d5a470223fc90b6b6807921d68011ff06ae7f9e 2025-08-26T15:19:56+08:00 Yunzhe Jia Merge branch 'master' into dev
5eff6ec9b1220b599a43b594b1110487ab6aca08 dfd9b5f6c7586c88588f06a644c131bec071a0a1 2025-08-25T17:23:40+02:00 Johannes Gäßler CUDA: MoE helper in device code, better tile sizes (#15525)
611f419cff11e4952228162a1c44cb35dff2274a b1afcab804e3281867a5471fbd701e32eb32e512 2025-08-23T13:16:17-05:00 Jeff Bolz vulkan: optimize rms_norm, and allow the work to spread across multiple SMs (#15281)
b55f06e1aa67fb10e89f53e31bbccf37eb2678ea 0a9b43e507a359ca392c037cf341f55137ad0b69 2025-08-23T14:58:57+08:00 R0CKSTAR vulkan.Dockerfile: install vulkan SDK using tarball (#15282)
330c3d2d21b55bca5517db7d2eea2ea8f131df4a e92734d51bcb82cc35f0a6b5a14928f0036b2c90 2025-08-23T01:31:54-05:00 Jeff Bolz vulkan: optimize mul_mat_id loading row ids into shared memory (#15427)
8ad038c0fdc719ced9fbf921a02cbae9ad79287f 5682a3745f2b653dcb855d5766d8edc318fb3336 2025-08-21T11:06:05+08:00 R0CKSTAR musa: add GGML_UNUSED_VARS (#15446)
a094f381432d92c4bf92d2d6167284316ba73a62 fb22dd07a639e81c7415e30b146f545f1a2f2caf 2025-08-20T10:17:37+08:00 R0CKSTAR musa: fix build warnings (#15258)
67f09a3a27db443f9870aac87e163dba0d08131e 6424594c56f4dbd0573455d89a0d89a0ac093d13 2025-08-19T18:33:47+08:00 R0CKSTAR musa: handle __hgt2_mask, available starting from MUSA SDK rc4.3.0 (#15413)
00f35d509e5367bf19ccaf4b4adddc38db4811c6 6028bf74351d35a06bd98498624f8c2f029f7d1a 2025-08-13T11:09:39+03:00 Georgi Gerganov ggml : repack block_iq4_nlx8 (#14904)
6028bf74351d35a06bd98498624f8c2f029f7d1a bc5182272c373267352bc689e5fca276934bea2d 2025-08-13T10:04:46+02:00 Oliver Simons CUDA: Optimize `reduce_rows_f32` kernel, leading up to 25x perf improvement on kernel-level and 10% perf increase for Gemma3n (#15132)
25ff6f7659f6a5c47d6a73eada5813f0495331f0 be48528b068111304e4a0bb82c028558b5705f05 2025-08-12T10:02:51+08:00 R0CKSTAR musa: fix failures in test-backend-ops for mul_mat_id op (#15236)
cd3069dfcbeee8e0e96cffb93b0ebb9e595e273a 50e81bdf5db563ab57a9a722b08f96fa8a76c927 2025-08-11T11:21:19+02:00 Daniel Bevenius kv-cache : log (debug) all streams in find_slot (#15176)
79c1160b073b8148a404f3dd2584be1606dccc66 34c9d765bf173c551398f1e7fa4595019bc53bab 2025-08-09T13:29:43-05:00 David Zhao cuda: refactored ssm_scan and use CUB (#13291)
34c9d765bf173c551398f1e7fa4595019bc53bab e54d41befcc1575f4c898c5ff4ef43970cead75f 2025-08-09T20:00:24+08:00 Aman Gupta CUDA: add attention sinks for tile and wmma (#15178)
9515c6131aecaccc955fdedcfe16c3e030aaefcb fd1234cb468935ea087d6929b2487926c3afff4b 2025-08-05T16:26:38-07:00 Reese Levine ggml: WebGPU disable SET_ROWS for now (#15078)
587d0118f50b7e8f4bafbcdd218aefd9da0272e1 5aa1105da24a8dd1661cea3db0582c9b2c2f54d3 2025-08-04T08:52:43-07:00 Reese Levine ggml: WebGPU backend host improvements and style fixing (#14978)
3025b621d12a6931ff5e9775d4f644719980ad91 ec0b18802c91badd3ff1388ffd09ee163251bd72 2025-08-02T17:20:40+08:00 R0CKSTAR llama-bench: rename DB table name from test to llama_bench (#15003)
baad94885df512bb24ab01e2b22d1998fce4d00e ba42794c9ead96ad52311ba1b23eefcbf3d6f63d 2025-08-01T11:50:33+05:30 Srihari-mcw ggml : Q2k interleaving implementation - x86/x64 SIMD (#14373)
484b2091ce5017901483b5204c07878f171d1441 daf2dd788066b8b239cb7f68210e090c2124c199 2025-08-01T08:47:27+08:00 R0CKSTAR compare-commits.sh: support both llama-bench and test-backend-ops (#14392)
8a4a85627702b569d7d2810f2de06a4321656e9d 11490b36723d511d75fb601995c79b5c363ba3a2 2025-07-31T19:49:09+08:00 Aman Gupta Add LLaDA 8b Diffusion model (#14771)
00131d6eaf4df029e1ec84de868c2c5957503007 1e15bfd42c3938506e0da5939bf7f42780965f01 2025-07-30T15:12:02+03:00 Georgi Gerganov tests : update for LLAMA_SET_ROWS=1 (#14961)
cd1fce6d4f9c191f1c7429cc96f61281c3b63ffc 00fa15fedc79263fa0285e6a3bbb0cfb3e3878a2 2025-07-28T20:32:15+05:30 Akarshan Biswas SYCL: Add set_rows support for quantized types (#14883)
9b8f3c6c776d77045ee4f7f13fdf7863dfe59e5b c7f3169cd523140a288095f2d79befb20a0b73f4 2025-07-26T10:36:02+08:00 R0CKSTAR musa: fix build warnings (unused variable) (#14869)
793c0d7f46384001738c337d7afa46b45ae32745 ce111d39d666f4a3b6a561ad020f6feb8cc67790 2025-07-25T10:47:39-06:00 Gabe Goodhart metal: SSM_SCAN performance (#14743)
c12bbde37258c6d053322d1cedd4a9672109ae58 3f4fc97f1d745f1d5d3c853949503136d419e6de 2025-07-25T01:07:26-07:00 Diego Devesa sched : fix multiple evaluations of the same graph with pipeline parallelism (#14855)
3f4fc97f1d745f1d5d3c853949503136d419e6de 2df255da3cea108de0ae9b302ffdd31674b6d88d 2025-07-25T03:05:37+08:00 R0CKSTAR musa: upgrade musa sdk to rc4.2.0 (#14498)
cb4a63aad6650c2b536a7578403935388cb2920e 86f5623d904cfd392fdeb14a143097b4074660f6 2025-07-24T11:09:57+01:00 Alberto Cabrera Pérez sycl: fixed semantics of block offset calculation (#14814)
48b86c4fdb1b1246d9fe17d2d53e3a1c2a0c3245 38d3af1b73302377111e88ddd725257638339286 2025-07-22T07:45:26+08:00 R0CKSTAR cuda: remove linking to cublasLt (#14790)
6c9ee3b17e19dcc82ab93d52ae46fdd0226d4777 cd465d823c378853f1f6570eebfb77f69c7e1d39 2025-07-21T19:03:19+02:00 rmatif opencl: add conv2d kernel (#14403)
90083283ec254fa8d33897746dea229aee401b37 d4b91ea7b2da253e1355b503f0fcb7b428ce005d 2025-07-19T12:51:22-04:00 compilade imatrix : use GGUF to store importance matrices (#9400)
2adf8d83acdb9b1bf58db6c9729ac9dc6847a58b 021cc28bef4dd7d0bf9c91dbbd0803caa6cb15f2 2025-07-18T17:33:41+03:00 Georgi Gerganov parallel : add option for different RNG seeds (#14757)
086cf81e88fb75287b71ff19c08a206b7bc2e02f d9b691081c04ec5fb0daa9d2b979f915c142963d 2025-07-17T09:22:11+02:00 Tarek Dakhran llama : fix parallel processing for lfm2 (#14705)
21c021745d781edf9c44b4972ef6cbbf53b0ecff b0f0ecc3dce806c68609d375a2b3edc430d8db18 2025-07-16T08:18:51-07:00 Reese Levine ggml: Add initial WebGPU backend (#14521)
225e7a1438f4ea85eaa7b5ef3ab3b266ee4d9c06 ab140198211385b85eeeb0abd549a4bbe259e10d 2025-07-16T16:35:42+03:00 Georgi Gerganov llama : add high-throughput mode (#14363)
e4841d24d3485ea4af54f8b65a19ec3123f0ff3c 538cc77f7f44dfa047dba6a06d90c86dda69cf1d 2025-07-16T19:12:22+09:00 Shunta Saito llama : fix parallel processing for plamo2 (#14716)
cbc68be51d88b1d5531643b926a4b359c3cff131 bdca38376f7e8dd928defe01ce6a16218a64b040 2025-07-15T15:28:53+08:00 R0CKSTAR cuda: fix build warnings in set-rows.cu (unused variable) (#14687)
7de5c7cab61d4da4387ed9b216f88b96297bcc2d 8eff95544e817704d44bec20f9fc956ce76a33be 2025-07-12T21:31:38+08:00 Aman Gupta CUDA: add set rows for f32 and f16 (#14551)
b3ad3a0191994d6c47b2bd389d5c7431526ecd2c 98197e5c98388470030d908f355ec5937dcccaaa 2025-07-12T05:12:26-05:00 Jeff Bolz vulkan: support SET_ROWS (#14587)
0aedae00e6fb48680324a5ac5da9cba0e35de6b5 6bdda13981d6c8189b7dc4f9fb8ecb91c21529f8 2025-07-10T18:20:13-06:00 Gabe Goodhart model : Granite Four (#13550)
704bb7a71c01dc07c1478b85f6322bf5dfde1eaf 435a6d10d618a015060e45a38c7e9f27f4243316 2025-07-10T13:59:38+05:30 Akarshan Biswas SYCL: Initial set_rows kernel implementation (#14562)
4a5686da22057867c23bd4a6be941ddc8c51e585 98bab638fb28cf95a5a66dd2d51b40d6c8f6d69a 2025-07-09T14:59:57-04:00 compilade llama : support Jamba hybrid Transformer-Mamba models (#7531)
6efcd65945a98cf6883cdd9de4c8ccd8c79d219a 699f4392a33f57c3352cf8d60bdc53db7ca235e7 2025-07-08T13:11:42-05:00 Jeff Bolz vulkan: optimize flash attention split_k_reduce (#14554)
68155c66f0e76680f34442247e589a090add22d3 e1a7059053a9b8958f2d57a21fc46dbc7fb24f8e 2025-07-08T07:58:30+08:00 R0CKSTAR musa: fix build warnings (unused variable) (#14561)
a0374a67e2924f2e845cdc59dd67d9a44065a89c ddef99522d1ba74193b7394e803fab8db5c78bae 2025-07-05T02:26:04-05:00 Jeff Bolz vulkan: Handle updated FA dim2/3 definition (#14518)
a70c8a0c4b4c1606cd9a0ba889ce61aa88610095 9067487c4411efb20400103fcccfdd389c80d428 2025-07-03T10:53:35+03:00 Georgi Gerganov kv-cache : use ggml_set_rows (#14285)
5d46babdc2d4675d96ebcf23cac098a02f0d30cc e17991c466ac835b2c71bd813c1ca7ff8dd97b94 2025-07-02T13:10:24-04:00 compilade llama : initial Mamba-2 support (#9126)
55a1c5a5fdefef808e95aabd3d5563af1068cc80 12a81af45f0dbbab24bd819a15f57c03ceb1be90 2025-07-02T20:34:24+08:00 Aman Gupta CUDA: add softmax broadcast (#14475)
a0535ffa0d35fccfec3e1a0a3bfc9dbb6054d7c0 bd9c981d7226107f18deb8344c3301450311bb8b 2025-06-29T11:04:10+02:00 Sigbjørn Skjæret ggml : implement REGLU/GEGLU/SWIGLU ops (#14158)
bd9c981d7226107f18deb8344c3301450311bb8b 27208bf657cfe7262791df473927225e48efe482 2025-06-29T02:43:36-05:00 Jeff Bolz vulkan: Add fusion support for RMS_NORM+MUL (#14366)
00d5282c7f2a0bb05bb315fb81ca3b0f42cf9f07 566c16fcce44876a167c37f159085afe6f84b28c 2025-06-28T10:17:09-05:00 Jeff Bolz vulkan: lock accesses of pinned_memory vector (#14333)
b25e92774e2fa4ee3820e458d5cf43f40190f8d2 6609507a910aa7437aaa53fd999447de3947d998 2025-06-28T17:35:41+08:00 Xinpeng Dou fix async_mode bug (#14432)
5783ae43599400b723b5da0569c1f848419ff3c7 bf5bcd0b857db420235e03639f0a5f218a7f8cf8 2025-06-26T15:50:15+03:00 Georgi Gerganov metal : batch rows copy in a single threadgroup (#14384)
8f52c6f8abb2ed9ad967cc0bfb90acb073011193 d2f325130c4ed77a3dcff2c23a926587fb08e2cc 2025-06-26T15:10:45+08:00 Yunzhe Jia Squashed commit of the following:
716301d1b03c31875ec3b24526c48c8b1bd0fd8c 60ef23d6c14d325d83eae5752e5de39ad268e9b0 2025-06-26T12:11:59+08:00 R0CKSTAR musa: enable fp16 mma (all) and cublas on qy2 (#13842)
73e53dc834c0a2336cd104473af6897197b96277 62af464227dafa1c55e0535bcb24346326748f46 2025-06-24T11:46:25-07:00 lhez opencl: ref count `ggml_backend_opencl_context` and refactor profiling (#14254)
fa4a9f2a1ccda2573189a9d4995bdf0bceb41156 238005c2dc67426cf678baa2d54c881701693288 2025-06-22T22:16:26+01:00 Ed Addario quantize : handle user-defined pruning of whole layers (blocks) (#13037)
bb16041caef45cd4348cd6f84906b5dfec7a1f6a 58cba76a9aab728717509d62b67c13afd8dc227a 2025-06-21T08:17:12+02:00 Markus Tavenrath Add support for VK_EXT_debug_utils to add labels to Vulkan objects. (#13792)
67ae5312e255ae97852a4a216e2245580bfafd72 692e3cdd0a069ab56411b64506a67537d767683e 2025-06-21T08:04:18+03:00 Georgi Gerganov metal : fix thread-safety (#14300)
8308f98c7fb778e54bf75538f5234d8bd20915e9 6369be07359d03723f38c0a4a014ff0f698a0738 2025-06-20T15:07:21+02:00 Nicolò Scipione sycl: add usage of enqueue_functions extension (#14244)
e28c1b93fd7d3f8faf9551d962e8a65fe2122e38 d27b3ca1758dfb1718e333d497ef4b68ad109bc2 2025-06-20T04:57:36-07:00 Diego Devesa cuda : synchronize graph capture and cublas handle destruction (#14288)
edc4a29effe716956fdfd2bc5b9cba2a6d8492f8 ed3290ab34493fd3d2e0f925f816a401da4f2dfd 2025-06-19T00:08:14-05:00 Gabe Goodhart memory : Hybrid recurrent cache (#13979)
8d947136546773f6410756f37fcc5d3e65b8135d 50d2227953ca9024f04255b4f116d06fcc0db74c 2025-06-19T01:10:26+08:00 Aaron Teo docs: add s390x build documentation (#14264)
fe9d60e74a6cb71bcaed2029377bfa2872b4abb0 e434e69183fd9e1031f4445002083178c331a28b 2025-06-17T17:48:08+08:00 R0CKSTAR musa: fix build warning (unused variable) (#14231)
6adc3c3ebc029af058ac950a8e2a825fdf18ecc6 0dbcabde8c006d5cf781ca0fe071c41559572a72 2025-06-16T08:11:43-07:00 Diego Devesa llama : add thread safety test (#14035)
c89c2d1ab94b11845240b7d3313c87691ea18d88 3555b3004ba7687be3d734acade52a3345758aa4 2025-06-16T00:21:08-06:00 Jeff Bolz vulkan: mutex around vkQueueSubmit (#14127)
c311ac664d68d10781a3e7b9f02d9d9520837d80 b9912ac570de8945ae9383c9ca8291027bf287dd 2025-06-15T10:08:58+03:00 Georgi Gerganov cparams : rename LLAMA_MAX_PARALLEL_SEQUENCES to LLAMA_MAX_SEQ (#14188)
c61285e7396c8e526fe7794c19e8d4f1c99bfc51 09cf2c7c655c90e53e100f29b830a788bab0653d 2025-06-13T08:45:37+01:00 Ewan Crawford SYCL: Bump oneMath commit (#14152)
bd248d4dc7265437e1918dc53ae3f49a0c592e5f 7781e5fe99f2a4fc1c8af0a8488eedac4644cb72 2025-06-11T09:48:52-05:00 Jeff Bolz vulkan: Better thread-safety for command pools/buffers (#14116)
dad5c44398b78467943ed0a603ea427fe9f6fc62 55f6b9fa6563f6ae49113f9abdc980c12348cc1c 2025-06-10T18:20:14-04:00 compilade kv-cache : avoid modifying recurrent cells when setting inputs (#13834)
e21d2d4ae26d6c5daf1602a1061aa4f8e722ca57 dc0623fddb661926e0998538895155e4f081ff09 2025-06-09T19:47:39+08:00 Xinpeng Dou CANN: Simplify the environment variable setting(#13104)
dc0623fddb661926e0998538895155e4f081ff09 87d34b381d5868e75586210ec17b5ef5deddc276 2025-06-09T18:01:17+08:00 R0CKSTAR webui: fix sidebar being covered by main content (#14082)
228f34c9ceefa3ea4f4d6933edd858121e8106cb 0974ad7a7cd4bca846b15c484ff3be890135a52c 2025-06-07T18:58:20+05:30 Akarshan Biswas SYCL: Implement few same quantized type copy kernels (#13739)
a7b8d35f780ab3e7639ae5345442fb1ad10f0163 6eba72b71c677ce9aae33c422a6e67008137987a 2025-05-29T13:29:50+03:00 Georgi Gerganov sync : whisper.cpp (ggml/1250)
fedf034a98378059274e4243d2a370a243335e73 8726392d3d927fe3e504868d3548d694496ee37e 2025-05-27T20:58:46-04:00 Daniel Tang ggml : Print backtrace on uncaught C++ exceptions (ggml/1232)
c04621711a893cbd09cff6c927cb005bc6749e36 0fc16b42e8793364918e830c234c1f3caec29dae 2025-06-01T11:42:16+03:00 Georgi Gerganov parallel : fix n_junk == 0 (#13952)
053b1539c02617eff744f89525ee57497c3c1fbe b3a89c3d9e34c28c5be70d8b687a84775746d4a0 2025-05-31T15:39:19-07:00 Max Krasnyansky threading: support for GGML_SCHED_PRIO_LOW, update thread info on Windows to avoid throttling (#12995)
12d0188c0dc6146ffde6d277a93f232ccbe699f8 eb3949938e82a128855bc0676220bb2ce6e4228d 2025-05-31T10:24:04+03:00 Georgi Gerganov kv-cache : refactor + add llama_memory_state_i (#13746)
dd665cc9d4b378626cde11ea0c4c91f514fdc994 df0c0c7d02f951dc639d48fd536f79200460ac83 2025-05-30T19:38:07+03:00 Georgi Gerganov parallel : increase the variability of the prompt lengths (#13927)
952f3953c1b61cc70e79e536c42ddce6a5ea5ea7 81713121ee56755ba4a147d1a1e3fa248ec31a66 2025-05-27T04:05:18-07:00 Diego Devesa ggml : allow CUDA graphs when using pipeline parallelism (#13814)
6f180b915c9ed9ec0c240b5dcd64644988fb5e82 03f582ae8fccecff225c30a2802461b44761e822 2025-05-26T21:10:36+05:30 Akarshan Biswas SYCL: Add non contiguous support in RMS_NORM and NORM kernels (#13611)
de2ef53a4b2c0d703749a309d19fe68fd8f1b9ac c508256db2de2b032e19c8ed833f4683c827c9a1 2025-05-25T16:34:36+03:00 Georgi Gerganov kv-cache : rework kv_cell (#13706)
ffd0eae60b7642e942c8245b89642527e36099e6 b775345d788ac16260e7eef49e11fe57ee5677f7 2025-05-24T11:46:19+02:00 Johannes Gäßler CUDA: fix race condition in FA vector kernels (#13742)
d394a9aedc50a13b7f6373416f7c1ccabfe79c32 6b56a64690a318fcabcd7739ac7e314d44785ea8 2025-05-22T13:54:43+02:00 Nicolò Scipione sycl : Remove waits from function calls (#13702)
6b56a64690a318fcabcd7739ac7e314d44785ea8 a4e8912dfd4604be1e39bc86ba4c0b02969967ef 2025-05-22T09:24:09+01:00 Ewan Crawford SYCL: Avoid using with SYCL-Graph for unsupported nodes (#13587)
a4e8912dfd4604be1e39bc86ba4c0b02969967ef edbf42edfdabb9cea72ae12137570cf48f5d8076 2025-05-22T02:21:45+03:00 Henry Linjamäki opencl: Add support for multiple devices (#12622)
c76532e7ba128bb097bf6836bf0f5592e1b56b76 2aa777d86d3f7bb80b93e226f1c25e47825f6a83 2025-05-21T19:40:35+03:00 antichristHater convert : add qwen2vl support for unsloth merges (#13686)
33983057d0f578aca74ba15eccc3de9c267a5ff6 fb1cab201c6c4cd36731f100df74eece2f4706fa 2025-05-21T09:58:49+08:00 R0CKSTAR musa: Upgrade MUSA SDK version to rc4.0.1 and use mudnn::Unary::IDENTITY op to accelerate D2D memory copy (#13647)
e298d2fbd082a52c0f6ed02729f94e9bf630cf17 f0adb80bf7c2c0d80abb04f4533b5513622d9964 2025-05-20T08:05:46+03:00 Georgi Gerganov kv-cache : add SWA support (#13194)
8b5e19aea6ce9fe4452598663924373234041440 60aea028b575ab54e0dfbb31db641bb93d2ae8c4 2025-05-18T18:30:13-07:00 Diego Devesa ggml : fix apple OS check in ggml_print_backtrace (ggml/1229)
60aea028b575ab54e0dfbb31db641bb93d2ae8c4 9c55e5c5c24990dd17fd6c8f4f2159052d2b06f1 2025-05-17T19:06:26-04:00 Daniel Tang ggml : Fix missing backtrace on Linux (ggml/1228)
518329b2d4434d0683c30b741b4f4cf5734b5f99 2f5a4e1e09567e09be8b84a5f976334de9539d17 2025-05-17T12:58:55+03:00 Georgi Gerganov parallel : add option for non-shared and larger prompts (#13598)
09232370fc6426aa5dd9be01a8271b9c28f5af3a 7474e00b34629e9cd8b06bc87ad935584ea30f8e 2025-05-11T16:20:39+02:00 Sigbjørn Skjæret scripts : exit compare-llama-bench.py gracefully when there's nothing to compare (#13451)
0208355f42bdab88a08507ead4a6302790a08323 d2a4ef05c60506ee48e7375eb36f2257de7ab0d2 2025-05-10T22:22:48+02:00 Johannes Gäßler CUDA: fix race conditions FlashAttention kernels (#13438)
33eff4024084d1f0c8441b79f7208a52fad79858 17512a94d636c4b6c1332370acb3e5af3ca70918 2025-05-09T19:29:37+02:00 Xuan-Son Nguyen server : vision support via libmtmd (#12898)
0527771dd80bd18479dfaaa0a98be297fc3592bf 2189fd3b6327a1d17893694125da8edcf74a6468 2025-05-09T17:25:50+08:00 R0CKSTAR llama-run: add support for downloading models from ModelScope (#13370)
1f73301b63668d61b5f3109489050a27dc3f65be 4773d7a02ffdb05ba9e673ff21ce95351836e33a 2025-05-07T15:48:23+08:00 R0CKSTAR cuda : remove nrows_x in mul_mat_q_process_tile (#13325)
93c4e23905987949b714b21ae918ff6bfb55fe36 8afbd968182909cf93fb15959fc867b6dd3adb53 2025-05-04T14:16:39+02:00 Johannes Gäßler CUDA: fix race condition in MMQ stream-k fixup (#13299)
8afbd968182909cf93fb15959fc867b6dd3adb53 8ae5ebcf859b05a2ea3bbd930133a2fe4a89ed3c 2025-05-04T13:58:38+02:00 Johannes Gäßler CUDA: fix race condition in MMQ ids_dst (#13294)
8efbdadc616fa717c369059b9b388160958d886c f057808ffadce213f54c1884ab5096e60140f358 2025-05-01T17:32:11-04:00 Justin Santa Barbara rpc : avoid uninitialized memory in serialize_tensor (#13210)
3e168bede4d27b35656ab8026015b87659ecbec2 ceda28ef8e310a8dee60bf275077a3eedae8e36c 2025-04-30T16:56:24+02:00 Xuan-Son Nguyen convert : improve model arch handling (#13122)
43ddab6eeeaab5a04fe5a364af0bafb0e4d35065 1831f538f720d1d99fba146f24f0a8e970838cc4 2025-04-28T21:00:20+03:00 Ville Vesilehto fix(rpc): Improve input validation and error handling (#13069)
5fa9e63be82225fb3249c76f39ddda3e5bdec0a3 a4c340f974f9b7ac0c1aae897aabaa54549a97e5 2025-04-28T12:18:59+02:00 Xuan-Son Nguyen clip : refactor set input for cgraph + fix qwen2.5vl input (#13136)
a4c340f974f9b7ac0c1aae897aabaa54549a97e5 d0a417f3c7a5a22ef05b3b76d91dbe1d3362bf0c 2025-04-28T15:03:25+05:30 Akarshan Biswas SYCL: Add all missing unary kernels (#13074)
f0dd6a1926cdb2f4183a937deee40db26ef8f1da 69699be48a6b94570773532850667f1591dc5bbe 2025-04-28T15:33:28+08:00 R0CKSTAR musa: fix typo in cc control (#13144)
e291450b7602d7a36239e4ceeece37625f838373 59e991c23cc44cb5fb657e7b9358cac21fb79828 2025-04-27T19:22:49+08:00 R0CKSTAR musa: fix build warning (#13129)
ca2bb89eac2097ab4620448737e58af8452e444b 2d451c80590b9ac250322769ac13d3b4870dbcf7 2025-04-27T16:10:34+08:00 HimariO clip : Add Qwen2.5VL support (#12402)
2cca6c01e46d2fc1124d15730273ed2acdad1016 658987cfc9d752dca7758987390d5fb1a7a0a54a 2025-04-23T10:32:49+03:00 Radoslav Gerganov rpc : add command line option for number of threads for the CPU backend (#13060)
7a395f67a7a02bb361d944b816d6e933889e28e1 971f245b3b5f3f55991bb779cb541b00f82eea1d 2025-04-17T20:34:16+08:00 hipudding CANN: Add support for async operator submission (#12864)
b0c75ac9f93322b45e3766e149417334b4fd1ed9 d6d2c2ab8c8865784ba9fef37f2b2de3f2134d33 2025-04-15T10:04:24+08:00 Xinpeng Dou CANN: Optimize CANN buffer pool memory management (#12875)
8ac9f5d765f2b1b7f821873618c0cff68ca59bc8 12e9158f25cb47e97ca9b8083e1ec7415f262260 2025-04-11T15:26:17+08:00 R0CKSTAR ci : Replace freediskspace to free_disk_space in docker.yml (#12861)
64eda5deb9859e87a020e56bab5d2f9ca956f1de fe5b78c89670b2f37ecb216306bed3e677b49d9f 2025-04-10T17:24:44+02:00 Xuan-Son Nguyen convert : ability to lazy-load safetensors remotely without downloading to disk (#12820)
d9a63b2f2e91cdcb0eda211b7f49fadcdea0f664 8ed71242f464dc0a3fb3cffcfe064e55bdec72f9 2025-04-09T17:22:30+08:00 R0CKSTAR musa: enable freediskspace for docker image build (#12839)
0090950f679475c5ecaac2f7bca5049cca96492b 7ecd780b1a1d5214b8d04c25ebfc194d310816ed 2025-04-09T00:25:08-05:00 Jeff Bolz vulkan: In coopmat2 mmq, load q4_k/q5_k scales through shared memory (#12833)
78a1ba0a4f2bfed5b8b8e312592143d22e531698 2dabf759e7c8c827d38cdd18d0792070e6a4f4e1 2025-04-08T18:37:06+02:00 Xuan-Son Nguyen server : fix thread.join() on exit (#12831)
916c83bfe7f8b08ada609c3b8e583cf5301e594b 0c74b04376b0b9efc096480fe10f866afc8d7c1c 2025-04-06T21:23:54+08:00 R0CKSTAR musa: fix compilation warnings in mp_22/31 (#12780)
5f696e88e0eb490c8028421d3c5419df9dcf5385 193c3e03a63ccda3ac3d6a2999e41e6d1414fe23 2025-04-03T19:51:35+08:00 R0CKSTAR sync : minja (inclusionAI/Ling) and update tests (#12699)
a10b36c91a091f4606710fba4e9327fd71e0e738 83a88bd6affbe148a622ac730952ac5b8b585979 2025-04-02T14:32:59+03:00 Georgi Gerganov llama : refactor kv cache guard (#12695)
a6f32f0b3437ac79827ffb55521cb839343324ab 2bb3597e426ce092c3e10ae0bdd876963765e6ed 2025-04-01T19:12:53+08:00 R0CKSTAR Fix clang warning in gguf_check_reserved_keys (#12686)
c80a7759dab10657b9b6c3e87eef988a133b9b6a 250d7953e829ff0e16074510fef0e7cec696461b 2025-03-31T18:40:56+02:00 Daniel Bevenius vocab : add special infill tokens for CodeLlama (#11850)
6c02a032fa21d69e881ef9a5c94ba28ebaf1d749 f52d59d771dc231fc2ac39adacf157ddefc97730 2025-03-31T14:55:24+05:30 Akarshan Biswas SYCL: Remove misleading ggml_sycl_op_flatten function (#12387)
492d7f1ff77e116e44962b832cc3db24cfc46d24 d3f1f0acfbf8aaafd2ce494309a10a7cc92042c8 2025-03-30T16:59:38+08:00 R0CKSTAR musa: fix all warnings, re-enable `-DLLAMA_FATAL_WARNINGS=ON` in ci and update doc (#12611)
c7b43ab60855f752ae79937fb93d561bc30b69a4 24feaec05792b972d5ff3e2b12d9237ebd50d1ac 2025-03-27T12:21:47+05:30 amritahs-ibm llamafile : ppc64le MMA implementation for Q4_0. (#12489)
f17a3bb4e8b0aa24c0f86636d234aca7dc2cfa01 bd40678df768ab189b26b8b03e3de4062e3b71a3 2025-03-27T07:16:00+05:30 Akarshan Biswas SYCL: implement memset ggml backend buffer interface (#12580)
fd7855f8f522ab26681b25ae506ff99c654e2dd5 53af4dba425768fd507ce6b45873cfbb3df2295f 2025-03-26T15:09:48+08:00 R0CKSTAR doc: [MUSA] minor changes (#12583)
3cd3a395323fa9cdf6ecfa1fea290bf228d4e856 2d77d88e70d017cd82c3f1a4517e3102e2028ac4 2025-03-25T15:45:08+08:00 R0CKSTAR ci: [MUSA] add CI and update doc (#12562)
7ea75035b67f44c22ed7039967f718011fd35ce5 c54f6b7988b63714b87b0390e01a1e69aee79a12 2025-03-24T18:28:34+08:00 R0CKSTAR CUDA: Fix clang warnings (#12540)
fac63a3d786b2a0f97876c30add02cb525a9648e eddfb438502bd5d1014d63a812e9b6d03d326f8c 2025-03-22T17:11:37+08:00 R0CKSTAR musa: refine compute capability (#12493)
3d82dbcbce2c677fc35fbf99574ccd107d95a1f8 732b5fbf5e7f9cf069942f0c5850ee959ef321ba 2025-03-20T17:05:34+05:30 Srihari-mcw ggml : block interleaving support for Q4_K quantization for x86 AVX2 architecture (#12332)
517b5ddbf002b91fd6d6daf5d8db8c88a0173039 a9b59288e222f39fc0311dc66944ed5a86c815fa 2025-03-20T01:22:06+05:30 Gaurav Garg CUDA: Improve flash decoding kernel GPU occupancy for BS=1 case (#12183)
d84635b1b085d54d6a21924e6171688d6e3dfb46 75422e8bc42646005be0754f7aa438b97a5e777e 2025-03-18T12:54:55-07:00 lhez opencl: improve profiling (#12442)
bb115d2bf7ed2cdd7dccd7ae74cc9cfe4b0adb71 29fff308c704c1c752cdb5153361e545e2bac09d 2025-03-19T02:28:26+08:00 R0CKSTAR musa: override warp_size of musa device to 32 (#12445)
7dfad387e3f6ac98d383ded2d175eb59736a3993 60c902926c928f9c2cd6390ce411876f92feeaf3 2025-03-18T07:27:50+08:00 Molly Sophia llama: Add support for RWKV v7 architecture (#12412)
9f2250ba722738ec0e6ab684636268a79160c854 774973b8f3d5e375b0b74d58638eeb1817e950a8 2025-03-14T16:41:20Z Eric Curtin Add CLI arg to llama-run to adjust the number of threads used (#12370)
10f2e81809bbb69ecfe64fc8b4686285f84b0c07 ba7654380a3c7c1b5ae154bea19134a3a9417a1e 2025-03-11T20:16:03+01:00 uvos CUDA/HIP: refractor mmqv to unify the calculation of nwarps and rows per block between host and device code. (#12177)
251364549fe4a78d4e2e66f1adfaf2bd53041d2c 8acdacb3ea00697477eb019efbb6fc183371055c 2025-03-11T01:18:25+08:00 R0CKSTAR musa: support new arch mp_31 and update doc (#12296)
05e6f5aad0a4bb48fb2775f2a78505540fdbc47d 673cfef9aa8daad09966208909f346eb996628a4 2025-02-28T13:06:12+05:30 Prashant Vithule ggml: aarch64: implement SVE kernels for q2_k_q8_k vector dot (#12064)
f777a73e18c218848bca0748581c043987348a5d af7747c95ae71a5db4184947f837179e82c70b77 2025-02-23T13:14:32Z Eric Curtin Some llama-run cleanups (#11973)
0b3863ff9576872855b0265da2cab2ce7e25c4d9 ee02ad02c56ff36a5edd22d8617ab3f9546ce7fe 2025-02-21T15:46:23+08:00 Bodhi MUSA: support ARM64 and enable dp4a .etc (#11843)
c5d91a74006c49376590ef2b67420bc7ce206397 4806498bf15ef767de3776b00856e56c373dd1b1 2025-02-20T14:06:51+01:00 Charles Xu ggml-cpu: Add CPU backend support for KleidiAI library (#11390)
73e2ed3ce3492d3ed70193dd09ae8aa44779651d f7b1116af102bcac450c1a522e9c59db241c6767 2025-02-17T14:03:24+01:00 Johannes Gäßler CUDA: use async data loading for FlashAttention (#11894)
c48f630d1c1942fce08aa7cb18a53ace443cd611 bd6e55bfd3f3af3e5705cf87a10e5178cef7c3c1 2025-02-13T14:46:59+01:00 Daniel Bevenius llama : add --completion-bash option (#11846)
bd6e55bfd3f3af3e5705cf87a10e5178cef7c3c1 c7f460ab882065ec5696e3d51e24dbf67b539287 2025-02-13T20:28:18+08:00 R0CKSTAR musa: bump MUSA SDK version to rc3.1.1 (#11822)
e4376270d971cff7992bdb6c5412a739195b1459 3e693197724c31d53a9b69018c2f1bd0b93ebab2 2025-02-13T01:25:34-05:00 Oleksandr Kuvshynov llama.cpp: fix warning message (#11839)
a394039db004c6ee00098250d160b5aa018c2314 be3bbd62153820ff6d358c817360927f429105c4 2025-02-13T01:02:38+01:00 Diego Devesa ggml-cpu : add chunking support to mul_mat_id (#11666)
748ee9fe9312acb8755ee4bf46fd9de2e6a45f29 198b1ec611a2c551ea40e5b9c0b862f37555a4cc 2025-02-12T13:57:33Z Richard ggml : fix multi-threaded clamp_f32 (#11824)
4d3465c5aeca8be29cac77f1535c35f4fb274eca d80be897acdca45f8f7ea2e52c930b1d0e738a14 2025-02-08T15:30:53+01:00 Karol Kontny ggml: Fix data race in ggml threadpool (#11736)
2fb3c32a1634488a5265d1304ab37628eeb5480d 9ab42dc722ad19a12af80f38a06474d498f96da3 2025-02-06T17:32:29+01:00 Xuan-Son Nguyen server : (webui) migrate project to ReactJS with typescript (#11688)
3ec9fd4b77b6aca03a3c2bf678eae3f9517d6904 3962fc1a7956dd0afacfbce10fd1a3ffd3ad857e 2025-02-05T02:18:38+08:00 fxzjshm HIP: force max threads per block to be 1024 (#11621)
a83f528688324a21484a97af1d1be5e1bc8d4c8e b1bcd309fc8ac929cbd4a6207b3a19886bda031f 2025-01-31T14:15:25Z Olivier Chafik `tool-call`: fix llama 3.x and functionary 3.2, play nice w/ pydantic_ai package, update readme (#11539)
4314e56c4f8c5091f45732f39bd94c0c6c323798 496e5bf46bab757d05e18227cb4e17055ae42f42 2025-01-30T11:05:00+01:00 Daniel Bevenius server : use lambda instead of std::bind (#11507)
e0449763a4f335cca374254a72892141f41eaa59 eb7cf15a808d4d7a71eef89cc6a9b96fe82989dc 2025-01-30T05:48:14+01:00 Daniel Bevenius server : update json snippets in README.md [no ci] (#11492)
1a0e87d29152cb9d4ce13b4ad64b0382c9ba1ab6 d2e518e9b4231077013ffb0e5c4cc24a0c4c1b7d 2025-01-23T11:59:08-08:00 William Tambellini ggml : add option to not print stack on abort (ggml/1081)
d2e518e9b4231077013ffb0e5c4cc24a0c4c1b7d b636228c0ad0db95bf73008094c6145a05615cf6 2025-01-17T21:29:08+09:00 issixx ggml-cpu : fix ggml_graph_compute_thread did not terminate on abort. (ggml/1065)
5245729e3317064959faefc5e5cbc63f4e9cfbea 6152129d05870cb38162c422c6ba80434e021e9f 2025-01-23T01:01:17-06:00 Jeff Bolz vulkan: fix diag_mask_inf (#11323)
6171c9d25820ccf676b243c172868819d882848f e28245f35f2faaf249dd352998b3693a8cc28c51 2025-01-21T13:18:51Z Olivier Chafik Add Jinja template support (#11016)
adc5dd92e8aea98f5e7ac84f6e1bc15de35130b5 f11cfdfd7fe29436fce512d934c2ff6b94bd89d2 2025-01-15T19:50:13Z Eve vulkan: scale caching for k quants + misc fixes (#11081)
6369f867a410416239d9f20ec27c2b1d6a9fee52 47182dd03fe04a4ffda5d7f4c8a109ae0056cf56 2025-01-06T10:28:17+01:00 Daniel Bevenius llama : rename missed batch params/vars to ubatch (#10059)
0da5d860266c6928b8c9408efbd264ae59fedda6 a45433ba209ee0b33d02c7dc4c31f29894ad83a6 2025-01-02T15:05:18+01:00 Xuan Son Nguyen server : allow using LoRA adapters per-request (#10994)
a813badbbdf0d38705f249df7a0c99af5cdee678 fdd21889123bec62b1db3b2fc22b5a4abab32174 2024-12-29T03:16:34-06:00 Jeff Bolz vulkan: im2col and matmul optimizations for stable diffusion (#10942)
227d7c5a7f4cc7734fde8a4ef4382d613486d3c8 7b1ec53f56bb72c49e4c8434157895f94d3709c2 2024-12-17T09:52:09+01:00 Xuan Son Nguyen server : (UI) fix missing async generator on safari (#10857)
7b1ec53f56bb72c49e4c8434157895f94d3709c2 160bc039c862c10b9938269a90ddb09d794a7b0d 2024-12-17T05:52:55Z Eve vulkan: bugfixes for small subgroup size systems + llvmpipe test (#10809)
5478bbcd173e7027af7689493c7421719f5c43df b5ae1ddff93403300fc79c7ab5ee73b8cfbb3457 2024-12-15T05:55:54-06:00 Vinesh Janarthanan server: (UI) add syntax highlighting and latex math rendering (#10808)
a76c56fa1a3d27467eb97468d8c3b2fe1243b61a c27ac678dd393af0da9b8acf10266e760c8a0912 2024-12-13T12:23:52-08:00 lhez Introducing experimental OpenCL backend with support for Qualcomm Adreno GPUs (#10693)
11e07fd63bac1cb642380a7a3eac03fd8703e948 4601a8bb6784d2ab8b4b605354b51979fbeea1d3 2024-12-13T18:23:50+01:00 Corentin REGAL fix: graceful shutdown for Docker images (#10815)
83ed24a97b500ccdb32b90b94e6f9621ad8db79e d583cd03f663701858ba152a334cbb467fabe342 2024-12-13T12:12:15+05:30 Akarshan Biswas SYCL: Reduce most of the compiler warnings (#10748)
3573fa8e7b7f0865638b52b4e9b4d2006f0558a2 d9c3ba2b7749c00df477599aa141a98b4521aa2c 2024-12-07T20:21:09+01:00 Xuan Son Nguyen server : (refactor) no more json in server_task input (#10691)
ce4a7b849388b67d45ad420bdd82d5efcd55647a 19d8762ab61df8286367588a80b9c7db4cb568db 2024-12-07T18:02:05+02:00 Georgi Gerganov server : various fixes (#10704)
e9e661bd59364e5d4fce035834b6cadcadf8c2ef efb6ae963031709fc331e6e48cc4606ac8f9c3a7 2024-12-03T21:11:43+08:00 mahorozte CUDA: remove unnecessary warp reduce in FA (ggml/1032)
efb6ae963031709fc331e6e48cc4606ac8f9c3a7 667d70d1704dfa6977505f5d01d4638669b90dce 2024-12-02T19:27:24+01:00 PAB feat: add `GGML_UNARY_OP_ARGMAX` Metal kernel (ggml/1019)
0533e7fb3842a523f64dc533bd7bd7147ec2c63a 7cc2d2c88908fc92b97b28acafb82f7d6e425b85 2024-11-30T07:00:02Z Eve vulkan: Dynamic subgroup size support for Q6_K mat_vec (#10536)
6c595676899013102fdb0aa4b06a49954300c94a 890719311b6535e572f15965c6d7ec4ac2537f60 2024-11-28T19:17:49+01:00 Xuan Son Nguyen server : (tests) don't use thread for capturing stdout/stderr, bump openai client library (#10568)
249cd93da3df9c8fa78869b0522526d1625aca91 904109ed0d97c9b656a5e8bf612925f739bb8166 2024-11-27T00:00:41+08:00 R0CKSTAR mtgpu: Add MUSA_DOCKER_ARCH in Dockerfiles && update cmake and make (#10516)
45abe0f74ee281aea6e5283c1e738061256cfcae 0bbd2262a3263f37385297b30de37941836e57f7 2024-11-26T16:20:18+01:00 Xuan Son Nguyen server : replace behave with pytest (#10416)
84e1c33cde9e0a7aafcda2d4f21ba51c300482d7 811872a59daefb25fc0c4326bcb6d8ae893c2f7c 2024-11-26T13:36:40+02:00 Georgi Gerganov server : fix parallel speculative decoding (#10513)
9ca2e677626fce759d5d95c407c03677b9c87a26 5931c1f233c616083d64e41a228249d58e039aa5 2024-11-25T16:31:38+02:00 Georgi Gerganov server : add speculative decoding support (#10455)
cce5a9007572c6e9fa522296b77571d2e5071357 dc39012cbaf8752fabecaeb60af78ccdd1dfb73b 2024-11-24T18:03:25+02:00 Georgi Gerganov flake.lock: Update (#10470)
2eb76b2a5e4ea395b971a419c95b473ab6f253e4 9b75f03cd2ec9cc482084049d87a0f08f9f01517 2024-11-18T16:08:20+02:00 Georgi Gerganov flake.lock: Update (#10346)
cf32a9b93ad859ea592c31785b6bd3b4b2121463 a43178299c2f74f14bcfc659bfd9fd32d931d1f4 2024-11-17T11:23:01+02:00 Georgi Gerganov metal : refactor kernel args into structs (#10238)
f0204a0ec70d50ca60e07bc0096ec1d6508ab0c7 57f8355b29a8c7dfcd1fb6094758ad85644f8535 2024-11-15T19:47:25+08:00 R0CKSTAR ci: build test musa with cmake (#10298)
9901068ac78838745e604fffb4601d315a610456 231f9360d94446cd083b6b116f63991b1328c484 2024-11-15T05:48:49-04:00 Xuan Son Nguyen server : (web UI) add copy button for code block, fix api key (#10242)
ae8de6d50a09d49545e0afab2e50cc4acfb280e2 4a8ccb37ad9c9027cbcfd5548c19cdffe48d5197 2024-11-14T18:04:35+01:00 Diego Devesa ggml : build backends as libraries (#10256)
fb4a0ec0833c71cff5a1a367ba375447ce6106eb 5ea926dad7f62ebccff7b24784bd1e01a06d13ae 2024-11-13T20:00:35+02:00 Michael Podvitskiy llama : propagate the results of `graph_compute` (#9525)
54ef9cfc726a799e6f454ac22c4815d037716eda b0cefea58a20020754b7431e3c725625274372a5 2024-11-11T11:13:51-06:00 Jeff Bolz vulkan: Throttle the number of shader compiles during the build step. (#10222)
4b3a9212b602be3d4e2e3ca26efd796cef13c55e 505f33274d60676320216b662a97672a76ec600e 2024-11-10T21:45:25+02:00 Georgi Gerganov flake.lock: Update (#10243)
3bcd40b3c593d14261fb2abfabad3c0fb5b9e318 5c333e014059122245c318e7ed4ec27d1085573c 2024-11-07T18:19:10+11:00 Zhiyuan Li Optimize RWKV6 Operator Naming and Implement Multi-core CPU/ SYCL Acceleration (#10133)
b11f9ba9b8ce319f04b88afe40d264e6b7f4ba46 94d8cb8be13b7c4d04eeca5a2b956b9148e6f222 2024-11-06T13:29:01+02:00 Georgi Gerganov server : remove hack for extra parallel slot (#10187)
9e0ecfb697d297355e43c20559d29bcc71beb0c3 6a066b9978533e2ab9890b7f4f8c0262d91798b3 2024-11-04T16:33:29+01:00 Xuan Son Nguyen server : clarify /slots endpoint, add is_processing (#10162)
1839f69130151ceeac4d01c0ef8964e1fb43bba6 9830b6923b61f1e652a35afeac77aa5f886dad09 2024-11-03T15:14:15+02:00 Georgi Gerganov flake.lock: Update (#10146)
42cadc74bda60afafb45b71b1a39d150ede0ed4d 45950415ed985830c59bf42cf9c9216b20cf08ef 2024-11-02T16:34:56Z sasha0552 server : fix slot selection by lru (#10126)
d865d1478cd4e403f82d793c2afcd0f943412f05 1804adb0cfee4811eaf633741503d683a46e4c77 2024-11-01T13:33:14Z sasha0552 server : fix smart selection of available slot (#10120)
07028f9d74d895da2ca4a1956624e3f07e04e620 524afeec9dad7d765ce91f5cf30c73703867cb47 2024-10-28T17:41:24+02:00 Georgi Gerganov flake.lock: Update (#10063)
524afeec9dad7d765ce91f5cf30c73703867cb47 8125e6cbfcf2b3b9066e4d923aca9295526730f5 2024-10-28T17:02:48+08:00 R0CKSTAR musa: workaround for Guilty Lockup in cleaning src0 (#10042)
8c60a8a46261ffb92b6d23a78acfac2fcb6fe233 9e4a2563eadf34e9432d248224d4f43e8495e8fe 2024-10-23T14:34:00-04:00 bssrdf increase cuda_cpy block size (ggml/996)
bc5ba007b2c83ac95875e68724dabfc12159fc61 958367bf530d943a902afa1ce1c342476098576b 2024-10-25T10:13:46+03:00 Georgi Gerganov server : check that the prompt fits in the slot's context (#10030)
958367bf530d943a902afa1ce1c342476098576b 40f2555797f97314de749873cdc29dc102be66e2 2024-10-24T21:51:22+02:00 Xuan Son Nguyen server : refactor slot input data, move tokenizer to HTTP thread (#10023)
873279b1592e433c4d9eb5065091cc98473c7bee c8c07d658a6cefc5a50cfdf6be7d726503612303 2024-10-20T00:22:59Z github-actions[bot] flake.lock: Update
60ce97c9d809f4b040e90b597468b839df5728d0 8901755ba328643c9ab071c20e1939ea52951a0e 2024-10-18T13:34:36+08:00 Ma Mingfei add amx kernel for gemm (#8998)
fbc98b748e7b075e327bcf13237057f647678049 dcdd535302fc9702a4709be25f56540d65163a44 2024-10-15T15:54:55+05:00 MaggotHATE sampling : add XTC sampler (#9742)
92be9f12164f18ce845a5bab60cefa5f7fec6836 edc265661cd707327297b6ec4d83423c43cb50a5 2024-10-13T06:11:26+03:00 Georgi Gerganov flake.lock: Update (#9870)
1bde94dd024b632f98428f4bf2ce483295130779 95c76e8e92ecc93f784b185eafae36a0e7ad2fa3 2024-10-12T16:06:31+03:00 Georgi Gerganov server : remove self-extend features (#9860)
11ac9800aff532715a5bc7991062c68ba3472e6e 943d20b4111c746bcd9dbc7e4771de313b08b50c 2024-10-12T08:21:51+03:00 Georgi Gerganov llama : improve infill support and special token detection (#9798)
943d20b4111c746bcd9dbc7e4771de313b08b50c 96776405a17034dcfd53d3ddf5d142d34bdbb657 2024-10-12T13:09:53+08:00 R0CKSTAR musa : update doc (#9856)
cf8e0a3bb9c0e93e371773b282054cdbbb231038 c7499c557cc1efafaf0a6bc12963c39826299703 2024-10-11T02:10:37+08:00 R0CKSTAR musa: add docker image support (#9685)
6279dac039ddeb6d5ebd125a6274fd3c37a77ba8 d5ac8cf2f2e30459489e6721a17d15b92a0c42a6 2024-10-07T19:35:42+03:00 Georgi Gerganov flake.lock: Update (#9753)
96b69121033d2b6b951d1b6b1b43f8b4f97dac99 d5cb86844f26f600c48bf3643738ea68138f961d 2024-10-07T13:26:31+01:00 Paul Tsochantaris metal : single allocation of encode_async block (#9747)
ace4f4be37abed4801fbd54a94cf38a7ae462416 8277a817f18967581b02b2248989d773e8e99998 2024-09-30T17:48:49+03:00 Georgi Gerganov flake.lock: Update (#9680)
641002fba8d2a0c0269027e23d2ef58e90546028 0de8b203f1d31cf5ee0d2a3560a0ad78d44f4d4c 2024-09-29T11:50:17-05:00 Jeff Bolz vulkan : multithread pipeline creation (ggml/963)
544f409b4bd8fc98a3e87820f0ac934e00402de7 6084bfb261b03f812de2255b05b6b5bb8d1c7171 2024-09-26T08:59:42+02:00 Salvatore Mesoraca vulkan : argsort barriers must be under uniform control flow (ggml/951)
6084bfb261b03f812de2255b05b6b5bb8d1c7171 faac0bae265449fd988c57bf894018edc36fbe1e 2024-09-24T13:23:59+03:00 Georgi Gerganov ggml : fix GGML_MAX_N_THREADS + improve formatting (ggml/969)
1b2f992cd2cff0b69e5abe78bb8888d51ed19d67 739842703e32cd43443c45e0b4f6647cc4e6b3d6 2024-09-28T14:32:46+02:00 slaren test-backend-ops : use flops for some performance tests (#9657)
739842703e32cd43443c45e0b4f6647cc4e6b3d6 6102037bbb55521880ae78a6ee6c2a0c00c901df 2024-09-28T15:13:21+03:00 Georgi Gerganov llama : add comment about thread-safety [no ci] (#9449)
7691654c68aa5316108f881136c59f815ccb6809 ea9c32be71b91b42ecc538bd902e93cbb5fb36cb 2024-09-26T09:27:40+08:00 R0CKSTAR mtgpu: enable VMM (#9597)
3d6bf6919f7b10726421779cd344f2da05421c68 904837e0cb2f5f01bf5d5901b7aa57a026860ae4 2024-09-25T01:06:52-06:00 Gabe Goodhart llama : add IBM Granite MoE architecture (#9438)
c087b6f11d3385f4293b6841ebfb755063479490 116efee0eef09d8c3c4c60b52fa01b56ddeb432c 2024-09-23T21:18:48-07:00 Max Krasnyansky threads: fix msvc build without openmp (#9615)
f0c7b5edf82aa200656fd88c11ae3a805d7130bf 1d48e98e4f3316bd2f6b187d288c7b6cb88d5cb3 2024-09-23T11:42:43-07:00 Max Krasnyansky threads: improve ggml_barrier scaling with large number of threads (#9598)
f3979df762b75a2b1c0f622a2cd15d1bc60f037f 1e7b9299c6ccb5bbc55d3db7cfa9b51f3ab09b59 2024-09-23T18:43:40+03:00 Georgi Gerganov flake.lock: Update (#9586)
c35e586ea57221844442c65a1172498c54971cb0 912c331d3dba3a079815844208dc36164baa8cc7 2024-09-22T22:55:49+08:00 R0CKSTAR musa: enable building fat binaries, enable unified memory, and disable Flash Attention on QY1 (MTT S80) (#9526)
424c5d00a9b97dd5559635872db9b57f87c23b02 a6809c6a2e8163cba296d4cc0c5cd4bbc8073638 2024-09-20T19:04:44+03:00 Johannes Gäßler ggml/examples: add backend support for numerical optimization (ggml/949)
a6809c6a2e8163cba296d4cc0c5cd4bbc8073638 5cb12f68395a5ec00b357e408883ce124a11dcdb 2024-09-08T11:10:43+03:00 Georgi Gerganov examples : add null threadpool args where needed (ggml/0)
64c6af3195c3cd4aa3328a1282d29cd2635c34c9 0d2f22e45c3c3b6f8222acb6284d0c8c93443ba1 2024-09-18T19:13:08+02:00 slaren ggml : fix n_threads_cur initialization with one thread (#9538)
8b836ae731bbb2c5640bc47df5b0a78ffcb129cb 8344ef58f8cdb8ebd6faf4463ca32ae91c374c81 2024-09-17T09:35:38-04:00 Bert Wagner arg : add env variable for parallel (#9513)
0226613853133c081b55bb892a41bb5eacc0bc94 503147a9f9d195d6a14e7c998df23b6eb61f2bae 2024-09-17T01:19:46-07:00 Max Krasnyansky threadpool : skip polling for unused threads (#9461)
5c3d0f1824714e9a97fc9b06e046eefcb6ecc721 0aadac10c7dd704f8285ddf5a63d6f764cb340aa 2024-09-16T06:48:24Z Eve ggml : IQ4_NL sgemm + Q4_0 AVX optimization (#9422)
90a2fff0e7f80c6fea3fc6cf9a7b482744f3f164 6262d13e0b2da91f230129a93a996609a2f5a2f2 2024-09-16T05:14:23+03:00 Georgi Gerganov flake.lock: Update (#9488)
befaf1197fa447f61714de041828852a270659d2 feff4aa8461da7c432d144c11da4802e41fef3cf 2024-09-14T09:50:12+02:00 Daniel Bevenius llama : make cell_id const in inp_s_mask block (#9470)
5af118efdaf1098798a06b24fd8a557760e99631 d2b496bff4f353a6429f8e833448f071bd237ba7 2024-09-11T10:22:40+02:00 Johannes Gäßler CUDA: fix --split-mode row race condition (#9413)
b34e02348064c2f0cef1f89b44d9bee4eb15b9e7 51b603863627c4074e77b7e556e18ece86bdf9a3 2024-09-11T09:46:55+08:00 R0CKSTAR musa: remove Clang builtins mapping (#9421)
cb9c933eb2a0d2b514556bdcb934b56dfe5d6771 6cd4e034442f71718563e600070c2b6fc389e100 2024-09-11T01:46:59+03:00 Georgi Gerganov flake.lock: Update (#9360)
5fac4d57643b1de8e9ab746f14d2fc4e319ae0c2 5fb5e24811cb01d48b482c15a974bfbd9f433e1d 2024-09-09T21:07:18+05:30 Prashant Vithule ggml : vector length agnostic SVE support (#9290)
efe6a83e3046a94cda38c8be5a7801eadc21d78d fbb7fcffbcfc50009c275e75982b1603a6cb6b80 2024-08-28T10:23:02+02:00 Salvatore Mesoraca ggml : fix cont with transposed tensors when one dimension is 1 (ggml/934)
9b2c24c0993487d3b34a873980e292da571481f3 134bc38ecf3e2c5460581badce289a1ffa680453 2024-09-06T23:21:29+02:00 Xuan Son Nguyen server : simplify state machine for slot (#9283)
4a1411b4f17b6569dc0a067e5914dcc0f738b370 8ebe8ddebd68526757c631cd019de009697c63c2 2024-09-06T14:06:04+02:00 Xuan Son Nguyen server : fix missing lock (#9334)
7605ae7daf31c02211bcfec2f46635ef6ec4b98a 8962422b1c6f9b8b15f5aeaea42600bcc2d44177 2024-09-04T02:36:43+03:00 Georgi Gerganov flake.lock: Update (#9261)
f771d064a95d212ddadea452ad0cc1e42b2c3db3 6e7d133a5f9409dd257fad90d7f320721b07a1b2 2024-09-02T08:25:30-07:00 yuri@FreeBSD ggml : add pthread includes on FreeBSD (#9258)
6e7d133a5f9409dd257fad90d7f320721b07a1b2 b60074f1c26d8354053a952844ef3f7ebefd8803 2024-09-02T17:11:51+02:00 Xuan Son Nguyen server : refactor multitask handling (#9274)
8f1d81a0b6f50b9bad72db0b6fcd299ad9ecd48c a47667cff41f5a198eb791974e0afcc1cddd3229 2024-09-01T22:38:17+08:00 Molly Sophia llama : support RWKV v6 models (#8980)
42c76d1358021ccdbe8ba89109c143dd7ae166df 9f7d4bcf5c27d37b0c7da82eeaf9c1499510554b 2024-08-29T19:20:53-04:00 Faisal Zaghloul Threadpool: take 2 (#8672)
1d1ccce67613674c75c9c7e3fa4c1e24e428ba48 9fe94ccac92693d4ae1bc283ff0574e8b3f4e765 2024-08-29T07:28:14+03:00 Georgi Gerganov flake.lock: Update (#9162)
a1631e53f6763e17da522ba219b030d8932900bd fc54ef0d1c138133a01933296d50a36a1ab64735 2024-08-21T17:58:11-04:00 compilade llama : simplify Mamba with advanced batch splits (#8526)
8455340b874aa90d5f70104c99ed2778d9e31c36 2f3c1466ff46a2413b0e363a5005c46538186ee6 2024-08-21T09:32:58+02:00 Daniel Bevenius llama : std::move llm_bigram_bpe from work_queue (#9062)
554b049068de24201d19dde2fa83e35389d4585d 2339a0be1c8e31fcf4531427183b94f2ef019e56 2024-08-18T17:43:32+03:00 Georgi Gerganov flake.lock: Update (#9068)
8b3befc0e2ed8fb18b903735831496b8b0c80949 d565bb2fd5a2a58b9924a7a34e77a87c78c52137 2024-08-16T17:19:05+02:00 Xuan Son Nguyen server : refactor middleware and /health endpoint (#9056)
5fd89a70ead34d1a17015ddecad05aaa2490ca46 98a532d474c73d3494a5353024cb6a4fbbabbb35 2024-08-14T18:32:53+02:00 0cc4m Vulkan Optimizations and Fixes (#8959)
98a532d474c73d3494a5353024cb6a4fbbabbb35 43bdd3ce188cd247bda7c1bd1ad01fa64e566690 2024-08-14T02:51:02-04:00 compilade server : fix segfault on long system prompt (#8987)
8cd1bcfd3fc9f2b5cbafd7fb7581b3278acec25f a21c6fd45032a20180e026773582d21294c85619 2024-08-11T16:58:58+03:00 Georgi Gerganov flake.lock: Update (#8979)
272e3bd95e620d285b2fb9faaa7b6b1b8edbbf3a 45a55b91aa87958a75d691be64b070266d4fbb94 2024-08-09T18:24:30+03:00 Georgi Gerganov make : fix llava obj file race (#8946)
be55695eff44784a141a863f273661a6bce63dfc 0478174d5959b66096ae6609fcb0df14cab66b51 2024-08-07T13:29:02+02:00 slaren ggml-backend : fix async copy from CPU (#8897)
db20f50cf4710c46e3a996919a26858cae8c80ed efda90c93a62274ec0b0bfa80c4eee4bdb6966d0 2024-08-06T17:21:47+04:00 Jaeden Amero cmake : Link vulkan-shaders-gen with pthreads (#8835)
064cdc265fb63590c7c8f04a609d36ef200d55a7 5587e57a76630651752031223cc7024cb32cf308 2024-08-05T07:52:55+02:00 0cc4m vulkan : fix Qantized Mat-Vec Mul on AMD GPUs for ncols < 64 (#8855)
ecf6b7f23e664afd7ff856ec39034240ce438daa 01aae2b4975b57a265ce8194928fd87f2d71027e 2024-08-04T03:55:03-07:00 Brian Cunnie batched-bench : handle empty `-npl` (#8839)
4b77ea95f56a4c49bc995f08eac62a6416875ccc 76614f352e94d25659306d9e97321f204e5de0d3 2024-08-04T05:53:20+03:00 Georgi Gerganov flake.lock: Update (#8847)
b7a08fd5e0e7c898c68d1743066ea495202d9608 7a11eb3a260915aee16101808f291a244e2facc7 2024-08-01T12:53:46-04:00 Alex O'Connell Build: Only include execinfo.h on linux systems that support it (#8783)
ed9d2854c9de4ae1f448334294e61167b04bec2a 398ede5efeb07b9adf9fbda7ea63f630d476a792 2024-07-31T15:51:06-04:00 Clint Herron Build: Fix potential race condition (#8781)
7c27a19b2eb91bb0f43c7f7aec0386cec2dddc33 140074bb8647df41840d6f32f4409fa8959bcf9f 2024-07-30T23:40:18+09:00 l3utterfly added android implementation of ggml_print_backtrace_symbols (#8751)
140074bb8647df41840d6f32f4409fa8959bcf9f 6e2b6000e5fe808954a7dcef8225b5b7f2c1b9e9 2024-07-30T15:58:57+03:00 Georgi Gerganov flake.lock: Update (#8729)
439b3fc75a8deb42899ac47a8f52aae75e0339fe 0832de723695ab400316a6c49b9f712380e3a731 2024-07-29T20:56:12+08:00 R0CKSTAR cuda : organize vendor-specific headers into vendors directory (#8746)
6eeaeba126ff701f3e8f79f246805b7023709972 4730faca618ff9cee0780580145e3cbe86f24876 2024-07-28T22:32:44+02:00 Johannes Gäßler cmake: use 1 more thread for non-ggml in CI (#8740)
4c676c85e59ef8f771f3a129e6eb217552139231 e54c35e4fb5777c76316a50671640e6e144c9538 2024-07-28T00:42:05-04:00 compilade llama : refactor session file management (#8699)
e54c35e4fb5777c76316a50671640e6e144c9538 5e2727fe0321c38d1664d26173c654fa1801dc5f 2024-07-28T07:41:25+08:00 R0CKSTAR feat: Support Moore Threads GPU (#8383)
45f2c19cc57286eead7b232ce8028273a817aa4d 22f281aa16f44d8f6ec2c180a0685ff27e04e714 2024-07-21T16:45:10+03:00 Georgi Gerganov flake.lock: Update (#8610)
22f281aa16f44d8f6ec2c180a0685ff27e04e714 328884f4219c0228673cf1870ac63987fb4f9fd0 2024-07-20T22:09:17-04:00 M-A examples : Rewrite pydantic_models_to_grammar_examples.py (#8493)
69c487f4ed57bb4d4514a1b7ff12608d5a8e7ef0 07283b1a90e1320aae4762c7e03c879043910252 2024-07-20T22:25:26+02:00 Johannes Gäßler CUDA: MMQ code deduplication + iquant support (#8495)
87e397d00bdcedd5cbf6dfda06a7b0f302462728 57b1d4f9eb6f2c139b31ea79626d954b261e1051 2024-07-19T17:17:27+02:00 slaren ggml : fix quant dot product with odd number of blocks (#8549)
7acfd4e8d55082c1b597dfc3ffe04fb5d530c6dc 97bdd26eee11fe109dec00de75690ceef61c03f2 2024-07-15T23:13:10-04:00 compilade convert_hf : faster lazy safetensors (#8482)
f17f39ff9cb71fa7b0eda0c649bb0ce9b2d8a6b8 9104bc20edf47f74dc49379b7d61d0c6e85a4882 2024-07-15T08:04:56-04:00 M-A server: update README.md with llama-server --help output [no ci] (#8472)
aaab2419eaa17ab3aa38f4ba49c7eea406999e99 73cf442e7bc9baca7b3e213b261551812f1676c9 2024-07-14T18:54:02+03:00 Georgi Gerganov flake.lock: Update (#8475)
278d0e18469aacf505be18ce790a63c7cc31be26 dd07a123b79f9bd9e8a4ba0447427b3083e9347a 2024-07-10T20:08:17-04:00 Clint Herron Initialize default slot sampling parameters from the global context. (#8418)
0f1a39f3439825acf7e3a1663566d410be152170 83321c6958acf20747d288031174cc1bf8816e33 2024-07-10T07:14:51-05:00 Dibakar Gope ggml : add AArch64 optimized GEMV and GEMM Q4 kernels (#5780)
7fdb6f73e35605c8dbc39e9f19cd9ed84dbc87f2 a130eccef42b75a84da270411cefeed45c153e30 2024-07-09T01:36:38+03:00 Georgi Gerganov flake.lock: Update (#8342)
470939d483d1c89b7292f78bac1fd27c42c171ce 6f0dbf6ab087bcd286fb78560099ca0458316735 2024-07-08T03:26:53-04:00 Kevin Wang common : preallocate sampling token data vector (#8363)
cb4d86c4d723af87d3d7e3177e9485f200391384 86e7299ef5dff0f388922dc6fcbce009e99d8005 2024-07-07T11:10:38+02:00 Bjarke Viksøe server: Retrieve prompt template in /props (#8337)
213701b51a17175d0d326b566efc03f30ec7fbe6 be20e7f49d9e5c6d9e8d9b4871eeba3df7a1639d 2024-07-05T19:01:35+02:00 jaime-m-p Detokenizer fixes (#8039)
d0a7145ba99ed3a8bc3145aa785b5c86ffe65020 9ef07800622e4c371605f9419864d15667c3558f 2024-07-01T02:09:34+03:00 Georgi Gerganov flake.lock: Update (#8218)
ab3679112d4c49a215a3d31550a7720b202e9015 97877eb10bd8e7f8023420b5b5300bcbdadd62dc 2024-06-27T18:37:29+03:00 Georgi Gerganov flake.lock: Update (#8071)
9b31a40c6ddabe552875b811d7127aa039ca9703 c70d117c37cc7876e775d1e2722208a50c52edb3 2024-06-27T01:50:09+02:00 Daniel Bevenius clip : suppress unused variable warnings (#8105)
e6bf007744eb06336a231ef39cf08146dd16d2ce 84631fe1504de40427dc4b4cdac92fa7ebf65955 2024-06-25T21:07:28+02:00 Daniel Bevenius llama : return nullptr from llama_grammar_init (#8093)
3791ad219323389106dc3fd80814eb5bbb7b80de f702a90e245499283d6de0b287701c723cda2a87 2024-06-25T16:57:35+05:30 HanishKVC SimpleChat v3.1: Boolean chat request options in Settings UI, cache_prompt (#7950)
95f57bb5d5b18ef0beb2702a0d6c06e46804075c e112b610a1a75cb7fa8351e1a933e2e7a755a5ce 2024-06-24T03:07:59+02:00 slaren ggml : remove ggml_task_type and GGML_PERF (#8017)
e112b610a1a75cb7fa8351e1a933e2e7a755a5ce 6a2f298bd784403c5c33eebb822217ec5d9b5590 2024-06-24T02:27:57+08:00 Eddie-Wang llama : add support for BitnetForCausalLM (#7931)
b6b9a8e606da7764bd3649c2ea574979c85abd43 45c0e2e4c1268c2d7c8c45536f15e3c9a731ecdc 2024-06-23T13:14:45+02:00 slaren fix CI failures (#8066)
ba5899315283eb1df3902363daf79bdc5eefe426 a7854743c5e6216a6178824a603aa9479728ddd5 2024-06-19T23:57:10Z sasha0552 server : fix smart slot selection (#8020)
9c77ec1d74874ee22bdef8f110e8e8d41389abf2 a04a953cab583f0229e7b4b506346e3e9a85c8d0 2024-06-19T15:04:15+02:00 slaren ggml : synchronize threads using barriers (#7993)
6a2f0b3474d479bda4ac2ee7cfd5dcdcf0be1f79 21be9cab94e0b5b53cb6edeeebf8c8c799baad03 2024-06-17T16:10:15+02:00 Markus Tavenrath Implement non-mapped async IO for CUDA on Windows. (#7896)
bc6c457fa35f6791e9a2bb61108e7d49e8fc98bd 52399254b3bceda279b4ea9111a983e32310166e 2024-06-16T19:16:21+03:00 Georgi Gerganov flake.lock: Update (#7951)
cddaf028adc738b5a7ecc60809cb78e0ba0f97c1 c8a82194a888f68f259e0d0fa96f3332ac7c5cb6 2024-06-16T14:50:12+03:00 Georgi Gerganov ggml : fix handling of zero blocks in IQ quants (#7955)
0c7b3595b9e5ad2355818e259f06b0dc3f0065b3 7b2f4a7d193ef2475259bbe7656fcccfab4b1217 2024-06-15T18:53:40+02:00 Xuan Son Nguyen Add `cvector-generator` example (#7514)
76d66ee0be91e2bec93206e821ee1db8d023cff5 66ef1ceedf983773c8ceb4d925285d41d4e50e2a 2024-06-14T18:41:49+02:00 Johannes Gäßler CUDA: faster q2_K, q3_K MMQ + int8 tensor cores (#7921)
f578b86b2123d0f92afbaa98a031df4d4464e582 1c641e6aac5c18b964e7b32d9dbbb4bf5301d0d7 2024-06-13T03:11:35+02:00 slaren move BLAS to a separate backend (#6210)
10ceba354a3b152ff425e9fa97f9caaef99a46b1 e95beeb1fc4621826ddd616776dbdf717366bf5c 2024-06-10T02:04:50+03:00 Georgi Gerganov flake.lock: Update (#7838)
7a16ce7db2a74a223f0f3b9cee66d4539c5bce8f da799b41891e34aac86ce4e173f9c4c0afd4fab3 2024-06-08T07:50:31Z sasha0552 server : smart slot selection using Longest Common Prefix (#7728)
27615f5ab21060d96953c9c1e223051ab2188f57 7027b27d765db95d4ac6b569d976e387a8715881 2024-06-07T05:15:07-07:00 intelmatt cmake : fix BUILD_SHARED_LIBS=ON build (#7784)
ee459f40f65810a810151b24eba5b8bd174ceffe f83351f9a62a6262f1fc3d08f320033089cddfb5 2024-06-06T19:19:59+03:00 Georgi Gerganov server : fix --threads-http arg (#7801)
ad675e1c67a05b16e4e12abe30dbecfc808e7b7e a143c04375828b1f72eb1a326115791b63e79345 2024-06-06T06:08:52-07:00 Clint Herron Added support for . (any character) token in grammar engine. (#6467)
9973e81c5ccf4f31b3980f5aa73f5cfea8699860 c90dbe026b456a233f8f0fbe752212e6a0503ca2 2024-06-04T23:40:49-07:00 arch-btw readme : remove -ins (#7759)
6d1616944d9efd342ed2a4fd318722adfc9febcd bde7cd3cd949c1a85d3a199498ac98e78039d46f 2024-06-04T10:01:09+03:00 Georgi Gerganov ggml : prevent builds with -ffinite-math-only (#7726)
a5735e4426b19a3ebd0c653ad8ac01420458ee95 0b832d53ba0ffcc759c8d62ede3772dd62321f8e 2024-06-04T00:14:15+09:00 Masaya, Kato ggml : use OpenMP as a thread pool (#7606)
6f28a333c1e3fdfdc7b4f9d0367f2b41a9b7e9d4 549279d8049d78620a2b081e26edb654f83c3bbd 2024-06-03T15:49:30+08:00 zhangkaihuo llama : MiniCPM support tied embeddings (#7664)
1669810d7c2446af8425aa54ff6611bf6f14646c 7c4e5b7eae26581869e782015d9deca947c34997 2024-06-03T00:13:12+03:00 Georgi Gerganov flake.lock: Update (#7686)
2ac95c9d5678d05e253691fb1f26471675bff5ad 750f60c03e4d3f53fa51910551ce87a3d508d2d7 2024-06-01T21:50:18+05:30 HanishKVC SimpleChat: Simple histogram/repeatMatching driven garbageTrimming, Settings UI, Streaming mode, OpenAi Compat (Model, Authorization Bearer), Save/Restore session, Auto Settings UI (#7548)
972b555ab935705f3437abd5909a5c46852811f6 3854c9d07f67de7f8cd6d86117bfaef47549b05a 2024-05-30T09:52:39+02:00 Johannes Gäßler README: explain parallel build [no ci] (#7618)
87bdf2a199acd62e19814d7a4d0500a04a7f09f3 00281b7be32462754618c42ed93f95743af46627 2024-05-29T13:36:39+02:00 slaren ggml : use atomic_flag for critical section (#7598)
ee3dff6b8e39bb8c1cdea1782a7b95ef0118f970 edc29433fa08b4e5aeb67649a29fc7713af13d04 2024-05-28T17:07:05+02:00 fairydreaming Add support for DeepseekV2ForCausalLM (#7519)
c41767154eb82aa3fe7568fc816c3402b78eae94 74b239b3d5f067470d7ef5e26e2e059720572e32 2024-05-28T00:41:14-04:00 Nathan Epstein Markdownish code block fix (#7571)
dff451cfa1f297348751ce6b538670e1ae9a7d5b d298382ad977ec89c8de7b57459b9d7965d2c272 2024-05-26T18:54:56+03:00 Georgi Gerganov flake.lock: Update (#7540)
d041d2ceaaf50e058622d92921b3e680ffa4e9e7 27891f6db03de6e3fd5941983838c29bef253352 2024-05-24T18:59:06+03:00 Georgi Gerganov flake.lock: Update (#7232)
fbca2f27fc7fa9aa4a8ad0357478fdb908472908 0df0aa8e43c3378975269a51f9b876c8692e70da 2024-05-24T14:31:13+02:00 fairydreaming Add support for ArcticForCausalLM (#7020)
3015851c5ac7334fb544a23a70a284c117b87044 55ac3b7aeaf52f19786ed96e885d89521fc0f6c8 2024-05-23T14:29:26+02:00 Daniel Bevenius llama : add getters for n_threads/n_threads_batch (#7464)
1e374365d170b7f692fd7753c145e21bc14486c8 197ff91462dd05bb9a3be03578114abf0c355536 2024-05-22T23:23:21+05:30 HanishKVC SimpleChat: a simple and dumb web front end for testing /chat/completions and /completions end points and try chat (#7350)
3bc10cb485dd7efa4da6c64e73ad0c9e2bfe0821 6bf9b66fa3f263ca2175dcb5f6d0a658581e1dfb 2024-05-20T15:10:03+03:00 Georgi Gerganov server : fix temperature + disable some tests (#7409)
cb42c294279bc4a0a4e926a7b5a5568049f12fa7 d233b507cd19fcc2d8d8963ecc6a3eb7a33f2ecc 2024-05-18T11:10:47+02:00 Johannes Gäßler server: correct --threads documentation [no ci] (#7362)
d273c1402b25086fd91aef2467ac13f2e49fa0ea 27b040691cbe45314147c2745e891a38e9c048d4 2024-05-17T15:11:45+03:00 Aarni Koskela py : convert-hf-to-gguf-update improvements (#7340)
e1b40ac3b94824d761b5e26ea1bc5692706029d9 dc020985b8755dd6aa93a2f002f43c3ede808cce 2024-05-15T12:59:12-05:00 kunnis ggml : use dynamic thread scheduling for matrix multiplication (#6915)
f308ea705974dff62a1fe5367d776ad9d5109239 c3c88f296a72432edb697ac8026dbf2ec18f2b21 2024-05-13T11:01:07+03:00 Georgi Gerganov metal : tune soft_max number of threads (whisper/0)
541600201e6480f54ae09e58d16b154d4b4b331d efc8f767c8c8c749a245dd96ad4e2f37c164b54c 2024-05-14T09:33:42+02:00 slaren llama : disable pipeline parallelism with nkvo (#7265)
988631335a20d06497f58be0b8ba13adb4323a22 f99e1e456eaf69cc38c1982a2693ce41c0f897ef 2024-05-11T04:13:02-04:00 Steve Grubb server : free llama_batch on exit (#7212)
bc4bba364fb96d908f2698e908648df5e6f55e02 c12452c7aec8a02264afc00196a13caa591a13ac 2024-05-08T21:55:49+01:00 agray3 Introduction of CUDA Graphs to LLama.cpp (#6766)
b3a995b416e13ae3123a117a743e11d0ede0ca4c bcdee0daa7c5e8e086b719e5eb4073b00df70e01 2024-05-06T18:36:06+03:00 Georgi Gerganov flake.lock: Update (#7079)
9c67c2773d4b706cf71d70ecf4aa180b62501960 952d03dbead16e4dbdd1d3458486340673cc2465 2024-04-30T12:16:08+03:00 Georgi Gerganov ggml : add Flash Attention (#5021)
b8c1476e44cc1f3a1811613f65251cf779067636 5539e6fdd1b97e0c37c54d34df67f334fc344a26 2024-04-29T14:40:14-04:00 Clint Herron Extending grammar integration tests (#6644)
6e472f58e40cd4acf6023e15c75a2700535c5f0b 4dba7e8114d84241c842b986e008af8b88d1a019 2024-04-28T00:18:27Z github-actions[bot] flake.lock: Update
7d641c26ac73956a54b204cabefe85c764823678 5790c8dac1a4f0aa80b4efee3b962d8c04c829e8 2024-04-26T09:26:59+02:00 Pierrick Hymbert ci: fix concurrency for pull_request_target (#6917)
28103f4832e301a9c84d44ff0df9d75d46ab6c76 c0d1b3e03e27634ac2871761f5033cf9324d472d 2024-04-24T11:08:36+02:00 Johannes Gäßler Server: fix seed for multiple slots (#6835)
e9b4a1bf68c18beff4e33f23ea62c1245b296915 5cf5e7d490dfdd2e70bface2d35dfd14aa44b4fb 2024-04-21T00:17:47Z github-actions[bot] flake.lock: Update
8cc91dc63c0df397d644a581b2cbeea74eb51ae0 dbceec87c0221ec952e69448df6a71f1372a7487 2024-04-16T14:55:30-04:00 Justine Tunney ggml : add llamafile sgemm (#6414)
f184dd920852d6d372b754f871ee06cfe6f977ad 422c2aff1c9735853c9d8f5162104e41a364adc4 2024-04-14T16:55:30+03:00 Georgi Gerganov flake.lock: Update (#6669)
b804b1ef77351d2a11be945462c6c251710476cb 8228b66dbc16290c5cbd70e80ab47c068e2569d8 2024-04-11T14:51:07+02:00 Pierrick Hymbert eval-callback: Example how to use eval callback for debugging (#6576)
5dc9dd7152dedc6046b646855585bd070c91e8c8 e11a8999b5690f810c2c99c14347f0834e68c524 2024-04-09T09:16:13+01:00 Carolinabanana llama : add Command R Plus support (#6491)
beea6e1b16e783a0886e78dec01002a8c00db24d 87fb5b4234d4b9c56ac94cf7aa229c8fd7defdb0 2024-04-08T20:43:30+08:00 Jan Boon llama : save and restore kv cache for single seq id (#6341)
b909236c0bf0b6e872af95df9490492ecec310ac e0717e751e12af13f4eedaae8bbbd608e40d7e54 2024-04-07T21:25:30+03:00 Georgi Gerganov flake.lock: Update (#6517)
8120efee1d9931b514aeb5a047209d576f23286c a74401f0e5ebb15fa4d8b6619d1baa6ea9179123 2024-04-04T16:59:04+02:00 Pierrick Hymbert ci: bench fix concurrency for workflow trigger dispatch with sha1 (#6478)
7a2c92637ae265654a68f62e6a7610b358255d3f 4bcd6b959ca3991084ad1d8464caf2a734e29b1d 2024-04-04T11:57:58+02:00 Pierrick Hymbert ci: bench: add more ftype, fix triggers and bot comment (#6466)
08a0c0206075556e82aca0feafad530dcc5f1426 52604860f93063ef98863921da697576af1c7665 2024-04-03T15:07:05+02:00 slaren ggml : mul_mat_id use the same tensor for all the experts (#6387)
f87f7b898651339fe173ddf016ca826163e899d8 33a52448061cfd2ea44da9e6cb30b2ec22e2f6d0 2024-04-01T19:05:57+03:00 Georgi Gerganov flake.lock: Update (#6402)
b75c38166cf0c66793a32d5c3d6cb69929dd083d bfe7dafc9cf96b9a09ead347fed9a547930fc631 2024-03-29T08:15:00+01:00 Pedro Cuenca convert : allow conversion of Mistral HF models (#6144)
6902cb7f2e3479f364ee177118200fb7e4e9fc92 d2d8f389960a106b66313ff1621bdb1aaaaaa285 2024-03-28T16:50:48+08:00 Eric Zhang server : stop gracefully on SIGTERM (#6348)
557410b8f06380560155ac7fcb8316d71ddc9837 55c1b2a3bbd470e9e2a3a0618b92cf64a885f806 2024-03-26T10:46:41-04:00 compilade llama : greatly reduce output buffer memory usage (#6122)
55c1b2a3bbd470e9e2a3a0618b92cf64a885f806 e097633f63fdd26d492844f7eff056e4083fd9eb 2024-03-26T15:21:27+01:00 Kawrakow IQ1_M: 1.75 bpw quantization (#6302)
43139cc528909c3de8c144ed174e09a1f7912a80 2f34b865b62b1d2b5eb8a27885e4de220deeacbd 2024-03-25T17:22:27+02:00 Georgi Gerganov flake.lock: Update (#6266)
f482bb2e4920e544651fb832f2e0bcb4d2ff69ab 1997577d5e121568ae39f538021733ccd4278c23 2024-03-23T18:07:00+01:00 Pierrick Hymbert common: llama_load_model_from_url split support (#6192)
1997577d5e121568ae39f538021733ccd4278c23 476b0251b27fb64c575507024a671e639d675594 2024-03-23T18:00:38+01:00 Pierrick Hymbert server: docs: `--threads` and `--threads`, `--ubatch-size`, `--log-disable` (#6254)
ee804f6223777019cf921e0d99cc24669313ab98 80bd33bc2c4be352697dc8473339f25e1085d117 2024-03-23T02:15:06+09:00 Minsoo Cheong ci: apply concurrency limit for github workflows (#6243)
be07a03217376c53b1d95e5f658adbbbb2831555 d0a71233fbf8ade8ef06ad8e6b81d1d7b254895f 2024-03-22T06:41:24+08:00 Jan Boon server : update readme doc from `slot_id` to `id_slot` (#6213)
2d15886bb092c3b780c676b5cc57ff3337af9c83 d199ca79f279e84ebe27caafe0aa59c461d88969 2024-03-17T06:37:44Z github-actions[bot] flake.lock: Update
dc0f6125487dcfbff913360f9d877bc0ccf6aa57 c47cf414efafb8f60596edc7edb5a2d68065e992 2024-03-18T01:12:22+08:00 GainLee ggml:fix finding transfer queue family index error (#6094)
12247f4c69a173b9482f68aaa174ec37fc909ccf 4e9a7f7f7fb6acbddd1462909c8d696e38edbfcc 2024-03-15T16:41:22-04:00 Andrew Canis llama : add Command-R support (#6033)
f30ea47a87ed4446ad55adb265755dc9102956a2 d8fd0ccf6ac8b07791ffd1575eed436930854ae3 2024-03-13T18:54:21+01:00 slaren llama : add pipeline parallelism support (#6017)
8030da7afea2d89f997aeadbd14183d399a017b9 184215e783dfad76aded2c68244c327a5c507df5 2024-03-12T14:27:20+02:00 Georgi Gerganov ggml : reuse quantum structs across backends (#5943)
05b06210c954491cf0f12034b0a62bd4d69ce78b 83796e62bc9f6caae6228168e359890f51e60fee 2024-03-11T17:49:47+02:00 Georgi Gerganov llama : more consistent names of count variables (#5994)
caa106d4e05a0ab94225c220b81f9e2cd522339b 3202361c5b1ba15e695b31209567ef42c22c5c32 2024-03-11T10:56:41+01:00 Xuan Son Nguyen Server: format error to json (#5961)
be858f620508385ad12d0e5e862010e666ca729c ef3ced26a3817d92890b97b83acaeb018ade02d0 2024-03-11T07:51:49+01:00 Kawrakow Better 1.5 bit quantization (#5971)
fa8a809a9119411bc9c3f00026550d0343f4d9b7 bcebd7dbf62fd7b293d5ed089023e4e733269c71 2024-03-10T18:17:47+01:00 Pierrick Hymbert server: ci: windows build and tests (#5968)
c78541479cf835dd9eb568ccd9a2083198a7203d 621e86b331f8b0e71f79fd82a4ae1cd54c3e4396 2024-03-10T16:43:08+02:00 Georgi Gerganov nix: update flake.lock (#5969)
d894f352bf433157232dc8dc54eacd50014e898e 098dbaab449f5309a54871ba7e5acef72ae696de 2024-03-09T19:55:54+01:00 slaren perplexity : support using multiple sequences to allow larger batch sizes (#5946)
c2101a2e909ac7c08976d414e64e96c90ee5fa9e 515f7d0d4fce41c752fc253acf30707c3be2531e 2024-03-08T17:31:00-05:00 compilade llama : support Mamba Selective State Space Models (#5328)
2002bc96bf2cbf5ab981a17d7e994d817c9801f5 ceca1aef0738b57951cd12c603c3477e75312dec 2024-03-07T11:41:53+02:00 Georgi Gerganov server : refactor (#5882)
21b08674331e1ea1b599f17c5ca91f0ed173be31 6a87ac3a52668e117d97bcea07b529c93188b303 2024-03-05T16:08:35+08:00 Neo Zhang Jianyu [SYCL] fix mul_mat fault in CI/unit-test (#5862)
67be2ce1015d070b3b2cd488bcb041eefb61de72 231ae28f078c3148d097b301f2145f1e3e816cc1 2024-03-03T14:26:18+01:00 slaren cuda : fix data race in soft max (#5853)
8ef969afcec1645d2d9c3ab1fc82263bba968989 fa974646e1a2024fc7dc9e6f27cf1f2f5d4a3763 2024-03-03T08:48:36+01:00 Pierrick Hymbert server : init http requests thread pool with --parallel if set (#5836)
fa974646e1a2024fc7dc9e6f27cf1f2f5d4a3763 9731134296af3a6839cd682e51d9c2109a871de5 2024-03-03T06:11:31+02:00 Georgi Gerganov flake.lock: Update (#5842)
bbde6eb2561153aabbdfac5001c690fe00cad639 ef2cd694c4155fbf25bae61c5178c47eb3676dba 2024-03-02T17:00:51+02:00 Kawrakow ggml : IQ3_S improvements (#5829)
c29af7e2252d288f2ea58a7d437c1cb7c0abf160 38d16b142624bdd7c41d9955752b7f7b59c5e048 2024-03-02T01:00:46+05:30 Sourab Mangrulkar llama : add StarCoder2 support (#5795)
5cb02b4a012bb16c6c699c0c62c05ffa653eee0f 6ea0f010ff6967034528d9e0b8330b9b0f0b7c13 2024-03-01T10:08:08+01:00 Pierrick Hymbert server: allow to override threads server pool with --threads-http (#5794)
5f706718566e3a5147916dc381f3b99de0ffad47 a693bea1e6762a17b78b6ddf4611e54136941ea2 2024-02-24T11:27:36-05:00 UEXTM.com Introduce backend GUIDs (ggml/743)
a693bea1e6762a17b78b6ddf4611e54136941ea2 adcb12a9bad87bc96f2f158c95892b3d04aa7ffb 2024-02-28T09:55:37+01:00 Xuan Son Nguyen server : hit Ctrl+C twice to exit (#5734)
7c4263d4261d6ee6f0539d53eb9e1b4d120ba8af cb49e0f8c906e5da49e9f6d64a57742a9a241c6a 2024-02-28T10:37:02+02:00 Kawrakow ggml : make i-quants work with super-blocks of 64 (CPU,Metal) (#5760)
0becb22ac05b6542bd9d5f2235691aa1d3d4d307 c24a2a6e6005e5d424301525a42ba45a4a362d30 2024-02-27T16:34:24+02:00 Kawrakow IQ4_XS: a 4.25 bpw quantization (#5747)
c39373398803c669056304090050fe3f44b41bf9 e3965cf35aac00d4e24998c8a3d0093ae1d98bd3 2024-02-25T00:17:11Z github-actions[bot] flake.lock: Update
930b1780269a69948d106e2d1b838ab7661f679a d52d7819b8ced70c642a88a59da8c78208dc58ec 2024-02-25T13:50:32+01:00 Pierrick Hymbert server: logs - unified format and --log-format option (#5700)
d52d7819b8ced70c642a88a59da8c78208dc58ec 12894088170f62e4cad4f8d6a3043c185b414bab 2024-02-25T13:49:43+01:00 Pierrick Hymbert server: concurrency fix + monitoring - add /metrics prometheus compatible endpoint (#5708)
9e359a4f47c1b2dceb99e29706c9f7403d32ab5e 4c4cb30736582cacb1a164a9d4bc8e17b1014be7 2024-02-24T19:16:04+01:00 Pierrick Hymbert server: continue to update other slots on embedding concurrent request (#5699)
4c4cb30736582cacb1a164a9d4bc8e17b1014be7 525213d2f5da1eaf4b922b6b792cb52b2c613368 2024-02-24T16:23:52+02:00 Kawrakow IQ3_S: a much better alternative to Q3_K (#5676)
525213d2f5da1eaf4b922b6b792cb52b2c613368 fd43d66f46ee3b5345fb8a74a252d86ccd34a409 2024-02-24T12:28:55+01:00 Pierrick Hymbert server: init functional tests (#5566)
1ecea255ebb70750b52688393f37a63606b90e3f a00a35cef93e057eace8351a667d14d152a91ebc 2024-02-21T15:47:48+01:00 Pierrick Hymbert server: health: fix race condition on slots data using tasks queue (#5634)
a14679cc30c785e75d38028bae6ec39c6209ddef 6560bed3f066c876682464762cad90f1e28e3f1b 2024-02-21T11:39:52+02:00 Kawrakow IQ4_NL: 4-bit non-linear quants with blocks of 32 (#5590)
c0a8c6db371cb3e4379900867b948879f5842201 b9111bd209c7b11b0592450a6ed2e0ca545b2c84 2024-02-20T08:48:19+01:00 Pierrick Hymbert server : health endpoint configurable failure on no slot (#5594)
f0d1fafc029a056cd765bdae58dcaa12312e9879 a0c2dad9d43456c677e205c6240a5f8afb0121ac 2024-02-18T23:38:32-08:00 bmwl ggml : android and old glibc NUMA incompatibility bugfixes (#5557)
c145f8a132b2fe1d1e65987faddbd9a40bef7a12 689a091bbe0537ee9abff3e15a1d74f5f3561165 2024-02-18T18:39:57+01:00 Pierrick Hymbert server : slots monitoring endpoint (#5550)
e75c6279d1c8e7abb82a331f5de7124eed402de2 36376abe05a12a8cb3af548a4af9b8d0e2e69597 2024-02-18T17:31:28+01:00 Pierrick Hymbert server : enhanced health endpoint (#5548)
66c1968f7a2e895675425e875b6589f1233a1b52 1dcc3fde004787e6fc4d84c9de0bb34cd2901a3e 2024-02-18T08:23:16-08:00 Daniel Hiltgen server : graceful server shutdown (#5244)
c8e0d7efeb7634ecc2e9832e879ab9fca4510e71 8f1be0d42f23016cb6819dbae01126699c4bd9bc 2024-02-18T00:17:07Z github-actions[bot] flake.lock: Update
f486f6e1e5e9d01603d9325ab3e05f1edb362a95 60ed04cf82dc91ade725dd7ad53f0ee81f76eccf 2024-02-16T01:31:07-08:00 bmwl ggml : add numa options (#5377)
0d4177126b0556e202efb85bf3f768be81076400 7930a8a6e89a04c77c51e3ae5dc1cd8e845b6b8f 2024-02-15T09:01:57+01:00 Elbios llava : fix memory management bug (#5491)
cf45252a7cfcb998bade46a886e20477cecc538a 03bf161eb6dea6400ee49c6dc6b69bdcfa9fd3fc 2024-02-13T15:14:22+02:00 Georgi Gerganov tests : multi-thread the tokenizer tests (#5474)
97a336507ed9b971d72262bec7e2b8b7016a054a c88c74f967028ae3d5ebade40ae586d20a961abc 2024-02-11T00:17:31Z github-actions[bot] flake.lock: Update
f026f8120f97090d34a52b3dc023c82e0ede3f7d cd9aea63b577a83def84dbd6dcd90a6fa02af745 2024-02-10T02:53:28-08:00 Ian Bull metal : use autoreleasepool to avoid memory leaks (#5437)
4b7b38bef5addbd31f453871d79647fbae6bec8a e00d2a62dd1441e3b089570ec06d05c18800d368 2024-02-10T05:30:19+11:00 Neuman Vong vulkan: Set limit for task concurrency (#5427)
e5ca3937c685d6e012ac4db40555d6ec100ff03c e4124c24775f2cb5b3d7acc93bf9dc5471c172ef 2024-02-09T10:48:06Z Paul Tsochantaris llama : do not cap thread count when MoE on CPU (#5419)
f3e2b4fa3f81a410ecb7dec929c259ef8d8dbb7d f68664ac241a6b5c233d8f1051eef20929b06008 2024-02-07T01:15:19-05:00 Justin Parker server : update `/props` with "total_slots" value (#5373)
8a79c591de9b7ff3242a94f68b7fb5a17ed8c2be 31e790322133a4b1d0684527ea446e765e8a96cf 2024-02-06T04:20:59-05:00 Justin Parker server : include total "num_slots" in props endpoint (#5349)
4ffc7a17d4e80c5f3f905139cb570ed9b6934fcb 906cff55c2848fda091d888a1585915ec0c9ea9e 2024-02-06T08:16:23Z Niall Coates server : various fixes for the prompt field in /completion (#5300)
6fdfa2ecc684000a25a4ad91823bc82a6652b645 a2d60c9158435ae9a6f14632f07f1acf7a3becef 2024-02-05T10:46:06+02:00 Kawrakow iq2_xxs: tune quantization (#5320)
9392ebd49ea5ae236a55b47cbf6a13247e8a3b8c 5ed26e1fc9fab4ce96ecf2d84183fe45bdcab0d4 2024-02-04T00:17:24Z github-actions[bot] flake.lock: Update
e920ed393d989ed35625ddaf182ebb52cda07fcd 52bb63c7082c859c3f1dfc527227e6a95b299c7c 2024-02-03T18:15:00+01:00 0cc4m Vulkan Intel Fixes, Optimizations and Debugging Flags (#5301)
15606309a05ccf7fadbaad5538cb7c32acb1e06b b2b9f025e7821e78bd501d75d01838c26de07a57 2024-01-31T21:10:15+08:00 JidongZhang-THU llava : add MobileVLM support (#5132)
dabcc5b471348e4ae03ddacc41e19ad75fb2f041 f8e9140cb46eebaa867e1184a9946e4840eec772 2024-01-31T13:43:03+01:00 slaren ggml : limit n_threads to the max n_tasks (#5238)
2aed77eb06a329f0d82bb1c467f4244904d4073f c82d18e863fcde91b4b1109b1d0c73ea4470c405 2024-01-29T15:45:41+01:00 divinity76 fix typo "RLIMIT_MLOCK" (#5175)
2307523d322af762ae06648b29ec5a9eb1c73032 0f648573dde61c510560f68244f70ece7e60d8c1 2024-01-28T18:03:59+01:00 0cc4m ggml : add Vulkan backend (#2059)
0f648573dde61c510560f68244f70ece7e60d8c1 b764b8f1d079ba44d912801ce6d29bd0d94d51cf 2024-01-28T21:26:23+05:30 Abhilash Majumder ggml : add unified SYCL backend for Intel GPUs (#2690)
b764b8f1d079ba44d912801ce6d29bd0d94d51cf 9241c3a2ace544aef708334e54bbdddb90208ee8 2024-01-28T16:54:54+02:00 Georgi Gerganov flake.lock: Update (#5162)
b2b2bf988c098851b4f3831f0cf38394bff75121 af4980bfedfd8df43b9e4cd1442895e85fee37bc 2024-01-28T09:35:14+01:00 Johannes Gäßler Tests for min_p, sampling queue (#5147)
7032f4f6349c17a8352f9f93f7d2122f45469e59 5f1925a8cef81eb9b372faaae34b0dd76d5361d4 2024-01-26T11:17:59-06:00 snadampal ggml : update softmax n_task calculation (#5126)
48c857aa10aea73210a4a72da3f1a6f99269e75d 413e7b0559f922bd4de5e9eec548829d111651b1 2024-01-26T13:42:20+01:00 Xuan Son Nguyen server : refactored the task processing logic (#5065)
5eaf9964fc797d4585c214db32a463d557f3ed33 d292f4f2047963f558dd516f1baaa71793e9acf2 2024-01-26T05:06:22+09:00 l3utterfly llama : dynamic temperature sampling (#4972)
bf63d695b804b1c995c7ae4427a8a86936ea6d25 1387ea21178f9f154944013d4dd9764b54c69deb 2024-01-22T03:17:05-07:00 Michael Hueschen nix: add cc to devShell LD_LIBRARY_PATH
780e24a22eb595b705cbe8284771e9ceff1c4dd2 3ce7e8f8e7ccfce07e5947ac5f1f3f4628cf68ea 2024-01-22T21:15:08+08:00 Reinforce-II ggml : parallelize FP32 conversion when using BLAS (#5045)
f7276f7500f7ea588836dd1fc6f126334c517878 15bceec2d73d4166340b46b27677c45ac1b4cdad 2024-01-13T17:10:19Z Someone Serge workflows: nix-ci: rebuild on flake.lock updates
7dcbe39d36b76389f6c5cd3b151928472b7e22ff 726c0fa9a2da976e9c5d5c51e185d9dd453fc9e5 2024-01-21T14:42:44+02:00 Kawrakow Add ability to evauate multiple choice tasks (#5047)
942c0107a7301434c0a5e7da46bc4cf2393aa556 b43ebde3b0ccbc42d9dd782b32e2fd8eb35b43b5 2024-01-21T05:17:27+02:00 Georgi Gerganov flake.lock: Update (#5054)
7051aacfac0057fa5fac9ea46c55bffc3892d810 2b3b999cacc7ad1207c32fbdf3479a19c06e1a34 2024-01-19T11:39:11+02:00 Kawrakow winogrande: evaluate log-probs in parallel (#5036)
821f0a271e7c9ee737945245dd7abfa22cc9b5b0 96d7f56d2918ffde1995dbb32392571deb76d7fc 2024-01-18T21:33:05+01:00 Xuan Son Nguyen server : defer tasks when "slot unavailable" (#5018)
96d7f56d2918ffde1995dbb32392571deb76d7fc 2d5419d08ab1131623e6a1d554607b7663435e87 2024-01-18T21:12:15+01:00 slaren llama : fix mlock with no-mmap with Metal (#5025)
3e945cc1e9c06d2001031360e4e303e9548fb02c ad19812cda4062c9f154ef16315df41fbe6a770a 2024-01-18T19:18:21+02:00 Kawrakow HellaSwag: speed up by parallelizing log-prob evaluation (#5020)
ad19812cda4062c9f154ef16315df41fbe6a770a 682986a08eb5cb04865d2e713449f17304d266d8 2024-01-18T15:33:01+02:00 Georgi Gerganov perplexity : faster HellaSwag via batching (#5017)
4feb4b33eeb1756e46084a4db9230b279af1a480 959ef0c0df725c013c7f712eaa7790b8e38a8e20 2024-01-16T18:41:42+01:00 Maximilian Winter examples : add complete parallel function calling example (#4974)
c37b3474e61d609d43cccc3bde5d559e80e4f5d1 158f8c9e21302114bac3c646f80ea85b52ffa0bd 2024-01-16T19:13:54+02:00 Georgi Gerganov flake.lock: update flake-parts, flake-parts/nixpkgs-lib, and nixpkgs (#4920)
158f8c9e21302114bac3c646f80ea85b52ffa0bd 862f5e41ab1fdf12d6f59455aad3f5dd8258f805 2024-01-16T17:05:19Z Paul Tsochantaris metal : localized logic in `ggml_metal_graph_compute` (#4924)
3a48d558a69c88ac17efcaa5900cd9eb19596ac4 7c8d3abd1a17c28fc56b1a4814bc4b29f91d7454 2024-01-16T14:41:27+01:00 Alex Azarov metal : replace loop of dispatch_async with dispatch_apply (#4934)
e0324285a569d0583cf2f4a07a2402221ee25f58 3e5ca7931c68152e4ec18d126e9c832dd84914c8 2024-01-16T12:04:32+01:00 stduhpf speculative : threading options (#4959)
bb0c1392479398f9aba86d9ec98db0b95ede6e6d 9408cfdad6b1c090a7e1419d4434edc260b7e47e 2024-01-14T13:26:53+02:00 Georgi Gerganov llama : check LLAMA_TRACE env for extra logging (#4929)
df845cc982e7e2ea7b9900e29d55b15338faa78d 6b48ed089377330cdb362970a51c1c89b6d857a8 2024-01-13T17:29:43+01:00 David Friehs llama : minimize size used for state save/load (#4820)
356327feb3f66980ab687040495d722696d98970 ee8243adaa9a9f51ff449213383874e49efe368f 2024-01-13T09:20:46-05:00 Ziad Ben Hadj-Alouane server : fix deadlock that occurs in multi-prompt scenarios (#4905)
e7e4df031b9e29d4b55a4e0b0295187f6b213db1 584d674be622fbf1578694ada6e62eebedbfd377 2024-01-12T20:07:38+01:00 slaren llama : ggml-backend integration (#4766)
eab67950068e4b125007d027232c47d2a5831cd0 d8d90aa343c22fe01429d3540e47ded87e9dcb9d 2024-01-11T12:41:39-05:00 Behnam M server : add `LOG_INFO` when model is successfully loaded (#4881)
7a9f75c38b5e62fe27b8a5a3ed823b4a3714024b 5c1980d8d4c4e0c0af77359f81cc44d90b3f250b 2024-01-11T02:12:05-05:00 Behnam M server : update readme to document the new `/health` endpoint (#4866)
cd108e641dbdedd8c5641c4cec1762f751f38136 57d016ba2d46a6e22517a31a75cebb48f9e234b6 2024-01-10T14:56:05-05:00 Behnam M server : add a `/health` endpoint (#4860)
f2eb19bd8bc9f5730d6e05d7a52a9e19bf5ac099 f3f62f0d835d559e80714bbeb05d03125574e3dd 2024-01-03T03:43:19-05:00 Justin Parker server : throw an error when `slot unavailable` (#4741)
5d7002d4372ebf107cfaf46fcd90df27b204f330 26f3071d714f0b27ad7f021a46a66a1085480258 2024-01-02T04:38:15-06:00 minarchist server : add --override-kv parameter (#4710)
edd1ab7bc34c10a780ee7f9a4499f7689cdad36d 198ed7ebfc89b8f2b35a8b1655d57bfb57530c1a 2023-12-31T17:42:22Z Someone Serge flake.lock: update
68eccbdc5b56f2a2450f9a8463f9934388cafabf 97bbca6e8522d18041fcde6c3d0907a52ce36446 2023-12-29T06:42:26-08:00 Philip Taron flake.nix : rewrite (#4605)
441f51dca004debf8b275f1bdc08e0f1af7fd8f8 38b3de4658292582a8941a2be5c77b40ce6ac0f2 2023-12-29T19:23:27+09:00 Tamotsu Takahashi ci : build with CLBlast + ggml-opencl use GGML_API (whisper/1576)
dc68f0054cd279cddddb0cae0c9ef4f9cbaa512a de8e496437c59e7d1cc84109e3e49a3478aee25a 2023-12-26T21:23:59+01:00 slaren cuda : fix vmm pool with multi GPU (#4620)
d232aca5a73b290e218a2e48b91023d5e994203f 31f27758faf4a4bd08101a57c7ec3a473f771f86 2023-12-21T21:07:46+01:00 slaren llama : initial ggml-backend integration (#4520)
880e352277fc017df4d5794f0c21c44e1eae2b84 66f35a2f48e1965a13835a523e677223dbf148be 2023-12-21T18:07:34+01:00 howlger py : open merges file as 'utf-8' (#4566)
799a1cb13b0b1b560ab0ceff485caed68faa8f1f fecac45658a99eddc4d6e36ba0310ca8f87a77f0 2023-12-13T13:04:25+01:00 slaren llama : add Mixtral support (#4406)
da5eaef1f34d0a1f584cd4a092e7691ea46a9d91 5f6e0c0dff1e7a89331e6b25eca9a9fd71324069 2023-12-06T09:08:17+01:00 stduhpf speculative : support `--color` (#4343)
52c8bc3cf312e1caf02d37bfb9d9d865cbe33594 e4b76bbe316ee50fb17d9ac29e654c0edf830eba 2023-12-05T15:05:51+05:00 MaggotHATE sampling : custom samplers order (#4285)
23b5e12eb5a76489b4c3ee22213a081da68b1809 d208995c6da66f252d4054c1c5a90eb8ccb7a2f7 2023-12-04T17:04:21+01:00 Daniel Bevenius simple : update error message for KV cache check (#4324)
880f57973b8e0091d0f9f50eb5ab4cd4e31582ca 8d6d9f033b8101f929e445cf45b39e1557ca7934 2023-12-01T18:42:11+02:00 Georgi Gerganov llama : fix integer overflow during quantization (#4284)
8d6d9f033b8101f929e445cf45b39e1557ca7934 ef47ec18da469423c276b683dd9b5741cee7023e 2023-12-01T10:41:56+01:00 Daniel Bevenius py : add requirements file for convert-hf-to-gguf.py (#4277)
ef47ec18da469423c276b683dd9b5741cee7023e 1d144112c0fbbb4ecc07dbcf4f05a380148bd6de 2023-12-01T10:51:24+02:00 Georgi Gerganov ggml : add ggml_soft_max_ext (#4256)
f43f09366dfd018e4568e23a232aaa8c4f7cfc78 d2809a3ba2780e00fce5a6149a7eda09f1c0e906 2023-11-30T17:25:04-05:00 Ziad Ben Hadj-Alouane server : add single-client multi-prompt support (#4232)
e2bd725f4b39bc5c6234858d158e01248f5ab5bd 1f5cd83275fabb43f2ae92c30033b384a3eb37b4 2023-11-30T20:50:40Z rhjdvsgsgks py : fix oai proxy (#3972)
8406b0924bf323f37d536dee8b8165c1f3d9d11d b38a16dfcff88d547f78f52d1bea31b84a05aff7 2023-11-28T10:32:03+02:00 Georgi Gerganov ggml : re-enable BLAS for CPU when src0 != F32 + remove redundant full offload checks in llama.cpp (#4240)
9d5949f04b1f8b76184818abbd99938c2020803f ff8238f71d56245f4a6dbea693f4ebd81263464d 2023-11-23T12:34:20+01:00 Daniel Bevenius examples : fix typo in parallel example doc comment (#4181)
f23c0359a32871947169a044eb1dc4dbffd0f405 40a34fe8d034bd484efd79ccbb95059ca6308dcb 2023-11-20T11:35:47+01:00 Galunid ci : add flake8 to github actions (python linting) (#4129)
532dd74e38c29e16ea1cfc4e7eedb4f2fab3f3cd e86fc56f7521ca4b18d1d9939e82abd40c2f1c01 2023-11-11T22:04:58-08:00 Richard Kiss Fix some documentation typos/grammar mistakes (#4032)
48ade94538fa509465d71023e49d07aab0ec8cd5 f28af0d81aa1010afa5de74cf627dcb04bea3157 2023-11-05T08:12:13+01:00 slaren cuda : revert CUDA pool stuff (#3944)
d6069051de7165a4e06662c89257f5d2905bb156 4ff1046d75e64f0e556d8dcd930ea25c23eb8b18 2023-11-02T18:10:39+01:00 Oleksii Maryshchenko cuda : use CUDA memory pool with async memory allocation/deallocation when available (#3903)
0e40806c1cb3bdf9955ed807ffbe212be85b4c67 a2758d08e44ce3624d233af4d23c6843e2e735b5 2023-11-01T14:42:01-03:00 bandoti common : allow caller to handle help/argument exceptions (#3715)
ff3bad83e29e3009010cbc923bebd769055eaa7f 82a6646e0221216c41edcdf99f5a44bb051391f5 2023-10-28T16:41:07+02:00 Erik Scholz flake : update flake.lock for newer transformers version + provide extra dev shell (#3797)
34b2a5e1ee4fe6295fb4420eb91131d743694c65 6961c4bd0b5176e10ab03b35394f1e9eab761792 2023-10-26T22:53:37+03:00 Georgi Gerganov server : do not release slot on image input (#3798)
ad939626577cd25b462e8026cc543efb71528472 1717521cdb976a2219888b0e5cba36e210eee9df 2023-10-24T16:10:43-04:00 cebtenzzre server : add parameter -tb N, --threads-batch N (#3584) (#3768)
1717521cdb976a2219888b0e5cba36e210eee9df b2f7e04bd312eaf97eee0523aa09d950d585626b 2023-10-24T23:08:20+03:00 Georgi Gerganov server : do not block system prompt update (#3767)
438c2ca83045a00ef244093d27e9ed41a8cb4ea9 9e70cc03229df19ca2d28ce23cc817198f897278 2023-10-22T22:53:08+03:00 Georgi Gerganov server : parallel decoding and multimodal (#3677)
0e89203b517c95ec6675eda75d200a60d1e8921d c67fe68e417f766970fb1feaf2e66458aa24116a 2023-10-18T16:21:57+03:00 Georgi Gerganov speculative : add tree-based sampling example (#3624)
c67fe68e417f766970fb1feaf2e66458aa24116a 1117d06607d2d885640ac501f05f0aae5494e2c5 2023-10-18T07:21:48-05:00 Jhen-Jie Hong metal : implement q5_0 and q5_1 kernels (#3648)
2a4bcbacead886996f175f33479d1d874a3e577f 424b6381c4daeed62e6600e0402e72f39845b58d 2023-10-13T12:33:16+02:00 Daniel Bevenius llama : remove n_threads from llama_decode_internal (#3614)
a8bdd65525ae86dea905e9866ad369b53e30ac14 70c29da118cdb02bfcbd0376c32b5b2236e48e48 2023-10-11T15:42:22-04:00 Michael Coppola server : add parameter -tb N, --threads-batch N (#3584)
a1202a31ed8c35705bd09fe91c3e7410c619bd70 94e502dfb79430870b42b8e8ee132b4aaa93e4a8 2023-10-08T12:21:19+02:00 Johannes Rudolph k-quants : fix comments about block sizing (#3499)
9ca79d5cbbc8d43f2bff951404b6a40ff1ee3788 0c731ca4039ccff86ffab90eaae4ca98037c4496 2023-10-06T10:10:13-06:00 Kerfuffle kv cache slot search improvements (#3493)
a8777ad84e00cda0399e827cdf971e2c3fab1da2 97af49fa395df77e4c18af0e1655b2fee67c9686 2023-10-06T14:16:38+01:00 pudepiedj parallel : add option to load external prompt file (#3416)
e2583cbc29cd7d6d1403f338842c07dfc0467e6c e8b8d32e8663ffc55a02c9721af3a5190382cbb0 2023-10-05T15:57:03+04:00 shibe2 CLBlast: Fix handling of on-device tensor data
7f1a0fe709ea1a861da2f3759f58a28bf8953c12 16bc66d9479edd5ee12ec734973554d4493c5dfa 2023-09-29T03:51:52+08:00 Qu Zongfu ggml : release the requested thread pool resource (#3292)
16bc66d9479edd5ee12ec734973554d4493c5dfa 0512d66670de3f650c579519833c085014b0f200 2023-09-28T21:42:38+02:00 slaren llama.cpp : split llama_context_params into model and context params (#3301)
0512d66670de3f650c579519833c085014b0f200 0e76a8992c8200237bbc6471a53fb8796b3872f7 2023-09-28T19:31:04Z Eve ci : multithreaded builds (#3311)
0e76a8992c8200237bbc6471a53fb8796b3872f7 2db94d98eda56982d80238840b0652b4137a2a84 2023-09-28T20:40:11+02:00 xaedes train : finetune LORA (#2632)
ec893798b7a2a803466cc8f063051499ec3d96f7 45855b3f1c7bdd0320aa632334d0b3e8965c26c4 2023-09-28T19:04:36+03:00 Georgi Gerganov llama : custom attention mask + parallel decoding + no context swaps (#3228)
8185710a80531e9ee0c0cb99d3a9c9af1019ab67 7eb41179edc56083ef4eb2df7967ac9ff38b34fb 2023-09-21T10:43:53+02:00 Johannes Gäßler CUDA: use only 1 thread if fully offloaded (#2915)
a51b68765799e75e17c7622f376bfbeb66f1bd70 76164fe2e65c058e9ee2c3afd0ad6b182ca57e25 2023-09-15T11:09:24+03:00 Georgi Gerganov metal : relax conditions on fast matrix multiplication kernel (#3168)
4c8643dd6ea1a163bc5979cb69c1e7ab0975bc93 35f73049af6c676a106a5a990a819ae0bc3fcd7d 2023-09-15T00:32:10+08:00 jameswu2014 feature : support Baichuan serial models (#3009)
cb6c44c5e045709b6bb5cc9bb8c9be107c771a78 a21baeb12202a9020b48c53beaaf4b355228e8ba 2023-09-08T14:09:21+02:00 Przemysław Pawełczyk build : do not use _GNU_SOURCE gratuitously (#2035)
be8c9c245bd129ebabb80e0a7a8dd7daeb4d30af be6beeb8d75294552c4918fce06d7b84eebf3d79 2023-09-07T15:45:01+02:00 Kawrakow metal : parallel RoPE on Metal (#3024)
d59bd97065cd7ded6c4ecab54b1d5e0b1b11e318 35938ee3b0c16f1fbbf240dae21e0228864b938c 2023-09-05T09:55:33+02:00 Kawrakow Guard against all weights in a super-block being zero (#3010)
35938ee3b0c16f1fbbf240dae21e0228864b938c 921772104ba2219bfdc2b2980d05ebc0aa0c92a4 2023-09-05T10:46:39+03:00 Georgi Gerganov llama : update logic for number of threads when using BLAS
e8d91589258f9204397a7ac5f9b3c857835c98f8 bce1fef328941499dc0acb76cc7fd7ac90449c2f 2023-09-01T11:15:57+03:00 Kawrakow metal: somewhat faster f16 x f32 matrix multiply kernel (#2951)
8341a25957b319a03d4a811176cd5ad7f2b0fbd4 849408957c687cde4ab32c147107f643fc55130b 2023-08-30T08:29:32+02:00 staviq main : log file (#2748)
44c117f41ee01c5ac8fb86bba041f08d8b87b46d 43033b7bb4858da4f591715b3babdf906c9b7cbc 2023-08-28T21:51:47+02:00 xaedes train : mem usage and other improvements (#2439)
92b1bbd2ec43c82ec0530ba3c8758846c5790c75 dd0dc366dab10e8df28d3924e7f313b5c695e908 2023-08-28T13:23:55+02:00 Johannes Gäßler CUDA: fix RoPE asserts, block sizes (#2833)
f55538c3ccba9b926846ef862fa830cea08c433e ebcee207b6058b7f695bb5c203ad87b1066a9790 2023-08-28T10:59:08+03:00 Georgi Gerganov metal : fix memory leak (#2762)
c10704d01e21e3dbe4d6ca1026ebff85349dd239 230d46c723edf5999752e4cb67fd94edb19ef9c7 2023-08-27T18:55:41+03:00 Georgi Gerganov llama : fix MPI threads (close #2827)
789c8c945a2814e1487e18e68823d9926e3b1454 c1ac54b77aaba10d029084d152be786102010eb2 2023-08-27T09:03:27+02:00 slaren ci : add LoRA test to CI (#2650)
730d9c681e339b76407659344e5a2cd50af7d7d5 c7d92e6dfec3f54849f3a0ba373054d29f321ea2 2023-08-26T14:13:36-06:00 Kerfuffle convert.py : advanced option (#2753)
38b16dfca6e5032e6cfb90c1653bf1ba4cf647b4 8f8c28e89cb9531211783da697d6e7c445e2af1d 2023-08-24T12:27:25-04:00 Shouzheng Liu metal : bug-fix when enable ggml-alloc (#2757)
cf658adc832badaaa2ca119fe86070e5a830f8f6 a192860cfec89a38d59a943623bf595b1fe4495b 2023-08-23T23:08:04+03:00 Georgi Gerganov llm : add Falcon support (#2717)
6381d4e110bd0ec02843a60bbeb8b6fc37a9ace9 dadbed99e65252d79f81101a392d0d6497b86caa 2023-08-21T23:07:43+03:00 Georgi Gerganov gguf : new file format with flexible meta data (beta) (#2398)
a872a2b28eaefc8d464eaa535c94deeb501666f9 0919a0f73d95cfb93a1646a1d1741a0615fe2c5e 2023-08-17T03:35:53-04:00 Shouzheng Liu ggml-alloc : fix discrepency between measure&eval (#2639)
fc8ef549e50087762a0b4f901cd74b2defcc6ae3 bf83bff6742c0f1795b4c18695a13a34ac7adf62 2023-08-16T16:08:28-04:00 Shouzheng Liu metal : enable ggml-alloc (#2627)
9ca4abed893685692f90413e4d43153af12342d9 e59fcb2bc129881f4a269fee748fb38bce0a64de 2023-08-10T13:11:36-07:00 DannyDaemonic Handle `ENABLE_VIRTUAL_TERMINAL_PROCESSING` more gracefully on earlier versions of Windows.
93356bdb7a324a8f6570f99d02af392cd4c45796 60baff7c8584ec369e53469cad5f92e102b1efe4 2023-08-07T14:25:58+03:00 Georgi Gerganov ggml : mul mat tweaks (#2372)
f6f9896ac3d2ff207e18f87dab85d126ceef5236 34a14b28ff7f3c98730339bacee035091b2a812a 2023-08-07T10:52:57+03:00 Georgi Gerganov metal : fix out-of-bounds access + inc concurrency nodes (#2416)
5f631c26794b6371fcf2660e8d0c53494a5575f7 415e99fec27be5a2e4283f1937afd17eb33fbd66 2023-08-04T06:37:24-05:00 Stephen Nichols Fixing race condition in server and partial stream handling in frontend. (#2391)
1a941869cbef8e9cc351a6c6987e4ae3b0f021f7 b5472ea0ada081a6e1c06998ebbc9a24aa2cd4a4 2023-07-27T11:00:54+03:00 Georgi Gerganov metal : disable graph concurrency optimization due to bug (#2413)
1aa18ef994a6a2b531434eb13251ef48e56d345b 9a08eaf3c4010962d0126e9e5bfbe9af64b2ac90 2023-07-25T08:00:19-04:00 Shouzheng Liu metal : concurrently dispatch commands (#2358)
57921ca6db53e08eb90010fba99add85be28b5a1 3602ac4255fd4cd589821346290b464a64b955d1 2023-07-23T21:33:02+08:00 wzy common : n_threads == -1 uses std::thread::hardware_concurrency() (#2347)
e76d630df17e235e6b9ef416c45996765d2e36fb 1d0824b2476e7fda09751a0235c9e571b76d6f2c 2023-07-23T15:09:47+03:00 Georgi Gerganov llama : grouped-query attention + LLaMAv2 70B support (#2276)
417a85a0010519224cf154eb85d383ffeafeeead 294f424554c1599784ac9962462fc39ace92d8a5 2023-07-20T06:32:22-04:00 Shouzheng Liu metal: minor q4 optimization and reduce code size (#2248)
32c54116318929c90fd7ae814cf9b5232cd44c36 ff5d58faecf1f02b05bd015bdfc6a394cf2bc9ba 2023-07-13T21:58:25+08:00 Howard Su Revert "Support using mmap when applying LoRA (#2095)" (#2206)
a7e20edf2266169ccd97a4eb949a593d628fbd64 1d656d6360359cfdaaf5d64ed9690047b600dbcb 2023-07-07T21:23:57+03:00 Georgi Gerganov ci : switch threads to 1 (#2138)
72421402834141df6cbdcf595fe46dbd11874dce 3e08ae99ceb143d67f9273fda47541e9d98ff23f 2023-07-07T18:36:37+03:00 Georgi Gerganov ggml : remove sched_yield() call in ggml_graph_compute_thread() (#2134)
7ee76e45afae7f9a7a53e93393accfb5b36684e1 acc111caf93fc6681450924df9f99679c384c59e 2023-07-04T10:05:27-04:00 Tobias Lütke Simple webchat for server (#1998)
9d23589d638dc74577d5ff880e6d4248b795f12e 0be54f75a6c3e9a09ea71bdfcdabf9a996a0549b 2023-06-27T19:06:33+02:00 Erik Scholz fix pthreads setaffinity usage on android (#2020)
b853d456018b10820686362af41b2f2f75f1eec6 9225baef71407d799a6f7f563b77fd7f82791416 2023-06-26T13:57:59-04:00 zrm ggml : add NUMA support (#1556)
6769e944c727c63612dcafbef52009d21ae00fff cbebf61ca7584e9709265395f0127ae7fc0f1882 2023-06-26T19:43:07+03:00 Kawrakow k-quants : support for super-block size of 64 (#2001)
2c9380dd2f77e41149340f3ecb09764d793b16db 051e1b0e6a6e3aee7d989b47760980e6fda5861c 2023-06-17T19:15:02+02:00 Johannes Gäßler Only one CUDA stream per device for async compute (#1898)
794db3e7b982fee37e3995db9c3a216a57ff65e3 5ddf7ea1fb42bac21026de2f77e0f9c069b92234 2023-06-17T07:53:04-04:00 Randall Fitzgerald Server Example Refactor and Improvements (#1570)
4bfcc855abdb2c9fcc3c5a84747974521909fa41 6b8312e7979b852f6b6ac9d29cd51fda16c17948 2023-06-15T20:29:48+03:00 Georgi Gerganov metal : parallel command buffer encoding (#1860)
e32089b2c20b1b87b22912f4a8b93fe01647d5b9 2347e45e7bdb09c9a7d74b2c0bc86c2b65f0c343 2023-06-13T21:04:40+02:00 xaedes train : improved training-from-scratch example (#1652)
74a6d922f12ccfe16b0c265f43be8978c6f25e98 e4caa8da59c1c97dc23fa336f4d726984a20560f 2023-06-12T22:39:21+03:00 Kawrakow Metal implementation for all k_quants (#1807)
4f0154b0bad775ac4651bf73b5c216eb43c45cdc ef3171d16241c18581d4d08374f0b9e396ade6b7 2023-06-10T01:59:17-06:00 Kerfuffle llama : support requantizing models instead of only allowing quantization from 16/32bit (#1691)
245fc3c37da5ac5963f9f11a9f4f2ac08d96afc6 72ff5282bf0388c60821f504c4c8cc2b1f491aa6 2023-06-09T10:39:59+03:00 Kawrakow metal : faster q4_0 (#1775)
17366df842e358768c0df7024484fffecfc7865b 44f906e8537fcec965e312d621c80556d6aa9bec 2023-06-06T21:33:23+02:00 Johannes Gäßler Multi GPU support, CUDA refactor, CUDA scratch buffer (#1703)
d5b111f53d14972669eb52055f9df2567663ad8b 2d43387dafe9c60f15f57aa23ee0b37864b98b32 2023-06-07T01:00:01+08:00 LostRuins Clblast fixes + enhancements to save VRAM and offload more layers (#1675)
ecb217db4fcfa3880300ad08531a5fb6bb142d45 dcb2ed48268e421baf25adc00d602dad0f415564 2023-06-04T23:34:30+03:00 Georgi Gerganov llama : Metal inference (#1642)
dcb2ed48268e421baf25adc00d602dad0f415564 d8bd0013e8768aaa3dc9cfc1ff01499419d5348e 2023-06-04T08:12:05+02:00 0cc4m OpenCL: Fix duplication of layers in VRAM and RAM, add GPU mul kernel (#1653)
1fcdcc28b119a6608774d52de905931bd5f8a43d ac7876ac20124a15a44fd6317721ff1aa2538806 2023-05-25T23:07:29+02:00 Johannes Gäßler cuda : performance optimizations (#1530)
7d873811f31d4d8c909015c946a862c0089cda7d 2e6cd4b02549e343bef3768e6b946f999c82e823 2023-05-23T18:01:15+02:00 Maarten ter Huurne Fix handling of "invalid property" when creating OpenCL command queue (#1565)
79b2d5b69d80be0bf29312fb9a95854876b0a8a5 13c351ad7292c5b5ab35db25c7a4f993e75d9cfd 2023-05-14T17:55:02+02:00 xaedes ggml : alternative fix for race condition bug in non-inplace ggml_compute_forward_diag_mask_f32 (#1454)
13c351ad7292c5b5ab35db25c7a4f993e75d9cfd 60f8c361ca26328ef8523dfb08077fe2f1034490 2023-05-14T18:22:50+03:00 Georgi Gerganov ggml : various fixes (#1450)
66841fdb0eaf0cc210757cc7f683d0f4eebadc21 905d87b70aa189623d500a28602d7a3a755a4769 2023-05-13T16:48:03+03:00 Georgi Gerganov ggml : multi-thread mul and diag_mask ops (#1428)
905d87b70aa189623d500a28602d7a3a755a4769 f954edda935a70a14cf0cc45ecc7fe7d60cf3e4b 2023-05-13T15:38:36+02:00 Johannes Gäßler ggml : GPU-accelerated token generation (#1412)
f954edda935a70a14cf0cc45ecc7fe7d60cf3e4b f048af0230ad5381bb20b9e3c1467ec6fc7debdf 2023-05-13T14:56:40+02:00 xaedes ggml : implement backward pass for llama + small training-llama-from-scratch example (#1360)
b9fd7eee57df101d4a3e3eabc9fd6c2cb13c9ca1 b608b55a3ea8e4760c617418538465449175bdb8 2023-05-12T00:23:08+03:00 Georgi Gerganov ggml : remove bit shuffling (#1405)
58b367c2d757c0ea12aec672382462b42204c724 ea3a0ad6b6b5ca4693b94acd4cb32e2803f66fae 2023-05-01T18:11:07+02:00 slaren cuBLAS: refactor and optimize f16 mat mul performance (#1259)
ea3a0ad6b6b5ca4693b94acd4cb32e2803f66fae 2bdc09646d8c6cb74a6f573e9081586b4b83b9d1 2023-05-01T08:58:51-04:00 xloem llama : update stubs for systems without mmap and mlock (#1266)
a5d30b1f53677cb50791fec41c43e93274347303 76a884920aa1d2fc0dc7a7ac12dfc5ec5816377c 2023-04-30T14:41:35-04:00 jon-chuang common : better default number of threads (#934)
7296c961d9303010a2b98379f738da2a8a55aa1b 78ec543733d10a1629f984fd0302fdaa4e87fe66 2023-04-28T16:57:16+02:00 0cc4m ggml : add CLBlast support (#1164)
7a32fcb3b29f4db8aed8a85dc58eb958fb118153 dd0eabc049fb1efc631cab8eb0a646808d704e18 2023-04-25T23:40:51+03:00 Georgi Gerganov ggml : add Q8_0 quantization format (rename the old one to Q8_1) (ARM NEON) (#1179)
50cb666b8a2e35a49b08c0f6bc81138c8f6f2ac1 25d7abbd1f73582b7e0fdc422a936e8541c0780b 2023-04-21T21:59:17+02:00 slaren Improve cuBLAS performance by using a memory pool (#1094)
018f2279f5fe3ef743bd8254b23ea8f0efae7e73 9411288271ab548216902a029f42a0a38ebcedb7 2023-04-22T02:27:06+08:00 源文雨 cmake : link threads publicly to ggml (#1042)
1bfc153e2f35ddd9d64b084e8d1a5e6fa57ad1c9 3d59769c3bb7e72c915646ddb1e239b1face19f5 2023-04-21T17:18:26+02:00 Kawrakow ggml : a faster version for Q4_1 x Q8_0 dot products (#1083)
38de86a7114c97ecf3644e3a60159f1ed893e1b0 e0305ead3a072db9c08b35c9600c49273b38a4b5 2023-04-20T19:42:27+02:00 Kawrakow llama : multi-threaded quantization (#1075)
f7d05095b404b5500b4a702ea16f67fc22446e49 884e7d7a2bfd7325b107442d6758983f5886ed3d 2023-04-19T20:20:14+02:00 Kawrakow Q4_2 quantization with rmse-optimized scale and quants (#1062)
66674012389f9537140044290f8517bc4a5e0b74 77a73403ca8eaced2590559d0f9cebd2b3649d32 2023-04-19T00:53:24+02:00 slaren Multi-threaded ggml_cpy (#1035)
77a73403ca8eaced2590559d0f9cebd2b3649d32 50a8a2af97cb92e53e7a3195aa201c3d87da5415 2023-04-18T23:54:57+03:00 Georgi Gerganov ggml : add new Q4_2 quantization (ARM only) (#1046)
723dac55fa2ba7adc6e3fc8609781d1ad0378906 0f07cacb05f49704d35a39aa27cfd4b419eb6f8d 2023-04-14T00:03:03-07:00 comex py : new conversion script (#545)
a3a2a0eda8828b60436e9f69d9ac2c1060d03e7a d990e3fffc5b0f5448e90a16c79a4f2675100af0 2023-04-13T18:36:40+03:00 Georgi Gerganov ggml : add GGML_DEFAULT_N_THREADS
95ea26f6e92d620a5437f576b80868aee7f808d6 82d146df9b43cf677e0dbce20b03cf864958a0cc 2023-04-13T14:46:23+02:00 SebastianApel benchmark : add tool for timing q4_0 matrix multiplication (#653)
2663d2c6784ad7b77998c6874df25648d597f74b a0caa34b162449b5c13b8d604573053300ff54a1 2023-04-11T06:19:54-07:00 comex Windows fixes (#890)
f963b63afa0e057cfb9eba4d88407c6a0850a0d8 aaf3b23debc1fe1a06733c8c6468fb84233cc44f 2023-04-08T12:24:37-07:00 comex Rewrite loading code to try to satisfy everyone:
eeaa7b0492fc79baab8bb1fe195d6c87159f2bd3 986b6ce9f99503c51ec5afd8a10baa32359434c6 2023-04-05T22:11:03+03:00 Georgi Gerganov ggml : multi-thread ggml_rope() (~3-4 times faster on M1) (#781)
6f23ba5ee235cbcb1eedd63b98422dd8d4392a78 78ca9838ee36660a776e97e3391b6fb5dcaacf7f 2023-03-30T01:53:36-07:00 Justine Tunney Ensure --mlock works properly with mmap() support
78ca9838ee36660a776e97e3391b6fb5dcaacf7f a017390358cdb23fffb30988dc84bb190d0403ca 2023-03-29T13:51:37-07:00 Justine Tunney Make loading weights 10-100x faster
41318d708ed196ff727dce14d263a64b23c7333d a6956b25a1c783e5e96fe06c9c00438f846ef047 2023-03-29T18:10:07+02:00 Maël Kerbiriou llama : use the same threshold for OpenBLAS and ggml thread limiting (#577)
c1f885067c61191a07a1aedf684168dda62f3f71 e0670260fb50a882b37074112b1881fb0820cf77 2023-03-28T15:56:03Z Stephan Walter ggml : introduce structs for the q4 data blocks (#356)
ecbe466a364876927994e2f1ec14f4d82301d201 502a400192013d3e95ed87b777e8fa3bec45713c 2023-03-25T19:47:21+02:00 Georgi Gerganov Retire the ggml_mul_mat() branch for transposed src0 (#500)
4640eff23d341a0273587800e17ff4a378132d60 ab77d7631211b299cb734bea6ad1f74324154150 2023-03-25T17:03:10+02:00 Georgi Gerganov Don't interefe with BLAS for large prompts by running only 1 thread
563cdc391dde140f1084d1012234e8e6f57f881f 8d4a855c241ecb0f3ddc03447fe56002ebf27a37 2023-03-24T08:19:05-07:00 comex Support calling mlock() on loaded model data on Linux and macOS (#453)
483bab2e3d4a868fe679d8bb32827d2a4df214dc 404e1da38ec8025707031a8027da14dc1590f952 2023-03-23T23:22:01+02:00 Georgi Gerganov Avoid the transposed X branch in the Z = X * Y matrix multiplication (#439)
ae44e23ee36c02da0e37ab508a4b473ace724f8e 928480ef5b7b03d7a07e98286aebe3d8b24457d9 2023-03-22T07:47:15+02:00 Georgi Gerganov When seed <= 0 - use the clock to generate one
2e664f1ff413995506c9a54f3a8d5b8c64e37a91 8cf9f34eddc124d4ab28f4d2fe8e99d574510bde 2023-03-21T07:35:42-07:00 Casey Primozic Add initial AVX512 support for dot product on Linux (#320)
7392f1cd2cef4dfed41f4db7c4160ab86c0dfcd9 ad5fd5b60cfdfbfb22b0f2bc9e9f6c9692768f8d 2023-03-19T12:38:44-06:00 Suaj Carrot Improved quantize script (#222)
4f546091102a418ffdc6230f872ac56e5cedb835 e81b9c81c101f64531ef0fa1ee6b77d562635652 2023-03-17T21:46:46+02:00 Georgi Gerganov Default to 4 threads (#243)
367946c668757532deed929e1d78673c6ac6bcb8 6b0df5ccf360fe5c015f6607f0375bfc6849005e 2023-03-17T17:47:35Z Stephan Walter Don't tell users to use a bad number of threads (#243)
Can't render this file because it contains an unexpected character in line 63 and column 134.
@@ -0,0 +1,730 @@
fd9bd632f346085920d523dd307a3e4c11cc0a05 e08e473cf292ba73789769b993bb35bcdfc31689 2026-06-01T14:15:35+08:00 wangbomeng HEAD -> dev, origin/dev llama-bench: fix device-info
e08e473cf292ba73789769b993bb35bcdfc31689 f86112d6758298241ab2fa84ad4f0f7b1ace35c6 2026-06-01T11:47:01+08:00 wangbomeng llama-bench:add device-info
ebce9e1a548c2329aa97f53b8b2ad50d968088dc e850ff4de25ad1221abc9bf3bb30df252ccd9c36 2026-05-27T09:38:00+08:00 Yunzhe Jia origin/runtime_replace Refactor cal-llm integration by removing runtime capacity loading and adjusting request handling
e850ff4de25ad1221abc9bf3bb30df252ccd9c36 9985688f7fa96f755882f96a2cd8a18114fdc42d 2026-05-26T10:59:45+08:00 Yunzhe Jia Enhance cal-llm integration by adding runtime checks for CALRT_LIBRARY and updating link settings for Linux and Windows
38ca6895815671a87ceec86b4aa4eb976580ce76 ddd60c928224b52eb4e1e60e01e8a1ecbb80ee45 2026-05-20T16:37:13+08:00 Yunzhe Jia Add support for cal-llm profile dumping to JSONL file
2716130010c58f1cdd9d94f0e2f8e047bc92dc66 b35bda124ccd4ed581dd6088d3ffa4931c2809b6 2026-05-18T08:40:54+08:00 Yunzhe Jia fix n_ctx_slot error by adding runtime capacity loading for cal-llm
a43741244a646d3f8fa3ff01bb9b7d059223d0a5 b2003d6c90ef0fa26ab9e930ba3e22b355eb3d39 2026-05-15T14:39:53+08:00 wangbomeng run llama-passkey successfully, fix llama-bench, copy 3 times input to infer qwen2.5vl
1bec0db5a675ddc60fb793be2a746e8f3c8855dc 465df20c3e1f3f58d0f5531c796e0941a49c32b0 2026-04-30T16:02:59+08:00 wangbomeng origin/dev-ben bench: support 2 calbins
eeeef3f6d6a5aad9296323ca15d9d929745b8932 431ad6f1c787f1b47e9e7be14b2e1a7d8565485c 2026-04-28T16:16:19+08:00 wangbomeng add unknown time info: prefill and decode
a2d5bf362d6c9a546f9deadf4f8975605a915d33 bd3a57a11aa008e0b5dc2a30f82fcd3a02587208 2026-04-09T21:01:46+08:00 Bomeng Wang server: comment fixed time
18814f9bf1a423ebe8f32d6043c9cbc5b21b0218 bbee06d6d851e3f84f75b578047967d7e0e4a8dc 2026-04-08T13:55:52+08:00 wangbomeng server : reset inference time
bbee06d6d851e3f84f75b578047967d7e0e4a8dc e126c21ed7b793b648d63533ea7ee30885f5a82a 2026-04-08T11:29:36+08:00 wangbomeng calrt: add test time print
1e8a16cd0e3ad3c9a0f8746852a0a38c6e52322e 893e52bda0fee99bbda1521ea733a760bc4201f1 2026-04-01T10:14:22+08:00 wangbomeng calrt: fix slice and add infer/copy time
98e8f9acfe87cd93646482cb2d942b8a132f0852 8c8152a04036bb0d4756a4e08e54f514dae4e64d 2025-12-10T00:20:57+08:00 Yunzhe Jia add timestamp
5d2387931528fbe04aa8d66de935147efb65ca4d e6285a748657add8d974b78ca920c5b41753ee12 2025-12-08T16:40:34+08:00 Yunzhe Jia add timestamp for one decode process
7e994168b1ccc12337ba8de939c4fd466107c1fb bcfa87622ae46be6345a8e3dfdbdc5ba5414042b 2025-11-03T03:35:33+02:00 shani-f SYCL: optimized repeat_back kernel (3× fewer asm instructions, 2× faster)Feature/sycl repeat back opt (#16869)
7fd205a8e8832ead273f62c5fd81d2b8aa910535 2f68ce7cfd20e9e7098514bf730e5389b7bba908 2025-11-02T00:15:31+02:00 Georgi Gerganov scripts : add script to bench models (#16894)
d261223d24e97f2df50220e4a5b7f0adb69bba81 dcca0d3ab840ebe9b2ccd4719033d408eeb758d7 2025-10-30T23:19:14+08:00 JJJYmmm model: add support for qwen3vl series (#16780)
8b11deea4663f29d3e042ce1056ba643264cd5f1 b9ce94017729465895402cbcfffb51fa926c15e3 2025-10-30T04:34:15+01:00 Oliver Simons Hide latency of bias and gate-loading (#16847)
b9ce94017729465895402cbcfffb51fa926c15e3 3464bdac37027c5e9661621fc75ffcef3c19c6ef 2025-10-29T15:13:10-05:00 Jeff Bolz vulkan: Fuse rope+set_rows (#16769)
3eb2be1ca5f37480aeb16102970d9e65f43347fe e41bcce8f0b53032a1fed275cd253e931c041cf6 2025-10-29T06:29:12-07:00 Max Krasnyansky Hexagon Op queue & dispatch optimizations (#16820)
f549b0007dbdd683215820f7229ce180a12b191d 9a3ea685b937c0f0cbfda2e50004ea54bf187512 2025-10-29T03:53:04-05:00 Jeff Bolz vulkan: Call ggml_vk_buffer_write_2d from ggml_vk_buffer_copy (#16793)
338074c383c81366320d176d83b94b0a567ee0c2 851553ea6b24cb39fd5fd188b437d777cb411de8 2025-10-29T08:14:39+02:00 YaelLogic sycl: add RMS_NORM_BACK operation support (#16808)
a8ca18b4b815a2abdbecb958ee5f4c542d69aac7 8284efc35c909217ee1b9a06903245d808ac2283 2025-10-28T19:41:43+02:00 Georgi Gerganov llama-bench : clarify benchmarked parts of the computation (#16823)
ad8d36beffd791db10c94eb9e964afb891e3ca55 c053e18a66dd95dc340aa61317877c2a41d4e3cf 2025-10-28T03:50:33+02:00 tamarPal sycl: add SSM_CONV operation support (#16800)
8423d019318b446640bb620e4ce80066d8530f05 5cca2542ac3f3f86831d32bce744d08fc2b353b0 2025-10-25T00:04:12-05:00 Jeff Bolz vulkan: Optimize SSM_SCAN (#16645)
63d2fc46e17a06be5b4b5823a5ada088317f1f0a a2e0088d9242bd9e57f8b852b05a6e47843b5a45 2025-10-22T13:47:09-07:00 Max Krasnyansky Add experimental ggml-hexagon backend for the Hexagon NPU (#16547)
9b9201f65a22c02cee8e300f58f480a588591227 19a5a3edfd306516cc419679d69d6435943b6816 2025-10-22T16:58:23+02:00 Pascal webui: introduce OpenAI-compatible model selector in JSON payload (#16562)
6ea37f57391d27736c35cd3c20c1f990b7952b74 fb349848f387f355450c3187556e71e6d32c145f 2025-10-20T22:26:17-07:00 lhez opencl: fix warnings and clean up profiling (#16688)
84bf3c677857279037adf67cdcfd89eaa4ca9281 c9c1972e2c2cc6a771fcc145bfa138700179f961 2025-10-20T21:38:20+02:00 Sigbjørn Skjæret model : add BailingMoeV2 support (#16063)
9ad4f1931ee0f3b41d9355245ef744786aaae0aa 79967ec596c0dacfd2251b085a57e79df292b1cc 2025-10-17T02:33:58-04:00 Ilia Ilmer metal : add `CONV_TRANSPOSE_2D` (#16542)
ceff6bb253dd306f5404d7ccb3f11fadafe71b52 1bb4f43380944e94c9a86e305789ba103f5e62bd 2025-10-17T05:36:40+03:00 GittyBurstein SYCL SET operator optimized for F32 tensors (#16350)
adc9b60f190c1016a09f439862fa1cbb302262ac ee50ee1eadff58777ae746827b04de7ba0befc55 2025-10-16T13:10:32+08:00 takuya kodama ggml-cpu: replace putenv with setenv for const-correctness (#16573)
f4ce81c45e7bd910e36bf44c253fc5255c49b1e4 17304cbcc1dd24de7741cbe57925d58e90a98ac1 2025-10-15T23:05:56+09:00 Sam/Samuel metal: optimise `GGML_OP_SUM` (#16559)
7ea15bb64c81e3813eb0babf9a57e1bc5697f569 9c7185dd28416cf67f5e3b268381f311b5e3da56 2025-10-14T07:51:36-05:00 Jeff Bolz vulkan: Improve build time for MSVC (#16545)
56fc38b9655fbe1869d8bd6cfb269418196cea69 1fb9504eb744969a990bfe4cfcf1d3d7a479541c 2025-10-13T17:01:24+08:00 Chenguang Li CANN: fix CPU memory leak in CANN backend (#16549)
1fb9504eb744969a990bfe4cfcf1d3d7a479541c 3f750f8d760ab5a61491e6a9409072dfeee4b4d7 2025-10-13T10:55:32+02:00 Pascal fix: add remark plugin to render raw HTML as literal text (#16505)
f9bc66c3ebcfddb5f09e4b21253623caeb8e414a a31cf36ad946a13b3a646bf0dadf2a481e89f944 2025-10-13T08:52:22+08:00 hipudding CANN: Update several operators to support FP16 data format (#16251)
a2fba89a426ff8005d303c73f0436e7e67368b70 20cc625edc2264aae2779e71bef1593e6a4e8c43 2025-10-12T07:19:06+02:00 Daniel Bevenius hparams : add check for layer index in is_recurrent (#16511)
31d0ff1869aa2ea31f4e96d5877d0343e9a2171b 97870e64975b26c5e06a3540a8dc0ff601351e86 2025-10-11T21:39:04+08:00 Yann Follet server / ranking : add sorting and management of top_n (#16403)
1deee0f8d494981c32597dca8b5f8696d399b0f2 d00cbea63c671cd85a57adaa50abf60b3b87d86f 2025-10-09T22:11:15+03:00 duduta cpu : optimize the ggml NORM operation (#15953)
74b8fc17f92ada295a648e3c5eb28f46bca7d892 aeaf8a36f06b5810f5ae4bbefe26edb33925cf5e 2025-10-07T13:48:56-07:00 Reese Levine ggml webgpu: profiling, CI updates, reworking of command submission (#16452)
8ae32dc9ecd7aeebf3a5b43557e0552a0a04cd4f 3df2244df40c67dfd6ad548b40ccc507a066af2b 2025-10-07T08:21:40+03:00 Georgi Gerganov metal : various optimizations + refactoring (#16446)
04e632a4aab8e6bfff0f8bc216b36ceb1e199ff9 a80ff183abe4e5a76316257ffa597da41b3b6fa0 2025-10-06T14:56:59+02:00 Daniel Bevenius ci : remove missing reranker model files (#16444)
ca71fb9b368e3db96e028f80c4c9df6b6b370edd 35266573b968e1c947b367782fb4b3eddbb4f3c0 2025-10-05T06:57:47-06:00 Gabe Goodhart model : Granite docling + Idefics3 preprocessing (SmolVLM) (#16206)
898acba6816ad23b6a9491347d30e7570bffadfd e29acf74fea996014380d59d31aa504ae8964258 2025-10-04T12:49:16+03:00 Radoslav Gerganov rpc : add support for multiple devices (#16276)
e29acf74fea996014380d59d31aa504ae8964258 128d522c04286e019666bd6ee4d18e3fbf8772e2 2025-10-04T11:42:56+02:00 Acly vulkan : incremental shader builds (#16341)
ef07a4090672a3438d7f64f197795d7dc1c18957 34fcc5a4ace8c69476ef2ea3857f39a60334acc4 2025-10-02T11:00:31-07:00 Reese Levine ggml webgpu: add support for soft_max, optimize rms_norm (#16357)
34fcc5a4ace8c69476ef2ea3857f39a60334acc4 91a2a5655658bb9ab77894716b82fae7ecb4b4d1 2025-10-02T19:43:22+02:00 Piotr Wilkin (ilintar) model : Apertus model implementation (#15852)
364a7a6d4a786e98947c8a90430ea581213c0ba9 2df5bcf357dba0c49b4df1d684b2ffc9e88b7054 2025-09-30T16:39:44+02:00 Adrien Gallouët common : remove common_has_curl() (#16351)
6a2c6145a0b91b40eb3c3dba7b20ccc4b270490f 3b53634fe35771e2e318227aa81585726bae7234 2025-09-28T09:34:44+03:00 Georgi Gerganov metal : extend mat-mat multiplication support (#16225)
e6d65fb02d553bd79cad94e517cdca18b687788d 8656f5de688cddcaea1d6174535eb60ee23ef6a0 2025-09-27T16:43:39-04:00 Jeff Bolz vulkan: support arbitrary KV dimension in flash attention (#16160)
1a189278944d030211f336e103e96b65f976c361 e0539eb6aed346d4b25a6ea019044e88771e7690 2025-09-26T18:35:42+02:00 Aleksander Grygier Allow viewing conversations even when llama server is down (#16255)
9b26511857ac09ae69ab485168fe2d3ee5fb1d6e 00217cd41388328c93e9e9644921c4319bb03bcc 2025-09-26T18:27:25+08:00 Aaron Teo ggml-cpu: implement MXFP4 SIMD for s390x (#16193)
077c94d0caf87fbd3cf3288dbb5c0fd9670294cf aa3ee0eb0b80efca126cedf9bcb4fb5864b46ce3 2025-09-25T22:35:05+08:00 Aman Gupta CUDA: add a fused top-K MoE kernel (#16130)
02a6a82ae7c7ddd1819ae26b0cc36675879aecee c498fc82fe5b83fc8c6e1627286bdc1f93caddbf 2025-09-25T11:29:08+03:00 Georgi Gerganov metal : restore im2col perf (#16219)
bee378e0988b44bbe93b0768208080951b312363 5fb557653b8756ac2b6c6a102b1e44abcadf552f 2025-09-25T05:06:06Z Eve ci: run the x64 and arm ci on the github machines instead (#16183)
f2a789e33490deb483a2694b066b37e45524bb79 3a599719673c850647e3bb911ed6d91109bb91d2 2025-09-24T16:17:49+02:00 Acly ggml : split graph allocations according to backend max buffer size (#15815)
3a599719673c850647e3bb911ed6d91109bb91d2 63b54c81a620981be020184ab99e63a8e50e47cb 2025-09-24T13:42:26+02:00 Tarek Dakhran model : add label for LiquidAI LFM2-2.6B model (#16204)
351f3da39c85f59d581fc184f09283da7f099a3b 3ecb2f671a2f49d56357f99d135a94e841759178 2025-09-23T01:57:46+08:00 Haiyue Wang clang-tidy : disable warning about performance enum size (#16127)
4d0a7cbc617e384fc355077a304c883b5c7d4fb6 9073a73d82a916cea0809de225ef5175c3a86e91 2025-09-22T08:31:40+03:00 Georgi Gerganov ci : adjust params for less runtime (#16167)
1eeb523c3e0c7ffbd59469f5463dcbdecba3535e 5bb4a3edec297e74b0f7bd4ed5d0fdd12e28d858 2025-09-21T08:31:55+02:00 Giuseppe Scrivano vulkan: optimize UMA buffer operations and fix driver hangs (#16059)
803dac2e48ef3ba26a504eb27c4e77ec2d21f7d0 459c0c2c1a400f960d7b8e8d94d31a8426f80986 2025-09-20T10:42:56+02:00 Ruben Ortlam vulkan: use vec dot for matrix matrix multiplications (#16056)
be79d9fdd95ab8955527c4aaa67b90e8b9516718 f432d8d83e7407073634c5e4fd81a3d23a10827f 2025-09-19T15:15:21-07:00 ssweens llama-bench: add --devices and --list-devices support (#16039)
0dd58b6877f3dc106593d6bc68d98305f553c566 69ffd891631befa9e6b485fd646a16dab4f2c007 2025-09-19T11:31:56+07:00 Xuan-Son Nguyen ggml : refactor forward_dup for cpu backend (#16062)
3edd87cd055a45d885fa914d879d36d33ecfc3e1 c0b45097c33e2667a94444f08cc9e36bec0a5e2e 2025-09-18T12:03:34-07:00 Shawn Gu opencl: optimize mxfp4 kernels (#16037)
c0b45097c33e2667a94444f08cc9e36bec0a5e2e 38dbdf4c057515ccea9bec0ca2518f86d5e4d28e 2025-09-18T13:46:17-05:00 Jeff Bolz rename optimize_graph to graph_optimize (#16082)
38dbdf4c057515ccea9bec0ca2518f86d5e4d28e 368560a1e3b9a3bc83af741b0b2bc9e46fb420d2 2025-09-18T11:26:03-07:00 Bowen Han CUDA: Optimize PAD_REFLECT_1D (#15957)
0320ac5264279d74f8ee91bafa6c90e9ab9bbb91 a7a98e0fffed794396b3fbad4dcdbbc184963645 2025-09-17T20:38:12+03:00 Georgi Gerganov metal : refactor + optimize v2 (#15995)
c959b676be29e93f8dbc3bd6056ceba812a9eb72 cd08fc3ecc0264b4414b68af3874a6c689ed60c1 2025-09-17T15:32:42+02:00 Johannes Gäßler CUDA: fix FA occupancy, optimize tile kernel (#15982)
d5fabe3682de515fd09d6c981f7a0d1b75614455 8ff206097c2bf3ca1c7aa95f9d6db779fc7bdd68 2025-09-17T14:33:08+08:00 Chenguang Li CANN: Optimize ggml_cann_set_device (#15935)
8ff206097c2bf3ca1c7aa95f9d6db779fc7bdd68 77475530b8bbea3bf578632507e1284cdfe2c8c0 2025-09-16T16:17:08+02:00 jacekpoplawski llama-bench: add --n-cpu-moe support (#15952)
77475530b8bbea3bf578632507e1284cdfe2c8c0 3913f8730ec6d6245480affc30ae3049107956f4 2025-09-16T15:27:52+02:00 Daniel Bevenius ci : use macos-latest for arm64 webgpu build (#16029)
3913f8730ec6d6245480affc30ae3049107956f4 76888d202ed2b835ae19ea9f9db6baf39e419297 2025-09-16T15:25:57+02:00 Daniel Bevenius ggml : fix padding in timestep embedding kernels (#15932)
76888d202ed2b835ae19ea9f9db6baf39e419297 f1fbffb5c0b34b2a68febb7da3fd0f8333f1ed4c 2025-09-16T13:41:38+02:00 Daniel Bevenius ci : upload xcframework artifact from ios-xcode-build job (#16010)
106220562aca42b6738b8f51acfce0db1b8a2fb6 a68f31edd71cc39141113f05f7133a3e9ece8c61 2025-09-15T17:35:11+08:00 Aman Gupta CUDA: some micro-optimizations in mmf.cuh for mul_mat_id (#15926)
b9c9c9f789cd57fb0b28b25223305613cd90fa10 50f4281a6f5c3a5d68bdeb12f904fa01e0e2ba91 2025-09-13T16:23:30+01:00 Jeff Bolz vulkan: initialize vulkan-hpp to allow using extension function pointers (#15705)
f161463a54d9f93d41246286aa4a9569a91d804d 84d7b2fca11d1be118ce776f6d72a486c4883b74 2025-09-13T13:54:28+03:00 Georgi Gerganov metal : allow ops to run concurrently (#15929)
00681dfc16ba4cebb9c7fbd2cf2656e06a0692a4 4f658855fa8f2e42b7ed9a5b298fa39a2e39b096 2025-09-10T22:04:03+02:00 Oliver Simons CUDA: Add `fastdiv` to `k_bin_bcast*`, giving 1-3% E2E performance (#15872)
9de447d94e1ae9d1a36e5a2e5bf47483352c0d9c 0f0a3c2851134d49955f3c85afbb0b1bb47c3e07 2025-09-10T17:31:40+02:00 Daniel Bevenius ggml-cpu : fix padding in ggml_timestep_embedding (#15917)
e7b6d83b524bbc24a1343d862de6dba8e8eddbd6 2cfef4d117d67ab1dec002915b48a15d11ee1973 2025-09-10T14:17:09+02:00 Daniel Bevenius tests : filter out no-ops from coverage report (#15900)
ff02caf9eed261423289d1531a56536fbf57bfc2 ae355f6f7108540297d8b7f7ae71d20fe610a0b7 2025-09-10T05:23:19+02:00 Daniel Bevenius ci : cache ROCm installation in windows-latest-cmake-hip (#15887)
a972faebed5fdc4a3d2a844d92d476058c02e02d 550cf726e133fd0a069d991287fd3a2a3e3e1cbd 2025-09-09T14:38:02+08:00 Aman Gupta CUDA: Add mul_mat_id support for the mmf kernel (#15767)
70cd37dbbebdb7a2f84f08207f18eabb0b291a55 acc1b008cfd95e63d5f99a370dbffb98e5a99d2c 2025-09-09T06:06:52+02:00 Daniel Bevenius requirements : update transformers/torch for Embedding Gemma (#15828)
e68aa10d8f3d26fdad5b912540362d79de5460e3 0a16bf52e6874369cb4fd2bdc4863ef984b688e7 2025-09-08T13:10:07-05:00 Jeff Bolz vulkan: sort graph to allow more parallel execution (#15850)
56920f56651908d5cce7a310dabf54ac4f6fbb7f b0d52998b962bd2681c34bf52af993af79f178b8 2025-09-08T21:50:05+07:00 Xuan-Son Nguyen server : bring back timings_per_token (#15879)
f28d4f4ac963f182ea9d0fe9e269f3f5f3782aaf 9fcb29f22f5c33c04c7f0daebb24057899d67a1a 2025-09-08T13:34:56+03:00 Georgi Gerganov metal : refactor + optimize (#15857)
a885dcff11a7b73f9377812d6151f6b15d307de0 663027fd5490438ce9c27ea866a560e1e268d11f 2025-09-08T10:27:07+03:00 Georgi Gerganov batched-bench : fix llama_synchronize usage during prompt processing (#15835)
3c3635d2f20424d557b5b0605a2a356214ffe048 61bdfd5298a78593be649a1035ee2a120b13c4f0 2025-09-06T19:45:24+07:00 Xuan-Son Nguyen server : speed up tests (#15836)
61bdfd5298a78593be649a1035ee2a120b13c4f0 01806e77714ae8a78130d432945b959a0956c56f 2025-09-06T18:35:04+07:00 Xuan-Son Nguyen server : implement prompt processing progress report in stream mode (#15827)
c1c354e44c06d259679bb5bb7a8fa9f0b28480e4 a68d9144262f1d0ef4f6ba7ad4a7e73e977ba78c 2025-09-04T20:20:14+08:00 Chenguang Li CANN: Refactor ND to NZ workspace to be per-device (#15763)
0fce7a1248b74148c1eb0d368b7e18e8bcb96809 8227695d7a3e5b357cb37fad263f00a8ca6db710 2025-09-03T13:33:15-05:00 Jeff Bolz vulkan: don't use std::string in load_shaders, to improve compile time (#15724)
661ae31c9c68201577e70278285b349a5a662caf 407c23786dd0d3a503e9429eead96e611d3950c9 2025-09-03T19:59:16+02:00 Oliver Simons CUDA: Optimize `rms_norm_f32` kernel and its fused variants, giving 1-6% perf E2E (#15715)
cdedb70a998cea7052560fe0b0615a839443564d 2c8dac72eb6acd4e20c0da251535dfc46d35178b 2025-09-03T18:16:26+03:00 Georgi Gerganov sampling : optimize dist sampler (#15704)
2c8dac72eb6acd4e20c0da251535dfc46d35178b 40a751ea9a94364da73537b86502a808ebe1fc3a 2025-09-03T13:35:49+02:00 Daniel Bevenius llama : fix incorrect model type for Gemma 270M (#15764)
05c0380f2ae5c7193445e03ebc7b6de9ce49f1a6 8c3fdf44ecf08335942f2ba558955f55e88c7991 2025-09-03T16:16:21+08:00 xctan ggml-cpu : optimize RVV kernels (#15720)
9961d244f2df6baf40af2f1ddc0927f8d91578c8 25f1045f07cf0daf667d63e35618842e3174a8c7 2025-09-02T17:12:37+08:00 hipudding CANN: Resolve soft_max precision issue (#15730)
02c1813517412f3e00aa6ca7c0273fea64edb492 77dee9de97be75b7143a213bc48893e0c0b29af7 2025-09-01T16:19:07+02:00 Ruben Ortlam Vulkan: Add Integer Dot Product mul_mat_vec shader for legacy quants (#14903)
b9382c3877c6067feccf182efe9449a2d1cb24c7 3dc7397a2799bdc07bccf637ab7ae5a1e786d1a4 2025-09-01T08:57:23+08:00 hipudding CANN: Optimize MUL_MAT_ID (#15658)
3dc7397a2799bdc07bccf637ab7ae5a1e786d1a4 e92d53b29e393fc4c0f9f1f7c3fe651be8d36faa 2025-09-01T08:57:00+08:00 hipudding CANN: fix RoPE cache issue on multi-device (#15629)
e92d53b29e393fc4c0f9f1f7c3fe651be8d36faa 0d161f021aa33ec0e90cce96f5d1a88925557327 2025-08-31T20:41:02+03:00 Georgi Gerganov sampling : optimize samplers by reusing bucket sort (#15665)
c37052ab4d6d1ae73c0e90bc6e560cc6409e1311 5c16b9c87d840e4d5d55fa83c732c6b693346f40 2025-08-31T02:06:43-05:00 Jeff Bolz vulkan: mul_mat_id coopmat2 optimizations (#15546)
e8d99dd0b67f2ecc1e45fca8074a3a18c3e036d2 a8bca68f727844e7dcf24a956003b3c2039ea563 2025-08-28T18:39:31-06:00 Gabe Goodhart nvidia nemotron nano v2 (nemotronh) (#15507)
fbef0fad7a7c765939f6c9e322fa05cd52cf0c15 da54f9f1a2db07aaae390024ac466e7867685d94 2025-08-27T20:58:09+02:00 Johannes Gäßler server: higher timeout for tests (#15621)
1e7489745a74996fc36e8fd05b73aa16bc184e0c 1cf123a343ab7ca5586aacb9e0a1d2de7fe33be4 2025-08-27T17:21:41+08:00 Chenguang Li CANN: refactor mask handling and improve performance in FA (#15561)
8b696861364360770e9f61a3422d32941a477824 8ce3ff1d91245e158d98d8062cd64b0dd98dcfe3 2025-08-27T00:27:49+05:30 Akarshan Biswas SYCL: fix rms_norm_mul_add for tensor dim not a multiple of sg_size (#15592)
44b1efa41acd4df3f56ee0e46f898135ecd1a054 a6a58d64785cb458ed9de52f391aa38142d38d64 2025-08-26T15:42:49Z Eve tests: add performance test for mul mat id (#15543)
a6a58d64785cb458ed9de52f391aa38142d38d64 0373486dbc0dccbdcb3b5fdd65759d88cec06196 2025-08-26T21:05:25+05:30 shalinib-ibm llamafile: PowerPC Sgemm Optimization (#15558)
b3964c1e890ef8c947afb36a5124ce6fcb2136d4 79a546220c719e6a70627b243a478ab8d84dc9e1 2025-08-26T14:22:14+03:00 Georgi Gerganov metal : optimize FA vec for large sequences and BS <= 8 (#15566)
1d8d83deaa48d4a5491820d58ff1c0d8cf9d196c c4e9239064a564de7b94ee2b401ae907235a8fca 2025-08-26T12:46:15+03:00 Georgi Gerganov metal : improve `MUL_MAT_ID` (#15541)
0115cfb7c1dec0753aecb34f3af4338bf9de8eeb 3a617cb18121a85eed17ac5585788810c5d9c1e0 0d5a470223fc90b6b6807921d68011ff06ae7f9e 2025-08-26T15:19:56+08:00 Yunzhe Jia Merge branch 'master' into dev
74f52f77f28a5ad6d6075231afcb8d1ad763ca32 f7207b0415986dd7f48447149da7de3a82338276 2025-08-26T05:21:22+08:00 Qeeweew CUDA: Accelerate MXFP4 table lookup using `__byte_perm` (#15451)
4d917cd4f64cc37744e76d084659475819fb0728 886b97a5d693550c2da470c091d9d27bf38398f8 2025-08-25T17:56:59+02:00 Ruben Ortlam vulkan: fix min subgroup 16 condition for mmid subgroup optimization (#15565)
5eff6ec9b1220b599a43b594b1110487ab6aca08 dfd9b5f6c7586c88588f06a644c131bec071a0a1 2025-08-25T17:23:40+02:00 Johannes Gäßler CUDA: MoE helper in device code, better tile sizes (#15525)
6b64f74b55628e4193f4fb00313f07dbd8556528 0d5a470223fc90b6b6807921d68011ff06ae7f9e 2025-08-25T13:56:43+03:00 Georgi Gerganov batched-bench : fix unified KV cache handling + pp timing (#15562)
043fb27d3808766d8ea8195bbd12359727264402 b730706a49e576fb882dc34d9966345778b3ab0b 2025-08-24T19:36:36+02:00 Ruben Ortlam vulkan: apply MUL_MAT_ID subgroup optimization to non-coopmat devices (#15524)
611f419cff11e4952228162a1c44cb35dff2274a b1afcab804e3281867a5471fbd701e32eb32e512 2025-08-23T13:16:17-05:00 Jeff Bolz vulkan: optimize rms_norm, and allow the work to spread across multiple SMs (#15281)
9ef536907de1b50c30e0369284898d30472a755a 21dc4ddaf21b8ed551d717e7606abd2cffbacdbf 2025-08-23T12:58:58+02:00 Johannes Gäßler scripts: fix compare-llama-bench.py (#15521)
289bf4113ef5c02d8f5eb0cf2d86683d8b8bc4d9 b55f06e1aa67fb10e89f53e31bbccf37eb2678ea 2025-08-23T02:33:36-05:00 Jeff Bolz vulkan: Rewrite synchronization to allow some overlap between nodes (#15489)
330c3d2d21b55bca5517db7d2eea2ea8f131df4a e92734d51bcb82cc35f0a6b5a14928f0036b2c90 2025-08-23T01:31:54-05:00 Jeff Bolz vulkan: optimize mul_mat_id loading row ids into shared memory (#15427)
ad5c975c2d0297124fad210776ef8eed6b90d578 4afb0a746f22abaa545b3ebdb76a400d7da3a713 2025-08-22T16:11:04+08:00 Aaron Teo ggml-cpu: Support Q5_0 and Q5_1 on s390x (#15486)
a0f98dd604d34826eb5ea2560d1e23fe726921df 54a241f505d515d625767b993bfd573ecee306b9 2025-08-22T14:12:07+08:00 Chenguang Li CANN: Optimize RMS_NORM using cache (#15419)
2758fa10dab0556e6c3f130e664750fd6773dc7c b108e429043ee5c9fc8fa4957a0a52c3e490d5c9 2025-08-21T12:16:54+02:00 Daniel Bevenius examples : add model conversion tool/example (#15455)
fec9519802ae1567048abb126cdd5ea160a22d0f 657b8a77bd01854f99d37a47318fa24f2e7e298f 2025-08-20T09:33:14-05:00 Jeff Bolz vulkan: shorten pipeline name strings (#15431)
37f10f955f70e0158d50343d0b9a3f92d194daae 2f37014073f4c6ddc8f241c927db87337c71aa52 2025-08-20T12:31:16+02:00 Daniel Bevenius make : remove make in favor of CMake (#15449)
a6d3cfe7fa6ea1fb0e1ba8243b731db22ddc0b49 67f09a3a27db443f9870aac87e163dba0d08131e 2025-08-19T21:28:22+08:00 SHUAI YANG CANN: optimize rope operator (#15335)
6424594c56f4dbd0573455d89a0d89a0ac093d13 e9288e886970884f288533cd597b3798995b4099 2025-08-19T10:54:31+02:00 Marvin Gießing ggml-cpu: add mxfp4 VSX intrinsics for Power9+ (ppc64le) hardware (#15385)
f0d3c7405c323784a60f14ddddfbac3f7404d417 f08c4c0d8d0cb6caaf8b7ad316039232b9fa059c 2025-08-19T08:45:12+03:00 Georgi Gerganov batched-bench : use rand tokens (#15398)
de5627910df74298c998e6bb36ee3217375a5719 65349f26f2299e06477ec8e85e46243046801358 2025-08-17T03:41:45-05:00 Jeff Bolz vulkan: Optimize argsort (#15354)
1fe00296f587dfca0957e006d146f5875b61e43d de2192794f4e8e04f2e8167ef2424905145e88fc 2025-08-16T11:48:22-05:00 Jeff Bolz vulkan: fuse adds (#15252)
863d341eeb81db104902b14b6f9413daa515e957 d32e03f4495d3efa1c5126f53b449f1d429c5664 2025-08-14T08:38:10-05:00 Jeff Bolz vulkan: perf_logger improvements (#15246)
5cdb27e0917479d2d742cea7beee089574bb09fa 3ea913f1ce9567289aedd866a569dbab8fb8e419 2025-08-14T03:03:57-07:00 Jonathan Graehl finetune: SGD optimizer, more CLI args (#13873)
6028bf74351d35a06bd98498624f8c2f029f7d1a bc5182272c373267352bc689e5fca276934bea2d 2025-08-13T10:04:46+02:00 Oliver Simons CUDA: Optimize `reduce_rows_f32` kernel, leading up to 25x perf improvement on kernel-level and 10% perf increase for Gemma3n (#15132)
bbd57b7eafb3b32e3f7f3a2175bce0b35abc7de8 25ff6f7659f6a5c47d6a73eada5813f0495331f0 2025-08-12T16:12:13+08:00 Chenguang Li CANN: GGML_OP_CPY optimization (#15070)
4850b52aedceeb70bb4fe49f2d7cd1df6ee98682 cd6983d56d2cce94ecb86bb114ae8379a609073c 2025-08-08T23:04:36+02:00 Johannes Gäßler server-bench: external OAI servers, sqlite (#15179)
9a96389544a08fd829fccda28142ce2066017fde 1d72c841888b9450916bdd5a9b3274da380f5b36 2025-08-07T13:45:41+02:00 Christian Kastner ggml: Skip backend library linking code when GGML_BACKEND_DL=ON (#15094)
2241453252147bb7362a286977ee9f9a92130062 9515c6131aecaccc955fdedcfe16c3e030aaefcb 2025-08-06T14:12:42+08:00 Chenguang Li CANN: add support for ACL Graph (#15065)
fd1234cb468935ea087d6929b2487926c3afff4b f324a3b715d5c1081c110ce459f8a8486fb1ee89 2025-08-05T22:10:36+03:00 Georgi Gerganov llama : add gpt-oss (#15091)
4cb208c93c1c938591a5b40354e2a6f9b94489bc 3025b621d12a6931ff5e9775d4f644719980ad91 2025-08-02T04:21:37-05:00 Jeff Bolz vulkan: coopmat2 mul_mat optimizations (#14934)
3025b621d12a6931ff5e9775d4f644719980ad91 ec0b18802c91badd3ff1388ffd09ee163251bd72 2025-08-02T17:20:40+08:00 R0CKSTAR llama-bench: rename DB table name from test to llama_bench (#15003)
a9f7541ec25c4c8547daf5ff48700ad2836e2b7d 9c35706b98ea271858acef4194f526a71b24cdc9 2025-08-02T02:57:04-05:00 Jeff Bolz vulkan: optimizations for direct convolution (#14933)
484b2091ce5017901483b5204c07878f171d1441 daf2dd788066b8b239cb7f68210e090c2124c199 2025-08-01T08:47:27+08:00 R0CKSTAR compare-commits.sh: support both llama-bench and test-backend-ops (#14392)
c7aa1364fd59b2ac06fd9e0a719253d968472dc3 1a67fcc30677e96dda76bb1b290788e7d8852b51 2025-07-29T17:43:43+02:00 uvos HIP: Ignore unsupported unroll transformation in fattn-vec (#14931)
bbd0f917797e9d524680f1b30d34a46eb06d7651 0a5036bee9cfb946870689db4400e9e0d17844c9 2025-07-29T10:40:50+02:00 Johannes Gäßler server-bench: make seed choice configurable (#14929)
bda62193b2a6bebbf515c3c389303094a44458c1 c556418b600ad5792440942079d93e393595688b 2025-07-28T09:04:27-07:00 Leonard Mosescu test-backend-ops : extend test case filtering (#14865)
c556418b600ad5792440942079d93e393595688b db16e2831c0f344f041af3d067db81c42b16eb22 2025-07-28T18:59:04+03:00 Radoslav Gerganov llama-bench : use local GPUs along with RPC servers (#14917)
66906cd82a4a1fd10151707cee3f66cb61fc4055 11dd5a44eb180e1d69fac24d3852b5222d66fb7f 2025-07-26T18:28:14-04:00 deepsek HIP: Enable Matrix cores for MMQ Kernels, Enable stream-K for CDNA 3 (#14624)
793c0d7f46384001738c337d7afa46b45ae32745 ce111d39d666f4a3b6a561ad020f6feb8cc67790 2025-07-25T10:47:39-06:00 Gabe Goodhart metal: SSM_SCAN performance (#14743)
e4868d16d24dec55e61bcaadaca28feed8f98b13 820de57d4faa427a3d0bfb14e48057247fae036e 2025-07-24T16:31:48+03:00 Georgi Gerganov context : perform output reorder lazily upon access after sync (#14853)
a86f52b2859dae4db5a7a0bbc0f1ad9de6b43ec6 b284197df426fb189cdcfe56a43c863a788ac756 2025-07-23T21:43:25+02:00 Johannes Gäßler CUDA: fix overflow in FA, tune performance (#14840)
d1aa0cc5d13ec3fa553de5d298f9166679e58479 c8ade30036139e32108fee53d8b7164dbfda4bee 2025-07-22T13:33:37+01:00 Ed Addario imatrix: add option to display importance score statistics for a given imatrix file (#12718)
a979ca22db0d737af1e548a73291193655c6be99 90083283ec254fa8d33897746dea229aee401b37 2025-07-19T21:59:08+02:00 Ervin Áron Tasnádi ggml: adds CONV_2D op and direct GEMM Vulkan implementation (#14316)
90083283ec254fa8d33897746dea229aee401b37 d4b91ea7b2da253e1355b503f0fcb7b428ce005d 2025-07-19T12:51:22-04:00 compilade imatrix : use GGUF to store importance matrices (#9400)
01612b74090df592663cfa01f661c9628f403b59 086cf81e88fb75287b71ff19c08a206b7bc2e02f 2025-07-17T19:08:33+03:00 Georgi Gerganov llama : reuse compute graphs (#14482)
225e7a1438f4ea85eaa7b5ef3ab3b266ee4d9c06 ab140198211385b85eeeb0abd549a4bbe259e10d 2025-07-16T16:35:42+03:00 Georgi Gerganov llama : add high-throughput mode (#14363)
ab140198211385b85eeeb0abd549a4bbe259e10d 64978340b0b4a0a6e2fb74270c1509383d2eff32 2025-07-16T20:03:51+08:00 Aman Gupta Support diffusion models: Add Dream 7B (#14644)
5cae76654113160f691f581930b69fc5535e8159 4b91d6f71f14040979bcdb7b6729b3bca93ec1c1 2025-07-16T09:33:28+02:00 Johannes Gäßler scripts: synthetic prompt mode for server-bench.py (#14695)
79e0b68c178656bb0632cb8602d2940b755077f8 c81f4192f91a1e209c1eec7a84fe5371ef9175da 2025-07-16T12:00:42+08:00 Min-Hua llama: add LLAMA_API to deprecated llama_kv_self_seq_div (#14708)
494c5899cb76859f32ddd913534f2685fd684a3d 0f4c6ec0f1a9607ba67071f8a02c69b0afc2f91e 2025-07-14T13:14:30+02:00 Johannes Gäßler scripts: benchmark for HTTP server throughput (#14668)
05fec5bd298d3c0243cbb9336e59b8b6aff75a81 dcf7f2ea3c4e3cf36dd9ab5a36785c00e6033267 2025-07-13T10:36:33+03:00 Georgi Gerganov ggml : add build-time message to remind about ggml_set_rows (#14661)
b3ad3a0191994d6c47b2bd389d5c7431526ecd2c 98197e5c98388470030d908f355ec5937dcccaaa 2025-07-12T05:12:26-05:00 Jeff Bolz vulkan: support SET_ROWS (#14587)
98197e5c98388470030d908f355ec5937dcccaaa f5e96b368f1acc7f53c390001b936517c4d18999 2025-07-12T04:51:58-05:00 Jeff Bolz vulkan: optimizations for deepseek prompt processing (#14555)
0aedae00e6fb48680324a5ac5da9cba0e35de6b5 6bdda13981d6c8189b7dc4f9fb8ecb91c21529f8 2025-07-10T18:20:13-06:00 Gabe Goodhart model : Granite Four (#13550)
4a5686da22057867c23bd4a6be941ddc8c51e585 98bab638fb28cf95a5a66dd2d51b40d6c8f6d69a 2025-07-09T14:59:57-04:00 compilade llama : support Jamba hybrid Transformer-Mamba models (#7531)
6efcd65945a98cf6883cdd9de4c8ccd8c79d219a 699f4392a33f57c3352cf8d60bdc53db7ca235e7 2025-07-08T13:11:42-05:00 Jeff Bolz vulkan: optimize flash attention split_k_reduce (#14554)
53903ae6fa5f1caf187889c839cdd1ad25da4018 4d0dcd4a06080e796e6742a88f2ffa7fc41b28b8 2025-07-08T02:38:31-05:00 Jeff Bolz vulkan: increase timeout for CI (#14574)
5d46babdc2d4675d96ebcf23cac098a02f0d30cc e17991c466ac835b2c71bd813c1ca7ff8dd97b94 2025-07-02T13:10:24-04:00 compilade llama : initial Mamba-2 support (#9126)
caf5681fcb47dfe9bafee94ef9aa8f669ac986c7 83790b0e7e09ab17238b16452a33053a71dbdfad 2025-06-29T20:02:53+02:00 matteo server : support jinja extra template kwargs (Qwen3 enable_thinking feature), from command line and from client (#13196)
a0535ffa0d35fccfec3e1a0a3bfc9dbb6054d7c0 bd9c981d7226107f18deb8344c3301450311bb8b 2025-06-29T11:04:10+02:00 Sigbjørn Skjæret ggml : implement REGLU/GEGLU/SWIGLU ops (#14158)
bd9c981d7226107f18deb8344c3301450311bb8b 27208bf657cfe7262791df473927225e48efe482 2025-06-29T02:43:36-05:00 Jeff Bolz vulkan: Add fusion support for RMS_NORM+MUL (#14366)
8d94219a4a7f2da72ee542019ca01f36af93d1d6 f667f1e6244e1f420512fa66692b7096ff17f366 2025-06-27T16:41:40+03:00 Radoslav Gerganov ggml : add ggml_set_rows (#14274)
8f52c6f8abb2ed9ad967cc0bfb90acb073011193 d2f325130c4ed77a3dcff2c23a926587fb08e2cc 2025-06-26T15:10:45+08:00 Yunzhe Jia Squashed commit of the following:
60ef23d6c14d325d83eae5752e5de39ad268e9b0 b193d5306912a2adae0fde7481819f6ee0941bc6 2025-06-26T05:49:04+08:00 Aaron Teo ggml-cpu: enable IBM NNPA Vector Intrinsics (#14317)
0142961a2e67909e33cdf410274b56c08c5dce7a ce82bd0117bd3598300b3a089d13d401b90279c7 2025-06-24T01:12:56+02:00 uvos CUDA/HIP: optimize mmv paths taken for HIP devices (#14324)
812939a9e90f99d1bd5bb1bc6b99d12600671d50 4c9fdfbe1580a66fd7d77c77418ce2c606a29fdd 2025-06-20T10:50:27+03:00 Georgi Gerganov model : more uniform output id handling (#14275)
8f71d0f3e86ccbba059350058af8758cafed73e6 381174bbdaf10d6a80dc2099f284b20544d86962 2025-06-19T12:24:14-07:00 Diego Devesa ggml-cpu : remove unnecesary arm feature detection (#14281)
fffcce535ebbdc25f81966a15b758658788e7466 5fc7856815920f828f9e90cb759ac82c7f0c1ea5 2025-06-19T13:24:12+03:00 bashayer hijji llama-bench : add --no-warmup flag (#14224) (#14270)
8d947136546773f6410756f37fcc5d3e65b8135d 50d2227953ca9024f04255b4f116d06fcc0db74c 2025-06-19T01:10:26+08:00 Aaron Teo docs: add s390x build documentation (#14264)
0dbcabde8c006d5cf781ca0fe071c41559572a72 ad590be98c83217fcf1a101d78d9ab389fd5dc0b 2025-06-16T10:32:13-03:00 bandoti cmake: clean up external project logic for vulkan-shaders-gen (#14179)
b9912ac570de8945ae9383c9ca8291027bf287dd 00ba7726100d7e1941d9f5a06f56a7559945b33c 2025-06-15T09:18:37+03:00 Georgi Gerganov batch : auto-gen positions + verify multi-sequence input (#14177)
2e42be42bd6bf1dcc643d6ac4e77419bfe5dd24f fb85a288d72abbd5e5daa8de96e6f8bfa7b5ab46 2025-06-14T16:34:20+08:00 Aman Gupta compare-llama-bench: add option to plot (#14169)
c61285e7396c8e526fe7794c19e8d4f1c99bfc51 09cf2c7c655c90e53e100f29b830a788bab0653d 2025-06-13T08:45:37+01:00 Ewan Crawford SYCL: Bump oneMath commit (#14152)
532802f938c6a18cc6a704057ab571f253fd77ed d4e0d95cf581f50c9a21d06eaecae2dd580076bd 2025-06-11T19:07:44Z Christian Kastner Implement GGML_CPU_ALL_VARIANTS for ARM (#14080)
3a12db23b6918682ccb70ab15d897f11fe5fc320 ae92c1855b1a5b604fa1bfcced19a556ab3e78c5 2025-06-10T16:48:07+01:00 Juk Armstrong Fixed spec timings to: accepted/tested instead of accepted/drafted (#14104)
228f34c9ceefa3ea4f4d6933edd858121e8106cb 0974ad7a7cd4bca846b15c484ff3be890135a52c 2025-06-07T18:58:20+05:30 Akarshan Biswas SYCL: Implement few same quantized type copy kernels (#13739)
7e00e60ef86645a01fda738fef85b74afa016a34 ea1431b0fa3a8108aac1e0a94a13ccc4a749963e 2025-06-03T13:30:22-05:00 Jeff Bolz vulkan: fix warnings in perf logger querypool code (#13937)
71e74a3ac929b8af91f16f73f3c2b9b2f796d207 bfb1e012a0b7658e8f00ed4333d059943ea9d648 2025-06-02T16:54:58-07:00 lhez opencl: add `backend_synchronize` (#13939)
093e3f1feb16e25e58f7d61e01266c830dd424b8 663445b0deb21fb602176da030d4154197a4fca6 2025-06-02T17:48:36+05:30 shalinib-ibm cmake : Handle mixed-case 'Power' strings in POWER CPU detection (#13966)
053b1539c02617eff744f89525ee57497c3c1fbe b3a89c3d9e34c28c5be70d8b687a84775746d4a0 2025-05-31T15:39:19-07:00 Max Krasnyansky threading: support for GGML_SCHED_PRIO_LOW, update thread info on Windows to avoid throttling (#12995)
b49a8ff96b769b8a4c36d89fb783ec0135be582b 53f925074de02c5304b00c14b4d6d8910c58667d 2025-05-30T19:40:57+05:30 Akarshan Biswas SYCL: Add mrope kernel (#13755)
54a2c7a8cd8a32b44e3a98c2999b0f5c9114be5c 21fcc21ad5e5de2daa5da8d08dbbcc86b8d815d7 2025-05-29T19:39:20+08:00 Yibo Cai arm64: optimize q4_k_q8_k kernel with i8mm (#13886)
bef817638780dcbd8c0c80c97b7a4f8e92c8fe74 34b7c0439ed0f98575cc4689dfecd98991dee8be 2025-05-27T11:39:07-05:00 Jeff Bolz vulkan: use timestamp queries for GGML_VULKAN_PERF (#13817)
bc583e3c63c04a11d287c108ea9e6a515ead0423 72b090da2c50e540143fd312a2f9aa5f151e6136 2025-05-27T14:06:10+02:00 Xuan-Son Nguyen mtmd : support Qwen 2.5 Omni (input audio+vision, no audio output) (#13784)
f5cd27b71da3ac375a04a41643d14fc779a8057b a2d02d5793fd9af7a7224773456501691b95fd02 2025-05-25T01:48:08+01:00 Olivier Chafik `server`: streaming of tool calls and thoughts when `--jinja` is on (#12379)
2bd1b30f6979235ec67b95c183b9b77baa7ab9ce 259469c4b57c1a32606353bcac52ba683424a990 2025-05-24T13:26:47-07:00 Diego Devesa ggml-cpu : set openmp wait time if not set (#13758)
f7c9429c85748cde9599499601ba48d0057722e6 1dfbf2cf3a9f15193dd893396d07762bbd2c4785 2025-05-20T02:54:43+02:00 Nicolò Scipione sycl : Overcoming workaround for mmap() allocation on Windows (#13482)
725f23f1f3f0d3adf49f95d8dfa6e7c74adff149 92ecdcc06a4c405a415bcaa0cb772bc560aa23b1 2025-05-19T14:38:20+01:00 Alberto Cabrera Pérez sycl : backend documentation review (#13544)
6c8b91500e75df6664278d1e9af3e39e8a2fb0d0 3cc1f1f1d24472a6558c942b1c78989ff4b0e569 2025-05-15T06:46:55-07:00 Diego Devesa llama-bench : fix -ot with dl backends (#13563)
b2838049ccf50859cea4c390e81405c2fb01e820 aa48e373f256df9608395ee6881e7010840d6202 2025-05-15T05:57:02+03:00 Georgi Gerganov bench : handle decode errors (#13548)
5ab5d5fb256aa23f8ab4de8463515ea627f43006 3198405e98530c683d12fd123e3920f2bd2aafa5 2025-05-15T03:53:52+08:00 Yibo Cai arm64: optimize q6_k_q8_k kernel with i8mm (#13519)
24e86cae7219b0f3ede1d5abdf5bf3ad515cccb8 bb1681fbd532eba26ae4c14cd8be884c8afeb31c 2025-05-14T18:55:26+09:00 Jeff Bolz vulkan: KHR_coopmat flash attention (#13506)
be1d4a13db26750fac702ceb3af88ae4f39dc9f4 ab3971f2a0a526564bfde0e4cc8a5b90f9d33ad2 2025-05-14T08:41:01+02:00 Sigbjørn Skjæret scripts : fix compare-llama-bench.py show parameter (#13514)
f0995d28ce3d15095b6845d94ce4465e46575873 c252e0c4097b34666e5a81db9d0450d71fa3098f 2025-05-13T18:04:39+03:00 Georgi Gerganov metal : use FA-vec kernel up to batch size 20 (#13496)
c252e0c4097b34666e5a81db9d0450d71fa3098f 4f711afed5e7ef4304b567c8888ee1aa60e868eb 2025-05-13T18:04:00+03:00 Georgi Gerganov metal : optimize multi-sequence FA vec kernel (#13493)
b89d605a91dee0a518ecd582f8991a07d523e2fa b4726345aca49e2ad62d615e6e370b3dbad6434f 2025-05-13T18:01:53+03:00 Georgi Gerganov batched-bench : fix pp batch contents (#13492)
bf7937112058f2815fc3825a9ff7b536ecafa3bb d590cd4c244e5f260c42c290b83a358b9d86d763 2025-05-13T15:31:12+02:00 Sigbjørn Skjæret scripts : support arbitrary input file formats in compare-llama-bench.py (#13455)
cf0a43bb6490bd49344775abb22ba26f8047cb54 f0d46ef15717cd609a7b69cf6190edde64d466c8 2025-05-12T15:31:37-07:00 Diego Devesa llama-bench : add defrag-thold, check for invalid ranges (#13487)
22cdab343b63edd0906f1c132616746085f81983 a71a4075cdb8e81eaaa834e48ffda88b038286bc 2025-05-12T13:08:22+02:00 Diego Devesa llama-bench : accept ranges for integer parameters (#13410)
09232370fc6426aa5dd9be01a8271b9c28f5af3a 7474e00b34629e9cd8b06bc87ad935584ea30f8e 2025-05-11T16:20:39+02:00 Sigbjørn Skjæret scripts : exit compare-llama-bench.py gracefully when there's nothing to compare (#13451)
7f323a589f8684c0eb722e7309074cb5eac0c8b5 3eac209319a6726fd9687c6188fc6b916b65953d 2025-05-11T20:18:39+08:00 David Huang Add `--no-op-offload` to improve `-ot` pp perf in MoE models like llama4 400B (#13386)
dc1d2adfc0f4de84da7923866d00781ec5c4e666 7c28a74e0783f4bb74a246fb9f19bf212139e365 2025-05-09T23:07:07-07:00 Jeff Bolz vulkan: scalar flash attention implementation (#13324)
33eff4024084d1f0c8441b79f7208a52fad79858 17512a94d636c4b6c1332370acb3e5af3ca70918 2025-05-09T19:29:37+02:00 Xuan-Son Nguyen server : vision support via libmtmd (#12898)
611aa914ef4231fab5d1ad04773c42e119ae2d2e 0cf6725e9f9a164c39f7a87214d60342f7f946d8 2025-05-09T15:14:56+03:00 Georgi Gerganov metal : optimize MoE for large batches (#13388)
1e333d5bba18e99bc328bb87ac1ee6a4e6260e0e 2f54e348ad2999c4e31b8777592247622b20420f 2025-05-06T20:27:06+05:30 Akarshan Biswas SYCL: Disable reorder optimize by default and stop setting tensor extras when optimize is disabled (#13254)
b34c859146630dff136943abc9852ca173a7c9d6 9b61acf06041dcbaff6afa5f28940e93297f8520 2025-05-05T17:03:31+03:00 igardev server : Webui - change setText command from parent window to also send the message. (#13309)
b34443923cad751483cc53af2e680d595daadce7 a75cb30dc9e63488c3614e2d5a9fe2306eaf47cd 2025-05-02T20:54:30+03:00 Georgi Gerganov sync : ggml (#13268)
3f3769ba76061a511f02f2a48da2ad2d93fce511 2f567611c0234bbca0a4009762acb47b56866095 2025-05-02T22:23:12+05:30 shalinib-ibm ggml : Enable MMA for BF16 in llamafile_sgemm (#13148)
19e899ce21a7c9ffcf8bb2b22269a75f6e078f8f e2e1ddb93a01ce282e304431b37e60b3cddb6114 2025-04-29T23:32:04+02:00 Johannes Gäßler scripts: n_depth for compare-llama-bench [no ci] (#13201)
5a6398011704c31178d7b774be67856ba57647c8 cdf76586b23c67abd3ca064ee2c084c57ae240bd 2025-04-29T16:24:36+01:00 Alberto Cabrera Pérez llama-bench: fixed size of fields to correctly map to values (#13183)
1831f538f720d1d99fba146f24f0a8e970838cc4 4e87962e34a4b257ec374c4baf6b1568554b81a9 2025-04-28T20:20:39+05:30 Vishal Agarwal llama-bench: add `-d` depth arg (#13096)
c0a97b762e5ec767dc414f0dc4979befd4c09a52 ced44be34290fab450f8344efa047d8a08e723b4 2025-04-27T14:48:26-07:00 4onen llama-bench : Add `--override-tensors` arg (#12922)
2d451c80590b9ac250322769ac13d3b4870dbcf7 4753791e70acd4d4e02f2098f14a03df26c992bd 2025-04-26T22:58:12+02:00 Xuan-Son Nguyen common : add common_remote_get_content (#13123)
77d5e9a76a7b4a8a7c5bf9cf6ebef91860123cba d5fe4e81bd447124836ecfb47d794f8768665b9f 2025-04-26T22:05:31+08:00 SXX ggml: move fp16/bf16 conversion optimizations to CPU backend + export conversion APIs (#13107)
553a5c3a9fdf771be2101bc3529937963f817457 13be08daf992c89d5169518229b3740041c0f419 2025-04-25T10:08:08+03:00 Radoslav Gerganov rpc : do not wait for response when sending RPC_CMD_SET_TENSOR (#12943)
7a395f67a7a02bb361d944b816d6e933889e28e1 971f245b3b5f3f55991bb779cb541b00f82eea1d 2025-04-17T20:34:16+08:00 hipudding CANN: Add support for async operator submission (#12864)
015022bb53387baa8b23817ac03743705c7d472b b43d89e311c5e7fbf62e5ec3c0401eb536677267 2025-04-16T13:37:25-05:00 Jeff Bolz vulkan: enable coopmat2 FA gqa and split_k optimizations more often (#12931)
84778e97703740d8ac5fb64e14d83b80eafa0f3c 510676475f885ec064ff147af9f20ee7a9b12a50 2025-04-15T17:20:38+08:00 David Huang CUDA/HIP: Share the same unified memory allocation logic. (#12934)
daa422881a0ec7944771bcc8ff8de34d11f5bd3b eccc7a1602f0752507de4aaad1008b9618a282c8 2025-04-15T07:49:57+01:00 Juk Armstrong llama : DeepSeek V2/V3 MLA implementation (#12801)
0019279bb56f028e4eee19b59b19750736c719f7 b0c75ac9f93322b45e3766e149417334b4fd1ed9 2025-04-15T10:09:35+08:00 Chenguang Li CANN: Opt ROPE optimization (#12865)
b0c75ac9f93322b45e3766e149417334b4fd1ed9 d6d2c2ab8c8865784ba9fef37f2b2de3f2134d33 2025-04-15T10:04:24+08:00 Xinpeng Dou CANN: Optimize CANN buffer pool memory management (#12875)
d6d2c2ab8c8865784ba9fef37f2b2de3f2134d33 75afa0ae31f0a51aaadcc5ff146eb7a32a7f9088 2025-04-15T01:18:20+08:00 Russyyds Add performance print for gemma3 in example (#12929)
8b9cc7cdd8a0dcf0176c60c755322c95b5965299 64eda5deb9859e87a020e56bab5d2f9ca956f1de 2025-04-10T22:57:16+02:00 Xuan-Son Nguyen llava : introduce libmtmd (#12849)
0090950f679475c5ecaac2f7bca5049cca96492b 7ecd780b1a1d5214b8d04c25ebfc194d310816ed 2025-04-09T00:25:08-05:00 Jeff Bolz vulkan: In coopmat2 mmq, load q4_k/q5_k scales through shared memory (#12833)
8ca6e1c3a4deb6bb27ee294bfd5706098d94ae88 656babd6c21a3b9b3622324cfcc80a2ab78da25b 2025-04-08T14:14:59+05:00 characharm server : webui : Improve Chat Input with Auto-Sizing Textarea (#12785)
6bf28f0111ff9f21b3c1b1eace20c590281e7ba6 f1e3eb4249db68d97be352c0adf16eef7ae53795 2025-04-05T18:04:03+02:00 0cc4m Vulkan: Tune Vulkan mmq int dot shader for performance (#12767)
74d4f5b041ad837153b0e90fc864b8290e01d8d5 35e592eb30832187412360912ab8f2f5b7984df1 2025-04-04T00:54:35-05:00 Jeff Bolz vulkan: Hybrid waitForFences/getFenceStatus to reduce fence latency (#12630)
c262beddf29f3f3be5bbbf167b56029a19876956 5dd5d1ab00d074e3b7c02ca3ae12f6bf3e86336a 2025-04-03T21:50:29+05:30 Gaurav Garg CUDA: Prefer vector flash decoding kernel for Gemma models (#12738)
be0a0f8cae039e2286f757612accebfb8f21b36e 92e3006bb69dfeb656ccf5c7c1c1efadb03c88c2 2025-04-02T12:40:32-05:00 Jeff Bolz vulkan: Implement grouped query attention in the coopmat2 FA shader (#12559)
9bacd6b37461608385360fd64326c13247ccf18e 267c1399f15a278ec8c3cdcf9c90dc94151fbc38 2025-04-02T15:22:13+08:00 Chenguang Li [CANN] get_rows and dup optimization (#12671)
e408d4351a4ad143656672479d8ae1479306ce31 3891e183c61c1e25c2c61afe68d7b95019ea3f89 2025-03-24T09:53:38+01:00 Daniel Bevenius ggml : add logging for native build options/vars (whisper/2935)
3891e183c61c1e25c2c61afe68d7b95019ea3f89 af6ae1efb27a9a7c3f7f7f84639d2243f7303ac1 2025-03-20T07:02:18+01:00 Daniel Bevenius examples : command.wasm updates (whisper/2904)
b4ae50810e4304d052e630784c14bde7e79e4132 b86f6007234da4bff51a3ebef2bdb952b52059c6 2025-03-28T20:21:59+02:00 Georgi Gerganov metal : improve FA + improve MoE (#12612)
5d01670266859444366e4f333ade5e0e5e2ae63d ef03229ff423dd1991f4f44ef1352f03334d86eb 2025-03-28T01:05:44-07:00 Benson Wong server : include speculative decoding stats when timings_per_token is enabled (#12603)
13731766db91ec927c1b61bf502ac7a9be2b11b9 ab6ab8f809bd514d88e02a63869b4d619f13fa86 2025-03-28T13:13:22+05:30 amritahs-ibm llamafile : ppc64le GEMV forwarding for FP32. (#12594)
c7b43ab60855f752ae79937fb93d561bc30b69a4 24feaec05792b972d5ff3e2b12d9237ebd50d1ac 2025-03-27T12:21:47+05:30 amritahs-ibm llamafile : ppc64le MMA implementation for Q4_0. (#12489)
ef19c71769681a0b3dde6bc90911728376e5d236 053b3f9aae63151732eccf6b7408c6418ba8746e 2025-03-25T17:46:11Z Eric Curtin run: de-duplicate fmt and format functions and optimize (#11596)
e2f560175a195f63c3276972a3d1caec0bd13e05 36ee06dd2dcf8d3d1157ebe36366d7670770e75f 2025-03-25T16:10:18+05:30 Akarshan Biswas SYCL: disable Q4_0 reorder optimization (#12560)
eddfb438502bd5d1014d63a812e9b6d03d326f8c 4375415b4abf94fb36a5fd15f233ac0ee23c0bd1 2025-03-22T03:40:11-05:00 Jeff Bolz vulkan: Optimize mul_mat_vec p021 and nc shaders (#12505)
732b5fbf5e7f9cf069942f0c5850ee959ef321ba 568013d0cd3d5add37c376b3d5e959809b711fc7 2025-03-20T02:36:37-04:00 Bartowski convert : avoid calls to tokenizer.added_tokens_decoder (#12473)
517b5ddbf002b91fd6d6daf5d8db8c88a0173039 a9b59288e222f39fc0311dc66944ed5a86c815fa 2025-03-20T01:22:06+05:30 Gaurav Garg CUDA: Improve flash decoding kernel GPU occupancy for BS=1 case (#12183)
a9b59288e222f39fc0311dc66944ed5a86c815fa 0fd8487b142b2b92565bc95b39ddc440955a237c 2025-03-19T13:56:23-05:00 Jeff Bolz vulkan: optimize iq1 coopmat2 dequant functions (#12427)
c446b2edd2a9fe2772a1a18923c3e54a6749c364 d84635b1b085d54d6a21924e6171688d6e3dfb46 2025-03-19T02:26:26-05:00 Jeff Bolz vulkan: Submit once enough matmul work has been recorded (#12406)
d84635b1b085d54d6a21924e6171688d6e3dfb46 75422e8bc42646005be0754f7aa438b97a5e777e 2025-03-18T12:54:55-07:00 lhez opencl: improve profiling (#12442)
484a8ab513bbd740cc49f30280c1acf52cb4e7e9 cf2270e4d3685ac46f4a166d8718997ba7cbc45a 2025-03-17T09:26:18-05:00 Jeff Bolz vulkan: Add N/2 and N/4 optimized paths in coopmat2 shader (#12312)
891c63956dbfbdf7ed2ecd0b5882cff49dbfe90f 2f21123c1deb3ce1be3c0578c5f6980fe19ed077 2025-03-17T04:41:59-05:00 Jeff Bolz vulkan: Pad N dimension of B matrix for coopmat2 perf, to avoid bounds checking (#12273)
92a391327e9201b9b5b32fdd3afb452026c22d4c 9f2250ba722738ec0e6ab684636268a79160c854 2025-03-15T09:31:08+08:00 Chenguang Li [CANN]MUL_MAT optimization (#12382)
9f2250ba722738ec0e6ab684636268a79160c854 774973b8f3d5e375b0b74d58638eeb1817e950a8 2025-03-14T16:41:20Z Eric Curtin Add CLI arg to llama-run to adjust the number of threads used (#12370)
5e2d57b2b2e43eadbe6d66ba3e873a824b95e725 f1648e91cf6c52e9593810aa70857e412d474c09 2025-03-07T15:35:57+08:00 BB-fat metal : simplify kernel arguments using a struct (#3229) (#12194)
e721c05c9336a72fbb59d5c75967360bc67036c6 57b6abf85acb1f697913a44e5e105e333d894b78 2025-03-06T08:20:52+01:00 uvos HIP/CUDA: set the paramerter value in maintain_cuda_graph instead of replaceing it. (#12209)
ed4ce0dda24986c80d58e2ce112049af00f632f4 07d15723470a0a5b15d8ccad1aff5b20354ffbe1 2025-03-06T09:30:05+08:00 simon886212 opencl : fix profile-related errors (#12095)
669912d9a5bf927312c553332ff997f0a99da8fb fa31c438e0e709242ab7334d26fc3be3dcda07a0 2025-03-05T13:05:13Z Olivier Chafik `tool-call`: fix Qwen 2.5 Coder support, add micro benchmarks, support trigger patterns for lazy grammars (#12034)
3ccbfe5a71c74ac574b00607067d0aa0a49df04c 06a92a193a07afe445929607be9d5e4d033956fb 2025-03-05T08:34:02+01:00 Daniel Bevenius ci : remove xframework upload (#12190)
2679c3b55d1c9c3fed56dea00fea713622e42594 c43af9276b119dae7436b7878d59671d0f6b1a97 2025-03-03T16:17:36+01:00 Daniel Bevenius ci : set GITHUB_ACTION env var for server tests (#12162)
7b69003af74924ac04d97313c2e57c45ba56b616 ece9745bb8079b9f4af45df29b67ad0c6e50584d 2025-03-03T11:42:45+01:00 Xuan-Son Nguyen webui : add ?m=... and ?q=... params (#12148)
438a83926afcff3643ffef5543db67545ceffe39 9c42b1718ca8299f9afeabdc122badeab64c9690 2025-02-28T09:42:52+01:00 Rémy O vulkan: add specific MMV kernels for IQ2 and IQ3 quants + optimizations (#11595)
581650b7cacec2872982fde381bd3bcda0f78699 b95c8af37ccf169b0a3216b7ed691af0534e5091 2025-02-28T06:52:51Z Daniele vulkan: improve im2col (#11826)
7a2c913e66353362d7f28d612fd3c9d51a831eda 08d5986290cc42d2c52739e046642b8252f97e4b 2025-02-24T09:09:51-07:00 Alex Brooks llava : Add Granite Vision Support (#11794)
08d5986290cc42d2c52739e046642b8252f97e4b 651adf4b6675339465179b81b194d98cc14704d6 2025-02-24T22:33:23+08:00 Neo Zhang Jianyu [SYCL] Optimize mul_mat for Q4_0 on Intel GPU (#12035)
af7747c95ae71a5db4184947f837179e82c70b77 a28e0d5eb18c18e6a4598286158f427269b1444e 2025-02-23T05:39:24+08:00 Aaron Teo ggml-cpu: Support s390x SIMD Instruction Set (#12019)
36c258ee921dbb5c96bdc57c0872e4a9a129bef6 f3e64859edb0d55d4223ead78672597cd1a218df 2025-02-22T22:28:28+08:00 Ting Lou llava: build clip image from pixels (#11999)
5fa07c2f93c73161bf09ef0b23b5d2686f9a073e 335eb04a91f481f37c0c9b302ee31b449b04c3e9 2025-02-22T12:20:17+01:00 Johannes Gäßler CUDA: optimize FA for GQA + large batches (#12014)
6dde1782483d6b0a1d59f5a5fbcb3119b9d34c27 fc10c38ded84670955d4c44770f8acfb64617e15 2025-02-15T20:23:22+01:00 Johannes Gäßler scripts: fix compare-llama-bench commit hash logic (#11891)
22885105a6b034abaf1c1471ad90fb2ae96146bb c2cd24fbfdfeacc2fc6ad03878379de104264114 2025-02-15T19:39:20+01:00 Adrian Kretz metal : optimize dequant q6_K kernel (#11892)
fc1b0d0936e4dfc52a81f38e7420c7d23f6caa88 89daa2564f6eab33be53c6a1b39273af536d6bb3 2025-02-15T09:01:40+01:00 Rémy O vulkan: initial support for IQ1_S and IQ1_M quantizations (#11528)
38e32eb6a0cec32130b699ce9fefad6c74571953 a4f011e8d02179f032627130f961eb77ee30401c 2025-02-14T16:54:27+08:00 Jinyang He ggml: optimize some vec dot functions for LoongArch ASX (#11842)
a7b8ce226071b2b0faaad0d36cc5ebd7fb074730 04045bb84288dc7e9e424d4e2bf7f40d259b4c6a 2025-02-14T09:13:43+08:00 theraininsky llama-bench : fix unexpected global variable initialize sequence issue (#11832)
27e8a23300e30cd6ff6107ce262acf832ca60597 e4376270d971cff7992bdb6c5412a739195b1459 2025-02-13T00:45:57-06:00 Vinesh Janarthanan sampling: add Top-nσ sampler (#11223)
be3bbd62153820ff6d358c817360927f429105c4 31afcbee0eebbc998ab311aa314e389d60aa2127 2025-02-13T00:33:45+01:00 Xuan-Son Nguyen ggml : x2 speed for WASM by optimizing SIMD (#11453)
c2a67efe38e6782c0217e1de3edc68de6951612b b044a0fe3ca0cbef9dd041edce3ebda8c501fae4 2025-02-10T07:17:21+01:00 Danny Milosavljevic vulkan: Make Vulkan optional at runtime (#11493). (#11494)
55ac8c7791ff44aeb82bd7fe3ca2041844fc77f1 e6e658319952f7ad269dc11275b9edddc721fc6d 2025-02-08T21:54:50+01:00 Xuan-Son Nguyen server : (webui) revamp Settings dialog, add Pyodide interpreter (#11759)
2d219b389e8c8c40bce547b08c8aa7add60fde1f 333820d7491cd31c707a340ff23b984a84e40154 2025-02-07T08:55:47-05:00 Christian Fillion vocab : ignore invalid UTF-8 input in the BPE tokenizer (#11729)
7ee953a64a40c09438b2064539becdbc577cefd0 ec3bc8270bc67b58955748d40a3e558a05b2d8f2 2025-02-07T04:33:27-05:00 Christian Fillion llama : add llama_sampler_init for safe usage of llama_sampler_free (#11727)
225bbbfa39930cda38a2e5d1f3e5b38226732009 855cd0734aca26c86cc23d94aefd34f934464ac9 2025-02-07T15:38:31+08:00 Jinyang He ggml : optimize and build warning fix for LoongArch (#11709)
2fb3c32a1634488a5265d1304ab37628eeb5480d 9ab42dc722ad19a12af80f38a06474d498f96da3 2025-02-06T17:32:29+01:00 Xuan-Son Nguyen server : (webui) migrate project to ReactJS with typescript (#11688)
2c6c8df56d8a3edd657b9a295e95d469a37f0044 8a7e3bf17aa5a8412854787746c92a28623a8925 2025-02-06T00:15:30-06:00 Jeff Bolz vulkan: optimize coopmat2 iq2/iq3 callbacks (#11521)
84ec8a58f7b6aad6887bbfbd1321f3ff417341a5 bfcce4d693617ec843d0b2510f6ee16e6bc6720d 2025-02-02T16:14:48+01:00 Eric Curtin Name colors (#11573)
ff227703d6d6e1888bdc7af6138514092ffcdb96 0cec062a638700495673f5494d200b74340538be 2025-02-01T23:55:32-08:00 Michał Moskal sampling : support for llguidance grammars (#10224)
66ee4f297cff3c7ce98b31dbc0ce909d41b9e408 e51c47b401f8cb5f21630a05171e2529cde4d186 2025-01-29T18:29:39+01:00 Rémy Oudompheng vulkan: implement initial support for IQ2 and IQ3 quantizations (#11360)
be5ef7963fcf14a9c77c963fdd3f7b606eacb498 cae9fb4361138b937464524eed907328731b81f6 2025-01-28T23:06:32+01:00 uvos HIP: Supress transformation warning in softmax.cu
cae9fb4361138b937464524eed907328731b81f6 7fee2889e6565830631fbe76d47ef85cf8fd946a 2025-01-28T07:42:20-08:00 Nikita Sarychev HIP: Only call rocblas_initialize on rocblas versions with the multiple instantation bug (#11080)
f643120bad8ab3a753daa64aaac8288ee5800e06 6e84b0ab8e10b8f6f99a32855f976ebcd35b0353 2025-01-28T11:42:32+01:00 Nuno docker: add perplexity and bench commands to full image (#11438)
a5203b4465c5c87813936bde98170e25bb09024f df984e014714cba4c99ef894b20b51cbcef31b16 2025-01-27T17:42:09+04:00 lexasub llama : minor fixes for up llama load model speed (#11448)
4a75d19376f2f00dbae6c266eb9c4f3001872b52 26771a1491f3a4c3d5b99c4c267b81aca9a7dfa0 2025-01-25T15:29:57-06:00 Jeff Bolz vulkan: compile shaders on-demand (#11406)
58456616408c828a1ce6d2481940fd1c97bce3b5 f211d1dc10332b7e89a4abd1041903fa63bfed27 2025-01-23T13:56:05+01:00 Xuan Son Nguyen server : add more clean up when cancel_tasks is called (#11340)
92bc493917d43b83e592349e138b54c90b1c3ea7 b9daaffe02d6a77d85f0420bce5dfe0e00daeff6 2025-01-19T20:22:30+02:00 Georgi Gerganov tests : increase timeout when sanitizers are enabled (#11300)
44e18ef93995f3040660750b527e5becf85899d0 3edfa7d3753c29e44b964c0ff424d2ea8d5fdee6 2025-01-18T02:26:50-06:00 Jeff Bolz vulkan: fix coopmat2 flash attention for non-contiguous inputs (#11281)
466300fe1416de2802b710215817db28d4496f41 206bc53422521a67de5e2caba661e21d590d2bae 2025-01-16T15:23:49-06:00 Jeff Bolz vulkan: optimize coopmat2 q4_k/q5_k dequant functions. (#11206)
206bc53422521a67de5e2caba661e21d590d2bae 4dbc8b9cb71876e005724f4e8f73a3544646bcf5 2025-01-16T15:16:39-06:00 Jeff Bolz vulkan: optimize coopmat2 q2_k dequant function (#11130)
adc5dd92e8aea98f5e7ac84f6e1bc15de35130b5 f11cfdfd7fe29436fce512d934c2ff6b94bd89d2 2025-01-15T19:50:13Z Eve vulkan: scale caching for k quants + misc fixes (#11081)
39509fb082895d1eae2486f8ad2cbf0e905346c4 a29f0870d4846f52eda14ae28cea612ab66d903c 2025-01-13T16:45:53+01:00 Andreas Kieslinger cuda : CUDA Graph Compute Function Refactor (precursor for performance improvements) (#11042)
afa8a9ec9b520137bbd1ca6838cda93ee39baf20 c05e8c9934f94fde49bc1bc9dc51eed282605150 2025-01-12T11:32:42+02:00 Georgi Gerganov llama : add `llama_vocab`, functions -> methods, naming (#11110)
8cef75c743ba13ebbd6d380c531200c768a8b8aa 0d52a69e4bf0d6181beec7853307bdcdeec9905b 2025-01-08T16:24:19+05:30 amritahs-ibm llamafile : ppc64le MMA INT8 implementation (#10912)
02f04301417e7fb44fa1025bc1b0aef866e2ca89 bec2183f2c8d37cf1278c11d1adb9311e9eaa242 2025-01-08T09:18:13+01:00 Mathieu Baudier Disable GL_KHR_cooperative_matrix Vulkan extension if not available. (#11117)
2f0ee84b9b02d2a98742308026f060ebdc2423f1 0da5d860266c6928b8c9408efbd264ae59fedda6 2025-01-02T18:06:12+01:00 Pierrick Hymbert server: bench: minor fixes (#10765)
716bd6dec3e044e5c325386b5b0483392b24cefe c250ecb3157f3bae0a45f44c3c953b5414d4c2f7 2024-12-30T11:27:11-06:00 Jeff Bolz vulkan: optimize mul_mat for small values of N (#10991)
a813badbbdf0d38705f249df7a0c99af5cdee678 fdd21889123bec62b1db3b2fc22b5a4abab32174 2024-12-29T03:16:34-06:00 Jeff Bolz vulkan: im2col and matmul optimizations for stable diffusion (#10942)
2cd43f4900ba0e34124fdcbf02a7f9df25a10a3d 09fe2e76137dde850b13313f720e7ffa17efdefa 2024-12-24T18:54:49+01:00 Djip007 ggml : more perfo with llamafile tinyblas on x86_64 (#10714)
7024d59e6a572730626cb11896829d115043a1b1 7c0e28585843b366864b43b48f92425e2ea17df6 2024-12-22T16:20:11-08:00 yuri@FreeBSD ggml : fix run-time on FreeBSD in get_executable_path() (#10948)
a91a41364b25705dbb81ae996bc35c3440c63b35 e34c5af43f941f0ddb92466776339897295aca11 2024-12-21T01:04:45-06:00 Jeff Bolz vulkan: optimize coopmat2 dequant functions (#10855)
644fd71b44c4cdbfc6482fbf0353d289c3bc29e6 4ddd199f6f6b980e0a7ed9f9b44efeae2fbdf5c4 2024-12-16T12:31:14+02:00 Georgi Gerganov sampling : refactor + optimize penalties sampler (#10803)
87cf323cef80f6aa530f047ab05b539ebc6b7e3c 5478bbcd173e7027af7689493c7421719f5c43df 2024-12-15T18:44:47+02:00 Georgi Gerganov scripts : change build path to "build-bench" for compare-commits.sh (#10836)
e52aba537a34d51a65cddec6bc6dafc9031edc63 ba1cb19cdd0d92e012e0f6e009e0620f854b6afd 2024-12-14T18:17:36Z Evgeny Kurnevsky nix: allow to override rocm gpu targets (#10794)
64ae0655114f84f11a724bc6878c6f8f4a55560b 83ed24a97b500ccdb32b90b94e6f9621ad8db79e 2024-12-13T08:42:04Z Eve vulkan: small mul_mat_vec optimizations (#10665)
235f6e14bf0ed0211c51aeff14139038ae1000aa 1a31d0dc00ba946d448e16ecc915ce5e8355994e 2024-12-11T20:52:14+01:00 Xuan Son Nguyen server : (UI) add tok/s, get rid of completion.js (#10786)
19d8762ab61df8286367588a80b9c7db4cb568db c2a16c0bdbe2e51adf318918bad82f0c3e3d6f3b 2024-12-07T13:37:50+01:00 Djip007 ggml : refactor online repacking (#10446)
3df784b3050f657ea681f804187ce5bddb433e88 86a1934978ce5daffc7e5b4251f6540ee5e7b47b 2024-12-07T10:24:15+01:00 0cc4m Vulkan: VK_KHR_cooperative_matrix support to speed up prompt processing (#10597)
40c6d79fb52f995f47507fedfeaae2ac05d9b35c 98036d5670f21e9b9a99d5e3dbb3bf7589f5c4e3 2024-12-04T02:29:20+01:00 Nicolò Scipione SYCL : Move to compile time oneMKL interface backend selection for NVIDIA backend (#10584)
cc98896db858df7aa40d0e16a505883ef196a482 91c36c269bca75b2d08119c653512cd20b4ea2ba 2024-12-03T13:29:54-06:00 Jeff Bolz vulkan: optimize and reenable split_k (#10637)
efb6ae963031709fc331e6e48cc4606ac8f9c3a7 667d70d1704dfa6977505f5d01d4638669b90dce 2024-12-02T19:27:24+01:00 PAB feat: add `GGML_UNARY_OP_ARGMAX` Metal kernel (ggml/1019)
64ed2091b24b2f9747148fdf49a34ed5938762c3 991f8aabeec89d801300bb179e52013fb0eb0584 2024-12-02T21:45:54+08:00 haopeng server: Add "tokens per second" information in the backend (#10548)
938f6087421889a3af7d0786c64406ced2be81b8 f095a649ec390e04dfab1b04e646ae8549dafaef 2024-11-29T14:46:55+08:00 Chenguang Li CANN: RoPE operator optimization (#10563)
f095a649ec390e04dfab1b04e646ae8549dafaef 678d7994f4da0af3d29046be99950ac999ee9762 2024-11-29T00:18:02-06:00 Jeff Bolz vulkan: get the first command buffer submitted sooner (#10499)
c202cef1686182a78f8f4e253ab8d0c0ffe2fcc8 2025fa67e94358deda4740a74fe9803916cb2f60 2024-11-28T20:52:03+08:00 Shupei Fan ggml-cpu: support IQ4_NL_4_4 by runtime repack (#10541)
b7420131bf8ab3e067bc660439ab1ab18be7edbd 9f912511bc9414fa7a3c521378b6388cd932b58d 2024-11-28T14:24:46+08:00 Chenguang Li CANN: ROPE operator optimization (#10540)
3ad5451f3b75809e3033e4e577b9f60bcaf6676a 46c69e0e752ff16206347bb12f96ed69f4a01abf 2024-11-27T17:10:08+01:00 uvos Add some minimal optimizations for CDNA (#10498)
46c69e0e752ff16206347bb12f96ed69f4a01abf 9e2301f4a4ef1690bd99360c11de43fe830b1c8d 2024-11-27T11:03:25+01:00 Diego Devesa ci : faster CUDA toolkit installation method and use ccache (#10537)
249a7902ec710c8d027b9cc0ed10219d2b4184f8 71a64989a5d2e25c13507efada145f12cf358914 2024-11-27T01:21:59-06:00 Jeff Bolz vulkan: further optimize q5_k mul_mat_vec (#10479)
4a57d362e1948ada50af997a92c3cbff9711e78b c9b00a70b080d5c0668608024afc3e0e2fed822f 2024-11-27T01:00:50-06:00 Jeff Bolz vulkan: optimize Q2_K and Q3_K mul_mat_vec (#10459)
9a4b79bcfa4338b922fa8cf903bd5ac058aaf46f 7066b4cce2898993e943ad6af5d8f1de5840c8e9 2024-11-26T18:08:37+08:00 Shanshan Shen CANN: Improve the Inferencing Performance for Ascend NPU Device (#10454)
7066b4cce2898993e943ad6af5d8f1de5840c8e9 0eb4e12beebabae46d37b78742f4c5d4dbe52dc1 2024-11-26T17:31:05+08:00 Chenguang Li CANN: RoPE and CANCAT operator optimization (#10488)
6dfcfef0787e9902df29f510b63621f60a09a50b 599b3e0cd40432cd1975a8906f3db70bbe53b627 2024-11-22T17:44:08+08:00 蕭澧邦 ci: Update oneAPI runtime dll packaging (#10428)
a5e47592b6171ae21f3eaa1aba6fb2b707875063 1bb30bf28cb5a7adf111bc41c935bdaf128397e7 2024-11-21T18:18:50+01:00 Diego Devesa cuda : optimize argmax (#10441)
1bacb9f62514b520bdf74ed6feb46c80508dad38 ad21c9e1f14d82b8c15ae369a8839019e3d498b4 2024-11-20T01:11:00-06:00 Jeff Bolz vulkan: further optimize mul_mat_vec using larger loads (#10387)
2a1507c1629975d9d20a503d6a14f44eff292c25 b3e585988fc65d3a8083c6d94dfc0629f9ce226d 2024-11-19T09:02:23+01:00 Romain Biessy sycl : Add option to set the SYCL architecture for all targets (#10266)
b3e585988fc65d3a8083c6d94dfc0629f9ce226d 557924f22237c76387a39c4db5abae154d57e754 2024-11-19T01:25:17-06:00 Jeff Bolz vulkan: Optimize soft_max (#10301)
cf32a9b93ad859ea592c31785b6bd3b4b2121463 a43178299c2f74f14bcfc659bfd9fd32d931d1f4 2024-11-17T11:23:01+02:00 Georgi Gerganov metal : refactor kernel args into structs (#10238)
8a43e940ab0daaff198809bf9277289994ec62f5 5c9a8b22b10132db620529435e3cfa49304b65cc 2024-11-16T22:17:59+02:00 Johannes Gäßler ggml: new optimization interface (ggml/988)
f245cc28d4eb900efad0bc740145f58d713c6e4f 772703c8fffdd83d2e28f60119e83525f1189412 2024-11-16T10:32:50+02:00 Georgi Gerganov scripts : fix missing key in compare-llama-bench.py (#10332)
772703c8fffdd83d2e28f60119e83525f1189412 dd3a6ce9f84d21ba05fe98af9f983bdea0398e6c 2024-11-16T00:26:57-06:00 Jeff Bolz vulkan: Optimize some mat-vec mul quant shaders (#10296)
1e58ee1318429a3e97aa66f3034cdfd65ffc6c34 89e4caaaf081f4712af61a3e08cb67b406c02b80 2024-11-16T01:53:37+01:00 Dan Johansson ggml : optimize Q4_0 into Q4_0_X_Y repack (#10324)
4047be74da398acb8717a4d21b77b929ad7ed4f7 883d206fbd2c5b2b9b589a9328503b9005e146c9 2024-11-15T21:19:03+01:00 Johannes Gäßler scripts: update compare-llama-bench.py (#10319)
18429220bdb344da1bc7df9bc580c7b41b3cd57b f0204a0ec70d50ca60e07bc0096ec1d6508ab0c7 2024-11-15T11:47:58Z Eve AVX BF16 and single scale quant optimizations (#10212)
5a54af4d4f588f109f31e456483fdf77096399d9 1607a5e5b08f4e55f118af3d7de325949d8f1835 2024-11-15T04:09:12+01:00 Romain Biessy sycl: Use syclcompat::dp4a (#10267)
af148c9386da825a60c7038549c121c35ca56b50 66798e42fbe636f1cb6236e4bc30939d23ef7c25 2024-11-13T23:22:55-06:00 Jeff Bolz vulkan: Optimize binary ops (#10270)
2e82ffa4af29f87e7d3d6dff8060a2a79613b72f 80dd7ff22fd050fed58b552cc8001aaf968b7ebf 2024-11-13T09:40:57Z Alberto Cabrera Pérez sycl : Fixes to broken builds and test-backend-ops (#10257)
80dd7ff22fd050fed58b552cc8001aaf968b7ebf 54ef9cfc726a799e6f454ac22c4815d037716eda 2024-11-13T00:58:57-06:00 Jeff Bolz vulkan: Optimize contiguous copies (#10254)
e89213492d3e01705739789733f0f2d250b4c449 8fc393f246c550d2481e53323a47644a94e8d01f 2024-11-09T12:47:50+05:30 amritahs-ibm ggml : optimize llamafile cpu matrix multiplication for ppc64le (#10156)
841f27abdbbcecc9daac14dc540ba6202e4ffe40 d05b3127bd30515955aa4ee2bacdb68ebafe88f4 2024-11-08T13:47:22+02:00 Georgi Gerganov metal : optimize FA kernels (#10171)
3bcd40b3c593d14261fb2abfabad3c0fb5b9e318 5c333e014059122245c318e7ed4ec27d1085573c 2024-11-07T18:19:10+11:00 Zhiyuan Li Optimize RWKV6 Operator Naming and Implement Multi-core CPU/ SYCL Acceleration (#10133)
340736477651095a98a3b10e19b038ec62593a1d d5a409e57fe8bd24fef597ab8a31110d390a6392 2024-11-04T22:06:31Z Eve Q6_K AVX improvements (#10118)
fc83a9e58479e4dd70054daa7afe5184c1bbe545 c5b0f4b5d90297f3e729fca7f78ddb25fcab5ddc 2024-10-30T15:00:40+08:00 xctan ggml : add Q4_0_8_8 RISC-V GEMV and GEMM kernels (#10029)
8f275a7c4593aa34147595a90282cf950a853690 8d8ff715367480b856ad86ac3888e9742b13a6fa 2024-10-29T17:52:56+09:00 Changyeon Kim ggml: Add POOL2D OP for GPU acceleration to the Vulkan backend in the MobileVLM model. (#9763)
2d3aba9ee8da9c026d54e8a912a1d64f56809be3 80273a306d07ed95059d6130389deacb3b2d7196 2024-10-23T17:16:56+03:00 Georgi Gerganov llama.vim : bump generation time limit to 3s [no ci]
4c9388fb96ac2415fbb1239b7ba8346616606e2e 873279b1592e433c4d9eb5065091cc98473c7bee 2024-10-23T19:33:45+09:00 Jun Hee Yoo metal : add POOL2D and fix IM2COL (#9943)
cda0e4b648dde8fac162b3430b14a99597d3d74f afd9909a6481402844aecefa8a8908afdd7f52f1 2024-10-18T23:18:01+02:00 Xuan Son Nguyen llama : remove all_pos_0, all_pos_1, all_seq_id from llama_batch (#9745)
13dca2a54a394757d56fdd652b9f0df08f44ea22 d4c19c0f5cdb1e512573e8c86c79e8d0238c73c4 2024-10-14T01:49:08+01:00 agray3 Vectorize load instructions in dmmv f16 CUDA kernel (#9816)
edc265661cd707327297b6ec4d83423c43cb50a5 1bde94dd024b632f98428f4bf2ce483295130779 2024-10-12T16:14:27+03:00 Georgi Gerganov server : add option to time limit the generation phase (#9865)
a39ab216aa624308fda7fa84439c6b61dc98b87a f536f4c4391bec74c432a924625c04e8c484d3ee 2024-10-02T15:49:55+02:00 Xuan Son Nguyen llama : reduce compile time and binary size (#9712)
76b37d1541a880b9645557c8715a343fd074cc5c 148844fe97fff4c1563a3111bf238ba4dd22ef56 2024-10-02T15:21:57+08:00 Zhenwei Jin gguf-split : improve --split and --merge logic (#9619)
148844fe97fff4c1563a3111bf238ba4dd22ef56 3f1ae2e32cde00c39b96be6d01c2997c29bae555 2024-10-02T10:14:44+03:00 Georgi Gerganov examples : remove benchmark (#9704)
cb00020504416606601f8cb35f55ee07b710b4b7 6c5322481a75f1be54e58a000c3f78484d07f948 2024-09-30T09:14:09+02:00 Salvatore Mesoraca vulkan : mul_mat: fix UB with small warps (ggml/952)
1b2f992cd2cff0b69e5abe78bb8888d51ed19d67 739842703e32cd43443c45e0b4f6647cc4e6b3d6 2024-09-28T14:32:46+02:00 slaren test-backend-ops : use flops for some performance tests (#9657)
6a0f7794847244fb3b99a983e03137d7e832b585 89f9944981010d195e411a9fbfbb19959412f710 2024-09-28T14:06:16+02:00 Dan Johansson ggml : add run-time detection of neon, i8mm and sve (#9331)
1e436302188a704ac9ea044af03193648806f19c afbbfaa537a96f562c34df4542930fa951b40d9e 2024-09-25T15:12:20+02:00 Charles Xu ggml : remove assert for AArch64 GEMV and GEMM Q4 kernels (#9217)
904837e0cb2f5f01bf5d5901b7aa57a026860ae4 70392f1f81470607ba3afef04aa56c9f65587664 2024-09-25T11:30:38+08:00 Dou Xinpeng cann: fix crash when llama-bench is running on multiple cann devices (#9627)
f0c7b5edf82aa200656fd88c11ae3a805d7130bf 1d48e98e4f3316bd2f6b187d288c7b6cb88d5cb3 2024-09-23T11:42:43-07:00 Max Krasnyansky threads: improve ggml_barrier scaling with large number of threads (#9598)
424c5d00a9b97dd5559635872db9b57f87c23b02 a6809c6a2e8163cba296d4cc0c5cd4bbc8073638 2024-09-20T19:04:44+03:00 Johannes Gäßler ggml/examples: add backend support for numerical optimization (ggml/949)
7be099fa817e9c53ffb4c3ed7d063e1cffcd675a 8b836ae731bbb2c5640bc47df5b0a78ffcb129cb 2024-09-17T22:41:38+02:00 Michael Podvitskiy llama-bench: correct argument parsing error message (#9524)
acb2c32c336ce60d765bb189563cc216e57e9fc2 a6a3a5c531c73aef85750a847d21e7d4671e723d 2024-09-16T13:07:13+02:00 Daniel Bevenius llama : rename n_embed to n_embd in rwkv6_time_mix (#9504)
5c3d0f1824714e9a97fc9b06e046eefcb6ecc721 0aadac10c7dd704f8285ddf5a63d6f764cb340aa 2024-09-16T06:48:24Z Eve ggml : IQ4_NL sgemm + Q4_0 AVX optimization (#9422)
0abc6a2c25272d5cf01384dda8ee8bfec4ba8745 bd35cb0ae357185c173345f10dc89a4ff925fc25 2024-09-13T09:53:38+03:00 Georgi Gerganov llama : llama_perf + option to disable timings during decode (#9355)
d2b496bff4f353a6429f8e833448f071bd237ba7 b34e02348064c2f0cef1f89b44d9bee4eb15b9e7 2024-09-11T10:03:54+03:00 Georgi Gerganov batched-bench : remove unused code (#9305)
0b4ac75772b744bb0a0d674927587621d1057884 fb3f2498156b3140e2050ec9c7bf61372f63ff56 2024-09-10T15:02:30+08:00 Molly Sophia RWKV v6: Add time_mix_decay_w1/w2 in quant exclusion list (#9387)
b2e89a327457179a34eae4d7de0d412ed945679c daa9623ab051a8162ae750b150b9522571b55f21 2024-09-09T09:02:45+02:00 Dan Johansson Arm AArch64: Documentation updates (#9321)
1b9ae5189cd279c6b45e36d43e4f9ccae628d02f e32d0816edfd247784f6780b0bb9ae0bceef5e47 2024-09-07T20:43:51+02:00 Xuan Son Nguyen common : refactor arg parser (#9308)
df270ef74596da8f1178f08991f4c51f18c9ee82 947538acb8617756a092042ff7e58db18dde05ec 2024-09-07T15:16:19+03:00 Georgi Gerganov llama : refactor sampling v2 (#9294)
134bc38ecf3e2c5460581badce289a1ffa680453 815b1fb20a53e439882171757825bacb1350de04 2024-09-07T00:03:01+03:00 Aarni Koskela llama-bench : log benchmark progress (#9287)
815b1fb20a53e439882171757825bacb1350de04 409dc4f8bb5185786087f52259ee4626be93f54d 2024-09-06T18:59:58+03:00 Aarni Koskela batched-bench : add `--output-format jsonl` option (#9293)
9bc6db28d011d47a5f318dc4aebbe7927fac4629 32b2ec88bc44b086f3807c739daf28a1613abde1 2024-09-05T21:48:47-04:00 compilade ggml-quants : ternary packing for TriLMs and BitNet b1.58 (#8151)
bdf314f38a2c90e18285f7d7067e8d736a14000a 581c305186a0ff93f360346c57e21fe16e967bb7 2024-09-05T02:19:39+02:00 slaren llama-bench : fix NUL terminators in CPU name (#9313)
8962422b1c6f9b8b15f5aeaea42600bcc2d44177 b69a480af4db8ffd6cbb2efe7ed8132bc7d39073 2024-09-03T20:58:54+03:00 Aarni Koskela llama-bench : add JSONL (NDJSON) output mode (#9288)
48baa61eccdca9205daf8d620ba28055c2347b64 f1485161e58d562099dd050f8ac3a9ea9f4cd765 2024-09-02T22:08:38+02:00 Xuan Son Nguyen server : test script : add timeout for all requests (#9282)
8f1d81a0b6f50b9bad72db0b6fcd299ad9ecd48c a47667cff41f5a198eb791974e0afcc1cddd3229 2024-09-01T22:38:17+08:00 Molly Sophia llama : support RWKV v6 models (#8980)
ea5d7478b1edcfc83f8ea8f9f0934585cc0b92e3 49271efbaf3f7a4ae52c4ca299b6d4e82598a97d 2024-08-31T13:50:35+05:30 Srihari-mcw sgemm : improved Q4_0 and Q8_0 performance via 4xN and Mx4 gemm (#8908)
42c76d1358021ccdbe8ba89109c143dd7ae166df 9f7d4bcf5c27d37b0c7da82eeaf9c1499510554b 2024-08-29T19:20:53-04:00 Faisal Zaghloul Threadpool: take 2 (#8672)
f12ceaca0c7b59def30b7a832a6904df7ed3f4f7 436787f170329b3f549e6c2c46593d2af8482e7c 2024-08-26T11:03:30+02:00 slaren ggml-ci : try to improve build time (#9160)
436787f170329b3f549e6c2c46593d2af8482e7c 93bc3839f980ff14be86efe408b4cd7e89b26835 2024-08-25T23:09:53-07:00 Justine Tunney llama : fix time complexity of string replacement (#9163)
2f3c1466ff46a2413b0e363a5005c46538186ee6 50addec9a532a6518146ab837a85504850627316 2024-08-21T04:00:00+09:00 Changyeon Kim llava: Add ACC OP for GPU acceleration to the Vulkan backend in the LLAVA CLIP model. (#8984)
d5492f0525fa533817a67e93a4bde9d71d81cf58 234b30676a97ce227b604c38beb9dcaca406dea9 2024-08-15T10:11:11+03:00 Georgi Gerganov ci : disable bench workflow (#9010)
5fd89a70ead34d1a17015ddecad05aaa2490ca46 98a532d474c73d3494a5353024cb6a4fbbabbb35 2024-08-14T18:32:53+02:00 0cc4m Vulkan Optimizations and Fixes (#8959)
7c5bfd57f83fd3630934cfa70892aa4022d3faf7 6e02327e8b7837358e0406bf90a4632e18e27846 2024-08-11T10:09:09+02:00 Markus Tavenrath Optimize Vulkan backend for better CPU performance and less GPU synchronization overhead. (#8943)
506122d854c5d05b4a3d45a294f14bd4c02d9868 725e3d94379d5b619c027347308bccf2e0ead89f 2024-08-07T09:01:06+08:00 Zhenwei Jin llama-bench : add support for getting cpu info on Windows (#8824)
bc0f887e159c0d78c28121e2c8b5c58094170875 b42978e7e4d56eaaa93588414e804d9fbbc3cae2 2024-08-05T21:10:37+08:00 wangshuai09 cann: fix buffer_num and runtime speed slowly error (#8865)
a3738b2fa7c60ef2c4592435d1aa7fb8f1f69c3e 655858ace0cf2720e56eb01f84ad05e0c94ada3c 2024-08-04T17:28:08+02:00 0cc4m vulkan : implement Stable Diffusion operators (ggml/904)
0d6fb52be0c1b7e77eb855f3adc4952771c8ce4c 978ba3d83d17b10fdf9807006048432b5b3769fc 2024-08-04T14:17:16-04:00 Brandon Squizzato Install curl in runtime layer (#8693)
ecf6b7f23e664afd7ff856ec39034240ce438daa 01aae2b4975b57a265ce8194928fd87f2d71027e 2024-08-04T03:55:03-07:00 Brian Cunnie batched-bench : handle empty `-npl` (#8839)
76614f352e94d25659306d9e97321f204e5de0d3 b72c20b85c1029d135022d39e9a20d4807c11893 2024-08-04T01:34:41+09:00 jdomke ggml : reading the runtime sve config of the cpu (#8709)
ed9d2854c9de4ae1f448334294e61167b04bec2a 398ede5efeb07b9adf9fbda7ea63f630d476a792 2024-07-31T15:51:06-04:00 Clint Herron Build: Fix potential race condition (#8781)
268c5660062270a2c19a36fc655168aa287aaec2 7e72aa74fd676a093eb9970e761085ec22734c71 2024-07-30T23:35:30+03:00 Someone nix: cuda: rely on propagatedBuildInputs (#8772)
c887d8b01726b11ea03dbcaa9d44fa74422d0076 75af08c475e285888f66556d0f459c533b7deb95 2024-07-30T14:56:51+08:00 zhentaoyu [SYCL] Add `TIMESTEP_EMBEDDING` OP (#8707)
a05ca9369716a8319014cd1fc365980d43f8aae9 9f77d899b7b0d56496f679e54b797da6199fed8e 2024-07-25T00:54:08-07:00 Mahesh Madhav ggml : loop tiling optimizations for scalar path (ggml/898)
b5e95468b1676e1e5c9d80d1eeeb26f542a38f42 92090eca212650727e38b335c1d4accfbcc9b79c 2024-07-27T05:03:45-07:00 Jeffrey Morgan llama : add support for llama 3.1 rope scaling factors (#8676)
46e47417aa4f18c08738afd4d9a3e838e97ca03f e7e6487ba06634edf58dfdf9673bad9df41b445a 2024-07-23T10:50:40+02:00 Jeroen Mostert Allow all RDNA2 archs to use sdot4 intrinsic (#8629)
566daa5a5b38018b2727950bbd280239adb981b6 6f11a83e4e7700fdf353ed4a29599cb662c792f6 2024-07-22T15:44:53+02:00 Jiří Podivín *.py: Stylistic adjustments for python (#8233)
22f281aa16f44d8f6ec2c180a0685ff27e04e714 328884f4219c0228673cf1870ac63987fb4f9fd0 2024-07-20T22:09:17-04:00 M-A examples : Rewrite pydantic_models_to_grammar_examples.py (#8493)
7acfd4e8d55082c1b597dfc3ffe04fb5d530c6dc 97bdd26eee11fe109dec00de75690ceef61c03f2 2024-07-15T23:13:10-04:00 compilade convert_hf : faster lazy safetensors (#8482)
808aba39161e5d7ca2ff24110b5aa14d2e536988 a977c115448e40856fb9cbe3ceb6d8ce802553b0 2024-07-11T16:47:47+02:00 Johannes Gäßler CUDA: optimize and refactor MMQ (#8416)
dd07a123b79f9bd9e8a4ba0447427b3083e9347a f4444d992c16b6b9442f4770c7c3a10b19a08343 2024-07-10T12:35:18-04:00 Clint Herron Name Migration: Build the deprecation-warning 'main' binary every time (#8404)
0f1a39f3439825acf7e3a1663566d410be152170 83321c6958acf20747d288031174cc1bf8816e33 2024-07-10T07:14:51-05:00 Dibakar Gope ggml : add AArch64 optimized GEMV and GEMM Q4 kernels (#5780)
fd560fe680c72fd0a0af2bc8881add20ad919071 e500d6135ac42c4a23baf6a9a1a934dc023e5c7d 2024-07-09T11:58:44-07:00 Andy Salerno Update README.md to fix broken link to docs (#8399)
e500d6135ac42c4a23baf6a9a1a934dc023e5c7d a03e8dd99d3954e7547137936c5a2a3b348bdb7f 2024-07-09T11:54:43-04:00 Clint Herron Deprecation warning to assist with migration to new binary names (#8283)
470939d483d1c89b7292f78bac1fd27c42c171ce 6f0dbf6ab087bcd286fb78560099ca0458316735 2024-07-08T03:26:53-04:00 Kevin Wang common : preallocate sampling token data vector (#8363)
3fd62a6b1c9ca7b7c0093e984cc9c133c6f2726d a8db2a9ce64cd4417f6a312ab61858f17f0f8584 2024-07-07T15:04:39-04:00 compilade py : type-check all Python scripts with Pyright (#8341)
905942abdba5ba0b28a1b0805e51e4f818c54bc9 b5040086d436e7345e4fa33a5b9558060c75603f 2024-07-07T20:52:10+08:00 toyer llama : support glm3 and glm4 (#8031)
0a423800ffe4e5da3d83527ef3473da88cd78146 d12f781074b92589a72a36ffabb583933f7b9dc0 2024-07-05T07:06:09Z Daniele CUDA: revert part of the RDNA1 optimizations (#8309)
f09b7cb609d80b8031803f89255991dc8b35db69 a38b884c6c4b0c256583acfaaabdf556c62fabea 2024-07-05T10:32:29+08:00 Neo Zhang Jianyu rm get_work_group_size() by local cache for performance (#8286)
d23287f122c34ebef368742116d53a0ccb2041ee 5f2d4e60e202aabee10051e6615bb821e51787be 2024-07-03T23:02:58Z Daniele Define and optimize RDNA1 (#8085)
cb5fad4c6c2cbef92e9b8b63449e1cb7664e4846 dae57a1ebc1c9bd5693ab999e19d77c5506ae559 2024-07-01T20:39:06+02:00 Johannes Gäßler CUDA: refactor and optimize IQ MMVQ (#8215)
9a590c82262dd518137f85406e65e452fdf2aca3 52fc8705a0617452df08333e1161838726c322b4 2024-06-24T12:41:23+02:00 Johannes Gäßler CUDA: optimize MMQ int8 tensor core performance (#8062)
95f57bb5d5b18ef0beb2702a0d6c06e46804075c e112b610a1a75cb7fa8351e1a933e2e7a755a5ce 2024-06-24T03:07:59+02:00 slaren ggml : remove ggml_task_type and GGML_PERF (#8017)
a927b0f3dd9a86ee042cd2bdcc8c9da4a855926b 80ea089d771f0c2d97afa8bead80ded412f600d7 2024-06-21T08:51:28+03:00 Georgi Gerganov llama : optimize long word tokenization with WPM (#8034)
61665277afde2add00c0d387acb94ed5feb95917 b96f9afb0d58b003ac8d1d0c94cd99393a3bc437 2024-06-18T14:00:14+02:00 Ulrich Drepper Allow compiling with CUDA without CUDA runtime installed (#7989)
6a2f0b3474d479bda4ac2ee7cfd5dcdcf0be1f79 21be9cab94e0b5b53cb6edeeebf8c8c799baad03 2024-06-17T16:10:15+02:00 Markus Tavenrath Implement non-mapped async IO for CUDA on Windows. (#7896)
b5fcf8ef5c29df53cfff60e180b4992a3b2332a6 398105ff4373eea385ea8e8625cb417b2ae51134 2024-06-16T16:53:11+08:00 Hong Bo PENG ggml : fix and optimize ppc64le (ggml/849)
e65bbf606c61f49dc06c7ac060cd5ba7ae446025 6fcd1331efbfbb89c8c96eba2321bb7b4d0c40e4 2024-06-14T16:47:41+03:00 Radoslav Gerganov llama-bench : fix RPC indication (#7936)
f578b86b2123d0f92afbaa98a031df4d4464e582 1c641e6aac5c18b964e7b32d9dbbb4bf5301d0d7 2024-06-13T03:11:35+02:00 slaren move BLAS to a separate backend (#6210)
148995e5e57b313cce2672f75610db58c6327a51 4bfe50f741479c1df1c377260c3ff5702586719e 2024-06-11T14:45:40+02:00 Johannes Gäßler llama-bench: more compact markdown tables (#7879)
5795b941827fdec6c1662986de962badff456718 ed9f2521185706481501a5e6d5315397b11802ff 2024-06-08T22:47:25-04:00 compilade convert-hf : match model part name prefix and suffix (#7687)
55b2d0849d3ec9e45e4a4d9e480f5fa7977872a6 f5d7b268ec4bf8628aa6ccc9f6631d0230dde76f 2024-06-06T10:07:06+01:00 Olivier Chafik grammars: x{min,max} repetition operator (#6640)
1442677f92e45a475be7b4d056e3633d1d6f813b 554c247caffed64465f372661f2826640cb10430 2024-06-04T21:23:39+03:00 Georgi Gerganov common : refactor cli arg parsing (#7675)
adc9ff384121f4d550d28638a646b336d051bf42 987d743d6bc4cee4bde6820733ea33a2abc0afac 2024-06-04T14:32:42+02:00 slaren llama-bench : allow using a different printer for stderr with -oe (#7722)
2ac95c9d5678d05e253691fb1f26471675bff5ad 750f60c03e4d3f53fa51910551ce87a3d508d2d7 2024-06-01T21:50:18+05:30 HanishKVC SimpleChat: Simple histogram/repeatMatching driven garbageTrimming, Settings UI, Streaming mode, OpenAi Compat (Model, Authorization Bearer), Save/Restore session, Auto Settings UI (#7548)
c8047d538f3addab40e3112be60bb92e70ce1a50 30e238b246f8002cc6eb7cb79afe242243f1f66d 2024-05-31T16:26:21+02:00 Johannes Gäßler scripts: update compare_llama_bench.py [no ci] (#7673)
210d99173dc82aafb48f6e39d787c387951fe3a9 87bdf2a199acd62e19814d7a4d0500a04a7f09f3 2024-05-29T14:45:44+03:00 Radoslav Gerganov llama-bench : add support for the RPC backend (#7435)
b9adcbbf92fc7096bee23fe61496d25652ebf765 9588f196b1d7b21bdff013fcf958c249576b2619 2024-05-26T06:26:34+05:30 HanishKVC SimpleChat Completion Mode flexibility and cleanup, Settings gMe, Optional sliding window (#7480)
1e374365d170b7f692fd7753c145e21bc14486c8 197ff91462dd05bb9a3be03578114abf0c355536 2024-05-22T23:23:21+05:30 HanishKVC SimpleChat: a simple and dumb web front end for testing /chat/completions and /completions end points and try chat (#7350)
b18532a4efeca8796fea8e36195c81cbfd596a4a fcda1128bc5f8eb7e1811708fe9d9867b9aec815 2024-05-22T16:10:46+02:00 slaren phi3 : duplicate rope factors in each layer (#7447)
65c58207ece92ad213f4bfd0f91dcb2dfb664f5b 1cc0155d04918cb3017afa472acea51b77483c4a 2024-05-20T15:19:21+08:00 junchao-loongson ggml : add loongarch lsx and lasx support (#6454)
1cc0155d04918cb3017afa472acea51b77483c4a e932094d58f513d5996c3efc9f6fed8238894c57 2024-05-20T10:16:41+03:00 Georgi Gerganov server : tuning tests (#7388)
d273c1402b25086fd91aef2467ac13f2e49fa0ea 27b040691cbe45314147c2745e891a38e9c048d4 2024-05-17T15:11:45+03:00 Aarni Koskela py : convert-hf-to-gguf-update improvements (#7340)
934266c0e0b2aa9781fdba2deb112c161ff038a9 9c4fdcbec8c7fcc428e723b0d8a1cf1f351ba642 2024-05-17T02:58:52-04:00 Justine Tunney ggml : rewrite silu and softmax for cpu (#7154)
24ecb58168dce81646c2ed425690a106591c8c6d 9afdffe70ebf3166d429b4434783bb0b7f97bdeb 2024-05-16T20:43:45+02:00 Pierrick Hymbert Revert "server bench: fix bench not waiting for model load (#7284)" (#7334)
13ad16af1231ab2d245d35df3295bcfa23de1305 8f7080bf48828b538bc9387c3d150bbd4fb4cf2d 2024-05-15T19:47:36-07:00 Max Krasnyansky Add support for properly optimized Windows ARM64 builds with LLVM and MSVC (#7191)
583fd6b000ec9ad1b465b5c98524f4a0ae388077 9f773486ab78d65f5cca3f7e31c862b7043bf721 2024-05-15T08:44:16+02:00 Johannes Gäßler server bench: fix bench not waiting for model load (#7284)
0d26d8ccd8caebab75af697c0275f599075fdacf 4f0263633b40e94e8b69fd6e7e4395cfedfd5c12 2024-05-12T17:17:18+08:00 Hong Bo PENG ggml : optimize for ppc64le using VSX intrinsics (ggml/784)
cbf75894d256f1861f6409565db599365de3d4b8 0d5cef78aeafae4d4e6d56e2d4bcda771af58cc9 2024-05-13T08:04:29+08:00 Neo Zhang [SYCL] Add oneapi runtime dll files to win release package (#7241)
e849648888a11de13aaaa4cb2eda3f5a9c7b444d 18e437665ce626dddbd79119aa7498493e7cb13b 2024-05-10T18:03:54+02:00 slaren llama-bench : add pp+tg test type (#7199)
fd9f92b154850014146f61717cd292a59a5cee5a 22842164bcae3251b81ad9e497a16ef66833cb9e 2024-05-09T13:03:29+02:00 Daniel Bevenius llama : update llama_timings.n_p_eval setting (#7160)
bc4bba364fb96d908f2698e908648df5e6f55e02 c12452c7aec8a02264afc00196a13caa591a13ac 2024-05-08T21:55:49+01:00 agray3 Introduction of CUDA Graphs to LLama.cpp (#6766)
acdce3cdef6fc2f0b7b5623231fd7762c0884d1c 3855416027cb25d9a708ffa5581cf503a87856a6 2024-05-08T18:54:39+10:00 Brian compare-llama-bench.py: add missing basicConfig (#7138)
3855416027cb25d9a708ffa5581cf503a87856a6 c0e6fbf8c380718102bd25fcb8d2e55f8f9480d1 2024-05-08T02:30:09-04:00 Justine Tunney ggml : introduce bfloat16 support (#6412)
858f6b73f6e57a62523d16a955d565254be889b4 b3a995b416e13ae3123a117a743e11d0ede0ca4c 2024-05-06T11:12:14-07:00 William Tambellini Add an option to build without CUDA VMM (#7067)
628b299106d1e9476fdecb3cbe546bf5c60f1b89 8f8acc8683a00ce40fa5a81161a079d2167126e6 2024-05-05T07:17:47-05:00 kunnis Adding support for the --numa argument for llama-bench. (#7080)
8f8acc8683a00ce40fa5a81161a079d2167126e6 ca3632602091e959ed2ad4c09c67a7c790b10d31 2024-05-05T13:38:55+02:00 Sigbjørn Skjæret Disable benchmark on forked repo (#7034)
a2ac89d6efb41b535778bfeaecaae8fe295b6ed3 433def286e98751bf17db75dce53847d075c0be5 2024-05-04T05:36:41+10:00 Brian convert.py : add python logging instead of print() (#6511)
9c67c2773d4b706cf71d70ecf4aa180b62501960 952d03dbead16e4dbdd1d3458486340673cc2465 2024-04-30T12:16:08+03:00 Georgi Gerganov ggml : add Flash Attention (#5021)
b8a7a5a90fd3187175d84227dad705ade395ba46 d2c898f746a527f09effb061829e68b2e1812a28 2024-04-29T17:02:45+01:00 Olivier Chafik build(cmake): simplify instructions (`cmake -B build && cmake --build build ...`) (#6964)
5790c8dac1a4f0aa80b4efee3b962d8c04c829e8 46e12c4692a37bdd31a0432fc5153d7d22bc7f72 2024-04-26T09:26:16+02:00 Pierrick Hymbert bench: server add stop word for PHI-2 (#6916)
5cf5e7d490dfdd2e70bface2d35dfd14aa44b4fb 40f74e4d739e9250431cf339ae7588b28d8d0663 2024-04-21T18:48:53+01:00 Olivier Chafik `build`: generate hex dump of server assets during build (#6661)
9958c81b798a5872087b30b360e4674871f2479e 8b1b1f4982d3e9b994308d05a1c8b9e45c23edb5 2024-04-19T09:35:54Z nopperl Implement the OLMo architecture (#6741)
8cc91dc63c0df397d644a581b2cbeea74eb51ae0 dbceec87c0221ec952e69448df6a71f1372a7487 2024-04-16T14:55:30-04:00 Justine Tunney ggml : add llamafile sgemm (#6414)
de17e3f7455dc7fd298cc61d86798533b9ca7a29 b5e7285baffb0da8a6619567b52d8e67de41291d 2024-04-14T10:42:29+08:00 Neo Zhang Jianyu fix memcpy() crash, add missed cmd in guide, fix softmax (#6622)
ab9a3240a9da941fdef5cd4a25f2b97c2f5a67aa fbbc030ba93561fac842af994c5c6c4c1147f13b 2024-04-12T19:43:38+01:00 Olivier Chafik JSON schema conversion: ⚡️ faster repetitions, min/maxLength for strings, cap number length (#6555)
04a5ac211ef40936295980b7cdf0ba6e97093146 f7001ccc5aa359fcf41bba19d1c99c3d25c9bcc7 2024-04-11T21:44:50-04:00 Clint Herron Optimization: eliminate addition of redundant stacks when advancing grammar. (#6616)
57dd02c44b2a0eb79e28f6c5eb8242a5d2d3174d 75cd4c77292034ecec587ecb401366f57338f7c0 2024-04-06T10:31:33-04:00 Clint Herron Tests: Added integration tests for GBNF parser (#6472)
75cd4c77292034ecec587ecb401366f57338f7c0 a8bd14d55717754a1f48313a846a2b16fa998ad2 2024-04-06T05:40:47+02:00 Pierrick Hymbert ci: bench: support sse and fix prompt processing time / server: add tokens usage in stream OAI response (#6495)
87e21bbacd830437ab653cf03b6f26d45c15395d 1b496a745c315022df2d919374052e6004ced8d3 2024-04-06T01:34:53+07:00 Ting Sun bench : make n_batch and n_ubatch configurable in Batched bench (#6500)
7dda1b727ef1730783a6077136d28b83e70dd397 c666ba26c39d5c07e07b4e1e411332f408e309ad 2024-04-05T01:30:53+09:00 Minsoo Cheong ci: exempt master branch workflows from getting cancelled (#6486)
8120efee1d9931b514aeb5a047209d576f23286c a74401f0e5ebb15fa4d8b6619d1baa6ea9179123 2024-04-04T16:59:04+02:00 Pierrick Hymbert ci: bench fix concurrency for workflow trigger dispatch with sha1 (#6478)
7a2c92637ae265654a68f62e6a7610b358255d3f 4bcd6b959ca3991084ad1d8464caf2a734e29b1d 2024-04-04T11:57:58+02:00 Pierrick Hymbert ci: bench: add more ftype, fix triggers and bot comment (#6466)
5fb1574c8112c757fc202fdae279da883f34e610 60cdf40cc32f0ad4cb11e0ca8fd38f3b93d8d640 2024-04-03T13:22:57-07:00 Fattire A few small fixes to server's README docs (#6428)
33a52448061cfd2ea44da9e6cb30b2ec22e2f6d0 226e819371eec0f298d9075198394a07b23ecfa9 2024-04-01T13:30:43+02:00 Johannes Gäßler compare-llama-bench.py: fix long hexsha args (#6424)
37e7854c104301c5b5323ccc40e07699f3a62c3e c342d070c64a1ffe35d22c1b16b672e684a30297 2024-03-30T11:36:07+01:00 Pierrick Hymbert ci: bench: fix Resource not accessible by integration on PR event (#6393)
057400a3fd457f4f214684eeb171444663b47a23 b75c38166cf0c66793a32d5c3d6cb69929dd083d 2024-03-29T08:23:22+01:00 Daniel Bevenius llama : remove redundant reshape in build_kv_store (#6369)
28cb9a09c4d10a489be1238abe7a858dcd4d65f2 cfc4d75df6399b36153ef739f2c1abee4c114bb8 2024-03-28T11:27:56+01:00 Pierrick Hymbert ci: bench: fix master not schedule, fix commit status failed on external repo (#6365)
a016026a3ac16d8c9b993a3573f19b9556d67de4 53c7ec53d5eca26b2c0c648605543a5fa6c12817 2024-03-27T20:26:49+01:00 Pierrick Hymbert server: continuous performance monitoring and PR comment (#6283)
557410b8f06380560155ac7fcb8316d71ddc9837 55c1b2a3bbd470e9e2a3a0618b92cf64a885f806 2024-03-26T10:46:41-04:00 compilade llama : greatly reduce output buffer memory usage (#6122)
55c1b2a3bbd470e9e2a3a0618b92cf64a885f806 e097633f63fdd26d492844f7eff056e4083fd9eb 2024-03-26T15:21:27+01:00 Kawrakow IQ1_M: 1.75 bpw quantization (#6302)
64e7b47c6986221f2ff5c57c89dfc018bb0e9e6d 7733f0c76081b2a69b5f8b192db2db7c43629d58 2024-03-25T16:38:22+09:00 Minsoo Cheong examples : add "retrieval" (#6193)
cfd3be76e37dab92c846d75a2421178f20db4a11 5b7b0ac8dfdd800c0fd0dc69b69991e8cb19fb46 2024-03-21T13:59:38+01:00 Kawrakow ggml : same IQ4_NL quantization for CPU/CUDA/Metal (#6196)
5b7b0ac8dfdd800c0fd0dc69b69991e8cb19fb46 1943c0198125a0da1a200390e82cf461f9080d99 2024-03-21T11:50:43Z Olivier Chafik json-schema-to-grammar improvements (+ added to server) (#5978)
76aa30a26353f597e4fbe3cf776772ae812af89a c5b8595e3f4f4ed319ef71c9c9d868d1b7a27626 2024-03-21T08:27:57+01:00 Kawrakow Add ability to use Q5_0, Q5_1, and IQ4_NL for quantized K cache (#6183)
bd60d82d0cc8b6852ec535495a5042dbdf05de24 6c0b287748327741b113d7d6018b68c63039b1c5 2024-03-20T01:33:49-04:00 Jared Van Bortel server tests : more pythonic process management; fix bare `except:` (#6146)
a56d09a4407f29c21e149b44fd5308f83aa1cb09 d84c48505f60bcd358b82a751d40418c4d235643 2024-03-16T13:20:53+01:00 Pierrick Hymbert ci : close inactive issue with workflow (#6053)
b0bc9f4a9da7c19f4779106ea83b23feca747566 4755afd1cbd40d93c017e5b98c39796f52345314 2024-03-15T09:22:24+01:00 slaren llama-bench : use random tokens to improve accuracy with mixtral (#6069)
6e0438da3cc95b89cdbf55f45fa4e324d9076792 727107707a73b3dc8a497cf9fc9405722c16dd2b 2024-03-14T14:29:32-04:00 Steve Grubb gguf : fix resource leaks (#6061)
43241adf22e8231ffaf3827d2c9310cc0ffd5ac5 a44bc969e4cd62ca9f4332e17fe3c51f2093e7c6 2024-03-14T12:15:39+01:00 Pierrick Hymbert server: disable debug release type sanitizer, simplify trigger (#6047)
2c4fb69246834503db7b78bcbedcef506bbc60c4 3ca23481dd309bd51cc31c73a4cc34f922cc372f 2024-03-14T11:56:48+01:00 Michael Podvitskiy llama : optimize defrag moves + fix fragmentation calculation (#6037)
f30ea47a87ed4446ad55adb265755dc9102956a2 d8fd0ccf6ac8b07791ffd1575eed436930854ae3 2024-03-13T18:54:21+01:00 slaren llama : add pipeline parallelism support (#6017)
44ca159faf4fbe1a7ace13a962845ba7cdfd95ec 05b06210c954491cf0f12034b0a62bd4d69ce78b 2024-03-11T16:53:15+01:00 Kawrakow 1.5 bit: we can do even better (#5999)
be858f620508385ad12d0e5e862010e666ca729c ef3ced26a3817d92890b97b83acaeb018ade02d0 2024-03-11T07:51:49+01:00 Kawrakow Better 1.5 bit quantization (#5971)
621e86b331f8b0e71f79fd82a4ae1cd54c3e4396 77d1ac7e00bf049b9f2bba1b5a310a78318c49c4 2024-03-09T23:41:49+01:00 Pierrick Hymbert server: benchmark: chat/completions scenario and other llm servers comparison (#5941)
c2101a2e909ac7c08976d414e64e96c90ee5fa9e 515f7d0d4fce41c752fc253acf30707c3be2531e 2024-03-08T17:31:00-05:00 compilade llama : support Mamba Selective State Space Models (#5328)
76e868821a94072fbc87cb1fcca291694319eae8 e457fb3540e0aaec47cfde0abf784c213f9216ee 2024-03-08T12:25:04+01:00 Pierrick Hymbert server: metrics: add llamacpp:prompt_seconds_total and llamacpp:tokens_predicted_seconds_total, reset bucket only on /metrics. Fix values cast to int. Add Process-Start-Time-Unix header. (#5937)
6cdabe652695167263c8b447520987b11856f7ca 89fb735fcfd21781a8194b211cf32824beb3f71f 2024-03-07T16:32:38+02:00 Georgi Gerganov llama-bench : add embeddings option (#5924)
2002bc96bf2cbf5ab981a17d7e994d817c9801f5 ceca1aef0738b57951cd12c603c3477e75312dec 2024-03-07T11:41:53+02:00 Georgi Gerganov server : refactor (#5882)
652ca2bded3c818320d92c70d2b67f64bdbff5e5 bd836944f826f07e19b7edcf994a78728da49c1c 2024-03-05T22:27:29+01:00 slaren compare-llama-bench.py : remove mul_mat_q (#5892)
61d1c88e155515dd03940913a5707ea84a8b119b 21b08674331e1ea1b599f17c5ca91f0ed173be31 2024-03-05T13:33:42+01:00 0cc4m Vulkan Improvements (#5835)
21b08674331e1ea1b599f17c5ca91f0ed173be31 6a87ac3a52668e117d97bcea07b529c93188b303 2024-03-05T16:08:35+08:00 Neo Zhang Jianyu [SYCL] fix mul_mat fault in CI/unit-test (#5862)
7d43c585dc174bb586775c22c15e5db9242b5b4b 82f3e668adafba647de703f835991e91a96b5ac4 2024-03-03T20:23:52+08:00 leejet add some new ops, fix some operators and add batch operations to certain operators. (ggml/747)
9731134296af3a6839cd682e51d9c2109a871de5 4a6e2d6142ab815c964924896891e9ab3e050632 2024-03-02T22:00:14+01:00 Pierrick Hymbert server: tests: passkey challenge / self-extend with context shift demo (#5832)
3ab8b3a92ede46df88bc5a2dfca3777de4a2b2b6 9600d59e010c18f5872580a21734ea1bf1968d04 2024-03-01T12:39:06+01:00 Pierrick Hymbert llama : cleanup unused mmq flags (#5772)
9600d59e010c18f5872580a21734ea1bf1968d04 5cb02b4a012bb16c6c699c0c62c05ffa653eee0f 2024-03-01T03:15:36-06:00 Douglas Hanley unicode : switch to multimap based nfd_map (#5799)
87c91c07663b707e831c59ec373b5e665ff9d64a 317709b2a81dbaf87850202686ec5bb2602a504e 2024-02-28T21:44:21+02:00 Georgi Gerganov ci : reduce 3b ppl chunks to 1 to avoid timeout (#5771)
0becb22ac05b6542bd9d5f2235691aa1d3d4d307 c24a2a6e6005e5d424301525a42ba45a4a362d30 2024-02-27T16:34:24+02:00 Kawrakow IQ4_XS: a 4.25 bpw quantization (#5747)
e3965cf35aac00d4e24998c8a3d0093ae1d98bd3 8b350356b28f782deab63d8b0e9ae103ceb25fcd 2024-02-25T22:48:33+01:00 Pierrick Hymbert server: tests - slow inference causes timeout on the CI (#5715)
4c4cb30736582cacb1a164a9d4bc8e17b1014be7 525213d2f5da1eaf4b922b6b792cb52b2c613368 2024-02-24T16:23:52+02:00 Kawrakow IQ3_S: a much better alternative to Q3_K (#5676)
70847553963c85e86051d06df848236829f5f951 4480542b2271ba1438f0daff8e5f3a74b1dc8609 2024-02-19T09:31:59+01:00 Daniel Bevenius llava : avoid changing the original BakLLaVA model (#5577)
fc0c8d286a533363a9a663510b62af85ffad58b3 bd2d4e393b2b7d2a1b2e201058e26017c9728ead 2024-02-18T17:19:23+01:00 Daniel Bevenius llava : update surgery script to not remove tensors (#5536)
8f1be0d42f23016cb6819dbae01126699c4bd9bc 6e4e973b2615f8d390b1c4f4a7e05a119078bb0f 2024-02-17T23:04:16+02:00 Georgi Gerganov ggml : add ALiBi support for ggml_soft_max_ext (#5488)
d2819d5577b35507be83d0c3f4d2d3c0ab1488ca 4cb072769804c77ab466bc8351c76ede9d5ba49d 2024-02-16T15:14:40+02:00 Georgi Gerganov scripts : add helpers script for bench comparing commits (#5521)
9060a1e9dfca6038906e819be5fa42217f49028c 9350a1cf21b1492c69b20175b73a419b897d6a3a 2024-02-15T16:49:01+01:00 slaren cuda : print message when initialization fails (#5512)
0d4177126b0556e202efb85bf3f768be81076400 7930a8a6e89a04c77c51e3ae5dc1cd8e845b6b8f 2024-02-15T09:01:57+01:00 Elbios llava : fix memory management bug (#5491)
704359e29985a06a389337a2617b7f3fa8eff908 594fca3fefe27b8e95cfb1656eb0e160ad15a793 2024-02-15T17:11:15+11:00 Neuman Vong vulkan: Find optimal memory type but with fallback (#5381)
49cc1f7d67de2da99f3ac185f9ff1319b7bf35f8 99b8b43d7b185a6483f28cf798a2d968b2e16ca7 2024-02-13T13:01:29+02:00 Georgi Gerganov bert : add tests + fix quantization (#5475)
85910c5b30f6e268321be8df044f5528a6efac52 139b62a839825ef20084ed75ed624db7a5ad554a 2024-02-11T15:35:50+02:00 Georgi Gerganov main : ctrl+C print timing in non-interactive mode (#3873)
a07d0fee1f05c5c1dc49948ae1a3293db017275f e4640d8fdf56f14a6db3d092bcd3d2d315cb5d04 2024-02-11T07:22:33-06:00 snadampal ggml : add mmla kernels for quantized GEMM (#4966)
e4640d8fdf56f14a6db3d092bcd3d2d315cb5d04 907e08c1109f498b01036367804cff3082c44524 2024-02-11T12:44:51+01:00 Johannes Gäßler lookup: add print for drafting performance (#5450)
4b7b38bef5addbd31f453871d79647fbae6bec8a e00d2a62dd1441e3b089570ec06d05c18800d368 2024-02-10T05:30:19+11:00 Neuman Vong vulkan: Set limit for task concurrency (#5427)
6fdfa2ecc684000a25a4ad91823bc82a6652b645 a2d60c9158435ae9a6f14632f07f1acf7a3becef 2024-02-05T10:46:06+02:00 Kawrakow iq2_xxs: tune quantization (#5320)
3cc5ed353c07201d8d5b98b0a4713ab633da6d04 60ecf099eddfe70fec797ef6790572e452054add 2024-02-03T20:14:59+01:00 Johannes Gäßler make: fix nvcc optimization flags for host code (#5309)
e920ed393d989ed35625ddaf182ebb52cda07fcd 52bb63c7082c859c3f1dfc527227e6a95b299c7c 2024-02-03T18:15:00+01:00 0cc4m Vulkan Intel Fixes, Optimizations and Debugging Flags (#5301)
af3ba5d94627d337e32a95129e31a3064c459f6b e1e721094d8169636d55f68efe37f222cd3f0677 2024-02-02T15:53:27+08:00 Neo Zhang Jianyu [SYCL] update guide of SYCL backend (#5254)
128dcbd3c9c4b12f42b560a4430427d7b2828628 4d0924a8902010d31bd737b6f1f594943d120d0f 2024-02-02T03:48:53+08:00 Neo Zhang Jianyu add --no-mmap in llama-bench (#5257)
e8dc55d0065d076d4c20f3c4bfca562701b4edfe e0085fdf7c758f0bc2746fc106fb29dd9df959de 2024-01-30T19:04:37-05:00 Jared Van Bortel kompute : llama-bench support and ggml_cpu_has_kompute() (#5226)
8e14e3ddb3744566aef7bc0fa734180e47ae6bdf f4d7e5497485ce6ce0e322533930b7da4657dd2d 2024-01-30T15:15:07+02:00 Kawrakow Faster AVX2 dot product for IQ2_XS (#5187)
f4d7e5497485ce6ce0e322533930b7da4657dd2d 2256f36b79a932a478d4dcdf02c1e5a60056e5f3 2024-01-30T15:14:12+02:00 Kawrakow SOTA 3-bit quants (#5196)
2307523d322af762ae06648b29ec5a9eb1c73032 0f648573dde61c510560f68244f70ece7e60d8c1 2024-01-28T18:03:59+01:00 0cc4m ggml : add Vulkan backend (#2059)
0f648573dde61c510560f68244f70ece7e60d8c1 b764b8f1d079ba44d912801ce6d29bd0d94d51cf 2024-01-28T21:26:23+05:30 Abhilash Majumder ggml : add unified SYCL backend for Intel GPUs (#2690)
7032f4f6349c17a8352f9f93f7d2122f45469e59 5f1925a8cef81eb9b372faaae34b0dd76d5361d4 2024-01-26T11:17:59-06:00 snadampal ggml : update softmax n_task calculation (#5126)
5eaf9964fc797d4585c214db32a463d557f3ed33 d292f4f2047963f558dd516f1baaa71793e9acf2 2024-01-26T05:06:22+09:00 l3utterfly llama : dynamic temperature sampling (#4972)
3ce7e8f8e7ccfce07e5947ac5f1f3f4628cf68ea b2d80e105a59b54822edf7ce7f3ed5f317e96e21 2024-01-22T21:09:35+08:00 XiaotaoChen llava : MobileVLM support (#4954)
726c0fa9a2da976e9c5d5c51e185d9dd453fc9e5 942c0107a7301434c0a5e7da46bc4cf2393aa556 2024-01-21T08:01:20+02:00 Kawrakow Slightly faster imatrix (#5050)
77bc1bbd05f0c31cb45773eb5eb59b9ff2b07e1b 48e2b1337257bb77573bf76cfffcff3a5efa8704 2024-01-20T08:11:31Z Herman Semenov cmake : add support for ccache (#5002)
381ee195721d8e747ee31a60c0751822b3072f02 a5cacb22b2114fd9adf61c00cbb237384d86bced 2024-01-19T13:20:50-05:00 Uzo Nweke finetune : fix ggml_allocr lifetimes (tmp workaround) (#5033)
7051aacfac0057fa5fac9ea46c55bffc3892d810 2b3b999cacc7ad1207c32fbdf3479a19c06e1a34 2024-01-19T11:39:11+02:00 Kawrakow winogrande: evaluate log-probs in parallel (#5036)
3e945cc1e9c06d2001031360e4e303e9548fb02c ad19812cda4062c9f154ef16315df41fbe6a770a 2024-01-18T19:18:21+02:00 Kawrakow HellaSwag: speed up by parallelizing log-prob evaluation (#5020)
ba69bbc84ced580fe4fdb0713ca2d95634325b7a 44a1a4a41a4c0b03afaa7d9e06bcbc7cf95aa1e6 2024-01-17T18:46:30+02:00 Georgi Gerganov imatrix : offload to GPU support (#4957)
44a1a4a41a4c0b03afaa7d9e06bcbc7cf95aa1e6 c918fe8dca8fa1c4602427e0a4b88e20046f6c34 2024-01-17T18:39:41+02:00 Georgi Gerganov backend : add eval callback (#4935)
158f8c9e21302114bac3c646f80ea85b52ffa0bd 862f5e41ab1fdf12d6f59455aad3f5dd8258f805 2024-01-16T17:05:19Z Paul Tsochantaris metal : localized logic in `ggml_metal_graph_compute` (#4924)
862f5e41ab1fdf12d6f59455aad3f5dd8258f805 3a48d558a69c88ac17efcaa5900cd9eb19596ac4 2024-01-17T00:47:34+11:00 Neuman Vong android : introduce starter project example (#4926)
a0b3ac8c48b66206b9c5921ce57bd5c0ea6557c3 d75c232e1da56f19ac4d2530dadbe0ab3a11fde5 2024-01-16T03:16:33-08:00 Justine Tunney ggml : introduce GGML_CALL function annotation (#4850)
7dc78764e2ff86512e6e31cb0fcb8087df4b4708 356327feb3f66980ab687040495d722696d98970 2024-01-13T15:52:53+01:00 Johannes Gäßler compare-llama-bench: tweak output format (#4910)
e7e4df031b9e29d4b55a4e0b0295187f6b213db1 584d674be622fbf1578694ada6e62eebedbfd377 2024-01-12T20:07:38+01:00 slaren llama : ggml-backend integration (#4766)
e739de790921e6abbc8c70398303cacd74913f61 c910e3c28a1caee8cb1398143d582dd9ab697e68 2024-01-10T21:13:42+08:00 leejet ggml : change GGML_MAX_NAME at compile time (ggml/682)
d34633d8db6c2e400355de4862cd699154ecc73f 4f56458d34cb13dcbf69aca650e9bf77d5497e6f 2024-01-10T14:37:09+01:00 John clip : support more quantization types (#4846)
4f56458d34cb13dcbf69aca650e9bf77d5497e6f 6efb8eb30e7025b168f3fda3ff83b9b386428ad6 2024-01-10T01:04:33+01:00 Johannes Gäßler Python script to compare commits with llama-bench (#4844)
6efb8eb30e7025b168f3fda3ff83b9b386428ad6 36e5a08b203542dca53cca4eaf172c5dc4bbc991 2024-01-09T13:46:46-05:00 Austin convert.py : fix vanilla LLaMA model conversion (#4818)
dd5ae06405c5565b99889bdb3f168f4351252cfb 668b31fc7d86245435ad6574e0e1126e734049e2 2024-01-08T16:02:32+01:00 Kawrakow SOTA 2-bit quants (#4773)
226460cc0d5b185bc6685fb76f418fd9418d7add d5a410e8556191672465f7ff58682ea2474038b0 2024-01-07T17:59:01+01:00 slaren llama-bench : add no-kv-offload parameter (#4812)
f3f62f0d835d559e80714bbeb05d03125574e3dd 0ef3ca2ac62016c0c545de1c89dc2e3e130f4a99 2024-01-02T21:07:47+02:00 Georgi Gerganov metal : optimize ggml_mul_mat_id (faster Mixtral PP) (#4725)
26f3071d714f0b27ad7f021a46a66a1085480258 775ac8712a7b42cfead2585f42cec0dfd56644ab 2024-01-02T16:23:38+07:00 Nam D. Tran py : re-enable mmap in convert hf (#4732)
68eccbdc5b56f2a2450f9a8463f9934388cafabf 97bbca6e8522d18041fcde6c3d0907a52ce36446 2023-12-29T06:42:26-08:00 Philip Taron flake.nix : rewrite (#4605)
db49ff8ed7f0bb201176703441cc02911b08ef2a 60f55e888c29cbd87c4238dd19e85d0eef87245d 2023-12-29T06:24:12-08:00 Justine Tunney server : replace sleep with condition variables (#4673)
afd997ab6011dfefe9e917425b04ef4d83614841 c8255f8a6b2a3b3ebc6cb340cc2487f39fc95ffc 2023-12-29T05:58:56-08:00 Peter Sugihara llama.swiftui : fix infinite loop, ouput timings, buff UI (#4674)
65e5f6dadbba4b496bba27f573e473c66b446496 ea5497df5d138c83b2b0ca70aefdc4b1175c1001 2023-12-28T11:20:00-08:00 Justine Tunney Fix OpenAI server sampling w.r.t. temp and seed (#4668)
f6793491b5af6da75edad34d6f503ef86d31b09f 879b690a9e1eb1ab0a29b58236fc76978fb4d902 2023-12-27T22:39:45+07:00 Nam D. Tran llama : add AWQ for llama, llama2, mpt, and mistral models (#4593)
48b7ff193e64c97ab174280ba0eb8d14b47c49ba 48b24b170e3b4f9dc28200306840cb07d1c123df 2023-12-22T12:12:53+01:00 slaren llama : fix platforms without mmap (#4578)
d232aca5a73b290e218a2e48b91023d5e994203f 31f27758faf4a4bd08101a57c7ec3a473f771f86 2023-12-21T21:07:46+01:00 slaren llama : initial ggml-backend integration (#4520)
800a489e4a8be199122259a995b1ee9dd7fae320 f7f468a97dceec2f8fe8b1ed7a2091083446ebc7 2023-12-17T19:38:41+02:00 Georgi Gerganov llama.swiftui : add bench functionality (#4483)
799a1cb13b0b1b560ab0ceff485caed68faa8f1f fecac45658a99eddc4d6e36ba0310ca8f87a77f0 2023-12-13T13:04:25+01:00 slaren llama : add Mixtral support (#4406)
bcc0eb4591bec5ec02fad3f2bdcb1b265052ea56 81bc9214a389362010f7a57f4cbc30e5f83a2d28 2023-12-07T13:03:17+02:00 Georgi Gerganov llama : per-layer KV cache + quantum K cache (#4309)
81bc9214a389362010f7a57f4cbc30e5f83a2d28 05cd6e5036d72d0930de4d8f6be7bce09e8dda24 2023-12-07T02:25:22-08:00 Hongyu Ouyang train : fix #4227 (double free in examples/train-text-from-scratch/train-text-from-scratch.cpp) (#4351)
5aa365d88fdb8fdd430ef3fc141c7a5fd37c3502 52c8bc3cf312e1caf02d37bfb9d9d865cbe33594 2023-12-05T10:19:18-07:00 Kerfuffle llama : allow overriding GGUF metadata when loading model (#4092)
ef47ec18da469423c276b683dd9b5741cee7023e 1d144112c0fbbb4ecc07dbcf4f05a380148bd6de 2023-12-01T10:51:24+02:00 Georgi Gerganov ggml : add ggml_soft_max_ext (#4256)
8e672efe632bb6a7333964a255c4b96f018b9a65 0b871f1a04ef60e114bbe43004fd9c21114e802d 2023-11-21T16:22:30+01:00 Galunid stablelm : simplify + speedup generation (#4153)
f23c0359a32871947169a044eb1dc4dbffd0f405 40a34fe8d034bd484efd79ccbb95059ca6308dcb 2023-11-20T11:35:47+01:00 Galunid ci : add flake8 to github actions (python linting) (#4129)
f7d5e975424ff0eea55ca5a9181ac8e15553c1fc ba4cf5c0bf37a729d29e899dadf14541cddd23d4 2023-11-17T16:20:53+01:00 Jiří Podivín py : remove superfluous import statements (#4076)
3e916a07ac093045d88ef0c4fa78647ae0efc010 947f64f1630bb8b0b363a3bb5e29e11425312d57 2023-11-17T14:48:19Z gwjr finetune : speed-up ggml_compute_forward_out_prod_f32 via BLAS (#4079)
91f6499393d2d999331fbfdba47a7f8b9f913f0d 8da46278e1a57107591653275f8e03a281de94f0 2023-11-16T19:14:37-07:00 Kerfuffle Respect tokenizer.ggml.add_bos_token value when tokenizing (#4040)
ca190bca8e844d171020d6147687e71472d71734 71e3718abdb2771b50c9606d3a7569623a0b0afe 2023-11-01T09:28:28Z Adrian Hesketh server : re-enable completion and embedded at the same time (#3876)
71e3718abdb2771b50c9606d3a7569623a0b0afe 238657db2364cfb728c694470a4a81702afea760 2023-11-01T08:04:02+02:00 Georgi Gerganov llama : refactor graph build code (#3837)
2f9ec7e271220a78fe27c9e6ccbcc0dda31cda0f 34b2a5e1ee4fe6295fb4420eb91131d743694c65 2023-10-27T17:01:23+03:00 Georgi Gerganov cuda : improve text-generation and batched decoding performance (#3776)
6961c4bd0b5176e10ab03b35394f1e9eab761792 cc448774866e6479c750bd7c135cd8f92cedee67 2023-10-25T10:26:27+03:00 Georgi Gerganov batched-bench : print params at start
2b4ea35e56792064598e922e46d081e02bc96b94 daab3d7f45832e10773c99f3484b0d5b14d86c0c 2023-10-24T16:48:37+03:00 Georgi Gerganov cuda : add batched cuBLAS GEMM for faster attention (#3749)
438c2ca83045a00ef244093d27e9ed41a8cb4ea9 9e70cc03229df19ca2d28ce23cc817198f897278 2023-10-22T22:53:08+03:00 Georgi Gerganov server : parallel decoding and multimodal (#3677)
a5e7dbd6141128bfa3c40a19c2945a181df625d3 d3956aea53369455008159cc405ed4c496976692 2023-10-22T12:14:56-06:00 Kerfuffle llama : validate special token ids are in range when loading GGUF model (#3635)
f439e506e8ae8b01df2ae2156380f8156d7553e3 e78f3ef24af4ca74e77e725644b41ae8ca3b10a5 2023-10-20T10:02:12Z Herman Semenov ggml : fix rope + llama minor optimizations (#3560)
370359e5baf619f3a8d461023143d1494b1e8fde 9e24cc6e2e589d405bd1720c400f5b0b9d0ca3ee 2023-10-12T18:23:18+03:00 M. Yusuf Sarıgöz examples: support LLaVA v1.5 (multimodal model) (#3436)
8c70a5ff25964f0a81e20d142a2f5ac5baff22fc 24ba3d829e31a6eda3fa1723f692608c2fa3adda 2023-10-11T21:25:33+03:00 Georgi Gerganov batched : add bench tool (#3545)
b0ec5218c3d24755786b80ecce9cf4ffc07583f8 63d3b06a4318329f92b078e8aa0be7ab6e9f871f 2023-10-08T10:01:53+03:00 Georgi Gerganov metal : support MTLGPUFamily < Apple7, formatting, style (#3524)
f93af02488179b9c52d0d391b08ae4c4d891b8d3 f72f8f22c9cb60465b2e79df2767e4ba9604e576 2023-10-04T15:29:58+03:00 Georgi Gerganov sync : ggml (conv 1d + 2d updates, UB fixes) (#3468)
79f34abddb72ac5ddbf118f3d87520b611a10a7d 8186242b6d67cf87ae179fb1a62f52fdf0e5c5eb 2023-10-03T23:38:19+05:00 Tameem ggml : add RISC-V Vector Support for K-Quants and improved the existing intrinsics (#3453)
f5ef5cfb18148131fcf45bdd2331f0db5ab7c3d0 40e07a60f9ce06e79f3ccd4c903eba300fb31b5e 2023-09-30T18:12:57+02:00 slaren ggml-cuda : perform cublas mat mul of quantized types as f16 (#3412)
16bc66d9479edd5ee12ec734973554d4493c5dfa 0512d66670de3f650c579519833c085014b0f200 2023-09-28T21:42:38+02:00 slaren llama.cpp : split llama_context_params into model and context params (#3301)
0e76a8992c8200237bbc6471a53fb8796b3872f7 2db94d98eda56982d80238840b0652b4137a2a84 2023-09-28T20:40:11+02:00 xaedes train : finetune LORA (#2632)
ec893798b7a2a803466cc8f063051499ec3d96f7 45855b3f1c7bdd0320aa632334d0b3e8965c26c4 2023-09-28T19:04:36+03:00 Georgi Gerganov llama : custom attention mask + parallel decoding + no context swaps (#3228)
da0400344be12074e67dcabc565140289cf7efaa e519621010cac02c6fec0f8f3b16cda0591042c0 2023-09-28T12:08:28+02:00 slaren ggml-cuda : perform cublas fp16 matrix multiplication as fp16 (#3370)
c091cdfb24621710c617ea85c92fcd347d0bf340 51a7cf5c6e490b2f51c82daa76c4ca4f8d845826 2023-09-23T21:48:24+02:00 slaren llama-bench : add README (#3317)
65c2c1c5ab7c5089dbc6d10bc49b9c58f0164317 80834daecf4b9021770361a6d5e1b9c7a60e6854 2023-09-20T12:06:08-04:00 Cebtenzzre benchmark-matmult : do not use integer abs() on a float (#3277)
d119c04c159d015a93567df7e73e0e45a22d0f1d 8781013ef654270cbead3e0011e33a6d690fb168 2023-09-20T10:02:39+03:00 Georgi Gerganov examples : fix benchmark-matmult (#1554)
8c00b7a6ff38e27fa1e471452b8a480913772c2a 7e50d34be68aae2cc766203703dd188e910e033a 2023-09-15T19:06:03+03:00 Georgi Gerganov sync : ggml (Metal F32 support + reduce ggml-alloc size) (#3192)
83a53b753a9499a2a3535c93975b430cb2c828a9 5c872dbca2c7979b1f6dafc97db0774b8bbf9372 2023-09-14T20:21:25+03:00 Alon CI: add FreeBSD & simplify CUDA windows (#3053)
d54a4027a6ebda98ab0fef7fa0c2247d0bef132a 1b0d09259e37898c519edb6c52d58f4d096f10bd 2023-09-11T19:55:51+02:00 Johannes Gäßler CUDA: lower GPU latency + fix Windows performance (#3110)
f31b6f4e2d6def3c0bd7c75f75c0c1e8698e0589 6eeb4d90839bac1e6085e5544654ab5c319ad09a 2023-09-11T09:30:11+02:00 Kawrakow metal : PP speedup (#3084)
ba7ffbb2517ff8cf4c689f94a9ad866f3ee71225 e64f5b55783e910d8287363895d652b4bea6527a 2023-09-08T18:01:04+02:00 Kawrakow metal : Q3_K speedup (#2995)
15b67a66c2f2d6032415b28a699b5131962318f1 be8c9c245bd129ebabb80e0a7a8dd7daeb4d30af 2023-09-07T15:52:34+02:00 slaren llama-bench : use two tokens in the warmup run for prompt evals (#3059)
31035681445181fb414e0def7ec3f84462b3bd97 5b8530d88c489f9d0c0ef3d0886b369f655b792e 2023-09-04T06:40:18-04:00 Cebtenzzre llama-bench : make cpp file non-executable (#2999)
47068e517004d90f13c16352bb3b4cafd53a00cd 8f429fa5111901f9646cf998643ac5310846d487 2023-09-03T15:12:08+03:00 Georgi Gerganov speculative : PoC for speeding-up inference via speculative sampling (#2926)
ca82cf7bac0c91d03e3d320b3a865dd006f854ac 6a31a3bd9806c85ed08266f6ab65181da0f30d03 2023-09-03T11:06:22+03:00 Kawrakow metal : more optimizations (#2959)
13268c533177a4dc76bce0b465645d74f0d51d55 4dcd47d71df8ca4edcc31302744bd93f0c31298e 2023-09-01T13:42:41+03:00 Georgi Gerganov metal : slight speed-up for add and mul kernels (#2917)
95b6e5212f5e4e1419de1d833d7f8d788f9f2227 44c117f41ee01c5ac8fb86bba041f08d8b87b46d 2023-08-28T23:33:27-07:00 Marcus Dunn added `struct` to llama_dump_timing_info_yaml's `llama_context` (#2857)
44c117f41ee01c5ac8fb86bba041f08d8b87b46d 43033b7bb4858da4f591715b3babdf906c9b7cbc 2023-08-28T21:51:47+02:00 xaedes train : mem usage and other improvements (#2439)
43033b7bb4858da4f591715b3babdf906c9b7cbc 6b73ef120114beb5664ea94aab48d07ed248ee52 2023-08-28T19:19:18+02:00 slaren llama-bench : set locale to utf8 (#2832)
463173a6c0ff353055eb90665794884c888c790f eaa13a48ff4136f01c1cdb79cacd61b67ec53095 2023-08-27T16:50:33+03:00 Kawrakow llama : speedup tokenization (#2831)
789c8c945a2814e1487e18e68823d9926e3b1454 c1ac54b77aaba10d029084d152be786102010eb2 2023-08-27T09:03:27+02:00 slaren ci : add LoRA test to CI (#2650)
730d9c681e339b76407659344e5a2cd50af7d7d5 c7d92e6dfec3f54849f3a0ba373054d29f321ea2 2023-08-26T14:13:36-06:00 Kerfuffle convert.py : advanced option (#2753)
154725c5436808e5c519685d0279e850596dbe62 12e2e33a977af73e75885eeee91c5575a77f4e5f 2023-08-25T15:16:19+02:00 slaren llama-bench : add model sizes (#2771)
6bbc598a632560cb45dd2c51ad403bda8723b629 3f460a2b723c8b936ac29ecfd02f244b3adeba55 2023-08-25T12:09:42+03:00 Henri Vasserman ROCm Port (#1087)
38b16dfca6e5032e6cfb90c1653bf1ba4cf647b4 8f8c28e89cb9531211783da697d6e7c445e2af1d 2023-08-24T12:27:25-04:00 Shouzheng Liu metal : bug-fix when enable ggml-alloc (#2757)
6e91a1b0706c2e0e52b9d9be7ee82d3c1e7a33c1 44d5462b5cddc1c5cbcd7647646f7b55b175b01f 2023-08-24T00:07:13-04:00 Evan Jones llama : fix grammar sometimes generating null char (#2756)
cf658adc832badaaa2ca119fe86070e5a830f8f6 a192860cfec89a38d59a943623bf595b1fe4495b 2023-08-23T23:08:04+03:00 Georgi Gerganov llm : add Falcon support (#2717)
7f7ddd5002040804e33fcdbde44aa22f8635f57d b8ad1b66b23f9b2e6e4531e9a62753323036a556 2023-08-23T06:31:09-03:00 IgnacioFDM Fix ggml to gguf conversion on Windows (#2733)
8e4364f2af9cd5d57240f23e83c0e29bc068bc02 1e3bc523d8053a77df3ac7126a84d0297ee97ef6 2023-08-22T09:56:03+02:00 slaren llama-bench : minor fixes (#2695)
097e121e2f17ed3541cf02c55ff7e9febc091b19 eaf98c2649d7da705de255712f0038ac7e47c610 2023-08-18T12:44:58+02:00 slaren llama : add benchmark example (#2626)
a872a2b28eaefc8d464eaa535c94deeb501666f9 0919a0f73d95cfb93a1646a1d1741a0615fe2c5e 2023-08-17T03:35:53-04:00 Shouzheng Liu ggml-alloc : fix discrepency between measure&eval (#2639)
bf83bff6742c0f1795b4c18695a13a34ac7adf62 b5ffb2849d23afe73647f68eec7b68187af09be6 2023-08-16T16:07:04-04:00 Shouzheng Liu metal : matrix-matrix multiplication kernel (#2615)
5517d6e69214cdead000a76983b9fe175c3f8329 f31b5397143009d682db90fd2a6cde83f1ef00eb 2023-08-14T15:16:54+08:00 Jhen-Jie Hong server : implement json-schema-to-grammar.mjs & add grammar param in the UI (#2588)
f64d44a9b9581cd58f7ec40f4fa1c3ca5ca18e1e b19edd54d51cef5e3616c18b1d0d8626895b2cba 2023-08-13T00:24:45+02:00 Johannes Gäßler CUDA: Fixed OpenLLaMA 3b mmq, reduced compile time (#2590)
53dc399472d5bd35ee739b865e843b1996bd3814 9ca4abed893685692f90413e4d43153af12342d9 2023-08-12T06:35:14+08:00 Equim server: fixed wrong variable name in timing json (#2579)
1a941869cbef8e9cc351a6c6987e4ae3b0f021f7 b5472ea0ada081a6e1c06998ebbc9a24aa2cd4a4 2023-07-27T11:00:54+03:00 Georgi Gerganov metal : disable graph concurrency optimization due to bug (#2413)
da1889834a036a63ead2b0ca5c9ed8967712568c 82552b7f5403ca13957ac9a2cdc1732470057b62 2023-07-25T14:32:20+02:00 slaren ggml : improve graph build time via hash table lookup (#2329)
1aa18ef994a6a2b531434eb13251ef48e56d345b 9a08eaf3c4010962d0126e9e5bfbe9af64b2ac90 2023-07-25T08:00:19-04:00 Shouzheng Liu metal : concurrently dispatch commands (#2358)
9a08eaf3c4010962d0126e9e5bfbe9af64b2ac90 129d844c87d90e74aafc23dcc84c980fd408def4 2023-07-25T13:48:29+03:00 Kawrakow Another speed gain for Q4_0 and Q4_1 on Metal (#2375)
2f9cf974a066ac0e03fbb235d834b01b0164d743 4f06592cc6b83979e4b442e8cb97b3948c857188 2023-07-24T00:19:47+03:00 Kawrakow Some more Q4_K and Q5_K speedup on CUDA (#2346)
d2a43664f93ba30a84e42713bb69f936cbdacf2a b9b7d94fc10a8039befd1bc3af4f4b09c620c351 2023-07-23T08:49:20+03:00 Kawrakow Speed up Q4_K (#2322)
b47b8a9cfeb439d271bf997fb985fd6d82b3af5e b5fe67f8c69113bd9354bc1adcfe2df6be323740 2023-07-22T21:17:57+03:00 Georgi Gerganov llama : optimize memory buffers (#2325)
5d500e8ccf5eee3de3ae66685cc3be75e43e08b9 7d5f18468ceabd7a38f414f9f21b26b0c137f994 2023-07-22T11:48:22+03:00 Georgi Gerganov ci : add 7B CUDA tests (#2319)
4d76a5f49b9b5382dba5d13d92edb9159536c225 0db14fef06836caaa13cc123c0a24dc598bdb9f0 2023-07-21T17:05:30+03:00 Kawrakow Faster Q3_K implementation on Metal (#2307)
e782c9e735f93ab4767ffc37462c523b73a17ddc 785829dfe8baf0213f2ff66963d28c62f92d7930 2023-07-20T18:19:45+03:00 Kawrakow Faster Q5_K and Q6_K on Metal (#2294)
417a85a0010519224cf154eb85d383ffeafeeead 294f424554c1599784ac9962462fc39ace92d8a5 2023-07-20T06:32:22-04:00 Shouzheng Liu metal: minor q4 optimization and reduce code size (#2248)
294f424554c1599784ac9962462fc39ace92d8a5 45a1b07e9b20c33d71d8c849ff27d693a75a0269 2023-07-19T15:06:40+08:00 Rinne llama : extend API to get max devices at runtime (#2253)
672dda10e4d8ac79df5d5970da7fb69d242ca9a7 27ab66e437797aedbb23b3599385756b6c26ac39 2023-07-17T03:57:28+08:00 Qingyou Meng ggml : fixed runtime bugs and compile errors related to GGML_PERF and GGML_DEBUG (#2219)
32c54116318929c90fd7ae814cf9b5232cd44c36 ff5d58faecf1f02b05bd015bdfc6a394cf2bc9ba 2023-07-13T21:58:25+08:00 Howard Su Revert "Support using mmap when applying LoRA (#2095)" (#2206)
c9c74b4e3f9dcfab8b0032749ff8a579ab4e4d8d 3ec7e596b2ba3f43c22f441254ca2bcfa91102ba 2023-07-12T00:18:43+08:00 Bach Le llama : add classifier-free guidance (#2135)
18780e0a5e17348236230bbe891901b9b5718709 3bbc1a11f04a9adc0d0e08c2940ba4d2978755ab 2023-07-09T05:20:43-03:00 JackJollimore readme : update Termux instructions (#2147)
1d656d6360359cfdaaf5d64ed9690047b600dbcb 72421402834141df6cbdcf595fe46dbd11874dce 2023-07-08T00:24:01+08:00 Qingyou Meng ggml : change ggml_graph_compute() API to not require context (#1999)
a17a2683d8fdb899ba497d0c28ccafb28c62efb6 31cfbb1013a482e89c72146e2063ac4362becae7 2023-07-06T09:17:50-07:00 tslmy alpaca.sh : update model file name (#2074)
31cfbb1013a482e89c72146e2063ac4362becae7 983b555e9ddb36703cee4d22642afe958de093b7 2023-07-05T16:51:13-04:00 Tobias Lütke Expose generation timings from server & update completions.js (#2116)
051c70dcd55709c9cbbfa849af035951fe720433 9e4475f5cf639315f61ed7b8da6258bb0c7c5ca9 2023-07-05T18:31:23+08:00 Howard Su llama: Don't double count the sampling time (#2107)
b2132270678c473f7cd9ba871b03d694126bc33a 2f8cd979ecd1fa582852e7136e92ff8990b98fd8 2023-07-01T20:31:44+02:00 Daniel Drake cmake : don't force -mcpu=native on aarch64 (#2063)
b8c8dda75fdf5fdea49c80af36818e7c30fe0ddf 96a712ca1b7f427e3bd7ffc0c70b2105cfc7fbf1 2023-06-29T21:15:15+08:00 Howard Su Use unsigned for random seed (#2006)
96a712ca1b7f427e3bd7ffc0c70b2105cfc7fbf1 d3494bb86bf7ad5b0b60aae0220ea576f273b5c0 2023-06-29T11:56:43+08:00 LostRuins Porting the improved K-Quant CUDA kernels to OpenCL (#1966)
a84ab1da8dc6a59a5b67420ae1322f09503ffc72 5743ca80928d8410754ec64a5673d5c2dd6cfbb7 2023-06-27T01:47:02+09:00 katsu560 tests : fix quantize perf (#1990)
6769e944c727c63612dcafbef52009d21ae00fff cbebf61ca7584e9709265395f0127ae7fc0f1882 2023-06-26T19:43:07+03:00 Kawrakow k-quants : support for super-block size of 64 (#2001)
18b35625c3c19c64b7818a12460ba5ddb006dfdc ba4e85a8339b9dd7cdffad31838235f2fe45a8ea 2023-06-19T20:43:30+03:00 Georgi Gerganov ggml : fix bug in LBFGS optimizer (found by ggml tests)
794db3e7b982fee37e3995db9c3a216a57ff65e3 5ddf7ea1fb42bac21026de2f77e0f9c069b92234 2023-06-17T07:53:04-04:00 Randall Fitzgerald Server Example Refactor and Improvements (#1570)
3d0112261042b356621e93db3fa4c6798a5d098f 602c748863e15270d80d74aa2c3bf86ab8139e07 2023-06-16T20:08:44+03:00 Kawrakow CUDA : faster k-quant dot kernels (#1862)
a09f9195be39afb4b023b646c0a6ec8a86915174 bed92756172d4514b23aaf9744cf8e2dc892fc7b 2023-06-15T21:49:08+02:00 Johannes Gäßler Fixed CUDA runtime version check (#1879)
254a7a7a5ff4c874ff8488f1f5cbdd7e9c89d682 92549202659fc23ba9fec5e688227d0da9b06b40 2023-06-14T19:47:19+02:00 Johannes Gäßler CUDA full GPU acceleration, KV cache in VRAM (#1827)
e32089b2c20b1b87b22912f4a8b93fe01647d5b9 2347e45e7bdb09c9a7d74b2c0bc86c2b65f0c343 2023-06-13T21:04:40+02:00 xaedes train : improved training-from-scratch example (#1652)
2347e45e7bdb09c9a7d74b2c0bc86c2b65f0c343 74d4cfa3438cb58bd177eed30014e6588694aaa8 2023-06-13T20:20:07+03:00 Georgi Gerganov llama : do a warm-up eval at start for better timings (#1824)
74a6d922f12ccfe16b0c265f43be8978c6f25e98 e4caa8da59c1c97dc23fa336f4d726984a20560f 2023-06-12T22:39:21+03:00 Kawrakow Metal implementation for all k_quants (#1807)
e9b66ee9829039d4ab54550d6222e42a0b31e52a 4f0154b0bad775ac4651bf73b5c216eb43c45cdc 2023-06-10T11:28:11+03:00 Kawrakow metal : add Q4_1 implementation (#1785)
4f0154b0bad775ac4651bf73b5c216eb43c45cdc ef3171d16241c18581d4d08374f0b9e396ade6b7 2023-06-10T01:59:17-06:00 Kerfuffle llama : support requantizing models instead of only allowing quantization from 16/32bit (#1691)
72ff5282bf0388c60821f504c4c8cc2b1f491aa6 0bf7cf1b296fc9fca05411b37afdf08a531487d2 2023-06-08T22:28:21+03:00 Kawrakow metal : add Q2_K implementation (#1762)
0f291e1f65c1d68201e71ce99c89562a36686b6d 8fc8179919a11738910db07a800f2b176f8adf09 2023-06-08T19:46:22+03:00 Kawrakow metal : Q6_K implementation (#1752)
4161bdc04debb70bf5f275492b4d89fd9330087c 0035858273ebe0694926bf4414d279f3e1cd109d 2023-06-08T10:08:23+03:00 Kawrakow metal : add Q4_K implementation (#1733)
5c64a0952ee58b2d742ee84e8e3d43cce5d366db 5b57a5b72676540b6a45a3f527126299969ad241 2023-06-07T10:59:52+03:00 Georgi Gerganov k-quants : allow to optionally disable at compile time (#1734)
35a84916fb029905c44746127026079268216e7a 2d7bf110edd8c49209401a16132052cba706ffd0 2023-06-07T04:10:17+02:00 Willy Tarreau main: add the possibility to open the prompt cache read-only (#1640)
f4c55d3bd7e124b101bc974cbbf0e0dbbc32d5a3 f1465624c2cbc8ee65b566e3d87f2af27796d4c4 2023-06-05T23:32:36+03:00 Yuval Peled docs : add performance troubleshoot + example benchmark documentation (#1674)
efe05076323f5c6bafece109e21cce046f5e4b07 e7fe66e670537990ccc075cce9286df88bba052a 2023-06-05T22:11:49+02:00 grahameth ggml : fix internal overflow in ggml_time_us on Windows (#1702)
99009e72f8072fa552eb02efee436be596c71cdd 5220a991a5e92bddad9542267ab445a2c033681c 2023-06-05T22:56:18+03:00 Kawrakow ggml : add SOTA 2,3,4,5,6 bit k-quantizations (#1684)
5220a991a5e92bddad9542267ab445a2c033681c d1f563a743a83dabc11e125d4a7d64189c16498c 2023-06-05T13:43:08+03:00 Henri Vasserman Increase 3B scratch buffers. (#1698)
ecb217db4fcfa3880300ad08531a5fb6bb142d45 dcb2ed48268e421baf25adc00d602dad0f415564 2023-06-04T23:34:30+03:00 Georgi Gerganov llama : Metal inference (#1642)
1fcdcc28b119a6608774d52de905931bd5f8a43d ac7876ac20124a15a44fd6317721ff1aa2538806 2023-05-25T23:07:29+02:00 Johannes Gäßler cuda : performance optimizations (#1530)
affc76edfdefa7b326f526e463cc65ff13fcfb92 ea600071cb005267e9e8f2629c1e406dd5fde083 2023-05-20T14:19:28+02:00 Johannes Gäßler cuda : loading models directly into VRAM, norm calculation on GPU, broadcasting for ggml_mul (#1483)
2d5db48371052087a83974abda3767d1aedec598 6986c7835adc13ba3f9d933b95671bb1f3984dc6 2023-05-19T22:17:18+03:00 Georgi Gerganov ggml : use F16 instead of F32 in Q4_0, Q4_1, Q8_0 (#1508)
c238b5873a1ea496db03ffcfe124c9d0d83afbc6 2b2646931bd2a2eb3e21c6f3733cc0e090b2e24b 2023-05-17T22:47:58+08:00 rankaiyx benchmark-matmul: Print the average of the test results (#1490)
b5c9295eef2b56e307393b35b3a923e3518d226e eb363627fda5f47de8ab5e9be8abd426049d00df 2023-05-14T22:46:00+02:00 slaren benchmark-matmul: fix clang-tidy issues, report results in GFLOPS (#1458)
bda4d7c215aa16b2a78e522521dfc0e1c2e8b194 5a5aeb1e91009c72bf816400b758bb8a305616d7 2023-05-13T17:25:09+03:00 Georgi Gerganov make : fix PERF build with cuBLAS
f954edda935a70a14cf0cc45ecc7fe7d60cf3e4b f048af0230ad5381bb20b9e3c1467ec6fc7debdf 2023-05-13T14:56:40+02:00 xaedes ggml : implement backward pass for llama + small training-llama-from-scratch example (#1360)
b9fd7eee57df101d4a3e3eabc9fd6c2cb13c9ca1 b608b55a3ea8e4760c617418538465449175bdb8 2023-05-12T00:23:08+03:00 Georgi Gerganov ggml : remove bit shuffling (#1405)
1b0fd454650ef4d68a980e3225488b79e6e9af25 3924088512d9e12e90ed6dbf28a6c5712481d33e 2023-05-07T10:03:23+07:00 swittk ggml : Allow usage of CLBlast alongside Accelerate.framework (#1336)
58b367c2d757c0ea12aec672382462b42204c724 ea3a0ad6b6b5ca4693b94acd4cb32e2803f66fae 2023-05-01T18:11:07+02:00 slaren cuBLAS: refactor and optimize f16 mat mul performance (#1259)
f0d70f147d969e41fa410b8af2965a27aa901eb9 3e5aa8a1c44051153d6d7b3eeca2f4b4e5fb310c 2023-04-30T12:32:37Z Stephan Walter Various fixes to mat_mul benchmark (#1253)
7296c961d9303010a2b98379f738da2a8a55aa1b 78ec543733d10a1629f984fd0302fdaa4e87fe66 2023-04-28T16:57:16+02:00 0cc4m ggml : add CLBlast support (#1164)
574406dc7e350ddbffaeca33bf0392b7bfeb1436 87a6f846d3e929632c45916dd08f1e2a9c72d2a3 2023-04-26T23:14:13+03:00 Georgi Gerganov ggml : add Q5_0 and Q5_1 quantization (#1187)
87a6f846d3e929632c45916dd08f1e2a9c72d2a3 ea3ad7eb60cfb44526a58122e8019850f437cd1b 2023-04-26T20:08:43Z Ásgeir Bjarni Ingvarsson Allow setting the rng seed after initialization. (#1184)
ec9cdb6752dd96b3cc74d90ad1adeba5b4fa2b0e e4422e299c10c7e84c8e987770ef40d31905a76b 2023-04-23T18:32:52+03:00 Georgi Gerganov ggml : do not print perf ops that have not been used at all
e4422e299c10c7e84c8e987770ef40d31905a76b 53c8434398b3cba7ac6298cdd44abd40f0e640b1 2023-04-23T18:15:39+03:00 Georgi Gerganov ggml : better PERF prints + support "LLAMA_PERF=1 make"
5f939498d517b4dddbe904f202e895a3ecfb9dc4 36b4f7e06406eed8a605cc9f2921d9244ef6a8e5 2023-04-22T11:10:39+02:00 unbounded ggml : unit test for quantization functions (#953)
36b4f7e06406eed8a605cc9f2921d9244ef6a8e5 10f19c1121068ce3dab9bece03a8b9caaea2db36 2023-04-22T16:56:35+08:00 wbpxre150 llama : print timings on ctrl+c exit (#1021)
c5aa5e577741d0359ad26ec50b9e21a74c65d911 e9a9cb0c54461ffbda75b7b2f99f3ea5562291c2 2023-04-22T07:37:05Z Stephan Walter ggml : AVX2 optimization for vec_dot_q4_3_q8_0 and refactoring (#1099)
50cb666b8a2e35a49b08c0f6bc81138c8f6f2ac1 25d7abbd1f73582b7e0fdc422a936e8541c0780b 2023-04-21T21:59:17+02:00 slaren Improve cuBLAS performance by using a memory pool (#1094)
1bfc153e2f35ddd9d64b084e8d1a5e6fa57ad1c9 3d59769c3bb7e72c915646ddb1e239b1face19f5 2023-04-21T17:18:26+02:00 Kawrakow ggml : a faster version for Q4_1 x Q8_0 dot products (#1083)
c8c2c524827be8fd681a63f0e5a697b0bf4c587b 02d6988121510c067e06d498a273a351a888f5b9 2023-04-20T06:45:41Z Stephan Walter AVX2 optimization for vec_dot_q4_2_q8_0 (#1068)
02d6988121510c067e06d498a273a351a888f5b9 834695fe3a3ed2a962e774c9615e3f7b41d360a8 2023-04-20T03:14:14+02:00 slaren Improve cuBLAS performance by dequantizing on the GPU (#1065)
f7d05095b404b5500b4a702ea16f67fc22446e49 884e7d7a2bfd7325b107442d6758983f5886ed3d 2023-04-19T20:20:14+02:00 Kawrakow Q4_2 quantization with rmse-optimized scale and quants (#1062)
884e7d7a2bfd7325b107442d6758983f5886ed3d 7cd5c4a3e9106151d48f328bb3c94c298a211f18 2023-04-19T20:10:08+03:00 Georgi Gerganov ggml : use 8-bit precision for Q4_1 intermediate results (#1047)
77a73403ca8eaced2590559d0f9cebd2b3649d32 50a8a2af97cb92e53e7a3195aa201c3d87da5415 2023-04-18T23:54:57+03:00 Georgi Gerganov ggml : add new Q4_2 quantization (ARM only) (#1046)
50a8a2af97cb92e53e7a3195aa201c3d87da5415 4caebf6d408b91c2d29d0abc7b1e867b5de64db5 2023-04-18T23:11:23+03:00 Georgi Gerganov ggml : scratch that - vmlaq_n_f32 is always better
dcdd65e2969bc03c91a1ebd1160162d5054e6923 5ecff35151156118c2df74899637ad34ee384b9b 2023-04-18T22:59:17+03:00 Georgi Gerganov ggml : optimize ggml_vec_dot_q4_0_q8_0() using vectorized accumulators
5ecff35151156118c2df74899637ad34ee384b9b 7faa7460f03bdd88becf1e659cf359f274055404 2023-04-18T21:00:14+02:00 Kawrakow Adding a simple program to measure speed of dot products (#1041)
f266259ad9a2bce5a34d919592310147af23f3dc 47f61aaa5f76d04286792e2fbd0c95b659ab2af0 2023-04-17T15:10:57+02:00 Ivan Komarov Speedup the AVX-512 implementation of ggml_vec_dot_q4_0() (#933)
489537e6cf6c93b74a029a11533dbcaa89791dcc 2d3481c72125cd388258864c7ad8d7d36777bad7 2023-04-16T12:13:00+02:00 Pavol Rusnak examples: add missing <ctime> include for time() (#1011)
e95b6554b493e71a0275764342e09bd5784a7026 aa485cee334e84437e21681c14b6f80b65876d8b 2023-04-15T17:53:22+03:00 Georgi Gerganov ggml : add Q8_0 quantization for intermediate results (#951)
c12b14b77fced0ce9a0e2d81f670c3a746dec251 106faaf2971d6c89d6010279a9a95737772470ef 2023-04-15T07:51:54+02:00 Ivan Komarov benchmark : fix result validation in benchmark-q4_0-matmult (#987)
723dac55fa2ba7adc6e3fc8609781d1ad0378906 0f07cacb05f49704d35a39aa27cfd4b419eb6f8d 2023-04-14T00:03:03-07:00 comex py : new conversion script (#545)
c5d70f5c9ea5a8f0f6b0d6aa741455978a1dabfd be87b6ed20a5f7528bf491a83e759a9fc6a24fea 2023-04-14T14:24:52+08:00 Howard Su ggml : optimize rope function to avoid call powf in the tight loop (#807)
d990e3fffc5b0f5448e90a16c79a4f2675100af0 9190e8eac8bdc108c40d2d7505e9b45fa773251f 2023-04-13T18:32:36+03:00 Georgi Gerganov ggml : speed-up ggml_vec_dot_q4_1() ARM_NEON + 32-bit ARM support (#900)
c85980acd04631a7c43d13676276f76ec72f5dfe 6232f2d7fd7a22d5eeb62182b2f21fcf01359754 2023-04-13T18:01:22+03:00 Georgi Gerganov gitignore : benchmark
6232f2d7fd7a22d5eeb62182b2f21fcf01359754 6c248707f51c8a50f7792e7f7787ec481881db88 2023-04-13T14:59:50Z Stephan Walter ggml : optimize non-SIMD Q4_0 vector dot product (#703)
95ea26f6e92d620a5437f576b80868aee7f808d6 82d146df9b43cf677e0dbce20b03cf864958a0cc 2023-04-13T14:46:23+02:00 SebastianApel benchmark : add tool for timing q4_0 matrix multiplication (#653)
c3ac702e5ee3533457e0489df4906ee112fe88e7 9d634ef452d0fc24fcd49592952d13d0ab0f41b7 2023-04-10T22:40:28+03:00 Georgi Gerganov ggml : add ggml_cont() + optimize ggml_cpy() for contiguous dst
f963b63afa0e057cfb9eba4d88407c6a0850a0d8 aaf3b23debc1fe1a06733c8c6468fb84233cc44f 2023-04-08T12:24:37-07:00 comex Rewrite loading code to try to satisfy everyone:
eeaa7b0492fc79baab8bb1fe195d6c87159f2bd3 986b6ce9f99503c51ec5afd8a10baa32359434c6 2023-04-05T22:11:03+03:00 Georgi Gerganov ggml : multi-thread ggml_rope() (~3-4 times faster on M1) (#781)
986b6ce9f99503c51ec5afd8a10baa32359434c6 34162989297fdfe3ab7305451ce55bc87e3f4c9c 2023-04-05T22:07:33+03:00 Georgi Gerganov ggml, llama : avoid heavy V transpose + improvements (#775)
0c44427df10ee024b4e7ef7bfec56e993daff1db 594cc95fabab0b662dabba3ea619ca5dca18bf6b 2023-04-05T17:38:37+03:00 Ivan Stepanov make : missing host optimizations in CXXFLAGS (#763)
437e77855a54e69c86fe03bc501f63d9a3fddb0e cd7fa956904cb8e321b72b3499f4a3a82e43c266 2023-04-03T09:52:28+02:00 SebastianApel 10+% performance improvement of ggml_vec_dot_q4_0 on AVX2 (#654)
1d08882afa647c44195f4f6495a68ea455650cae 02c5b27e91a6d18cf1043d3a2d8dbc59610ac257 2023-03-31T17:55:52+02:00 slaren Optimize AVX2 ggml_vec_dot_q4_0 (#642)
78ca9838ee36660a776e97e3391b6fb5dcaacf7f a017390358cdb23fffb30988dc84bb190d0403ca 2023-03-29T13:51:37-07:00 Justine Tunney Make loading weights 10-100x faster
b51c717d5cf9181c33afcb84554e47f6d539c891 0ba76c1e73ae21038b80bfb5a746157376c88173 2023-03-29T22:15:34+03:00 Georgi Gerganov ggml : init time on first ggml_init() call
53635c081c49321d523567112f9fddfbba6b787b 41318d708ed196ff727dce14d263a64b23c7333d 2023-03-29T19:29:26+03:00 Georgi Gerganov py : add GPT4All conversion script
436e56193199a1625f8c561069f702e8840a9e08 20e1e84884376b3fb44ffbfd48d478b2934b0b5e 2023-03-28T16:48:20Z Stephan Walter all : be more strict about converting float to double (#458)
29b7baab670ae8b76ac0da21c2ded69ff18971ee 4a7129acd2e939b92d70dd568c746f2fa078232c 2023-03-25T15:34:23+01:00 slaren Add timings for the prompt evaluation (#478)
481044d50cfe8eaa6cd0c1a1b445680e4b0b3ebc 563cdc391dde140f1084d1012234e8e6f57f881f 2023-03-24T08:19:26-07:00 Cameron Kaiser additional optimizations for POWER9 (#454)
8d4a855c241ecb0f3ddc03447fe56002ebf27a37 b6b268d4415fd3b3e53f22b6619b724d4928f713 2023-03-24T08:05:13-07:00 Luciano Add embedding mode with arg flag. Currently working (#282)
305ba6f0e6daa3796aad9dd18053a1945dd4cc58 4122dffff958cd137175b58f1f27c0913528d7ba 2023-03-22T18:16:35+01:00 tjohnman Don't force immediate interactive without `-i` (#354)
f5a77a629bd0f37ae1696747633ab42a5530ec15 da0e9fe90ccf6e73597eb19dd0cfc0a28363fb3b 2023-03-22T07:32:36+02:00 Georgi Gerganov Introduce C-style API (#370)
353ec251a42491f5192c48561da4b444ef67f23c 89d5d90f3b6d25f134da7a8e252c3432bffcf674 2023-03-21T14:21:50-03:00 Fabio R. Sluzala We could use std::unordered_map over std::map (#305)
16ffc013c62f22bdaa3cdc022d7a13fd952d73fc 486ae645fd3eda8b9d7413d5ff34fb65a3e337fb 2023-03-21T09:42:25-07:00 comex Importer for GPTQ quantized LLaMA models (#301)
486ae645fd3eda8b9d7413d5ff34fb65a3e337fb 3ab3e6582f7320c2b6568c892fdfc8215caf7e6c 2023-03-21T09:27:42-07:00 Gary Linscott Compute perplexity over prompt (#270)
2e664f1ff413995506c9a54f3a8d5b8c64e37a91 8cf9f34eddc124d4ab28f4d2fe8e99d574510bde 2023-03-21T07:35:42-07:00 Casey Primozic Add initial AVX512 support for dot product on Linux (#320)
2af23d30434a677c6416812eea52ccc0af65119c 904d2a8d6acd667c9633138d45a361d40fbf76d0 2023-03-17T10:47:06+01:00 Bernat Vadell 🚀 Dockerize llamacpp (#132)
904d2a8d6acd667c9633138d45a361d40fbf76d0 721311070e31464ac12bef9a4444093eb3eaebf7 2023-03-17T05:48:39+01:00 Matvey Soloviev Q4_1 quantization (#193)
84d9015c4a91ab586ba65d5bd31a8482baf46ba1 63fd76fbb06f9b723ca11505352387a3148b1814 2023-03-13T18:36:44+02:00 Georgi Gerganov Use vdotq_s32 to improve performance (#67)
63fd76fbb06f9b723ca11505352387a3148b1814 2a20f48efad692a8c2744f10c673bbdbe0c751b7 2023-03-14T01:33:43+09:00 uint256_t Reduce model loading time (#43)
c80e2a8f2adeda202cbffe76ef800f134e51f03f 54a0e66ea0ed3248e6c95a070a2da0bf5c6d4817 2023-03-13T01:28:08+02:00 Georgi Gerganov Revert "10% performance boost on ARM"
113a9e83ebc0f788f861394437087bf3ca0e019b 404fac0d623c9eea74ad7a9347da69e33f10984e 2023-03-13T00:56:10+02:00 Georgi Gerganov 10% performance boost on ARM
Can't render this file because it contains an unexpected character in line 311 and column 157.
@@ -0,0 +1,86 @@
ebce9e1a548c2329aa97f53b8b2ad50d968088dc e850ff4de25ad1221abc9bf3bb30df252ccd9c36 2026-05-27T09:38:00+08:00 Yunzhe Jia origin/runtime_replace Refactor cal-llm integration by removing runtime capacity loading and adjusting request handling
2716130010c58f1cdd9d94f0e2f8e047bc92dc66 b35bda124ccd4ed581dd6088d3ffa4931c2809b6 2026-05-18T08:40:54+08:00 Yunzhe Jia fix n_ctx_slot error by adding runtime capacity loading for cal-llm
1bec0db5a675ddc60fb793be2a746e8f3c8855dc 465df20c3e1f3f58d0f5531c796e0941a49c32b0 2026-04-30T16:02:59+08:00 wangbomeng origin/dev-ben bench: support 2 calbins
6787a53ab9b4897c5a7b51a4062d7b90e6697d35 e1a76abf66178ea85656479a5e19aea7785c09f4 2026-04-24T09:22:02+08:00 wangbomeng calrt:input of multimodel from fp32 to bf16
059009eeaf20a569abfbac5eb37dad3bb9376428 1b073661d1311b5300173993b9f31ee7241d8606 2026-03-10T07:04:22+08:00 wangbomeng calrt: add multimodel
ed8aa63320393512bdcfe4b05b5ae01ba91888e1 48bd26501b08a3f0bff1249db47f313641f7bebb 2025-11-03T18:01:59+01:00 Daniel Bevenius model-conversion : pass config to from_pretrained (#16963)
5a91109a5d7dab5d7adc40bedb397ede99a705b1 f8f071faddf32ea09f4234edb6e809b380a9ee26 2025-10-24T12:02:02+02:00 Daniel Bevenius model-conversion : add trust_remote_code for orig model run [no ci] (#16751)
4b9f4cb0f89a88de4bdf97727d0457b0c648804c 85e72271ba1ce78adf34fd8997803c991e617ca6 2025-09-23T13:59:34+08:00 Aaron Teo devops: add s390x containers (#15915)
37a23c17bdc9c99c9c6ad41168e4ced3724b72cd 138c87ce8bd558b2cc134ada7316a3dad8eb67ac 2025-09-22T14:13:51+02:00 Adrien Gallouët common : enable `--offline` mode without curl support (#16137)
28baac9c9f491c872e2c37762d3bd90446b005e9 1eeb523c3e0c7ffbd59469f5463dcbdecba3535e 2025-09-21T16:50:45+03:00 Georgi Gerganov ci : migrate ggml ci to self-hosted runners (#16116)
4ca088b036313c2d8e682f4cfeb7c29edd85d0b9 703f9e32c4eb3166f8d63007c26e31a1466c21af 2025-09-18T16:22:50+01:00 Eric Curtin Add resumable downloads for llama-server model loading (#15963)
28b5f190ef1dbea5edf82dbc8b4407b721fadd13 86587da03bd78df8f4e7d8b111a0c1d2494d6ed0 2025-09-10T15:29:12+08:00 Chenguang Li CANN: implement LRU cache for ACL graphs (#15814)
5d6688de08e73acc2532d668380801ed79d704eb 4fd1242bef6cb2325b4ff1c1a80f3b54b64508a6 2025-09-05T04:36:23+02:00 Daniel Bevenius model-conversion : add --embeddings flag to modelcard.template [no ci] (#15801)
46d9caa27a0281150e8cf082308c0f9e7576ebe5 5a0e3ef6f00c658fbae53797f02d5a360ebf8fec 2025-08-28T09:26:48+02:00 Daniel Bevenius model-conversion : add mmproj conversion target (#15628)
ef0144c087b33e5b8da42d529ac71aaf05cb49df 2721257e3e2c4c944ac8a08221113ee7cb503f1b 2025-08-05T04:29:25+10:00 Sam model: support GLM 4.5 family of models (#14939)
90083283ec254fa8d33897746dea229aee401b37 d4b91ea7b2da253e1355b503f0fcb7b428ce005d 2025-07-19T12:51:22-04:00 compilade imatrix : use GGUF to store importance matrices (#9400)
0aedae00e6fb48680324a5ac5da9cba0e35de6b5 6bdda13981d6c8189b7dc4f9fb8ecb91c21529f8 2025-07-10T18:20:13-06:00 Gabe Goodhart model : Granite Four (#13550)
4a5686da22057867c23bd4a6be941ddc8c51e585 98bab638fb28cf95a5a66dd2d51b40d6c8f6d69a 2025-07-09T14:59:57-04:00 compilade llama : support Jamba hybrid Transformer-Mamba models (#7531)
5364ae4ba53cc6367b8c8bf78876839122ca4e57 7c07ac244d59c833bf209582f6df019a77cdda59 2025-05-16T07:38:07-07:00 Diego Devesa llama : print hint when loading a model when no backends are loaded (#13589)
7f323a589f8684c0eb722e7309074cb5eac0c8b5 3eac209319a6726fd9687c6188fc6b916b65953d 2025-05-11T20:18:39+08:00 David Huang Add `--no-op-offload` to improve `-ot` pp perf in MoE models like llama4 400B (#13386)
0527771dd80bd18479dfaaa0a98be297fc3592bf 2189fd3b6327a1d17893694125da8edcf74a6468 2025-05-09T17:25:50+08:00 R0CKSTAR llama-run: add support for downloading models from ModelScope (#13370)
b2034c2b55b36b2192bdefb3b295db2a911370f5 06bb53ad9b6e6d92b6ab6979927530080b1c990c 2025-04-11T20:01:56+08:00 tastelikefeet contrib: support modelscope community (#12664)
02082f1519565fc7b49de211b28bc5404a69209b df4d20cd53d5bb6fc21c1dc65f026d53b566d097 2025-03-26T22:06:04+08:00 Ivy233 clip: Fix llama-llava-clip-quantize-cli quantization error under CUDA backend (#12566)
333820d7491cd31c707a340ff23b984a84e40154 c026ba3c23765a648ca27c7a15ecf179f8e27f26 2025-02-07T15:48:47+02:00 magicse llama : fix progress dots (#11730)
9dd7a0390feffcc1f4b17eb7692a6e43030d85af c0d4843225eed38903ea71ef302a02fa0b27f048 2025-02-06T13:41:37+02:00 Georgi Gerganov llama : add log about loading model tensors (#11699)
a5203b4465c5c87813936bde98170e25bb09024f df984e014714cba4c99ef894b20b51cbcef31b16 2025-01-27T17:42:09+04:00 lexasub llama : minor fixes for up llama load model speed (#11448)
c07e87f38bd0c22ec6dbc852ae50aaa1c64632d4 564804b79b78df1469ec8646869972de5e885ec4 2025-01-24T09:02:38+01:00 stduhpf server : (webui) put DeepSeek R1 CoT in a collapsible <details> element (#11364)
47182dd03fe04a4ffda5d7f4c8a109ae0056cf56 3e6e7a6bc2c4b980a0cf0fcb5cb3b79a965b5f14 2025-01-06T10:55:18+02:00 Georgi Gerganov llama : update llama_model API names (#11063)
4ddd199f6f6b980e0a7ed9f9b44efeae2fbdf5c4 a0974156f334acf8af5858d7ede5ab7d7490d415 2024-12-15T15:43:25-05:00 Bartowski llava : Allow locally downloaded models for QwenVL (#10833)
10bce0450f0c4d80087e06312b9dbbab3e87f16b 1f922254f0c984a8fb9fbaa0c390d7ffae49aedb 2024-11-25T19:30:06+01:00 Diego Devesa llama : accept a list of devices to use to offload a model (#10497)
feff4aa8461da7c432d144c11da4802e41fef3cf 0abc6a2c25272d5cf01384dda8ee8bfec4ba8745 2024-09-13T14:23:11+02:00 Xuan Son Nguyen server : add loading html page while model is loading (#9468)
67155ab7f5e47c01b62aa989eab30f517bf6dc67 5af118efdaf1098798a06b24fd8a557760e99631 2024-09-11T12:52:37+03:30 Farbod Bijary feat: Implements retrying logic for downloading models using --model-url flag (#9255)
54f376d0b92c6ff6feb1fa2ef8ed2022348100ba b2e89a327457179a34eae4d7de0d412ed945679c 2024-09-09T11:04:39+03:00 Radoslav Gerganov rpc : update README [no ci] (#9320)
8f1d81a0b6f50b9bad72db0b6fcd299ad9ecd48c a47667cff41f5a198eb791974e0afcc1cddd3229 2024-09-01T22:38:17+08:00 Molly Sophia llama : support RWKV v6 models (#8980)
84eb2f4fad28ceadd415a4e775320c983f4d9a7d 1262e7ed13ac197c944f15e1ddb083cb4f36cf65 2024-08-12T20:45:50+08:00 Frank Mai docs: introduce gpustack and gguf-parser (#8873)
86e7299ef5dff0f388922dc6fcbce009e99d8005 60d83a0149849e9217e4b8ae26e277a41aea906e 2024-07-06T15:32:04-05:00 Derrick T. Woolworth added support for Authorization Bearer tokens when downloading model (#8307)
0c7b3595b9e5ad2355818e259f06b0dc3f0065b3 7b2f4a7d193ef2475259bbe7656fcccfab4b1217 2024-06-15T18:53:40+02:00 Xuan Son Nguyen Add `cvector-generator` example (#7514)
57684331fc2d685f7d1f5775af0b9e47d1829833 b83bab15a5d2a1e7807d09613a9b34309d86cfaa 2024-05-24T18:14:42-07:00 Mikko Juola Make tokenize CLI tool have nicer command line arguments. (#6188)
b18532a4efeca8796fea8e36195c81cbfd596a4a fcda1128bc5f8eb7e1811708fe9d9867b9aec815 2024-05-22T16:10:46+02:00 slaren phi3 : duplicate rope factors in each layer (#7447)
b83cc3f5b303ff30c52874b2d5864dc6385ebf9f 9cb317f77e53067f7a138cc89ef7657148eae8e6 2024-05-11T09:46:09+02:00 Joan Fontanals llama : add Jina Embeddings architecture (#6826)
f98eb31c517c95960df1d0abc48002787f145f3b bc4bba364fb96d908f2698e908648df5e6f55e02 2024-05-08T18:16:38-04:00 compilade convert-hf : save memory with lazy evaluation (#7075)
4cc120c7443cf9dab898736f3c3b45dc8f14672b 24ee66ed0d908d156bd0d1747b63a636a495cd7a 2024-04-12T14:11:46+02:00 Daniel Bevenius infill : add download instructions for model (#6626)
f4183afe6a22f356ee222a710686ae7f83dbd949 b804b1ef77351d2a11be945462c6c251710476cb 2024-04-11T15:22:47+02:00 Daniel Bevenius scripts : add --outdir option to hf.sh (#6600)
4bcd6b959ca3991084ad1d8464caf2a734e29b1d 9b84ae1806cded4d6683c7b810925da5ead40607 2024-04-04T09:49:21+02:00 Daniel Bevenius common: remove duplicate check for curl (#6471)
08a0c0206075556e82aca0feafad530dcc5f1426 52604860f93063ef98863921da697576af1c7665 2024-04-03T15:07:05+02:00 slaren ggml : mul_mat_id use the same tensor for all the experts (#6387)
f482bb2e4920e544651fb832f2e0bcb4d2ff69ab 1997577d5e121568ae39f538021733ccd4278c23 2024-03-23T18:07:00+01:00 Pierrick Hymbert common: llama_load_model_from_url split support (#6192)
dba1af612926cbd4ebe2d876277af1e3305177e0 ee804f6223777019cf921e0d99cc24669313ab98 2024-03-22T19:00:01+01:00 Pierrick Hymbert llama_model_loader: support multiple split/shard GGUFs (#6187)
d01b3c4c32357567f3531d4e6ceffc5d23e87583 cd776c37c945bf58efc8fe44b370456680cb1b59 2024-03-17T19:12:37+01:00 Pierrick Hymbert common: llama_load_model_from_url using --model-url (#6098)
b5f4ae09c3244ae1644b67c03ed9f4227ab25ad2 dfbfdd60f90207404039c6578d709231496831d9 2024-03-16T16:46:29+01:00 Daniel Bevenius gritlm : add initial README.md (#6086)
c2101a2e909ac7c08976d414e64e96c90ee5fa9e 515f7d0d4fce41c752fc253acf30707c3be2531e 2024-03-08T17:31:00-05:00 compilade llama : support Mamba Selective State Space Models (#5328)
21b08674331e1ea1b599f17c5ca91f0ed173be31 6a87ac3a52668e117d97bcea07b529c93188b303 2024-03-05T16:08:35+08:00 Neo Zhang Jianyu [SYCL] fix mul_mat fault in CI/unit-test (#5862)
9731134296af3a6839cd682e51d9c2109a871de5 4a6e2d6142ab815c964924896891e9ab3e050632 2024-03-02T22:00:14+01:00 Pierrick Hymbert server: tests: passkey challenge / self-extend with context shift demo (#5832)
973053d8b0d04809836b3339a50f68d9c842de90 7c8bcc11dc61cf5930b70cd0168b84afcebe12a9 2024-02-22T00:42:09+01:00 slaren llama : fix loading models with shared tok_embd and output (#5651)
df845cc982e7e2ea7b9900e29d55b15338faa78d 6b48ed089377330cdb362970a51c1c89b6d857a8 2024-01-13T17:29:43+01:00 David Friehs llama : minimize size used for state save/load (#4820)
e7e4df031b9e29d4b55a4e0b0295187f6b213db1 584d674be622fbf1578694ada6e62eebedbfd377 2024-01-12T20:07:38+01:00 slaren llama : ggml-backend integration (#4766)
e790eef21ce659f5c16d59f8a5c8dcf6cde0692a 5537d9d36bfdb4379555431f574d3d78ce6e7955 2024-01-12T05:48:00-07:00 Zay llama.swiftui : update models layout (#4826)
eab67950068e4b125007d027232c47d2a5831cd0 d8d90aa343c22fe01429d3540e47ded87e9dcb9d 2024-01-11T12:41:39-05:00 Behnam M server : add `LOG_INFO` when model is successfully loaded (#4881)
7a9f75c38b5e62fe27b8a5a3ed823b4a3714024b 5c1980d8d4c4e0c0af77359f81cc44d90b3f250b 2024-01-11T02:12:05-05:00 Behnam M server : update readme to document the new `/health` endpoint (#4866)
cd108e641dbdedd8c5641c4cec1762f751f38136 57d016ba2d46a6e22517a31a75cebb48f9e234b6 2024-01-10T14:56:05-05:00 Behnam M server : add a `/health` endpoint (#4860)
57d016ba2d46a6e22517a31a75cebb48f9e234b6 329ff615699d32f596d4ebf8baba654c30064e0d 2024-01-11T01:09:53+11:00 Brian llama : add additional suffixes for model params (#4834)
3c0b585561d74a56977cf3a3844535ecc9e37972 e5804313a1edaf00726ed0b96ecced07accbf50c 2024-01-04T16:22:38+08:00 singularity llama.swiftui : support loading custom model from file picker (#4767)
441f51dca004debf8b275f1bdc08e0f1af7fd8f8 38b3de4658292582a8941a2be5c77b40ce6ac0f2 2023-12-29T19:23:27+09:00 Tamotsu Takahashi ci : build with CLBlast + ggml-opencl use GGML_API (whisper/1576)
d232aca5a73b290e218a2e48b91023d5e994203f 31f27758faf4a4bd08101a57c7ec3a473f771f86 2023-12-21T21:07:46+01:00 slaren llama : initial ggml-backend integration (#4520)
800a489e4a8be199122259a995b1ee9dd7fae320 f7f468a97dceec2f8fe8b1ed7a2091083446ebc7 2023-12-17T19:38:41+02:00 Georgi Gerganov llama.swiftui : add bench functionality (#4483)
bcc0eb4591bec5ec02fad3f2bdcb1b265052ea56 81bc9214a389362010f7a57f4cbc30e5f83a2d28 2023-12-07T13:03:17+02:00 Georgi Gerganov llama : per-layer KV cache + quantum K cache (#4309)
5aa365d88fdb8fdd430ef3fc141c7a5fd37c3502 52c8bc3cf312e1caf02d37bfb9d9d865cbe33594 2023-12-05T10:19:18-07:00 Kerfuffle llama : allow overriding GGUF metadata when loading model (#4092)
03562f3a86d6706eea9f4fc09b532946c191b34e 37c746d687d877bc11803e96b4dc5f378b83c0a0 2023-12-02T02:17:06+08:00 CausalLM llama : support attention bias on LLaMA architecture (#4283)
b18c66ca6eee4fe0465cff5042daf05005dc9ab2 f4d973cecb7368c985720ba9100ae6abba14806d 2023-11-30T22:43:08+01:00 Daniel Bevenius llama : fix alignment of general.name in print meta (#4254)
54b4df8886103b436a4bb3b60f4d84824f9e8868 46876d2a2c92e60579dc732cdb8cbd243b06f317 2023-11-06T23:43:59-08:00 Matthew Tejo Use params when loading models in llava-cli (#3976)
71e3718abdb2771b50c9606d3a7569623a0b0afe 238657db2364cfb728c694470a4a81702afea760 2023-11-01T08:04:02+02:00 Georgi Gerganov llama : refactor graph build code (#3837)
a5e7dbd6141128bfa3c40a19c2945a181df625d3 d3956aea53369455008159cc405ed4c496976692 2023-10-22T12:14:56-06:00 Kerfuffle llama : validate special token ids are in range when loading GGUF model (#3635)
0e76a8992c8200237bbc6471a53fb8796b3872f7 2db94d98eda56982d80238840b0652b4137a2a84 2023-09-28T20:40:11+02:00 xaedes train : finetune LORA (#2632)
ec893798b7a2a803466cc8f063051499ec3d96f7 45855b3f1c7bdd0320aa632334d0b3e8965c26c4 2023-09-28T19:04:36+03:00 Georgi Gerganov llama : custom attention mask + parallel decoding + no context swaps (#3228)
dc07dc492ef9640bbb82904d7c7679f7bdcf6d76 ad9ddcff6ef322db5cf13785bd7c856b610d242e 2023-08-30T02:25:50-06:00 Kerfuffle convert : various script cleanups/fixes + merges and special token handling (#2842)
44c117f41ee01c5ac8fb86bba041f08d8b87b46d 43033b7bb4858da4f591715b3babdf906c9b7cbc 2023-08-28T21:51:47+02:00 xaedes train : mem usage and other improvements (#2439)
95385241a91a616788a3bb76d12c9b7b2379ca2d 335acd2ffd7b04501c6d8773ab9fcee6e7bf8639 2023-08-23T20:33:05+01:00 Olivier Chafik examples : restore the functionality to import llama2.c models (#2685)
6381d4e110bd0ec02843a60bbeb8b6fc37a9ace9 dadbed99e65252d79f81101a392d0d6497b86caa 2023-08-21T23:07:43+03:00 Georgi Gerganov gguf : new file format with flexible meta data (beta) (#2398)
fff0e0eafe817eef429ecb64f892ab7bdae31846 417a85a0010519224cf154eb85d383ffeafeeead 2023-07-20T13:47:26+03:00 Georgi Gerganov llama : fix regression from #2000 - could not load no-mmap models
a17a2683d8fdb899ba497d0c28ccafb28c62efb6 31cfbb1013a482e89c72146e2063ac4362becae7 2023-07-06T09:17:50-07:00 tslmy alpaca.sh : update model file name (#2074)
e32089b2c20b1b87b22912f4a8b93fe01647d5b9 2347e45e7bdb09c9a7d74b2c0bc86c2b65f0c343 2023-06-13T21:04:40+02:00 xaedes train : improved training-from-scratch example (#1652)
8c0a10e64dbf60fd9946c0cd5e6f59690800b123 fa84c4b3e80199a5683438f062009c031a06c4fa 2023-06-12T14:31:36+03:00 Kawrakow metal : fix failure to load model (#1817)
ffb06a345e3a9e30d39aaa5b46a23201a74be6de 7552ac586380f202b75b18aa216ecfefbd438d94 2023-05-30T21:24:22+03:00 Henri Vasserman OpenLLaMA 3B support (#1588)
affc76edfdefa7b326f526e463cc65ff13fcfb92 ea600071cb005267e9e8f2629c1e406dd5fde083 2023-05-20T14:19:28+02:00 Johannes Gäßler cuda : loading models directly into VRAM, norm calculation on GPU, broadcasting for ggml_mul (#1483)
b9fd7eee57df101d4a3e3eabc9fd6c2cb13c9ca1 b608b55a3ea8e4760c617418538465449175bdb8 2023-05-12T00:23:08+03:00 Georgi Gerganov ggml : remove bit shuffling (#1405)
78ca9838ee36660a776e97e3391b6fb5dcaacf7f a017390358cdb23fffb30988dc84bb190d0403ca 2023-03-29T13:51:37-07:00 Justine Tunney Make loading weights 10-100x faster
563cdc391dde140f1084d1012234e8e6f57f881f 8d4a855c241ecb0f3ddc03447fe56002ebf27a37 2023-03-24T08:19:05-07:00 comex Support calling mlock() on loaded model data on Linux and macOS (#453)
1 ebce9e1a548c2329aa97f53b8b2ad50d968088dc e850ff4de25ad1221abc9bf3bb30df252ccd9c36 2026-05-27T09:38:00+08:00 Yunzhe Jia origin/runtime_replace Refactor cal-llm integration by removing runtime capacity loading and adjusting request handling
2 2716130010c58f1cdd9d94f0e2f8e047bc92dc66 b35bda124ccd4ed581dd6088d3ffa4931c2809b6 2026-05-18T08:40:54+08:00 Yunzhe Jia fix n_ctx_slot error by adding runtime capacity loading for cal-llm
3 1bec0db5a675ddc60fb793be2a746e8f3c8855dc 465df20c3e1f3f58d0f5531c796e0941a49c32b0 2026-04-30T16:02:59+08:00 wangbomeng origin/dev-ben bench: support 2 calbins
4 6787a53ab9b4897c5a7b51a4062d7b90e6697d35 e1a76abf66178ea85656479a5e19aea7785c09f4 2026-04-24T09:22:02+08:00 wangbomeng calrt:input of multimodel from fp32 to bf16
5 059009eeaf20a569abfbac5eb37dad3bb9376428 1b073661d1311b5300173993b9f31ee7241d8606 2026-03-10T07:04:22+08:00 wangbomeng calrt: add multimodel
6 ed8aa63320393512bdcfe4b05b5ae01ba91888e1 48bd26501b08a3f0bff1249db47f313641f7bebb 2025-11-03T18:01:59+01:00 Daniel Bevenius model-conversion : pass config to from_pretrained (#16963)
7 5a91109a5d7dab5d7adc40bedb397ede99a705b1 f8f071faddf32ea09f4234edb6e809b380a9ee26 2025-10-24T12:02:02+02:00 Daniel Bevenius model-conversion : add trust_remote_code for orig model run [no ci] (#16751)
8 4b9f4cb0f89a88de4bdf97727d0457b0c648804c 85e72271ba1ce78adf34fd8997803c991e617ca6 2025-09-23T13:59:34+08:00 Aaron Teo devops: add s390x containers (#15915)
9 37a23c17bdc9c99c9c6ad41168e4ced3724b72cd 138c87ce8bd558b2cc134ada7316a3dad8eb67ac 2025-09-22T14:13:51+02:00 Adrien Gallouët common : enable `--offline` mode without curl support (#16137)
10 28baac9c9f491c872e2c37762d3bd90446b005e9 1eeb523c3e0c7ffbd59469f5463dcbdecba3535e 2025-09-21T16:50:45+03:00 Georgi Gerganov ci : migrate ggml ci to self-hosted runners (#16116)
11 4ca088b036313c2d8e682f4cfeb7c29edd85d0b9 703f9e32c4eb3166f8d63007c26e31a1466c21af 2025-09-18T16:22:50+01:00 Eric Curtin Add resumable downloads for llama-server model loading (#15963)
12 28b5f190ef1dbea5edf82dbc8b4407b721fadd13 86587da03bd78df8f4e7d8b111a0c1d2494d6ed0 2025-09-10T15:29:12+08:00 Chenguang Li CANN: implement LRU cache for ACL graphs (#15814)
13 5d6688de08e73acc2532d668380801ed79d704eb 4fd1242bef6cb2325b4ff1c1a80f3b54b64508a6 2025-09-05T04:36:23+02:00 Daniel Bevenius model-conversion : add --embeddings flag to modelcard.template [no ci] (#15801)
14 46d9caa27a0281150e8cf082308c0f9e7576ebe5 5a0e3ef6f00c658fbae53797f02d5a360ebf8fec 2025-08-28T09:26:48+02:00 Daniel Bevenius model-conversion : add mmproj conversion target (#15628)
15 ef0144c087b33e5b8da42d529ac71aaf05cb49df 2721257e3e2c4c944ac8a08221113ee7cb503f1b 2025-08-05T04:29:25+10:00 Sam model: support GLM 4.5 family of models (#14939)
16 90083283ec254fa8d33897746dea229aee401b37 d4b91ea7b2da253e1355b503f0fcb7b428ce005d 2025-07-19T12:51:22-04:00 compilade imatrix : use GGUF to store importance matrices (#9400)
17 0aedae00e6fb48680324a5ac5da9cba0e35de6b5 6bdda13981d6c8189b7dc4f9fb8ecb91c21529f8 2025-07-10T18:20:13-06:00 Gabe Goodhart model : Granite Four (#13550)
18 4a5686da22057867c23bd4a6be941ddc8c51e585 98bab638fb28cf95a5a66dd2d51b40d6c8f6d69a 2025-07-09T14:59:57-04:00 compilade llama : support Jamba hybrid Transformer-Mamba models (#7531)
19 5364ae4ba53cc6367b8c8bf78876839122ca4e57 7c07ac244d59c833bf209582f6df019a77cdda59 2025-05-16T07:38:07-07:00 Diego Devesa llama : print hint when loading a model when no backends are loaded (#13589)
20 7f323a589f8684c0eb722e7309074cb5eac0c8b5 3eac209319a6726fd9687c6188fc6b916b65953d 2025-05-11T20:18:39+08:00 David Huang Add `--no-op-offload` to improve `-ot` pp perf in MoE models like llama4 400B (#13386)
21 0527771dd80bd18479dfaaa0a98be297fc3592bf 2189fd3b6327a1d17893694125da8edcf74a6468 2025-05-09T17:25:50+08:00 R0CKSTAR llama-run: add support for downloading models from ModelScope (#13370)
22 b2034c2b55b36b2192bdefb3b295db2a911370f5 06bb53ad9b6e6d92b6ab6979927530080b1c990c 2025-04-11T20:01:56+08:00 tastelikefeet contrib: support modelscope community (#12664)
23 02082f1519565fc7b49de211b28bc5404a69209b df4d20cd53d5bb6fc21c1dc65f026d53b566d097 2025-03-26T22:06:04+08:00 Ivy233 clip: Fix llama-llava-clip-quantize-cli quantization error under CUDA backend (#12566)
24 333820d7491cd31c707a340ff23b984a84e40154 c026ba3c23765a648ca27c7a15ecf179f8e27f26 2025-02-07T15:48:47+02:00 magicse llama : fix progress dots (#11730)
25 9dd7a0390feffcc1f4b17eb7692a6e43030d85af c0d4843225eed38903ea71ef302a02fa0b27f048 2025-02-06T13:41:37+02:00 Georgi Gerganov llama : add log about loading model tensors (#11699)
26 a5203b4465c5c87813936bde98170e25bb09024f df984e014714cba4c99ef894b20b51cbcef31b16 2025-01-27T17:42:09+04:00 lexasub llama : minor fixes for up llama load model speed (#11448)
27 c07e87f38bd0c22ec6dbc852ae50aaa1c64632d4 564804b79b78df1469ec8646869972de5e885ec4 2025-01-24T09:02:38+01:00 stduhpf server : (webui) put DeepSeek R1 CoT in a collapsible <details> element (#11364)
28 47182dd03fe04a4ffda5d7f4c8a109ae0056cf56 3e6e7a6bc2c4b980a0cf0fcb5cb3b79a965b5f14 2025-01-06T10:55:18+02:00 Georgi Gerganov llama : update llama_model API names (#11063)
29 4ddd199f6f6b980e0a7ed9f9b44efeae2fbdf5c4 a0974156f334acf8af5858d7ede5ab7d7490d415 2024-12-15T15:43:25-05:00 Bartowski llava : Allow locally downloaded models for QwenVL (#10833)
30 10bce0450f0c4d80087e06312b9dbbab3e87f16b 1f922254f0c984a8fb9fbaa0c390d7ffae49aedb 2024-11-25T19:30:06+01:00 Diego Devesa llama : accept a list of devices to use to offload a model (#10497)
31 feff4aa8461da7c432d144c11da4802e41fef3cf 0abc6a2c25272d5cf01384dda8ee8bfec4ba8745 2024-09-13T14:23:11+02:00 Xuan Son Nguyen server : add loading html page while model is loading (#9468)
32 67155ab7f5e47c01b62aa989eab30f517bf6dc67 5af118efdaf1098798a06b24fd8a557760e99631 2024-09-11T12:52:37+03:30 Farbod Bijary feat: Implements retrying logic for downloading models using --model-url flag (#9255)
33 54f376d0b92c6ff6feb1fa2ef8ed2022348100ba b2e89a327457179a34eae4d7de0d412ed945679c 2024-09-09T11:04:39+03:00 Radoslav Gerganov rpc : update README [no ci] (#9320)
34 8f1d81a0b6f50b9bad72db0b6fcd299ad9ecd48c a47667cff41f5a198eb791974e0afcc1cddd3229 2024-09-01T22:38:17+08:00 Molly Sophia llama : support RWKV v6 models (#8980)
35 84eb2f4fad28ceadd415a4e775320c983f4d9a7d 1262e7ed13ac197c944f15e1ddb083cb4f36cf65 2024-08-12T20:45:50+08:00 Frank Mai docs: introduce gpustack and gguf-parser (#8873)
36 86e7299ef5dff0f388922dc6fcbce009e99d8005 60d83a0149849e9217e4b8ae26e277a41aea906e 2024-07-06T15:32:04-05:00 Derrick T. Woolworth added support for Authorization Bearer tokens when downloading model (#8307)
37 0c7b3595b9e5ad2355818e259f06b0dc3f0065b3 7b2f4a7d193ef2475259bbe7656fcccfab4b1217 2024-06-15T18:53:40+02:00 Xuan Son Nguyen Add `cvector-generator` example (#7514)
38 57684331fc2d685f7d1f5775af0b9e47d1829833 b83bab15a5d2a1e7807d09613a9b34309d86cfaa 2024-05-24T18:14:42-07:00 Mikko Juola Make tokenize CLI tool have nicer command line arguments. (#6188)
39 b18532a4efeca8796fea8e36195c81cbfd596a4a fcda1128bc5f8eb7e1811708fe9d9867b9aec815 2024-05-22T16:10:46+02:00 slaren phi3 : duplicate rope factors in each layer (#7447)
40 b83cc3f5b303ff30c52874b2d5864dc6385ebf9f 9cb317f77e53067f7a138cc89ef7657148eae8e6 2024-05-11T09:46:09+02:00 Joan Fontanals llama : add Jina Embeddings architecture (#6826)
41 f98eb31c517c95960df1d0abc48002787f145f3b bc4bba364fb96d908f2698e908648df5e6f55e02 2024-05-08T18:16:38-04:00 compilade convert-hf : save memory with lazy evaluation (#7075)
42 4cc120c7443cf9dab898736f3c3b45dc8f14672b 24ee66ed0d908d156bd0d1747b63a636a495cd7a 2024-04-12T14:11:46+02:00 Daniel Bevenius infill : add download instructions for model (#6626)
43 f4183afe6a22f356ee222a710686ae7f83dbd949 b804b1ef77351d2a11be945462c6c251710476cb 2024-04-11T15:22:47+02:00 Daniel Bevenius scripts : add --outdir option to hf.sh (#6600)
44 4bcd6b959ca3991084ad1d8464caf2a734e29b1d 9b84ae1806cded4d6683c7b810925da5ead40607 2024-04-04T09:49:21+02:00 Daniel Bevenius common: remove duplicate check for curl (#6471)
45 08a0c0206075556e82aca0feafad530dcc5f1426 52604860f93063ef98863921da697576af1c7665 2024-04-03T15:07:05+02:00 slaren ggml : mul_mat_id use the same tensor for all the experts (#6387)
46 f482bb2e4920e544651fb832f2e0bcb4d2ff69ab 1997577d5e121568ae39f538021733ccd4278c23 2024-03-23T18:07:00+01:00 Pierrick Hymbert common: llama_load_model_from_url split support (#6192)
47 dba1af612926cbd4ebe2d876277af1e3305177e0 ee804f6223777019cf921e0d99cc24669313ab98 2024-03-22T19:00:01+01:00 Pierrick Hymbert llama_model_loader: support multiple split/shard GGUFs (#6187)
48 d01b3c4c32357567f3531d4e6ceffc5d23e87583 cd776c37c945bf58efc8fe44b370456680cb1b59 2024-03-17T19:12:37+01:00 Pierrick Hymbert common: llama_load_model_from_url using --model-url (#6098)
49 b5f4ae09c3244ae1644b67c03ed9f4227ab25ad2 dfbfdd60f90207404039c6578d709231496831d9 2024-03-16T16:46:29+01:00 Daniel Bevenius gritlm : add initial README.md (#6086)
50 c2101a2e909ac7c08976d414e64e96c90ee5fa9e 515f7d0d4fce41c752fc253acf30707c3be2531e 2024-03-08T17:31:00-05:00 compilade llama : support Mamba Selective State Space Models (#5328)
51 21b08674331e1ea1b599f17c5ca91f0ed173be31 6a87ac3a52668e117d97bcea07b529c93188b303 2024-03-05T16:08:35+08:00 Neo Zhang Jianyu [SYCL] fix mul_mat fault in CI/unit-test (#5862)
52 9731134296af3a6839cd682e51d9c2109a871de5 4a6e2d6142ab815c964924896891e9ab3e050632 2024-03-02T22:00:14+01:00 Pierrick Hymbert server: tests: passkey challenge / self-extend with context shift demo (#5832)
53 973053d8b0d04809836b3339a50f68d9c842de90 7c8bcc11dc61cf5930b70cd0168b84afcebe12a9 2024-02-22T00:42:09+01:00 slaren llama : fix loading models with shared tok_embd and output (#5651)
54 df845cc982e7e2ea7b9900e29d55b15338faa78d 6b48ed089377330cdb362970a51c1c89b6d857a8 2024-01-13T17:29:43+01:00 David Friehs llama : minimize size used for state save/load (#4820)
55 e7e4df031b9e29d4b55a4e0b0295187f6b213db1 584d674be622fbf1578694ada6e62eebedbfd377 2024-01-12T20:07:38+01:00 slaren llama : ggml-backend integration (#4766)
56 e790eef21ce659f5c16d59f8a5c8dcf6cde0692a 5537d9d36bfdb4379555431f574d3d78ce6e7955 2024-01-12T05:48:00-07:00 Zay llama.swiftui : update models layout (#4826)
57 eab67950068e4b125007d027232c47d2a5831cd0 d8d90aa343c22fe01429d3540e47ded87e9dcb9d 2024-01-11T12:41:39-05:00 Behnam M server : add `LOG_INFO` when model is successfully loaded (#4881)
58 7a9f75c38b5e62fe27b8a5a3ed823b4a3714024b 5c1980d8d4c4e0c0af77359f81cc44d90b3f250b 2024-01-11T02:12:05-05:00 Behnam M server : update readme to document the new `/health` endpoint (#4866)
59 cd108e641dbdedd8c5641c4cec1762f751f38136 57d016ba2d46a6e22517a31a75cebb48f9e234b6 2024-01-10T14:56:05-05:00 Behnam M server : add a `/health` endpoint (#4860)
60 57d016ba2d46a6e22517a31a75cebb48f9e234b6 329ff615699d32f596d4ebf8baba654c30064e0d 2024-01-11T01:09:53+11:00 Brian llama : add additional suffixes for model params (#4834)
61 3c0b585561d74a56977cf3a3844535ecc9e37972 e5804313a1edaf00726ed0b96ecced07accbf50c 2024-01-04T16:22:38+08:00 singularity llama.swiftui : support loading custom model from file picker (#4767)
62 441f51dca004debf8b275f1bdc08e0f1af7fd8f8 38b3de4658292582a8941a2be5c77b40ce6ac0f2 2023-12-29T19:23:27+09:00 Tamotsu Takahashi ci : build with CLBlast + ggml-opencl use GGML_API (whisper/1576)
63 d232aca5a73b290e218a2e48b91023d5e994203f 31f27758faf4a4bd08101a57c7ec3a473f771f86 2023-12-21T21:07:46+01:00 slaren llama : initial ggml-backend integration (#4520)
64 800a489e4a8be199122259a995b1ee9dd7fae320 f7f468a97dceec2f8fe8b1ed7a2091083446ebc7 2023-12-17T19:38:41+02:00 Georgi Gerganov llama.swiftui : add bench functionality (#4483)
65 bcc0eb4591bec5ec02fad3f2bdcb1b265052ea56 81bc9214a389362010f7a57f4cbc30e5f83a2d28 2023-12-07T13:03:17+02:00 Georgi Gerganov llama : per-layer KV cache + quantum K cache (#4309)
66 5aa365d88fdb8fdd430ef3fc141c7a5fd37c3502 52c8bc3cf312e1caf02d37bfb9d9d865cbe33594 2023-12-05T10:19:18-07:00 Kerfuffle llama : allow overriding GGUF metadata when loading model (#4092)
67 03562f3a86d6706eea9f4fc09b532946c191b34e 37c746d687d877bc11803e96b4dc5f378b83c0a0 2023-12-02T02:17:06+08:00 CausalLM llama : support attention bias on LLaMA architecture (#4283)
68 b18c66ca6eee4fe0465cff5042daf05005dc9ab2 f4d973cecb7368c985720ba9100ae6abba14806d 2023-11-30T22:43:08+01:00 Daniel Bevenius llama : fix alignment of general.name in print meta (#4254)
69 54b4df8886103b436a4bb3b60f4d84824f9e8868 46876d2a2c92e60579dc732cdb8cbd243b06f317 2023-11-06T23:43:59-08:00 Matthew Tejo Use params when loading models in llava-cli (#3976)
70 71e3718abdb2771b50c9606d3a7569623a0b0afe 238657db2364cfb728c694470a4a81702afea760 2023-11-01T08:04:02+02:00 Georgi Gerganov llama : refactor graph build code (#3837)
71 a5e7dbd6141128bfa3c40a19c2945a181df625d3 d3956aea53369455008159cc405ed4c496976692 2023-10-22T12:14:56-06:00 Kerfuffle llama : validate special token ids are in range when loading GGUF model (#3635)
72 0e76a8992c8200237bbc6471a53fb8796b3872f7 2db94d98eda56982d80238840b0652b4137a2a84 2023-09-28T20:40:11+02:00 xaedes train : finetune LORA (#2632)
73 ec893798b7a2a803466cc8f063051499ec3d96f7 45855b3f1c7bdd0320aa632334d0b3e8965c26c4 2023-09-28T19:04:36+03:00 Georgi Gerganov llama : custom attention mask + parallel decoding + no context swaps (#3228)
74 dc07dc492ef9640bbb82904d7c7679f7bdcf6d76 ad9ddcff6ef322db5cf13785bd7c856b610d242e 2023-08-30T02:25:50-06:00 Kerfuffle convert : various script cleanups/fixes + merges and special token handling (#2842)
75 44c117f41ee01c5ac8fb86bba041f08d8b87b46d 43033b7bb4858da4f591715b3babdf906c9b7cbc 2023-08-28T21:51:47+02:00 xaedes train : mem usage and other improvements (#2439)
76 95385241a91a616788a3bb76d12c9b7b2379ca2d 335acd2ffd7b04501c6d8773ab9fcee6e7bf8639 2023-08-23T20:33:05+01:00 Olivier Chafik examples : restore the functionality to import llama2.c models (#2685)
77 6381d4e110bd0ec02843a60bbeb8b6fc37a9ace9 dadbed99e65252d79f81101a392d0d6497b86caa 2023-08-21T23:07:43+03:00 Georgi Gerganov gguf : new file format with flexible meta data (beta) (#2398)
78 fff0e0eafe817eef429ecb64f892ab7bdae31846 417a85a0010519224cf154eb85d383ffeafeeead 2023-07-20T13:47:26+03:00 Georgi Gerganov llama : fix regression from #2000 - could not load no-mmap models
79 a17a2683d8fdb899ba497d0c28ccafb28c62efb6 31cfbb1013a482e89c72146e2063ac4362becae7 2023-07-06T09:17:50-07:00 tslmy alpaca.sh : update model file name (#2074)
80 e32089b2c20b1b87b22912f4a8b93fe01647d5b9 2347e45e7bdb09c9a7d74b2c0bc86c2b65f0c343 2023-06-13T21:04:40+02:00 xaedes train : improved training-from-scratch example (#1652)
81 8c0a10e64dbf60fd9946c0cd5e6f59690800b123 fa84c4b3e80199a5683438f062009c031a06c4fa 2023-06-12T14:31:36+03:00 Kawrakow metal : fix failure to load model (#1817)
82 ffb06a345e3a9e30d39aaa5b46a23201a74be6de 7552ac586380f202b75b18aa216ecfefbd438d94 2023-05-30T21:24:22+03:00 Henri Vasserman OpenLLaMA 3B support (#1588)
83 affc76edfdefa7b326f526e463cc65ff13fcfb92 ea600071cb005267e9e8f2629c1e406dd5fde083 2023-05-20T14:19:28+02:00 Johannes Gäßler cuda : loading models directly into VRAM, norm calculation on GPU, broadcasting for ggml_mul (#1483)
84 b9fd7eee57df101d4a3e3eabc9fd6c2cb13c9ca1 b608b55a3ea8e4760c617418538465449175bdb8 2023-05-12T00:23:08+03:00 Georgi Gerganov ggml : remove bit shuffling (#1405)
85 78ca9838ee36660a776e97e3391b6fb5dcaacf7f a017390358cdb23fffb30988dc84bb190d0403ca 2023-03-29T13:51:37-07:00 Justine Tunney Make loading weights 10-100x faster
86 563cdc391dde140f1084d1012234e8e6f57f881f 8d4a855c241ecb0f3ddc03447fe56002ebf27a37 2023-03-24T08:19:05-07:00 comex Support calling mlock() on loaded model data on Linux and macOS (#453)
@@ -0,0 +1,2 @@
79e0b68c178656bb0632cb8602d2940b755077f8 c81f4192f91a1e209c1eec7a84fe5371ef9175da 2025-07-16T12:00:42+08:00 Min-Hua llama: add LLAMA_API to deprecated llama_kv_self_seq_div (#14708)
4579af95e8e16910f6dbab0994917a5b3901f0cf 8c3ffc2f048a372639906fb30ec3c2070288d3be 2023-04-13T21:43:22+08:00 Judd zig : update build.zig (#872)
1 79e0b68c178656bb0632cb8602d2940b755077f8 c81f4192f91a1e209c1eec7a84fe5371ef9175da 2025-07-16T12:00:42+08:00 Min-Hua llama: add LLAMA_API to deprecated llama_kv_self_seq_div (#14708)
2 4579af95e8e16910f6dbab0994917a5b3901f0cf 8c3ffc2f048a372639906fb30ec3c2070288d3be 2023-04-13T21:43:22+08:00 Judd zig : update build.zig (#872)
File diff suppressed because it is too large Load Diff
@@ -0,0 +1,553 @@
c931ef3163940227c9b6291e04216245cce21429 a43741244a646d3f8fa3ff01bb9b7d059223d0a5 2026-05-18T17:34:37+08:00 wangbomeng calrt: fix prefill_by_ids.fix create_buf
eeeef3f6d6a5aad9296323ca15d9d929745b8932 431ad6f1c787f1b47e9e7be14b2e1a7d8565485c 2026-04-28T16:16:19+08:00 wangbomeng add unknown time info: prefill and decode
99962021f2dd1994dbbf90d5712f0ca2633f20f8 9af6682ef101c6d006c743c703cf150ac25f466f 2026-04-17T14:48:33+08:00 wangbomeng origin/dev-ot calrt: add onetoken slice and untile_prefill
a206460e610aef995e36e50b33e8bd41fe477541 d8b2aaa00049978cebac15041f960d75b552f97b 2026-04-14T10:23:43+08:00 wangbomeng calrt: support mixture of prefill_by_ids and prefill_by_embeds
b8153b6b8f244b223c9f4c2940ae1f212634519e 82842cfc3fa3d5c004c4540aeff8a81f38509bee 2026-04-09T15:07:02+08:00 wangbomeng server: fix limit tokens to max_seq_len
82842cfc3fa3d5c004c4540aeff8a81f38509bee 622a22991089c6debd5f4b57738f3df3a0bda8b5 2026-04-09T15:06:26+08:00 wangbomeng server: fix limit tokens to max_seq_len
1e8a16cd0e3ad3c9a0f8746852a0a38c6e52322e 893e52bda0fee99bbda1521ea733a760bc4201f1 2026-04-01T10:14:22+08:00 wangbomeng calrt: fix slice and add infer/copy time
e4eaab700333490e80ebefc8d023f6c1adfcc312 aeacc23a883400db0ebffb50e23355ada054da66 2026-03-25T09:03:55+08:00 wangbomeng calrt: prefil to prefill
aeacc23a883400db0ebffb50e23355ada054da66 cbaa7492663630132adeddccd9fec5e44ffa3336 2026-03-25T08:49:22+08:00 wangbomeng calrt: add slice only on decode
3c08ebf0e442cd730ddffd959ec676f9caf31c82 613bc2b9a9d7af92efbe42d876ffcdb244f7a00e 2026-03-24T02:43:03+08:00 wangbomeng calrt: comment LOG_ERROR in untile_decode_cpy
16cbf81a731f5839a2f6b0eb9d8539826353748b 8b4e17d990c23025148c4abadefe1010a0dd0734 2026-03-23T09:38:21+08:00 wangbomeng calrt: fix model_name of untile_cpy
b2c45d8ddefb7ec09435231c8ec5b736fabf9c91 c6ea3f0d2468e3b8eab5de80bacee7fe4c9dd3d7 2026-03-09T15:03:26+08:00 Bomeng Wang clart: past_kv_len = n_tokens
583c387efaf7bc030574e554088de79d09a27fbd 0edc14a60a2d5596f71d728c655e3523da924d89 2026-02-27T02:24:56+08:00 wangbomeng caserver: lim generated tokens to n_ctx_per_seq
0edc14a60a2d5596f71d728c655e3523da924d89 aa0a17d719326a63e0d6fea60aa0ced44e7abc33 2026-02-27T01:57:39+08:00 wangbomeng caserver: limit generated tokens to n_ctx_per_seq
84f2c0b5f334a7ab77347c6779b6027a951d0ff0 0bd95719fed2f0247c8d0199dd897d24157dfae6 2026-02-09T01:46:36+08:00 wangbomeng add bf16_to_fp32 in untile_decode/prefill_cpy
9328f21378275f2354a19c3af907332b216ab492 49fea70a20f550bfdb59d0ffe041b54919c22447 2026-01-28T15:32:36+08:00 Yunzhe Jia add prefill-only mode
5d2387931528fbe04aa8d66de935147efb65ca4d e6285a748657add8d974b78ca920c5b41753ee12 2025-12-08T16:40:34+08:00 Yunzhe Jia add timestamp for one decode process
e492f5dc8cec17529f53ef2bbdf7b502107f8148 2e05afd22b3d77c7013b11eee88e88b17188f21a 2025-11-04T14:09:59+08:00 Yunzhe Jia redo untile logic
070ff4d5356083d60b807bb34d36b31c3653a29e bf7b0c9725ed0c406c5debaea022ec7258430634 2025-11-03T11:11:18+01:00 Xuan-Son Nguyen mtmd: add --image-min/max-tokens (#16921)
cd5e3b57541ecc52421130742f4d89acbcf77cd4 87c9efc3b297b8a498716b1db3d061842e6fc85b 2025-11-02T18:14:04+02:00 Georgi Gerganov server : support unified cache across slots (#16736)
cf659bbb8ef9eb048e5153a27cf787fd83c05560 d8b860a219c2415faac8cc0e50b48b4aa11e3b64 2025-11-01T15:51:36+01:00 Xuan-Son Nguyen mtmd: refactor preprocessing + support max/min pixels (#16878)
b52edd25586fabb70f0c21b274473b307cf14499 517b7170e1a4d733583c4b07c5b7a49acc05911c 2025-10-30T18:42:57+02:00 Georgi Gerganov server : remove n_past (#16818)
5a91109a5d7dab5d7adc40bedb397ede99a705b1 f8f071faddf32ea09f4234edb6e809b380a9ee26 2025-10-24T12:02:02+02:00 Daniel Bevenius model-conversion : add trust_remote_code for orig model run [no ci] (#16751)
84bf3c677857279037adf67cdcfd89eaa4ca9281 c9c1972e2c2cc6a771fcc145bfa138700179f961 2025-10-20T21:38:20+02:00 Sigbjørn Skjæret model : add BailingMoeV2 support (#16063)
17304cbcc1dd24de7741cbe57925d58e90a98ac1 3e3cb19f6449f9168a128eaeae01f8f41b049acc 2025-10-15T16:53:12+03:00 Georgi Gerganov server : fix img token logs (#16595)
bc07349a7f87ba6eb31ed4b0ea9d9a7352185213 e60f241eacec42d3bd7c9edd37d236ebf35132a8 2025-10-14T08:48:50+03:00 Georgi Gerganov server : dynamic token limit for prompt cache (#16560)
477a66b03501cf3bd067f8968b77ca4d053ff1bd e60f01d941bc5b7fae62dd57fee4cec76ec0ea6e 2025-10-11T11:33:41+03:00 amirai21 convert : correctly handle LLaMA tokenizer for Jamba (#16470)
81086cd6a3ca1252f0dc0f938171648399179c53 68ee98ae181a5c83a5cc6261daeee69a1f588c15 2025-10-10T17:17:31+03:00 Georgi Gerganov vocab : mark EOT token for Granite models (#16499)
1faa13a1187051af66b0fd9f0d6effe4c77f0b3e 1deee0f8d494981c32597dca8b5f8696d399b0f2 2025-10-09T22:54:57+02:00 Pascal webui: updated the chat service to only include max_tokens in the req… (#16489)
c08002a1988348403a5fd59b1fa3de3a10a6f92f 3a002afafa8e06555f11aed88b02d055d8a166f3 2025-10-06T10:59:40-06:00 Gabe Goodhart chat : Granite Docling stopping (#16438)
ca71fb9b368e3db96e028f80c4c9df6b6b370edd 35266573b968e1c947b367782fb4b3eddbb4f3c0 2025-10-05T06:57:47-06:00 Gabe Goodhart model : Granite docling + Idefics3 preprocessing (SmolVLM) (#16206)
77233277c912d495d1069543ca540c21a2f9e5b4 e308efda8e54e3f07578937a45a5d83624eb7970 2025-10-03T11:30:39+02:00 Aleksander Grygier Capture model name only after first token (streaming) or completed request (#16405)
e74c92e84236b2bab3f3c77bee4ead94928be360 b2ba81dbe07b6dbea9c96b13346c66973dede32c 2025-09-30T16:24:36-04:00 Bartowski model : support GLM 4.6 (make a few NextN/MTP tensors not required) (#16359)
2f61c0f5bf8a620ca4c3872408803ab38cfb9613 3ffd0fae473c954bb3e67526b31262048fb508d4 2025-09-29T12:33:12+05:30 Vinkal llama-cli: prevent spurious assistant token (#16202)
624207e676ab5eb3ce7af631902bb45fb73a8359 807e8c6d310952f2f5656afc63dab9d7083dcb5c 2025-09-27T02:03:33+08:00 Aaron Teo devops: add s390x & ppc64le CI (#15925)
077c94d0caf87fbd3cf3288dbb5c0fd9670294cf aa3ee0eb0b80efca126cedf9bcb4fb5864b46ce3 2025-09-25T22:35:05+08:00 Aman Gupta CUDA: add a fused top-K MoE kernel (#16130)
aa3ee0eb0b80efca126cedf9bcb4fb5864b46ce3 d0991da39d3c39b3980c24cdfccb9a4c95a46870 2025-09-25T12:02:36+02:00 Daniel Bevenius model-conversion : add embedding prompt file support (#15871)
351f3da39c85f59d581fc184f09283da7f099a3b 3ecb2f671a2f49d56357f99d135a94e841759178 2025-09-23T01:57:46+08:00 Haiyue Wang clang-tidy : disable warning about performance enum size (#16127)
745cbcf2fe1eb88f8db615ac622f0b944d924ad6 1cbd80f8cf80a817715b1ccc5680fe2a3c5172c8 2025-09-17T15:30:55+08:00 Jie Fu (傅杰) llama-quant : fix the verification of attention layers for encoder-decoder models (#16023)
1cbd80f8cf80a817715b1ccc5680fe2a3c5172c8 85286f354813056f6c835046c0acfa3bf6ba9432 2025-09-17T15:29:00+08:00 Jie Fu (傅杰) examples : support encoder-decoder models in the simple example (#16002)
c0389dba43d50695f9d3f57dd1f1a14cbefc100c 00681dfc16ba4cebb9c7fbd2cf2656e06a0692a4 2025-09-11T15:59:37+08:00 hipudding CANN: Disable acl_graph for prefill stage (#15933)
4f658855fa8f2e42b7ed9a5b298fa39a2e39b096 6ab397e12ba8e9f776341cdae68f7ffb2f8d2cde 2025-09-11T02:51:51+08:00 Jie Fu (傅杰) llama : support T5 models with unequal number of encoder-decoder layers (#15909)
70cd37dbbebdb7a2f84f08207f18eabb0b291a55 acc1b008cfd95e63d5f99a370dbffb98e5a99d2c 2025-09-09T06:06:52+02:00 Daniel Bevenius requirements : update transformers/torch for Embedding Gemma (#15828)
88021565f08e0b7c4e07ac089a15ec16fae9166c 56920f56651908d5cce7a310dabf54ac4f6fbb7f 2025-09-08T10:59:48-04:00 Jesse chat : Deepseek V3.1 reasoning and tool calling support (OpenAI Style) (#15533)
56920f56651908d5cce7a310dabf54ac4f6fbb7f b0d52998b962bd2681c34bf52af993af79f178b8 2025-09-08T21:50:05+07:00 Xuan-Son Nguyen server : bring back timings_per_token (#15879)
fd621880f3fd908424e675a41715a2dc760247a2 4281c7b315f8a904549fe527039b976e08098d1a 2025-09-05T17:32:39-06:00 Gabe Goodhart aLoRA Support (#15327)
5fac79cbc77b6d12c9feb5f34fc63586b35fd561 408ff524b40baf4f51a81d42a9828200dd4fcb6b 2025-09-05T14:31:24-06:00 Gabe Goodhart Thinking model disabled assistant prefill (#15404)
3dc7397a2799bdc07bccf637ab7ae5a1e786d1a4 e92d53b29e393fc4c0f9f1f7c3fe651be8d36faa 2025-09-01T08:57:00+08:00 hipudding CANN: fix RoPE cache issue on multi-device (#15629)
e8d99dd0b67f2ecc1e45fca8074a3a18c3e036d2 a8bca68f727844e7dcf24a956003b3c2039ea563 2025-08-28T18:39:31-06:00 Gabe Goodhart nvidia nemotron nano v2 (nemotronh) (#15507)
84ab83cc0b4b7e769451ee48e4c7d1acef91ef25 55042b3692cb1467c9ee15c62c4a9fbf180f89e3 2025-08-28T15:49:50+02:00 Sigbjørn Skjæret model : jina-embeddings-v3 support (#13693)
1e7489745a74996fc36e8fd05b73aa16bc184e0c 1cf123a343ab7ca5586aacb9e0a1d2de7fe33be4 2025-08-27T17:21:41+08:00 Chenguang Li CANN: refactor mask handling and improve performance in FA (#15561)
a6a58d64785cb458ed9de52f391aa38142d38d64 0373486dbc0dccbdcb3b5fdd65759d88cec06196 2025-08-26T21:05:25+05:30 shalinib-ibm llamafile: PowerPC Sgemm Optimization (#15558)
62cef26ac5b6b7acb635d3dc963813b43952dc2b 8f5afa94c4f929da71f560db7c9f38ef6a783d95 2025-08-26T16:12:29+02:00 Daniel Bevenius model-conversion : add qat-q4 quantization targets (#15588)
79a546220c719e6a70627b243a478ab8d84dc9e1 85cc1ae998e4898d9fa992cb9b8620338cee97bf 2025-08-26T12:54:19+02:00 Xuan-Son Nguyen mtmd : support Kimi VL model (#15458)
0115cfb7c1dec0753aecb34f3af4338bf9de8eeb 3a617cb18121a85eed17ac5585788810c5d9c1e0 0d5a470223fc90b6b6807921d68011ff06ae7f9e 2025-08-26T15:19:56+08:00 Yunzhe Jia Merge branch 'master' into dev
6b64f74b55628e4193f4fb00313f07dbd8556528 0d5a470223fc90b6b6807921d68011ff06ae7f9e 2025-08-25T13:56:43+03:00 Georgi Gerganov batched-bench : fix unified KV cache handling + pp timing (#15562)
4afb0a746f22abaa545b3ebdb76a400d7da3a713 e288693669cf9d0a71e2f2b8bd57305f06340257 2025-08-22T08:10:14Z 65a server : Support multimodal completion and embeddings prompts in JSON format (#15108)
e288693669cf9d0a71e2f2b8bd57305f06340257 a0f98dd604d34826eb5ea2560d1e23fe726921df 2025-08-22T09:29:08+02:00 Tarek Dakhran readme : model : mtdm : lfm2 improvements (#15476)
657b8a77bd01854f99d37a47318fa24f2e7e298f ec5ab1a36c11dd3efcf4ec8d1ac89a13a8117bc3 2025-08-20T14:26:01+02:00 Daniel Bevenius chat: handle gpt-oss return/end token inconsistency (#15421)
f0d3c7405c323784a60f14ddddfbac3f7404d417 f08c4c0d8d0cb6caaf8b7ad316039232b9fa059c 2025-08-19T08:45:12+03:00 Georgi Gerganov batched-bench : use rand tokens (#15398)
f08c4c0d8d0cb6caaf8b7ad316039232b9fa059c 6d7f1117e3e3285d0c5c11b5ebb0439e27920082 2025-08-18T22:53:52+02:00 Xuan-Son Nguyen mtmd : clean up clip_n_output_tokens (#15391)
5e6229a8409ac786e62cb133d09f1679a9aec13e e2c1bfff5305c661ac53e9d57cb732ff626a2242 2025-08-15T19:50:52+02:00 Daniel Bevenius common : fix double bos, use common_chat_templates for add_bos and add_eos (#15326)
b204a5a234f4cf0b3f449476da639a5510c6d157 646944cfa8961afd914dd6637739b3cda9a72e11 2025-08-14T09:23:11-05:00 Aldehir Rojas gpt-oss: implement harmony parsing (#15181)
3a617cb18121a85eed17ac5585788810c5d9c1e0 c42293848dd9f03eba9a6c1b85a600b398f06541 2025-08-13T10:58:59+08:00 Yunzhe Jia add calrt_decode
1ebbaddff2a44b0599df659175d3274bd5bbeb81 a3a7874272e5a060079658eb5cca4617b7f99062 2025-08-11T10:21:24+02:00 Daniel Bevenius perplexity : update comments/error msg to use decode [no ci] (#15227)
99acbc9921b119aa7ed929eb5780a66a8f06e6d9 7ad67ba9fe2b909e271dd31b99c5fce3aba35899 2025-08-08T00:20:40+08:00 RunningLeon llama : Support intern-s1 (#14875)
1cbf442f50a154aac0bf35d7b8b3436a2cdfd6f5 ba67d6c03fed3193987a4ef13050e6e2a4451df4 2025-07-24T15:50:19+08:00 Yunzhe Jia 1.sync with calrt prefill,decode,kv_update op 2.add hw pattern untile function
fd1234cb468935ea087d6929b2487926c3afff4b f324a3b715d5c1081c110ce459f8a8486fb1ee89 2025-08-05T22:10:36+03:00 Georgi Gerganov llama : add gpt-oss (#15091)
ef0144c087b33e5b8da42d529ac71aaf05cb49df 2721257e3e2c4c944ac8a08221113ee7cb503f1b 2025-08-05T04:29:25+10:00 Sam model: support GLM 4.5 family of models (#14939)
97366dc6abdd0bdc74260bd3c42bd06f0feb7428 83bc2f288c0e08e676d9beca9c4669197e920593 2025-08-03T12:38:18-07:00 Csaba Kecskemeti vocab : JetBrains Mellum pre-tokenizer (#15045)
83bc2f288c0e08e676d9beca9c4669197e920593 6c7a441161080551ce8a52ba32563b6295067192 2025-08-03T09:56:25-05:00 Gabriel Larson model : add text-only support for Kimi-VL (and find special tokens in text_config) (#15051)
2bf3fbf0b54f97aef2b388b76d222789e1c170f1 711d5e6fe66eb6cd7a10d71cec4567321848be08 2025-08-02T14:39:01+02:00 Sigbjørn Skjæret ci : check that pre-tokenizer hashes are up-to-date (#15032)
711d5e6fe66eb6cd7a10d71cec4567321848be08 f738989dcb9ccbe468c945553eafbeef7b869675 2025-08-02T05:51:02-05:00 Douglas Hanley convert : fix Qwen3-Embedding pre-tokenizer hash (#15030)
f906275537d14c8fc7c6976d944233771fd6672c a9f7541ec25c4c8547daf5ff48700ad2836e2b7d 2025-08-02T10:12:41+02:00 Johannes Gäßler server: enable token array inputs for OAI API (#15001)
0f5ccd6fd1a1f709010312933db0316867cc30b6 1c872f71fb8a25589efa3ee9b6bf8b517cb8caa4 2025-08-01T21:31:12+08:00 stevenkuang model : add hunyuan dense (#14878)
94933c8c2eeaa9a7983e3f6c08af76bd86724094 c1dacaa99b4ead6edbac928cd2da59436573f6b0 2025-07-31T05:25:23-07:00 g2mt server : implement universal assisted decoding (#12635)
8a4a85627702b569d7d2810f2de06a4321656e9d 11490b36723d511d75fb601995c79b5c363ba3a2 2025-07-31T19:49:09+08:00 Aman Gupta Add LLaDA 8b Diffusion model (#14771)
92b8810ec7aa6d778bc287cc918443cf67b962e2 00131d6eaf4df029e1ec84de868c2c5957503007 2025-07-30T15:46:13+02:00 Johannes Gäßler CUDA: skip masked KV slices for all FA kernels (#14924)
00fa15fedc79263fa0285e6a3bbb0cfb3e3878a2 946b1f685909c8c9c044f145bce819c02f327eaa 2025-07-28T15:01:48+02:00 Xuan-Son Nguyen mtmd : add support for Voxtral (#14862)
ca0ef2dddb022cb1337d775cd05cd27d7808aff4 89d1029559bd2968f76db854f9f113d73e34527c 2025-07-27T12:10:51+02:00 Daniel Bevenius llama : clarify comment about pp and tg graphs [no ci] (#14895)
793c0d7f46384001738c337d7afa46b45ae32745 ce111d39d666f4a3b6a561ad020f6feb8cc67790 2025-07-25T10:47:39-06:00 Gabe Goodhart metal: SSM_SCAN performance (#14743)
b4efd77f8ab407836ca73a5176f041650c5b2411 2be60cbc2707359241c2784f9d2e30d8fc7cdabb 2025-07-21T09:24:51+02:00 IsaacDynamo server : add parse_special option to /tokenize endpoint (#14783)
09651d09ffc1e941bd1be23163abf5495c416547 349ea79fcebc75b0c55bf61594a47736966d4f95 2025-07-18T06:25:54+02:00 Nexes the Elder graph : Pass the graph placeholder message in debug mode (#14748)
cb887f1bc1001c92f7b4a595b9014f3a454a07ab d6fb3f6b49b27ef1c0f4cf5128e041f7e7dc03af 2025-07-17T23:15:32+02:00 Piotr Wilkin (ilintar) model: add Ernie 4.5 MoE support (#14658)
19e5943d9e976b59ccd5a0a87ae3d2ff3da44390 496957e1cbcb522abc63aa18521036e40efce985 2025-07-16T23:17:43+02:00 Sigbjørn Skjæret convert : make hf token optional (#14717)
4b91d6f71f14040979bcdb7b6729b3bca93ec1c1 cf91f217f1c8b98b6db8e4ba6b480f017f81d206 2025-07-16T08:52:04+02:00 Sigbjørn Skjæret convert : only check for tokenizer folder if we need it (#14704)
68e37a61a7b24863f67541db65b4f6195962a268 cbc68be51d88b1d5531643b926a4b359c3cff131 2025-07-16T01:11:42+09:00 Shunta Saito model : add PLaMo-2 support (#14560)
576c82eda210ca0111c04f5256bf77897a4d4cc4 0aedae00e6fb48680324a5ac5da9cba0e35de6b5 2025-07-11T16:36:04+09:00 Dowon vocab : add midm-2.0 model pre-tokenizer (#14626)
0aedae00e6fb48680324a5ac5da9cba0e35de6b5 6bdda13981d6c8189b7dc4f9fb8ecb91c21529f8 2025-07-10T18:20:13-06:00 Gabe Goodhart model : Granite Four (#13550)
4bb625b713fd9b294b4f7af87eaa752b710c7cc1 11ee0fea2a24da1d3206eeba8fc52b759d9dfb24 2025-07-10T13:41:00-04:00 Ryan Mangeno Smoldocling support (#14597)
8f22dc0a53338c629c1ef8fa878d8e39bfe627c9 53903ae6fa5f1caf187889c839cdd1ad25da4018 2025-07-08T10:24:06+02:00 Xuan-Son Nguyen model : add hunyuan moe (#14425)
ddef99522d1ba74193b7394e803fab8db5c78bae 668168814601d2aef6161ce49ab186bc74177ae7 2025-07-05T09:17:14+02:00 Sigbjørn Skjæret server : fix assistant prefilling when content is an array (#14360)
5d46babdc2d4675d96ebcf23cac098a02f0d30cc e17991c466ac835b2c71bd813c1ca7ff8dd97b94 2025-07-02T13:10:24-04:00 compilade llama : initial Mamba-2 support (#9126)
caf5681fcb47dfe9bafee94ef9aa8f669ac986c7 83790b0e7e09ab17238b16452a33053a71dbdfad 2025-06-29T20:02:53+02:00 matteo server : support jinja extra template kwargs (Qwen3 enable_thinking feature), from command line and from client (#13196)
8f52c6f8abb2ed9ad967cc0bfb90acb073011193 d2f325130c4ed77a3dcff2c23a926587fb08e2cc 2025-06-26T15:10:45+08:00 Yunzhe Jia Squashed commit of the following:
66aba7aca9a245d71f1ddf02c7a97223529752a8 f1f5e82df6222dcbaca6396c0de44df259a1694f 2025-06-23T01:28:06+08:00 Ruikai Peng run : avoid double tokenization (#14327)
f1f5e82df6222dcbaca6396c0de44df259a1694f af3373f1adfca56119f3e4de0e6a0a8df8edf3d9 2025-06-22T20:10:07+03:00 Georgi Gerganov examples : fix is_first logic for tokenization (#14329)
aa0ef5c578eef4c2adc7be1282f21bab5f3e8d26 bb16041caef45cd4348cd6f84906b5dfec7a1f6a 2025-06-21T18:12:05+02:00 Sigbjørn Skjæret gguf-py : fix Qwen3-Embedding eos token (#14314)
dd6e6d0b6a4bbe3ebfc931d1eb14db2f2b1d70af 8308f98c7fb778e54bf75538f5234d8bd20915e9 2025-06-20T22:13:06+08:00 Ruikai Peng vocab : prevent tokenizer overflow (#14301)
88fc854b4bd2e3caf10e705e6afcbbca136f0a3c e28c1b93fd7d3f8faf9551d962e8a65fe2122e38 2025-06-20T14:04:09+02:00 Sigbjørn Skjæret llama : improve sep token handling (#14272)
812939a9e90f99d1bd5bb1bc6b99d12600671d50 4c9fdfbe1580a66fd7d77c77418ce2c606a29fdd 2025-06-20T10:50:27+03:00 Georgi Gerganov model : more uniform output id handling (#14275)
d2f325130c4ed77a3dcff2c23a926587fb08e2cc 6391ee7ffd97e723dfbdcc32f001e1b95a63cba6 2025-06-17T11:53:33+08:00 Yunzhe Jia calrt: add input_token in graph; input_token will be copy to calrt_in_buffer
f6e1a7aa8787b5c00acba6370cb70a0beff48b1e c3ee46fab49a765d2e32e171e9ed7a5fa121dd9c 2025-06-12T11:50:01+03:00 Georgi Gerganov context : simplify output counting logic during decode (#14142)
a20b2b05bce6622c585459ebf46f142f113d021c 2e89f76b7af2c0b827be785e445f2e2b3e52e1ca 2025-06-12T02:56:04-04:00 compilade context : round n_tokens to next multiple of n_seqs when reserving (#14140)
cc66a7f78f95dcb5208420f4dd1abc3fc6aec0cc bd248d4dc7265437e1918dc53ae3f49a0c592e5f 2025-06-11T17:16:32+02:00 Sigbjørn Skjæret tests : add test-tokenizers-repo (#14017)
dad5c44398b78467943ed0a603ea427fe9f6fc62 55f6b9fa6563f6ae49113f9abdc980c12348cc1c 2025-06-10T18:20:14-04:00 compilade kv-cache : avoid modifying recurrent cells when setting inputs (#13834)
9f47fa5792bae5312615439e68dbf1826913f7ac 9e31bec4fd53634c9e5b04650488a09a055f5dab 2025-06-05T09:29:18+02:00 Sigbjørn Skjæret vocab : warn about missing mask token (#14022)
9e31bec4fd53634c9e5b04650488a09a055f5dab 5a8ae3053ced350ed300ba91600519fcad1c6ba7 2025-06-05T09:06:29+03:00 Georgi Gerganov context : fix pos_min initialization upon error decode (#14008)
5e1c3aed4074480f63e914d6c44c93536ed1452a c496fe0b1da28618dd17bda8b0a6bf5004554080 2025-06-01T18:07:21+02:00 Sigbjørn Skjæret convert : fix nomic-bert-moe mask token (#13757)
12d0188c0dc6146ffde6d277a93f232ccbe699f8 eb3949938e82a128855bc0676220bb2ce6e4228d 2025-05-31T10:24:04+03:00 Georgi Gerganov kv-cache : refactor + add llama_memory_state_i (#13746)
db38704f0133be7832123495fa8fc2601ea999d4 07e4351ce663a7802b31f92fd7bc0e555c2044b6 2025-05-30T14:50:43+02:00 Sigbjørn Skjæret convert : fix rwkv bos/eos token (#13844)
07e4351ce663a7802b31f92fd7bc0e555c2044b6 291f2b6913c7ef8350dbf0e77da38f7af131a08e 2025-05-30T12:24:37+02:00 Xuan-Son Nguyen convert : allow partial update to the chkhsh pre-tokenizer list (#13847)
bc583e3c63c04a11d287c108ea9e6a515ead0423 72b090da2c50e540143fd312a2f9aa5f151e6136 2025-05-27T14:06:10+02:00 Xuan-Son Nguyen mtmd : support Qwen 2.5 Omni (input audio+vision, no audio output) (#13784)
f9cd68398baf2ba8af4725ca9ed00bef205e6706 4f81b33e324b1669b282eb81104e4a1131be7dce 2025-05-27T12:07:52+03:00 Georgi Gerganov sampling : make sure samplers return at least 1 token (#13822)
79c137f77677b3c8ee3c60a7da033721b938399a 22229314fc46b2f741bb21b12cde71f6c6a60b52 2025-05-26T14:03:54+03:00 Georgi Gerganov examples : allow extracting embeddings from decoder contexts (#13797)
aa50ba462f63759e1731227f20f5009cfc2a0f16 de2ef53a4b2c0d703749a309d19fe68fd8f1b9ac 2025-05-25T16:22:29+02:00 Sigbjørn Skjæret tests : improve UGM tokenizer test coverage (#13773)
c3a2624339187e89c4f65fd72a5fe7103968b5ad ffd0eae60b7642e942c8245b89642527e36099e6 2025-05-24T12:29:09+02:00 Sigbjørn Skjæret vocab : fix ugm tokenizer precision (#13743)
8a1d206f1d2b4e45918b589f3165b4be232f7ba8 797990c4bca0dca5be295c63e3fb2800dc0a69c2 2025-05-22T22:21:07+03:00 Georgi Gerganov tts : fix n_ubatch + make WavTokenizer cache-less (#13713)
b7a17463ec190aeee7b9077c606c910fb4688b84 be0239693c1530a18496086331fc18d8a9adbad1 2025-05-21T00:55:30+08:00 l3utterfly mtmd-helper : bug fix to token batching in mtmd (#13650)
e298d2fbd082a52c0f6ed02729f94e9bf630cf17 f0adb80bf7c2c0d80abb04f4533b5513622d9964 2025-05-20T08:05:46+03:00 Georgi Gerganov kv-cache : add SWA support (#13194)
92ecdcc06a4c405a415bcaa0cb772bc560aa23b1 f71f40a2847d4c9f57b86cd206e0a27b2bfb6d1c 2025-05-19T13:04:14+02:00 Xuan-Son Nguyen mtmd : add vision support for llama 4 (#13282)
6a2bc8bfb7cd502e5ebc72e36c97a6f848c21c2c e3a7cf6c5bf6a0a24217f88607b06e4405a2b5d9 2025-05-17T17:59:48-04:00 Isaac McFadyen server : added --no-prefill-assistant flag (#13608)
b2838049ccf50859cea4c390e81405c2fb01e820 aa48e373f256df9608395ee6881e7010840d6202 2025-05-15T05:57:02+03:00 Georgi Gerganov bench : handle decode errors (#13548)
aa48e373f256df9608395ee6881e7010840d6202 e3a9421b78da5c810d812e6348a405f5acc39f34 2025-05-15T02:39:51+01:00 Olivier Chafik `server`: inject date_string in llama 3.x template + fix date for firefunction v2 (#12802)
360a9c98e13d35f322b4c5b1309aab0cc90ed82b 09d13d94fb169093095416ac6323551c37b75339 2025-05-14T13:35:07+02:00 Xuan-Son Nguyen server : fix cache_tokens bug with no cache_prompt (#13533)
43dfd741a5da77982e0a94d1e522a2481dfb914d b064a51a4e7246fa43a3307f58e59f65e6be170a 2025-05-10T17:19:52+02:00 Sigbjørn Skjæret llguidance : set tokenizer slices to default (#13424)
33eff4024084d1f0c8441b79f7208a52fad79858 17512a94d636c4b6c1332370acb3e5af3ca70918 2025-05-09T19:29:37+02:00 Xuan-Son Nguyen server : vision support via libmtmd (#12898)
efb8b47eda78ea8ae570d4fece3953aae499289e 0527771dd80bd18479dfaaa0a98be297fc3592bf 2025-05-09T05:53:58-04:00 Bartowski imatrix : Add --parse-special for enabling parsing of special tokens in imatrix calculation (#13389)
f05a6d71a0f3dbf0730b56a1abbad41c0f42e63d ee01d71e585f4a17ae83ec55d77acfdcf0bfa798 2025-05-08T14:25:39-04:00 Matt Clayton mtmd : Expose helper_decode_image_chunk (#13366)
0ccc1213549e39ef4c1affb1bf5f49651ef4ce48 6562e5a4d6c58326dcd79002ea396d4141f1b18e 2025-05-08T22:03:53+09:00 welix mtmd : fix the calculation of n_tokens for smolvlm (#13381)
6562e5a4d6c58326dcd79002ea396d4141f1b18e 51fb96b1ff2e1cc98b2492a012b7d93531a6a9a8 2025-05-08T14:28:33+03:00 Georgi Gerganov context : allow cache-less context for embeddings (#13108)
27aa2595321c4d9cc4086a8e67bdea204b8309b0 9fdfcdaeddd1ef57c6d041b89cd8fb7048a0f028 2025-05-04T23:43:42+02:00 Xuan-Son Nguyen mtmd : add C public API (#13184)
36667c8edcded08063ed51c7d57e9e086bbfc903 3bf785f3efa89ed28294fbf73054558a2b034bfb 2025-05-03T20:07:54+02:00 Xuan-Son Nguyen clip : revert the change of BOI/EOI token for GLM-edge (⚠️ breaking change) (#13259)
3f3769ba76061a511f02f2a48da2ad2d93fce511 2f567611c0234bbca0a4009762acb47b56866095 2025-05-02T22:23:12+05:30 shalinib-ibm ggml : Enable MMA for BF16 in llamafile_sgemm (#13148)
2f567611c0234bbca0a4009762acb47b56866095 7d2123484e6ba8fcd90fff8c01661b9dbbefdc9d 2025-05-02T11:42:30-04:00 Jared Van Bortel llama-model : support Qwen2 embedding models and pooling_mode_lasttoken (#13245)
e2e1ddb93a01ce282e304431b37e60b3cddb6114 d9d398f84f96d16c308d4976f5e90222ecc2a492 2025-04-29T20:33:10+02:00 matteo server : Prefilling assistant message in openai compatible API (#13174)
00e3e5a194e88e604e7c91391b9e90332888fd72 e98b3692be4cd8fbbd9a56fbacc2f2bf0bf26a68 2025-04-29T11:47:04+02:00 Xuan-Son Nguyen mtmd : add qwen2vl and qwen2.5vl (#13141)
5f5e39e1ba5dbea814e41f2a15e035d749a520bc eaea3253244dc4bbe07f6cd81325847ccc6cf93e 2025-04-28T15:52:15-04:00 AT model : Nomic Embed Text V2 with Mixture-of-Experts (MoE) architecture (#12466)
4e87962e34a4b257ec374c4baf6b1568554b81a9 fb0471d1753824e75474c24f82fbdd54c94dceda 2025-04-28T16:12:56+02:00 Xuan-Son Nguyen mtmd : fix glm-edge redundant token count (#13139)
d2b2031e5f11b826dcc718138642f147a2009665 5fa9e63be82225fb3249c76f39ddda3e5bdec0a3 2025-04-28T14:20:56+02:00 Xuan-Son Nguyen llama : (mrope) allow using normal 1D position for text token (#13138)
ced44be34290fab450f8344efa047d8a08e723b4 e291450b7602d7a36239e4ceeece37625f838373 2025-04-27T21:57:32+02:00 matteo llama-chat : fix wrong template in GLM4-0414 (#13140)
553a5c3a9fdf771be2101bc3529937963f817457 13be08daf992c89d5169518229b3740041c0f419 2025-04-25T10:08:08+03:00 Radoslav Gerganov rpc : do not wait for response when sending RPC_CMD_SET_TENSOR (#12943)
ecda2ec4b347031a9b8a89ee2efc664ce63f599c eb1776b15a32d832f1266deeeab75b9d255c5849 2025-04-23T20:21:59+02:00 Xuan-Son Nguyen mtmd : Support Pixtral 12B (#13065)
b9154ecff93ff54dc554411eb844a2a654be49f2 2db9ba1464f3de0aceb2b5289963e69fc369cb66 2025-04-18T10:04:51+02:00 Xuan-Son Nguyen mtmd : add methods to access `mtmd_image_tokens` (#12906)
971f245b3b5f3f55991bb779cb541b00f82eea1d 12b17501e6015ffe568ac54fdf08e6580833bf1b 2025-04-17T01:37:05-07:00 Mikko Juola llama : recognize IBM Granite 3.3 FIM tokens (#12988)
8b9cc7cdd8a0dcf0176c60c755322c95b5965299 64eda5deb9859e87a020e56bab5d2f9ca956f1de 2025-04-10T22:57:16+02:00 Xuan-Son Nguyen llava : introduce libmtmd (#12849)
64eda5deb9859e87a020e56bab5d2f9ca956f1de fe5b78c89670b2f37ecb216306bed3e677b49d9f 2025-04-10T17:24:44+02:00 Xuan-Son Nguyen convert : ability to lazy-load safetensors remotely without downloading to disk (#12820)
0090950f679475c5ecaac2f7bca5049cca96492b 7ecd780b1a1d5214b8d04c25ebfc194d310816ed 2025-04-09T00:25:08-05:00 Jeff Bolz vulkan: In coopmat2 mmq, load q4_k/q5_k scales through shared memory (#12833)
1466621e738779eefe1bb672e17dc55d63d166bb 82974011f312057b446c27267105bd7ad3810599 2025-04-07T23:06:44+02:00 Xuan-Son Nguyen llama : Support llama 4 text-only (#12791)
a10b36c91a091f4606710fba4e9327fd71e0e738 83a88bd6affbe148a622ac730952ac5b8b585979 2025-04-02T14:32:59+03:00 Georgi Gerganov llama : refactor kv cache guard (#12695)
c80a7759dab10657b9b6c3e87eef988a133b9b6a 250d7953e829ff0e16074510fef0e7cec696461b 2025-03-31T18:40:56+02:00 Daniel Bevenius vocab : add special infill tokens for CodeLlama (#11850)
403fbacbbcd3650abcc53e84f5e6bf88e51dd6f5 a8a1f3356786cbf8bcc3422e3c8737fc33b453e7 2025-03-31T16:36:25+02:00 Sigbjørn Skjæret convert : Qwerky : use lora_rank_tokenshift and lora_rank_decay if present (#12667)
52de2e594979be52f0da92601747aa44a13e50e4 2c3f8b850a4a6cff0f5dda2135c03fc81d33ed8b 2025-03-31T10:20:30+02:00 marcoStocchi tts : remove printfs (#12640)
5d01670266859444366e4f333ade5e0e5e2ae63d ef03229ff423dd1991f4f44ef1352f03334d86eb 2025-03-28T01:05:44-07:00 Benson Wong server : include speculative decoding stats when timings_per_token is enabled (#12603)
13731766db91ec927c1b61bf502ac7a9be2b11b9 ab6ab8f809bd514d88e02a63869b4d619f13fa86 2025-03-28T13:13:22+05:30 amritahs-ibm llamafile : ppc64le GEMV forwarding for FP32. (#12594)
c7b43ab60855f752ae79937fb93d561bc30b69a4 24feaec05792b972d5ff3e2b12d9237ebd50d1ac 2025-03-27T12:21:47+05:30 amritahs-ibm llamafile : ppc64le MMA implementation for Q4_0. (#12489)
00d53800e00bb22a26bf710fa6bd1150e412cc1d 7ea75035b67f44c22ed7039967f718011fd35ce5 2025-03-24T06:47:24-04:00 compilade llama-vocab : add SuperBPE pre-tokenizer (#12532)
732b5fbf5e7f9cf069942f0c5850ee959ef321ba 568013d0cd3d5add37c376b3d5e959809b711fc7 2025-03-20T02:36:37-04:00 Bartowski convert : avoid calls to tokenizer.added_tokens_decoder (#12473)
2048b5913d51beab82dfe29955f9008130b936c0 f08f4b3187b691bb08a8884ed39ebaa94e956707 2025-03-13T06:10:05-04:00 Ishaan Gandhi server : fix crash when using verbose output with input tokens that are not in printable range (#12178) (#12338)
2b3a25c212f8c4d8a49cec23e03343a7719d51c9 8352cdc87b207a735d34c431a36c425728cb4586 2025-03-10T09:44:42Z Olivier Chafik `sampler`: fixes trigger tokens + lazy grammars (fix typo cast from token to string) (#12291)
06a92a193a07afe445929607be9d5e4d033956fb a057897ad4e48e3df0354256e0cc80dadcb57595 2025-03-05T15:25:45+08:00 Clauszy server : fix cache reuse logic (#12161)
7b69003af74924ac04d97313c2e57c45ba56b616 ece9745bb8079b9f4af45df29b67ad0c6e50584d 2025-03-03T11:42:45+01:00 Xuan-Son Nguyen webui : add ?m=... and ?q=... params (#12148)
34a846b5847a18d133b360074f1fb485b2632b2d 7a2c913e66353362d7f28d612fd3c9d51a831eda 2025-02-24T13:47:07-08:00 lhez opencl: fix for small models (#11950)
af7747c95ae71a5db4184947f837179e82c70b77 a28e0d5eb18c18e6a4598286158f427269b1444e 2025-02-23T05:39:24+08:00 Aaron Teo ggml-cpu: Support s390x SIMD Instruction Set (#12019)
36c258ee921dbb5c96bdc57c0872e4a9a129bef6 f3e64859edb0d55d4223ead78672597cd1a218df 2025-02-22T22:28:28+08:00 Ting Lou llava: build clip image from pixels (#11999)
abd4d0bc4f1a9a0e429bc8ee0d5ece2a394a0a39 9626d9351a6dfb665400d9fccbda876a0a96ef67 2025-02-19T13:29:42+02:00 Georgi Gerganov speculative : update default params (#11954)
63e489c025d61c7ca5ec06c5d10f36e2b76aaa1d 63ac12856303108ee46635e6c9e751f81415ee64 2025-02-18T18:03:23Z Olivier Chafik tool-call: refactor common chat / tool-call api (+ tests / fixes) (#11900)
3e693197724c31d53a9b69018c2f1bd0b93ebab2 a394039db004c6ee00098250d160b5aa018c2314 2025-02-13T07:07:51+01:00 Daniel Bevenius llama : update llama_decode_internal ref [no ci] (#11840)
a18f481f99962638092d6f1c98b1d34d3e3256de b9ab0a4d0b2ed19effec130921d05fb5c30b68c5 2025-02-11T14:06:45+01:00 Daniel Bevenius server : use common_token_to_piece instead of common_detokenize (#11740)
2d219b389e8c8c40bce547b08c8aa7add60fde1f 333820d7491cd31c707a340ff23b984a84e40154 2025-02-07T08:55:47-05:00 Christian Fillion vocab : ignore invalid UTF-8 input in the BPE tokenizer (#11729)
c3db0480bb820e120249014b380e1f4badf2a1c1 d774ab3acc4fee41fbed6dbfc192b57d5f79f34b 2025-02-06T01:55:25+01:00 Matvey Soloviev readme : add link to Autopen under UIs (#11684)
cde383323959544abe10a4d79e1d3e1ee479933c b3451785aca16fbf4214eeba7e4612676cdf8ccb 2025-02-03T23:49:27Z Olivier Chafik `tool-call`: allow `--chat-template chatml` w/ `--jinja`, default to chatml upon parsing issue, avoid double bos (#11616)
bfcce4d693617ec843d0b2510f6ee16e6bc6720d 69804487e0b10f2c5c06316f0ac0eb6ada68433f 2025-02-02T09:25:38Z Olivier Chafik `tool-call`: support Command R7B (+ return tool_plan "thoughts" in API) (#11585)
ff227703d6d6e1888bdc7af6138514092ffcdb96 0cec062a638700495673f5494d200b74340538be 2025-02-01T23:55:32-08:00 Michał Moskal sampling : support for llguidance grammars (#10224)
0cec062a638700495673f5494d200b74340538be 53debe6f3c9cca87e9520a83ee8c14d88977afa4 2025-02-02T15:48:46+08:00 piDack llama : add support for GLM-Edge and GLM-Edge-V series models (#10573)
ffd0821c57edc7e5d04338ab0c6b1461198df15f 4314e56c4f8c5091f45732f39bd94c0c6c323798 2025-01-30T11:10:59+01:00 mgroeber9110 vocab : correctly identify LF token for GPT-2 style BPE tokenizer (#11496)
df984e014714cba4c99ef894b20b51cbcef31b16 acd38efee316f3a5ed2e6afcbc5814807c347053 2025-01-27T12:07:12+01:00 Johannes Gäßler llama: refactor llama_decode_impl (#11381)
6171c9d25820ccf676b243c172868819d882848f e28245f35f2faaf249dd352998b3693a8cc28c51 2025-01-21T13:18:51Z Olivier Chafik Add Jinja template support (#11016)
6390a998bfc63241fde8509022b0768a71bf20bb 44e18ef93995f3040660750b527e5becf85899d0 2025-01-18T18:20:57+08:00 LostRuins Concedo tts : add guide tokens support (#11186)
3edfa7d3753c29e44b964c0ff424d2ea8d5fdee6 667d72846c06b2cf4f7c8a4265e210991a49706b 2025-01-17T20:57:56+08:00 codezjx llama.android: add field formatChat to control whether to parse special tokens when send message (#11270)
bbf3e55e352d309573bdafee01a014b0a2492155 c5bf0d1bd7eb8762edca47e0a95f64e6fbfaf5b1 2025-01-14T12:54:58+02:00 Georgi Gerganov vocab : add dummy tokens for "no_vocab" type (#11231)
8f70fc3d1b1d3c17b61842330dd106d391cc1227 1244cdcf14900dd199907b13f25d9c91a507f578 2025-01-13T13:38:20+01:00 Daniel Bevenius llama : remove 'd' from bad special token log (#11212)
08f10f69c38288e9e8bb1f933af63a3fc9013d40 afa8a9ec9b520137bbd1ca6838cda93ee39baf20 2025-01-12T12:15:53+02:00 Georgi Gerganov llama : remove notion of CLS token (#11064)
afa8a9ec9b520137bbd1ca6838cda93ee39baf20 c05e8c9934f94fde49bc1bc9dc51eed282605150 2025-01-12T11:32:42+02:00 Georgi Gerganov llama : add `llama_vocab`, functions -> methods, naming (#11110)
2739a71e4b88474833b64aa974ca4515574fd3c4 ba8a1f9c5b675459c55a83e3f97f10df3a66c788 2025-01-11T05:50:33+01:00 Daniel Bevenius convert : sort print supported models [no ci] (#11179)
ff3fcabc727b2dd0c477d23a258217b27cc639fb c3f9d25706ac84297067aeaa662c1f1af42ed443 2025-01-10T11:30:53+01:00 Daniel Bevenius convert : add --print-supported-models option (#11172)
8cef75c743ba13ebbd6d380c531200c768a8b8aa 0d52a69e4bf0d6181beec7853307bdcdeec9905b 2025-01-08T16:24:19+05:30 amritahs-ibm llamafile : ppc64le MMA INT8 implementation (#10912)
3e6e7a6bc2c4b980a0cf0fcb5cb3b79a965b5f14 ae2f606bb598b287f5fb69c9fdfc98b86598c6cc 2025-01-06T10:54:25+02:00 Georgi Gerganov tokenize : escape the prompt (#11058)
727368c60f2ebf2d6a7473a4a9f80957ab063a8e 5047dd3546951dea3d65c02257d06c46c8662338 2025-01-06T10:52:15+02:00 Georgi Gerganov llama : use LLAMA_TOKEN_NULL (#11062)
9394bbd484f802ce80d2858033583af3ef700d25 f922a9c542ee117550a168395c63ea79261f5c99 2025-01-04T21:06:11+01:00 fairydreaming llama : Add support for DeepSeek V3 (#11049)
2f0ee84b9b02d2a98742308026f060ebdc2423f1 0da5d860266c6928b8c9408efbd264ae59fedda6 2025-01-02T18:06:12+01:00 Pierrick Hymbert server: bench: minor fixes (#10765)
16cdce7b68218959e0658e2f95b4572573d5008e d79d8f39b4da6deca4aea8bf130c6034c482b320 2024-12-28T15:08:54Z Alexey Parfenov server : fix token duplication when streaming with stop strings (#10997)
30caac3a68a54de8396b21e20ba972554c587230 60cfa728e27c28537657d4e627ed432508eb9537 2024-12-24T09:44:20+02:00 Georgi Gerganov llama : the WPM vocabs use the CLS token as BOS (#10930)
b92a14a841fb4dfaf27b29d982ec8ba5289a3bff 6f0c9e034bb398915a6617ee4acc62adb87d387d 2024-12-23T08:35:44+08:00 Yun Dou llama : support InfiniAI Megrez 3b (#10893)
7ae33a616f44ecc081f3dcb589be20962d1d4a92 ebdee9478ca7ba65497b9b96f7457698c6ee5115 2024-12-23T01:09:58+03:00 Billel Mokeddem llama : add Falcon3 support (#10883)
57bb2c40cd94c5a09f5210ed8264cc93b21c4b7e a3c33b1dce2d4f25040b75f66629104bd1e40128 2024-12-19T15:40:08+01:00 Xuan Son Nguyen server : fix logprobs, make it OAI-compatible (#10783)
2fffc52b50992ac5bc64db19d33c39cbc06f52cf 7585edbdebd02861e0994dae67c9338731fb3fc5 2024-12-19T06:04:51-07:00 Sukriti Sharma llama : fix Roberta embeddings (#10856)
0bf2d10c5514ff61b99897a4a5054f846e384e1e 7bbb5acf125d1d2840cac7d31b9aaa72210dd5ec 2024-12-18T19:27:21+02:00 Georgi Gerganov tts : add OuteTTS support (#10784)
152610eda91217ac409342cd976d05f5114ad39f 0e70ba686e6c717a0aa41d88284e2a392c2bd0cd 2024-12-18T13:01:41+02:00 Georgi Gerganov server : output embeddings for all tokens when pooling = none (#10861)
0e70ba686e6c717a0aa41d88284e2a392c2bd0cd 46828872c31b25df16169cbbf5c2225fa9cb0675 2024-12-18T11:05:29+02:00 Georgi Gerganov server : add "tokens" output (#10853)
644fd71b44c4cdbfc6482fbf0353d289c3bc29e6 4ddd199f6f6b980e0a7ed9f9b44efeae2fbdf5c4 2024-12-16T12:31:14+02:00 Georgi Gerganov sampling : refactor + optimize penalties sampler (#10803)
ba1cb19cdd0d92e012e0f6e009e0620f854b6afd 56eea0781cbd2608ed8ff524955495569b9264be 2024-12-14T20:43:46+08:00 HimariO llama : add Qwen2VL support + multimodal RoPE (#10361)
64ed2091b24b2f9747148fdf49a34ed5938762c3 991f8aabeec89d801300bb179e52013fb0eb0584 2024-12-02T21:45:54+08:00 haopeng server: Add "tokens per second" information in the backend (#10548)
8fc393f246c550d2481e53323a47644a94e8d01f ec450d3bbf9fdb3cd06b27c00c684fd1861cb0cf 2024-11-09T15:06:54+08:00 haopeng scripts : fix pattern and get n_tokens in one go (#10221)
2319126a70b541f8670225a04a38202bbdccbedb 3bcd40b3c593d14261fb2abfabad3c0fb5b9e318 2024-11-07T02:02:08-06:00 snadampal fix q4_0_8_8 format for corrupted tokens issue (#10198)
d865d1478cd4e403f82d793c2afcd0f943412f05 1804adb0cfee4811eaf633741503d683a46e4c77 2024-11-01T13:33:14Z sasha0552 server : fix smart selection of available slot (#10120)
958367bf530d943a902afa1ce1c342476098576b 40f2555797f97314de749873cdc29dc102be66e2 2024-10-24T21:51:22+02:00 Xuan Son Nguyen server : refactor slot input data, move tokenizer to HTTP thread (#10023)
c8c07d658a6cefc5a50cfdf6be7d726503612303 19d900a7565b8f6b0a708836a57d26966cb9efe2 2024-10-22T16:59:02+02:00 Xuan Son Nguyen llama : fix empty batch causing llama_batch_allocr to crash (#9966)
c421ac072d46172ab18924e1e8be53680b54ed3b 4ff7fe1fb36b04ddd158b2de881c348c5f0ff5e4 2024-10-22T13:08:41+02:00 Xuan Son Nguyen lora : warn user if new token is added in the adapter (#9948)
4ff7fe1fb36b04ddd158b2de881c348c5f0ff5e4 6b8447352df3d662b56280c8fc38d7f092885787 2024-10-22T18:33:37+08:00 Molly Sophia llama : add chat template for RWKV-World + fix EOT (#9968)
cda0e4b648dde8fac162b3430b14a99597d3d74f afd9909a6481402844aecefa8a8908afdd7f52f1 2024-10-18T23:18:01+02:00 Xuan Son Nguyen llama : remove all_pos_0, all_pos_1, all_seq_id from llama_batch (#9745)
6f55bccbb8835d42147add4ee48807450f5ff535 17bb9280807cfbb6611b853aa1ef05114bd9efe9 2024-10-18T01:41:51+02:00 Daniel Bevenius llama : rename batch_all to batch (#8881)
99bd4ac28c32cd17c0e337ff5601393b033dc5fc 3752217ed5a6a11864682fbf009bcb36afffd6bc 2024-10-17T22:32:47+03:00 Georgi Gerganov llama : infill sampling handle very long tokens (#9924)
9e041024481f6b249ab8918e18b9477f873b5a5e dbf18e4de9e7aa496871f1555f9f0c8d84567108 2024-10-16T19:34:28+02:00 Daniel Bevenius llama : suppress conversion from 'size_t' to 'int' (#9046)
fbc98b748e7b075e327bcf13237057f647678049 dcdd535302fc9702a4709be25f56540d65163a44 2024-10-15T15:54:55+05:00 MaggotHATE sampling : add XTC sampler (#9742)
11ac9800aff532715a5bc7991062c68ba3472e6e 943d20b4111c746bcd9dbc7e4771de313b08b50c 2024-10-12T08:21:51+03:00 Georgi Gerganov llama : improve infill support and special token detection (#9798)
8c475b97b8ba7d678d4c9904b1161bd8811a9b44 58b16695e146628481c6b9b8a3b101c0c9bac00f 2024-10-05T15:55:04+03:00 Georgi Gerganov rerank : use [SEP] token instead of [BOS] (#9737)
e3c355ba654d4164c1c09e5d0dcacecb8b214af8 841713e1e487bdb82fd106a52ad998c5f87b59e9 2024-10-03T10:22:15-04:00 compilade convert : handle tokenizer merges format from transformers 4.45 (#9696)
1927378bcce20ba72b6c89d5977b854a4bcaeb5d 6f1d9d71f4c568778a7637ff6582e6f6ba5fb9d3 2024-10-01T02:31:36-04:00 compilade convert : refactor rope_freqs generation (#9396)
faac0bae265449fd988c57bf894018edc36fbe1e f99d3f8367174f7aba73c07fd87de687d4a0ece1 2024-09-29T05:25:00-07:00 matiaslin common : ensure llama_batch size does not exceed max size (#9668)
f4d2b8846a6b34419ff9e9491aee6cd95e444bfc 1b2f992cd2cff0b69e5abe78bb8888d51ed19d67 2024-09-28T17:42:03+03:00 Georgi Gerganov llama : add reranking support (#9510)
6102037bbb55521880ae78a6ee6c2a0c00c901df 9a913110cf471a8287ac06c43cbe307d3cf6df99 2024-09-28T20:10:58+08:00 Zhenwei Jin vocab : refactor tokenizer to reduce init overhead (#9449)
9a913110cf471a8287ac06c43cbe307d3cf6df99 43bcdd9703ec19af7d2a519640b5ed6f4aac3d53 2024-09-28T12:08:43Z nopperl llama : add support for Chameleon (#8543)
31ac5834fe75c296476658a124c06c84772aa641 cea1486ecf34a1c7e014a9e290eb458f5a11f876 2024-09-24T10:16:06+03:00 Georgi Gerganov llama : keep track of all EOG tokens in the vocab (#9609)
6443ddd98576a9da904ef9f07df4e4398bb6a01a 8a308354f6520df6bea851b435bd8054ee5617b4 2024-09-18T13:42:36+02:00 Daniel Bevenius llama : use reserve/emplace_back in sampler_sample (#9534)
8344ef58f8cdb8ebd6faf4463ca32ae91c374c81 0226613853133c081b55bb892a41bb5eacc0bc94 2024-09-17T12:18:22+02:00 Michael Podvitskiy llama : fix n_vocab init for 'no_vocab' case (#9511)
0abc6a2c25272d5cf01384dda8ee8bfec4ba8745 bd35cb0ae357185c173345f10dc89a4ff925fc25 2024-09-13T09:53:38+03:00 Georgi Gerganov llama : llama_perf + option to disable timings during decode (#9355)
78203641fee3b1f82abaff0c7f667e1b4a286390 e6b7801bd189d102d901d3e72035611a25456ef1 2024-09-12T22:30:11+02:00 Mathijs Henquet server : Add option to return token pieces in /tokenize endpoint (#9108)
c837981bba7cf6839b69d32b25552ce685936b14 3c26a1644dacfa6b5d58af550210524efd7b93fc 2024-09-12T20:28:20+09:00 daminho py : add Phi-1.5/Phi-2 tokenizer (#9361)
39f852f44039b058fdd0611ee127c6efa7ba4a04 2b00fa799773cc75d53b841c03d21d7468a1e3a1 2024-09-12T19:25:16+08:00 Molly Sophia py : add special tokens in hf_converter for RWKV v6 (#9428)
1b28061400eb9832603c9f1dfbec4d339a8490a2 8db003a19d7055b5bd248ce2afff9324e5b8da95 2024-09-11T17:52:13+02:00 slaren llama : skip token bounds check when evaluating embeddings (#9437)
83008b7cfe90ad89d0c0ed2c2424fd75edc25ac1 0b4ac75772b744bb0a0d674927587621d1057884 2024-09-10T09:03:21+02:00 Daniel Bevenius llama : update llm_build_copy_mask_state comment [no ci] (#9385)
eae597182cb61bbde0b26e7cec5999d28b9327fe 00b02bb249406ec0123757a67a5b714c3f33a699 2024-09-08T12:41:51+02:00 slaren llama : sanitize tokens in the upper bound (#9359)
fbb7fcffbcfc50009c275e75982b1603a6cb6b80 a5b5d9a1014248f385939e6739e9db9de7147e55 2024-09-07T22:51:00-07:00 Kevin Gibbons llama : set attrs of mislabelled EOT/EOM tokens (#9348)
faf69d4237c9ae4d7f572b4674d1002463e8acd3 e536426ded3fb4a8cd13626e53508cd92928d6c2 2024-09-08T00:33:13+03:00 Georgi Gerganov llama : sanitize invalid tokens (#9357)
9b2c24c0993487d3b34a873980e292da571481f3 134bc38ecf3e2c5460581badce289a1ffa680453 2024-09-06T23:21:29+02:00 Xuan Son Nguyen server : simplify state machine for slot (#9283)
9bc6db28d011d47a5f318dc4aebbe7927fac4629 32b2ec88bc44b086f3807c739daf28a1613abde1 2024-09-05T21:48:47-04:00 compilade ggml-quants : ternary packing for TriLMs and BitNet b1.58 (#8151)
9c1ba557335c3cab46807e6478eb7d17a63361f1 c6d4cb46559b359d2682cf2a002e7fe01bb7a767 2024-09-02T16:51:01+05:30 Tushar build(nix): Package gguf-py (#5664)
8f1d81a0b6f50b9bad72db0b6fcd299ad9ecd48c a47667cff41f5a198eb791974e0afcc1cddd3229 2024-09-01T22:38:17+08:00 Molly Sophia llama : support RWKV v6 models (#8980)
c679e0cb5c378bfb63643c44a453345ba8b90126 fb487bb5671b37267f35ff43fe8849ddccd925cd 2024-08-16T15:35:18+09:00 Minsoo Cheong llama : add EXAONE model support (#9025)
4af8420afba39de4968adf2695ce12fd42422a13 6bda7ce6c3a9284fcbb70c1ace4107db8eb63e5c 2024-08-15T15:23:23+08:00 Zhenwei Jin common : remove duplicate function llama_should_add_bos_token (#8778)
6bda7ce6c3a9284fcbb70c1ace4107db8eb63e5c d5492f0525fa533817a67e93a4bde9d71d81cf58 2024-08-15T10:17:12+03:00 Esko Toivonen llama : add pre-tokenizer regexes for BLOOM and gpt3-finnish (#8850)
5ef07e25ac39e62297a67208c5bcced50835a2dd 4134999e01f31256b15342b41c4de9e2477c4a6c 2024-08-12T10:21:50+03:00 Georgi Gerganov server : handle models with missing EOS token (#8997)
7c3f55c10051c634546247387c5c359c9d499360 911b437f228e75aa3d235acec21bfddd23ecce2f 2024-08-10T11:43:26+02:00 fairydreaming Add support for encoder-only T5 models (#8900)
cdd1889de62a7140c8c016405ec917464bde8bd3 c21a896405de4cdf4207eb8130555ceaac0ab110 2024-08-06T02:20:54-05:00 Douglas Hanley convert : add support for XLMRoberta embedding models (#8658)
d3f0c7166adfa952237e0f437a5344362d8256d4 e31a4f679779220312c165b0f5994c680a610e38 2024-08-05T09:38:01+02:00 fairydreaming Stop the generation when <|eom_id|> token is encountered - needed for Llama 3.1 tool call support (#8858)
978ba3d83d17b10fdf9807006048432b5b3769fc ecf6b7f23e664afd7ff856ec39034240ce438daa 2024-08-04T18:16:23Z ardfork Server: Don't ignore llama.cpp params (#8754)
9d03d085dd6cb275c078690bb64073b9b043e95f bfb4c74981f0a40d757b450b596a9fe4ca983d26 2024-07-27T12:45:02+02:00 Daniel Bevenius common : add --no-warmup option for main/llama-cli (#8712)
938943cdbf4dd79005a394d732bc226f9e34e0ff 751fcfc6c33ea5f43cadd4d976f8fb176871df5e 2024-07-23T13:10:17+03:00 Georgi Gerganov llama : move vocab, grammar and sampling into separate files (#8508)
d94c6e0ccbd29ee1ba4f44e9caa8682ad94df9fa 566daa5a5b38018b2727950bbd280239adb981b6 2024-07-22T10:43:01-04:00 Jason Stillerman llama : add support for SmolLm pre-tokenizer (#8609)
6f11a83e4e7700fdf353ed4a29599cb662c792f6 e093dd238282a980d248db0786063f8174400f70 2024-07-22T13:33:22+03:00 Georgi Gerganov llama : allow overrides for tokenizer flags (#8614)
e093dd238282a980d248db0786063f8174400f70 50e05353e88d50b644688caa91f5955e8bdb9eb9 2024-07-22T13:32:49+03:00 Georgi Gerganov tests : re-enable tokenizer tests (#8611)
628154492a0b2dcc954a3af99e5c267097568eae 04bab6b7da0ed2b0a57174a57784d602aabb6c10 2024-07-22T16:02:09+08:00 Jan Boon server : update doc to clarify n_keep when there is bos token (#8619)
c69c63039cd75f8f33f253ab7485d82a8b4cd403 69c487f4ed57bb4d4514a1b7ff12608d5a8e7ef0 2024-07-20T21:53:01-04:00 compilade convert_hf : fix Gemma v1 conversion (#8597)
940362224d20e35f13aa5fd34a0d937ae57bdf7d 69b9945b44c3057ec17cb556994cd36060455d44 2024-07-20T09:43:51-04:00 Michael Coppola llama : add support for Tekken pre-tokenizer (#8579)
69b9945b44c3057ec17cb556994cd36060455d44 c3776cacabce2ee35f172fb72be7a519752125fa 2024-07-20T09:09:37-04:00 Huifeng Ou llama.swiftui: fix end of generation bug (#8268)
fa79495bb4897953a75607addd9d2cdd2ec63222 17eb6aa8a992cda37ee65cf848d9289bd6cad860 2024-07-13T23:35:10-04:00 compilade llama : fix pre-tokenization of non-special added tokens (#8228)
c3ebcfa148e867a68e78fd5c4f0c23e8f84c788b 8a4441ea1a2564578134404f31158c318e9c0bf3 2024-07-12T03:14:12-05:00 Douglas Hanley server : ensure batches are either all embed or all completion (#8420)
5aefbce27a66473d4b1263ba3f7bdd3d14245975 71c1121d11f1437be9421fd0cbaa011b9ef49098 2024-07-12T10:06:33+02:00 Jiří Podivín convert : remove fsep token from GPTRefactForCausalLM (#8237)
9a55ffe6fbf7f19c865f8f277ca7cd585cc0b094 7a221b672e49dfae459b1af27210ba3f2b5419b6 2024-07-11T03:41:48-04:00 compilade tokenize : add --no-parse-special option (#8423)
470939d483d1c89b7292f78bac1fd27c42c171ce 6f0dbf6ab087bcd286fb78560099ca0458316735 2024-07-08T03:26:53-04:00 Kevin Wang common : preallocate sampling token data vector (#8363)
6f0dbf6ab087bcd286fb78560099ca0458316735 ffd00797d81ef7db1528b9e10adbdc333ade6495 2024-07-08T09:34:35+03:00 Georgi Gerganov infill : assert prefix/suffix tokens + remove old space logic (#8351)
3fd62a6b1c9ca7b7c0093e984cc9c133c6f2726d a8db2a9ce64cd4417f6a312ab61858f17f0f8584 2024-07-07T15:04:39-04:00 compilade py : type-check all Python scripts with Pyright (#8341)
905942abdba5ba0b28a1b0805e51e4f818c54bc9 b5040086d436e7345e4fa33a5b9558060c75603f 2024-07-07T20:52:10+08:00 toyer llama : support glm3 and glm4 (#8031)
86e7299ef5dff0f388922dc6fcbce009e99d8005 60d83a0149849e9217e4b8ae26e277a41aea906e 2024-07-06T15:32:04-05:00 Derrick T. Woolworth added support for Authorization Bearer tokens when downloading model (#8307)
213701b51a17175d0d326b566efc03f30ec7fbe6 be20e7f49d9e5c6d9e8d9b4871eeba3df7a1639d 2024-07-05T19:01:35+02:00 jaime-m-p Detokenizer fixes (#8039)
6f63d646c1a06a6e09f721009a2676864ae04e31 51d2ebadbbf365b894f3888361df42dbacb12b7a 2024-07-04T18:38:58+02:00 Daniel Bevenius tokenize : add --show-count (token) option (#8299)
807b0c49ff7071094f97ebc3a0a8e2b9e274f503 f8c4c0738d72d2162736edd72dd5db8b269adca1 2024-07-04T15:46:11+02:00 fairydreaming Inference support for T5 and FLAN-T5 model families (#5763)
20fc3804bfb727074bc270b6eacb60af8d0bf7d4 f619024764e72261f14d7c31d892b8fb976603b4 2024-07-04T10:41:03+03:00 Georgi Gerganov convert : fix gemma v1 tokenizer convert (#8248)
5fac350b9cc49d0446fc291b9c4ad53666c77591 cb5fad4c6c2cbef92e9b8b63449e1cb7664e4846 2024-07-02T01:07:23+02:00 Xuan Son Nguyen Fix gemma2 tokenizer convert (#8244)
e57dc62057d41211ac018056c19c02cd544694df a27aa50ab7e07fe46aae619076b6e31d5663e914 2024-06-28T00:00:43-04:00 pculliton llama: Add support for Gemma2ForCausalLM (#8156)
f675b20a3b7f878bf3be766b9a737e2c8321ff0d 911e35bb8bb2fd1c7d3f40f27e96ff432eae7e14 2024-06-27T11:58:54+03:00 kustaaya Added support for Viking pre-tokenizer (#8135)
911e35bb8bb2fd1c7d3f40f27e96ff432eae7e14 ac146628e47451c531a3c7e62e6a973a2bb467a0 2024-06-27T09:46:41+02:00 Sigbjørn Skjæret llama : fix CodeLlama FIM token checks (#8144)
6777c544bdd8c5d9de3220d6e2557957bbbf2a4f 163d50adaf8897d8b734d701ff332de6be63d484 2024-06-26T01:45:58+01:00 Olivier Chafik `json`: fix additionalProperties, allow space after enum/const (#7840)
6fcbf6823553efabe52ed83e3c2a3329aa3387d1 e6bf007744eb06336a231ef39cf08146dd16d2ce 2024-06-25T21:14:35+02:00 fairydreaming llama : implement Unigram tokenizer needed by T5 and FLAN-T5 model families (#5763)
d62e4aaa02540c89be8b59426340b909d02bbc9e 9a590c82262dd518137f85406e65e452fdf2aca3 2024-06-24T14:13:39+02:00 fairydreaming gguf-py : fix tensor groups for encoder-decoder models in gguf-dump.py (#8090)
de0d6a68ac99f307fe889c48e21124bc3b7ca29a 95f57bb5d5b18ef0beb2702a0d6c06e46804075c 2024-06-24T07:06:05+02:00 fairydreaming gguf-py, convert-hf : model conversion support for T5 and FLAN-T5 model variants (#5763)
a927b0f3dd9a86ee042cd2bdcc8c9da4a855926b 80ea089d771f0c2d97afa8bead80ded412f600d7 2024-06-21T08:51:28+03:00 Georgi Gerganov llama : optimize long word tokenization with WPM (#8034)
80ea089d771f0c2d97afa8bead80ded412f600d7 0e64591e8290037db6412665a56354b789a0597e 2024-06-21T00:38:22-05:00 Douglas Hanley llama : allow pooled embeddings on any model (#7477)
37bef8943312d91183ff06d8f1214082a17344a5 91c188d6c296bd3384f2a02a83b71187aa3d18b3 2024-06-18T18:40:52+02:00 jaime-m-p tokenizer : BPE fixes (#7530)
91c188d6c296bd3384f2a02a83b71187aa3d18b3 84f6de17f6a8602e7ff7f7c7bda36a73f510a2dd 2024-06-18T14:19:45+02:00 Sigbjørn Skjæret Only use FIM middle token if it exists (#7648)
0c7b3595b9e5ad2355818e259f06b0dc3f0065b3 7b2f4a7d193ef2475259bbe7656fcccfab4b1217 2024-06-15T18:53:40+02:00 Xuan Son Nguyen Add `cvector-generator` example (#7514)
6fcd1331efbfbb89c8c96eba2321bb7b4d0c40e4 41b9260f18eb7f325c952006ac46afc1d0d8ad2f 2024-06-14T12:20:04+02:00 Sigbjørn Skjæret llama : more checks before assuming FIM tokens (#7644)
41b9260f18eb7f325c952006ac46afc1d0d8ad2f 172c8256840ffd882ab9992ecedbb587d9b21f15 2024-06-14T13:16:49+03:00 Elaine convert : add Poro-34B-chat tokenizer support (#7713)
ad675e1c67a05b16e4e12abe30dbecfc808e7b7e a143c04375828b1f72eb1a326115791b63e79345 2024-06-06T06:08:52-07:00 Clint Herron Added support for . (any character) token in grammar engine. (#6467)
c90dbe026b456a233f8f0fbe752212e6a0503ca2 b90dc566c1c615289b05b50d61680f23744a21e7 2024-06-05T01:26:14+02:00 jaime-m-p Fix per token atrributes bits (#7749)
3b38d48609280aa5f8ab7ea135a4351b2a5ee240 6d1616944d9efd342ed2a4fd318722adfc9febcd 2024-06-04T09:17:17+02:00 jaime-m-p Per token attributes (#7685)
549279d8049d78620a2b081e26edb654f83c3bbd 9e405b6e2ecb888e860f7b92720b4809e21b3915 2024-06-03T08:34:43+03:00 Georgi Gerganov llama : avoid double token-to-piece cache (#7654)
2e666832e6ac78194edf030bd1c295e21bdb022c 2ac95c9d5678d05e253691fb1f26471675bff5ad 2024-06-01T21:31:48+02:00 Yazan Agha-Schrader server : new UI (#7633)
2ac95c9d5678d05e253691fb1f26471675bff5ad 750f60c03e4d3f53fa51910551ce87a3d508d2d7 2024-06-01T21:50:18+05:30 HanishKVC SimpleChat: Simple histogram/repeatMatching driven garbageTrimming, Settings UI, Streaming mode, OpenAi Compat (Model, Authorization Bearer), Save/Restore session, Auto Settings UI (#7548)
5921b8f089d3b7bda86aac5a66825df6a6c10603 5dcdf946764fae49a8e2a90bf2f0960bde1c44e8 2024-05-30T19:01:41+03:00 Georgi Gerganov llama : cache llama_token_to_piece (#7587)
9c4c9cc83f7297a10bb3b2af54a22ac154fd5b20 59b0d077662fab430446b3119fa142f3291c45b2 2024-05-30T13:40:00+02:00 Galunid Move convert.py to examples/convert-legacy-llama.py (#7430)
eb57fee51f7b4d78039f003249873c2eb46f12f6 55d62262a99cd8bc28a1492975791fe433c8cc0f 2024-05-30T02:10:40+02:00 Galunid gguf-py : Add tokenizer.ggml.pre to gguf-new-metadata.py (#7627)
02c1ecad07f0e2d2febe8196271bcc64bdc9c006 6bd12ce409f949012935b7d1b15a21ffa473a565 2024-05-28T21:46:34+02:00 jaime-m-p Tokenizer WPM fixes (#7500)
5442939fcc5e6ae41abf40612a95fd71377e487e 56411a950f255b523a9edd684fd1632752474399 2024-05-28T20:49:49+02:00 Giuseppe Scrivano llama : support small Granite models (#7481)
edc29433fa08b4e5aeb67649a29fc7713af13d04 8b99e2aa66ba39e4e1114effea6ef7430881eca4 2024-05-28T15:04:09+03:00 Georgi Gerganov tests : fix test-tokenizer-0.sh
852aafb163d32d5bad63c10bc323a02c28fec59d 0136966dafb452601c23f30395878d5a65ddc559 2024-05-28T01:40:47+02:00 Djip007 update HIP_UMA #7399 (#7414)
d298382ad977ec89c8de7b57459b9d7965d2c272 32a28217f475119926c603341e8273b26932b56a 2024-05-27T00:10:17+10:00 Brian main: replace --no-special with --special (#7534)
b9adcbbf92fc7096bee23fe61496d25652ebf765 9588f196b1d7b21bdff013fcf958c249576b2619 2024-05-26T06:26:34+05:30 HanishKVC SimpleChat Completion Mode flexibility and cleanup, Settings gMe, Optional sliding window (#7480)
00c63907931bb08a0ed2b7e38cf44dd290143cb9 faa0e6979a11dcb731e9d778ad42ceaa0302015e 2024-05-25T05:04:03-04:00 Justine Tunney main : don't print special tokens with --grammar (#6923)
57684331fc2d685f7d1f5775af0b9e47d1829833 b83bab15a5d2a1e7807d09613a9b34309d86cfaa 2024-05-24T18:14:42-07:00 Mikko Juola Make tokenize CLI tool have nicer command line arguments. (#6188)
fbca2f27fc7fa9aa4a8ad0357478fdb908472908 0df0aa8e43c3378975269a51f9b876c8692e70da 2024-05-24T14:31:13+02:00 fairydreaming Add support for ArcticForCausalLM (#7020)
3015851c5ac7334fb544a23a70a284c117b87044 55ac3b7aeaf52f19786ed96e885d89521fc0f6c8 2024-05-23T14:29:26+02:00 Daniel Bevenius llama : add getters for n_threads/n_threads_batch (#7464)
c3f8d583560b4f261fa21c976793e538c60cd66c 11474e756de3f56b760986e73086d40e787e52f8 2024-05-21T19:53:48+03:00 Georgi Gerganov tests : test-tokenizer-0.sh print more info (#7402)
d7e852c1bc8e85bf62a6f1aede08cd2de723404a 917dc8cfa67a72fb7c8bf7392270da3bf4833af4 2024-05-21T14:39:48+02:00 jaime-m-p Tokenizer SPM fixes for phi-3 and llama-spm (bugfix) (#7425)
917dc8cfa67a72fb7c8bf7392270da3bf4833af4 fabf30b4c4fca32e116009527180c252919ca922 2024-05-20T20:15:57+02:00 jaime-m-p Tokenizer SPM fixes for phi-3 and llama-spm (#7375)
1b01f06db0cff5f5f600bb754fc39fde565ed56a 41858392e17abead21735309bf17cb55183d8c31 2024-05-19T16:26:02+02:00 Johannes Gäßler server: add test for token probs (#7347)
6aade19ee74b896c59929676629340b36be3e22c ab33f7a338593f6cf1ae98b10b6f8684f63bd72c 2024-05-19T14:46:46+02:00 Anas Ahouzi Add StableLM2 pre-tokenizer (#7349)
0f98acfac6cc561dc57586bfff778405e42b576b ca57e0f35e33f714b9a6c2c4482b87bfe059c819 2024-05-18T10:04:55+02:00 Steffen Röcker llama : add support for larger Granite Code Models (20B, 34B) (#7324)
29c60d8cddcfd14fa8a6bf023a6c4eb8692c76ba 359cbe3f46c90ce6f5151005e411b8fb74f8139e 2024-05-17T09:59:57+02:00 Johannes Gäßler tokenization: add warning for double BOS (#7332)
dc020985b8755dd6aa93a2f002f43c3ede808cce 344f9126cc0d15891fde9472fe40b8572628ad7d 2024-05-15T14:44:49+01:00 agray3 Avoid unnecessarily disabling CUDA graphs (#7302)
9aa672490c848e45eaa704a554e0f1f6df995fc8 b1f8af1886e8187db6bb2a9b87cfc1c0f175f629 2024-05-13T10:35:14+02:00 Joan Fontanals llama : rename jina tokenizers to v2 (#7249)
f99e1e456eaf69cc38c1982a2693ce41c0f897ef 5ae3426b0b64672991563d4c28b2018b9f961467 2024-05-11T16:12:06+08:00 Haoxiang Fei llama : lookup word in vocab before doing BPE merges (#7193)
5ae3426b0b64672991563d4c28b2018b9f961467 b83cc3f5b303ff30c52874b2d5864dc6385ebf9f 2024-05-11T10:11:28+02:00 Johannes Gäßler server: fix reported top tokens for temperature 0 (#7203)
b83cc3f5b303ff30c52874b2d5864dc6385ebf9f 9cb317f77e53067f7a138cc89ef7657148eae8e6 2024-05-11T09:46:09+02:00 Joan Fontanals llama : add Jina Embeddings architecture (#6826)
f89fe2732c5709f6e86d5f4aee2e6d2a561f2eb2 d11afd665241c1b3910ab5f040d0216403019d87 2024-05-10T15:51:58+05:30 HanishKVC Main+: optionally allow special tokens from user in interactive mode (#7097)
43248e559472556f368988575d9fba906b3eb139 a743d76a01f23038b2c85af1e9048ee836767b44 2024-05-09T15:30:44+02:00 jaime-m-p llama3 custom regex split (#6965)
f31ec120bc36c6270e4948e6a065a7c4cfa0c404 fd9f92b154850014146f61717cd292a59a5cee5a 2024-05-09T14:13:05+02:00 Galunid Add warning if token is invalid (#7173)
fd9f92b154850014146f61717cd292a59a5cee5a 22842164bcae3251b81ad9e497a16ef66833cb9e 2024-05-09T13:03:29+02:00 Daniel Bevenius llama : update llama_timings.n_p_eval setting (#7160)
22842164bcae3251b81ad9e497a16ef66833cb9e 47345248827f426038098d016ed11975021b4919 2024-05-09T12:56:00+02:00 Sigbjørn Skjæret gguf-py : add special token modification capability (#7166)
f98eb31c517c95960df1d0abc48002787f145f3b bc4bba364fb96d908f2698e908648df5e6f55e02 2024-05-08T18:16:38-04:00 compilade convert-hf : save memory with lazy evaluation (#7075)
911b3900dded9a1cfe0f0e41b82c7a29baf3a217 ad211edef5db1f1fb955874b7ca6a67bd0c88708 2024-05-08T14:27:58+02:00 Johan server : add_special option for tokenize endpoint (#7059)
229ffff872f8ad0d21c997d18ee7a23692ae60a0 1fd9c1741d864d01cd7ec6d67227b92d7bfabf22 2024-05-08T20:06:43+08:00 Ren Xuancheng llama : add BPE pre-tokenization for Qwen2 (#7114)
4cd621c26de2095cd7c4464bdec5fe2e696ef3f3 7e0b6a7b3ba94ff624dc27c1e0e735fded8819b8 2024-05-08T06:43:23-04:00 DAN™ convert : add BPE pre-tokenization for DBRX (#7132)
af0a5b616359809ce886ea433acedebb39b12969 b6aa6702030320a3d5fbc2508307af0d7c947e40 2024-05-07T23:07:58+02:00 Johannes Gäßler server: fix incorrectly reported token probabilities (#7125)
3af34c1d1b0da47f85b95f60922abeded1cb5d33 04976db7a819fcf8bfefbfc09a3344210b79dd27 2024-05-07T19:51:31+02:00 RhinoDevel main : update log text (EOS to EOG) (#7104)
889bdd76866ea31a7625ec2dcea63ff469f3e981 6fbd43221167bf96112f899daf22c127b282cbcf 2024-05-05T01:19:30-04:00 DAN™ command-r : add BPE pre-tokenization (#7063)
03fb8a002df2e96104f9e06de9c78d2a8ed91e92 92139b90af4841d7fd060b526bdd443b621770ff 2024-05-04T12:06:40+03:00 maor-ps If first token generated from the server is the stop word the server will crash (#7038)
92139b90af4841d7fd060b526bdd443b621770ff a2ac89d6efb41b535778bfeaecaae8fe295b6ed3 2024-05-04T08:32:32+03:00 Georgi Gerganov tests : add test-tokenizer-0.sh + fix some tokenizers (#7036)
f4ab2a41476600a98067a9474ea8f9e6db41bcfa 3f167476b11efa7ab08f6cacdeb8cab0935c1249 2024-04-29T16:58:41+03:00 Georgi Gerganov llama : fix BPE pre-tokenization (#6920)
7f5ff558eed0f732af8f25c2ab0645610bdec80c 9e4e077ec50fde6049b128662c72d37a3c28e34b 2024-04-26T12:15:30+02:00 Pierrick Hymbert server: stop generation at `n_ctx_train` if `n_predict` is not set (#6638)
37246b1031b1680c0dcaf20aef736d6b446203fa 28103f4832e301a9c84d44ff0df9d75d46ab6c76 2024-04-24T05:15:29-05:00 Kyle Mistele common : revert showing control tokens by default for server (#6860)
3fec68be4e9577fc53158366d3b3af039c17bb1f c8297c6af5693555652c40b95974b95d49d2674d 2024-04-24T15:16:21+08:00 Junyang Lin convert : add support of codeqwen due to tokenizer (#6707)
c8297c6af5693555652c40b95974b95d49d2674d 4e96a812b3ce7322a29a3008db2ed73d9087b176 2024-04-24T15:00:37+08:00 liuwei-git llama : add phi3 support (#6852)
8960fe86ae075c846c5df8848230d1904ba8877f c0956b09ba845a7cd787d5580d7c8b96e80f40f5 2024-04-22T15:41:11+03:00 Georgi Gerganov llama : fix typo in <|im_end|> token text (#6745)
40f74e4d739e9250431cf339ae7588b28d8d0663 b9cc76d87e3d7ae5900f19d4fe8f8976d0a35888 2024-04-21T18:36:45+03:00 Georgi Gerganov llama : add option to render special/control tokens (#6807)
7dbdba5690ca61b3ee8c92cfac8e7e251042e787 c1386c936e9fbc38eb2816c711ab28f13355708e 2024-04-21T15:03:39+02:00 Wouter llama : add llama-3 chat template (#6751)
b97bc3966e852adb626c90be64fd48282800f504 b8109bc0139f15a5b321909f47510b89dca47ffc 2024-04-21T13:50:41+02:00 Pedro Cuenca llama : support Llama 3 HF conversion (#6745)
03c0946d73c63ea73e1d85015b7088298443d438 e11b2e6e1e18522ca7cf129600875a0f6fb9307d 2024-04-18T13:49:01+02:00 Sigbjørn Skjæret convert : support models with multiple chat templates (#6588)
8cc91dc63c0df397d644a581b2cbeea74eb51ae0 dbceec87c0221ec952e69448df6a71f1372a7487 2024-04-16T14:55:30-04:00 Justine Tunney ggml : add llamafile sgemm (#6414)
4fbd8098e63670c6ae11a8adc350f5ba191cfda3 7593639ce335e8d7f89aa9a54d616951f273af60 2024-04-16T08:13:13+02:00 Daniel Bevenius gguf : add special tokens metadata for FIM/Infill (#6689)
1b67731e184e27a465b8c5476061294a4af668ea c4a3a4ff47d62d2503ddf9bd91b58c21f04fe3c3 2024-04-09T13:44:08-04:00 Jared Van Bortel BERT tokenizer fixes (#6498)
5dc9dd7152dedc6046b646855585bd070c91e8c8 e11a8999b5690f810c2c99c14347f0834e68c524 2024-04-09T09:16:13+01:00 Carolinabanana llama : add Command R Plus support (#6491)
75cd4c77292034ecec587ecb401366f57338f7c0 a8bd14d55717754a1f48313a846a2b16fa998ad2 2024-04-06T05:40:47+02:00 Pierrick Hymbert ci: bench: support sse and fix prompt processing time / server: add tokens usage in stream OAI response (#6495)
db214fa578e00b01e0884fc2725c9349608bdab5 1ff4d9f3d683f02ef8a12e04bfac84300c44bd3a 2024-04-03T21:12:52+05:30 Abhishek Gopinath K Missing tokenizer.model error during gguf conversion (#6443)
1ff4d9f3d683f02ef8a12e04bfac84300c44bd3a 076b08649ecc3b0e1c0709c2a086a63eddd1bf32 2024-04-03T23:24:31+08:00 kaizau Add OpenChat, Alpaca, Vicuna chat templates (#6397)
057400a3fd457f4f214684eeb171444663b47a23 b75c38166cf0c66793a32d5c3d6cb69929dd083d 2024-03-29T08:23:22+01:00 Daniel Bevenius llama : remove redundant reshape in build_kv_store (#6369)
b75c38166cf0c66793a32d5c3d6cb69929dd083d bfe7dafc9cf96b9a09ead347fed9a547930fc631 2024-03-29T08:15:00+01:00 Pedro Cuenca convert : allow conversion of Mistral HF models (#6144)
557410b8f06380560155ac7fcb8316d71ddc9837 55c1b2a3bbd470e9e2a3a0618b92cf64a885f806 2024-03-26T10:46:41-04:00 compilade llama : greatly reduce output buffer memory usage (#6122)
e097633f63fdd26d492844f7eff056e4083fd9eb d25b1c31b07c3675443a55a828dd58cfef5a241c 2024-03-26T13:32:19+01:00 Pedro Cuenca convert-hf : fix exception in sentencepiece with added tokens (#6320)
94d1b3b4119209efcdd08df0dceaecbd1fe7f85c 95562175f83a49755ff6fd3bad09409417c8e6f9 2024-03-23T18:48:02-04:00 Jared Van Bortel use _wfopen instead of fopen on Windows (#6248)
1d0331c12a2f2a6296b471232bd4e66fbf06e6a1 dba1af612926cbd4ebe2d876277af1e3305177e0 2024-03-22T19:47:14+01:00 Kawrakow quantize: options for output and token embedding tensors qtype (#6239)
bd60d82d0cc8b6852ec535495a5042dbdf05de24 6c0b287748327741b113d7d6018b68c63039b1c5 2024-03-20T01:33:49-04:00 Jared Van Bortel server tests : more pythonic process management; fix bare `except:` (#6146)
b0bc9f4a9da7c19f4779106ea83b23feca747566 4755afd1cbd40d93c017e5b98c39796f52345314 2024-03-15T09:22:24+01:00 slaren llama-bench : use random tokens to improve accuracy with mixtral (#6069)
044ec4b2a567f649459ccd20af2f387c784faa51 77178eedc83d49f31bf757d8e12315d76460be78 2024-03-14T15:14:14+02:00 Georgi Gerganov embedding : add EOS token if not present (#899)
f30ea47a87ed4446ad55adb265755dc9102956a2 d8fd0ccf6ac8b07791ffd1575eed436930854ae3 2024-03-13T18:54:21+01:00 slaren llama : add pipeline parallelism support (#6017)
7ab7b733bb48250b2df26c12b00256ef42c76932 d9f65c97c3dc3aa6fa27470b8c6e69b437ec1a27 2024-03-11T04:03:17+08:00 Dean android : fix utf8 decoding error (#5935)
621e86b331f8b0e71f79fd82a4ae1cd54c3e4396 77d1ac7e00bf049b9f2bba1b5a310a78318c49c4 2024-03-09T23:41:49+01:00 Pierrick Hymbert server: benchmark: chat/completions scenario and other llm servers comparison (#5941)
0db32beaf09d90b8959d3d0cc493ed1e45685353 8a3012a4ad08112bb3dc3f1399afec4e93780c44 2024-03-09T11:16:53Z Alexey Parfenov server : fix passing prompt as tokens (#5955)
c2101a2e909ac7c08976d414e64e96c90ee5fa9e 515f7d0d4fce41c752fc253acf30707c3be2531e 2024-03-08T17:31:00-05:00 compilade llama : support Mamba Selective State Space Models (#5328)
515f7d0d4fce41c752fc253acf30707c3be2531e 76e868821a94072fbc87cb1fcca291694319eae8 2024-03-08T10:53:37-05:00 compilade llama : fix quantization of shared token_embd (#5944)
76e868821a94072fbc87cb1fcca291694319eae8 e457fb3540e0aaec47cfde0abf784c213f9216ee 2024-03-08T12:25:04+01:00 Pierrick Hymbert server: metrics: add llamacpp:prompt_seconds_total and llamacpp:tokens_predicted_seconds_total, reset bucket only on /metrics. Fix values cast to int. Add Process-Start-Time-Unix header. (#5937)
af37fd8b30e37ccbffdd82e6f48559e2fb7ce7dd 581ed5c4fe3a8909aaa8313633ac443f471ba755 2024-03-08T12:40:02+02:00 Georgi Gerganov server : fix EOS token detection with disabled cache (#5938)
2002bc96bf2cbf5ab981a17d7e994d817c9801f5 ceca1aef0738b57951cd12c603c3477e75312dec 2024-03-07T11:41:53+02:00 Georgi Gerganov server : refactor (#5882)
21b08674331e1ea1b599f17c5ca91f0ed173be31 6a87ac3a52668e117d97bcea07b529c93188b303 2024-03-05T16:08:35+08:00 Neo Zhang Jianyu [SYCL] fix mul_mat fault in CI/unit-test (#5862)
29ae62d2ae163e2b68aa0ad3bf2ab4636de0c957 e0843afe1b37890b631bc7d3d2da2ed36c862b91 2024-03-04T22:31:20+02:00 Georgi Gerganov llama : fix embeddings (#5796)
5a51cc1bb4592f0d71f9af89cd08b11a066ba447 67be2ce1015d070b3b2cd488bcb041eefb61de72 2024-03-04T02:57:20-05:00 DAN™ main : support special tokens as reverse/anti prompt (#5847)
9731134296af3a6839cd682e51d9c2109a871de5 4a6e2d6142ab815c964924896891e9ab3e050632 2024-03-02T22:00:14+01:00 Pierrick Hymbert server: tests: passkey challenge / self-extend with context shift demo (#5832)
4d4d2366fc9c54d4a275065cfe9299c6cf7c5b78 c7a0ad8ec9ebb5ddb1c1c80c82f2ee041c525d47 2024-03-02T12:27:26-05:00 Jared Van Bortel convert : automatically fall back to HfVocab if tokenizer.model doesn't exist (#5821)
177628bfd85565070916ad66a5ac4071ee0527d8 6c4416868df2e5455da7d20547f62bcf9735ba8e 2024-02-28T02:51:11-06:00 Douglas Hanley llama : improve BERT tokenization (#5740)
f7625019c51ca437a5840576d92362cfa710e4a2 abbabc5e51d0d4656b438aec10b7fae9479ef37d 2024-02-25T13:43:50-05:00 compilade server : fix crash when system prompt is bigger than batch size (#5714)
525213d2f5da1eaf4b922b6b792cb52b2c613368 fd43d66f46ee3b5345fb8a74a252d86ccd34a409 2024-02-24T12:28:55+01:00 Pierrick Hymbert server: init functional tests (#5566)
15499eb94227401bdc8875da6eb85c15d37068f7 96633eeca1265ed03e57230de54032041c58f9cd 2024-02-22T17:05:23-05:00 Jared Van Bortel mpt : do not duplicate token_embd.weight on disk (#5670)
96633eeca1265ed03e57230de54032041c58f9cd 847eedbdb2d1ebf14ef56eb507d4b4b975510908 2024-02-22T23:23:46+02:00 Georgi Gerganov gemma : use more bits for the token_embd.weight tensor (#5650)
73122473ffd73030146276dbb85da7c8021a3ee4 0d4177126b0556e202efb85bf3f768be81076400 2024-02-15T14:14:37+01:00 Michaël de Vries fix(gguf-py): special tokens are no longer skipped when add_<token>_token is set to false (#5487)
c4e6dd59e45ef7b14f7763fb073b517395dc176c 037259be689353081e7bae3c1ab4ab18e7fbe8c9 2024-02-13T18:18:16+02:00 Aarni Koskela llama : allow raw byte in SPM vocabs; don't crash on nl 404 (#5478)
cf45252a7cfcb998bade46a886e20477cecc538a 03bf161eb6dea6400ee49c6dc6b69bdcfa9fd3fc 2024-02-13T15:14:22+02:00 Georgi Gerganov tests : multi-thread the tokenizer tests (#5474)
49cc1f7d67de2da99f3ac185f9ff1319b7bf35f8 99b8b43d7b185a6483f28cf798a2d968b2e16ca7 2024-02-13T13:01:29+02:00 Georgi Gerganov bert : add tests + fix quantization (#5475)
2891c8aa9af17f4ff636ff3868bc34ff72b56e25 97a336507ed9b971d72262bec7e2b8b7016a054a 2024-02-11T10:21:38-06:00 Douglas Hanley Add support for BERT embedding models (#5423)
684780141a08200ec98eba3e982dbafd1d0b5000 85910c5b30f6e268321be8df044f5528a6efac52 2024-02-11T13:38:14Z Alexey Parfenov server : allow to specify tokens as strings in logit_bias (#5003)
0ef46da632c32faa1a538e5dc180994e8bbb46e1 ee1628bdfea8b0079fed0140ac2f00ef1b465b57 2024-02-07T02:17:25-06:00 Xiao-Yong Jin llava-cli : always tokenize special tokens (#5382)
316c7faf7740fa98ea68f1445f4505810f706b9e f3e2b4fa3f81a410ecb7dec929c259ef8d8dbb7d 2024-02-07T14:15:56+08:00 runfuture llama : add MiniCPM support (#5346)
906cff55c2848fda091d888a1585915ec0c9ea9e 098f6d737b65134cf220d12b9b706e8cfc5e4610 2024-02-06T07:47:22+02:00 Georgi Gerganov py : handle byte tokens in `get_token_type` (#5341)
e1e721094d8169636d55f68efe37f222cd3f0677 128dcbd3c9c4b12f42b560a4430427d7b2828628 2024-02-01T23:20:13-08:00 Ian Bull llama : fix memory leak in llama_batch_free (#5252)
e6f291d15844398f8326940fe5ad7f2e02b5aa56 4003be0e5feef320f3707786f22722b73cff9356 2024-01-30T20:17:30+02:00 Georgi Gerganov server : fix context shift (#5195)
e76627bcce9f77adb6034cb127b7ec93d4287b69 fbe7dfa53caff0a7e830b676e6e949917a5c71b4 2024-01-29T18:24:19+09:00 Sang-Kil Park py : improve BPE tokenizer support (#5189)
9241c3a2ace544aef708334e54bbdddb90208ee8 b2b2bf988c098851b4f3831f0cf38394bff75121 2024-01-28T09:59:49+01:00 Johannes Gäßler Apply min_p to unsorted tokens (#5115)
44879ee885f48ecf4675dd216b373dce0a6f3690 9ecdd12e95aee20d6dfaf5f5a0f0ce5ac1fb2747 2024-01-23T15:17:20+02:00 Kawrakow Additional KL-divergence statistics (#5081)
d6bd4d46ddb6926087c11e0f6633ab1c81da58c3 152d9d05e097e35f1cac21262946d57faec7542a 2024-01-22T06:21:52-05:00 compilade llama : support StableLM 2 1.6B (#5052)
8b20858e5e9c44b99b4b31ae9c40b8f20d01d94f 57e2a7a52a819883f40dada8a2edc24ecf48186b 2024-01-19T10:45:06+02:00 Georgi Gerganov perplexity : faster Winogrande via batching (#5024)
ad19812cda4062c9f154ef16315df41fbe6a770a 682986a08eb5cb04865d2e713449f17304d266d8 2024-01-18T15:33:01+02:00 Georgi Gerganov perplexity : faster HellaSwag via batching (#5017)
4f4bf35f46600441dec2f941e667291eeb9a18d8 2b3a665d3917edf393761a24c4835447894df74a 2024-01-17T15:45:03+02:00 Georgi Gerganov py : fix missing added_tokens_dict for SPM and BPE vocabs (#4971)
cec8a4847062fbd76253e3b085683f39d91e80d3 334a835a1ccc8106a5fa355683a965efb1bfa24b 2024-01-16T18:54:24+01:00 Daniel Bevenius finetune : add training data file to log message (#4979)
f172de03f11465dc6c5a0fc3a22f8ec254c6832c 2d57de525541247132e354f561ff48775fba5d85 2024-01-13T18:47:38+02:00 Georgi Gerganov llama : fix detokenization of non-special added-tokens (#4916)
df845cc982e7e2ea7b9900e29d55b15338faa78d 6b48ed089377330cdb362970a51c1c89b6d857a8 2024-01-13T17:29:43+01:00 David Friehs llama : minimize size used for state save/load (#4820)
722d33f34ec74c6f7046109f936d0928ffe171bc c30b1ef39aeba497a943416d2897d69fee055b96 2024-01-14T00:09:08+08:00 Yann Follet main : add parameter --no-display-prompt (#4541)
ee8243adaa9a9f51ff449213383874e49efe368f 15ebe59210e7fd9817ff67f51fa1a5ee2d004294 2024-01-13T14:16:11Z makomk server : fix crash with multimodal models without BOS token (#4904)
3ca63b4538dfc78aaec88cd2c3e3f8417c1924e3 b0377875488b33f7114138687d828da1de61775d 2024-01-11T22:43:05+02:00 Georgi Gerganov main : disable token count by default (#4874)
d8d90aa343c22fe01429d3540e47ded87e9dcb9d 43f76bf1c362c067fce46bb8dcda0b64af8a9533 2024-01-11T17:22:34Z Someone ci: nix-flake-update: new token with pr permissions (#4879)
43f76bf1c362c067fce46bb8dcda0b64af8a9533 2f043328e3116724d15b915b5c6078e2df860a69 2024-01-11T16:14:52Z pudepiedj main : print total token count and tokens consumed so far (#4874)
6efb8eb30e7025b168f3fda3ff83b9b386428ad6 36e5a08b203542dca53cca4eaf172c5dc4bbc991 2024-01-09T13:46:46-05:00 Austin convert.py : fix vanilla LLaMA model conversion (#4818)
128de3585b0f58b1e562733448fc00109f23a95d 8c5833031857c9e9ada61948bae894ab9c785f86 2024-01-09T05:02:05-05:00 Behnam M server : update readme about token probs (#4777)
dd5ae06405c5565b99889bdb3f168f4351252cfb 668b31fc7d86245435ad6574e0e1126e734049e2 2024-01-08T16:02:32+01:00 Kawrakow SOTA 2-bit quants (#4773)
c75ca5d96f902564cbbbdd7f5cade80d53c288bb 96e80dabc6e73ff68b09b68947b1fc25883c5094 2024-01-06T16:12:59+01:00 Daniel Illescas Romero llama.swiftui : use correct pointer for llama_token_eos (#4797)
012cf349aec8ffb47c9def5dc018240fa3721e8b a91928014fcf51fe297823fcff0788de4f14206e 2024-01-04T19:56:33+02:00 Georgi Gerganov server : send token probs for "stream == false" (#4714)
0ef3ca2ac62016c0c545de1c89dc2e3e130f4a99 540938f8904707dd74cb3be18495f853b312e72f 2024-01-02T15:48:49Z Phil H server : add token counts to html footer (#4738)
0040d42eeb237197054cc7790df5776eacfa608e 83e633c27efdf0eb0ba54249e784b0ea760b1007 2024-01-02T06:15:16-08:00 Marcus Dunn llama : replace all API facing `int`'s with `int32_t` (#4577)
65e5f6dadbba4b496bba27f573e473c66b446496 ea5497df5d138c83b2b0ca70aefdc4b1175c1001 2023-12-28T11:20:00-08:00 Justine Tunney Fix OpenAI server sampling w.r.t. temp and seed (#4668)
f56d6077d0c37e6606ac0a4fa3169de70593acfe dc68f0054cd279cddddb0cae0c9ef4f9cbaa512a 2023-12-27T17:37:25+09:00 wonjun Jang Add byte token type when tokenizer.model is not exists (#4641)
7082d24cec35e9ce9147535a2224dfc67ee0a78c ba661751322a7c201fd3bef71af077c5aebfaa2a 2023-12-22T17:05:56+01:00 LeonEricsson lookup : add prompt lookup decoding example (#4484)
880e352277fc017df4d5794f0c21c44e1eae2b84 66f35a2f48e1965a13835a523e677223dbf148be 2023-12-21T18:07:34+01:00 howlger py : open merges file as 'utf-8' (#4566)
b9e74f9bca5fdf7d0a22ed25e7a9626335fdfa48 3c04bf6da89eaf4c7d317e0518f0687dfcbf2de7 2023-12-18T17:27:47Z Ebey Abraham llama : add phi-2 + fix NeoX rope + ggml_mul_mat_set_prec (#4490)
2994f0c5a2e8c96955b422dedc93ec2595d16b82 b1306c439490c7fa4ec33594500d980d1e9e15e6 2023-12-17T19:39:02-05:00 Jared Van Bortel decode : fix logits_valid for legacy API (#4516)
f7f468a97dceec2f8fe8b1ed7a2091083446ebc7 919c40660fd27157b391b5832d2a577d5afef4cb 2023-12-17T10:45:46-05:00 Jared Van Bortel gguf-py : fail fast on nonsensical special token IDs (#4489)
873637afc7924f435ac44c067630a28e82eefa7b 0353a1840134b24b07ab61fd4490192f28c4db6b 2023-12-14T17:09:34+09:00 wonjun Jang convert : support loading vocab from fast tokenizer config (#3633)
948ff137ec37f1ec74c02905917fa0afc9b97514 4d98d9a65665eee3838cef936641f640e3f5b649 2023-12-13T23:57:15+04:00 shibe2 server : fix handling of characters that span multiple tokens when streaming (#4446)
799a1cb13b0b1b560ab0ceff485caed68faa8f1f fecac45658a99eddc4d6e36ba0310ca8f87a77f0 2023-12-13T13:04:25+01:00 slaren llama : add Mixtral support (#4406)
6391817cd19a4507c6c941a1fd08756268662b2d d9d4cfef64ea416dd66632173787d03ffb180cc7 2023-12-12T04:25:57-05:00 crasm llama : document logits_all deprecation (#4418)
e18f7345a300920e234f732077bda660cc6cda9c fe680e3d1080a765e5d3150ffd7bab189742898d 2023-12-09T16:29:27-05:00 Xiang (Kevin) Li grammar : revert the replacement of llama_token_to_piece with id_to_token (#4396)
5f6e0c0dff1e7a89331e6b25eca9a9fd71324069 5aa365d88fdb8fdd430ef3fc141c7a5fd37c3502 2023-12-05T10:55:12-10:00 Marcus Dunn grammar : pre-computed pieces + reserve mem + less string copies (#4330)
23b5e12eb5a76489b4c3ee22213a081da68b1809 d208995c6da66f252d4054c1c5a90eb8ccb7a2f7 2023-12-04T17:04:21+01:00 Daniel Bevenius simple : update error message for KV cache check (#4324)
5c9f90cba1cc6b0a2a7d19ee5dcb73cad6331d30 4fa44e84adb4c78e1885694cc3513982d4af2b08 2023-12-04T22:43:45+09:00 Miwa / Ensan swift : fix prompt tokenization logic (#4321)
b220222a64ce760bfbec9c770f11db3ec6a6abb6 511f52c334e37033f9c9de07b98fca4abc9470bd 2023-12-02T03:19:45+09:00 Miwa / Ensan swift : fix token_to_piece implementation (#4278)
b18c66ca6eee4fe0465cff5042daf05005dc9ab2 f4d973cecb7368c985720ba9100ae6abba14806d 2023-11-30T22:43:08+01:00 Daniel Bevenius llama : fix alignment of general.name in print meta (#4254)
8406b0924bf323f37d536dee8b8165c1f3d9d11d b38a16dfcff88d547f78f52d1bea31b84a05aff7 2023-11-28T10:32:03+02:00 Georgi Gerganov ggml : re-enable BLAS for CPU when src0 != F32 + remove redundant full offload checks in llama.cpp (#4240)
922754a8d60080e956891f6cee1fb03aa48d57c6 22da05536ff4ad963080773bef1fb839fdab95d3 2023-11-26T20:33:07+02:00 Georgi Gerganov lookahead : add example for lookahead decoding (#4207)
f837c3a992b2b6146936cb120871a8cf9d0e3857 3014b5415d08e3dff961da6eea835b9760a701b8 2023-11-25T08:58:23-08:00 Marcus Dunn llama : grammar `reserve` space in `decode_utf8` (#4210)
af19d3573481d409b3c4e55494810eb1f65a9aae e9c13ff78114af6fc6a4f27cc8dcdda0f3d389fb 2023-11-25T11:29:06+02:00 Georgi Gerganov server : OAI API compatibility (#4198)
2568a4bf548d7392e9c78c008b33b4c11d53fe95 b35f3d0def3efde92ed465d92a267430d957e87d 2023-11-24T18:25:10+09:00 eastriver main.swift : fix eos checking (#4197)
40a34fe8d034bd484efd79ccbb95059ca6308dcb dae06c06e5c6232ae2be4d567dd5101e1e96c814 2023-11-20T03:50:04-06:00 Branden Butler speculative : fix prompt tokenization in speculative example (#4025)
35985acffaab1eb4ffcbc22c86063bc630f24a89 e937066420b79a757bf80e9836eb12b88420a218 2023-11-19T18:50:49+02:00 Georgi Gerganov gitignore : tokenize
28a2e6e7d476717881be6eb9e2d3331342cec57b 0b5c3b04572a05f80163a365070fb377a837ac27 2023-11-18T14:48:17-07:00 Kerfuffle tokenize example: Respect normal add BOS token behavior (#4126)
5ad387e994dde77a47ec547a4a65f7611dc325f4 2fa02b4b3d86182381311c98b75065ee1b7c2930 2023-11-17T18:01:38+02:00 Georgi Gerganov tokenize : fix trailing whitespace
2fa02b4b3d86182381311c98b75065ee1b7c2930 2ab0707acbf3a3ca9e5bc5959c7920c22eba2257 2023-11-17T17:36:44+02:00 zakkor examples : add tokenize (#4039)
91f6499393d2d999331fbfdba47a7f8b9f913f0d 8da46278e1a57107591653275f8e03a281de94f0 2023-11-16T19:14:37-07:00 Kerfuffle Respect tokenizer.ggml.add_bos_token value when tokenizing (#4040)
a6fc554e268634494f33b0de76f9dde650dd292f 1cf2850d52bb027aa215e039ed9a0c61beeef8d3 2023-11-15T11:34:47-05:00 Jared Van Bortel llama : restore prefix space in llama tokenizer (#4081)
34b0a082074b073eb14c2bd93c0c070e20ddcd16 4a4fd3eefad5bd17ab6bcd8e2181b4f62eae76cf 2023-11-10T22:04:50-07:00 Kerfuffle gguf-py: Refactor and allow reading/modifying existing GGUF files (#3981)
238657db2364cfb728c694470a4a81702afea760 07178c98e1b61a5e2af39d347add12e7eb9e08e1 2023-10-31T14:44:49-05:00 kalomaze samplers : Min-P sampler implementation [alternative to Top P/Top K] (#3841)
6e08281e588bbba1a5d180290a94a43f167f3a1a 2046eb4345e62c4575b3cdc0115a51db89f3fb70 2023-10-29T11:31:40-06:00 Kerfuffle Extend llama_kv_cache_seq_rm to allow matching any sequence (#3843)
8a2f2fea2914aaa3f4b2f82800c7de15f15bdb09 bd6d9e205982b34e0ba2c3b22bbf31a1ef1a1bb5 2023-10-28T15:25:15+03:00 Georgi Gerganov convert : ignore tokens if their IDs are within [0, vocab_size) (#3831)
ee1a0ec9cb367ba41d138134795cbbbe93d2bf1c 177461104b454163473dced2a5038f4e016cdb7e 2023-10-28T14:23:11+03:00 Georgi Gerganov llama : add option for greedy sampling with probs (#3813)
daab3d7f45832e10773c99f3484b0d5b14d86c0c 469c9addef75893e6be12edda852d12e840bf064 2023-10-24T09:17:17+02:00 Galunid Add more tokenizer tests (#3742)
69a6735087c3634963c642fd69f0851ac479cd78 5be6c803fa5378f62a1590f3ad8c6b64c7c0c2ce 2023-10-23T21:46:00+02:00 Galunid Update special token handling in conversion scripts for gpt2 derived tokenizers (#3746)
5be6c803fa5378f62a1590f3ad8c6b64c7c0c2ce 6336701c9378c23c85d1c0e464b663ca2bbb8e60 2023-10-23T12:40:03-07:00 Marcus Dunn llama : remove token functions with `context` args in favor of `model` (#3720)
438c2ca83045a00ef244093d27e9ed41a8cb4ea9 9e70cc03229df19ca2d28ce23cc817198f897278 2023-10-22T22:53:08+03:00 Georgi Gerganov server : parallel decoding and multimodal (#3677)
9e70cc03229df19ca2d28ce23cc817198f897278 5a42a5f8e8a86da9ac88008d748cf232a83aa0e1 2023-10-22T21:21:42+02:00 goerch Add test for MPT tokenization (#3728)
a5e7dbd6141128bfa3c40a19c2945a181df625d3 d3956aea53369455008159cc405ed4c496976692 2023-10-22T12:14:56-06:00 Kerfuffle llama : validate special token ids are in range when loading GGUF model (#3635)
d3956aea53369455008159cc405ed4c496976692 22c69a27945e7acf9690dd3210d316f22182751c 2023-10-22T20:09:51+02:00 vvhg1 main : escape prompt for cfg_negative_prompt and consecutive inputs in main with interactive (#3623)
40e5ce054f4c4fa555e4510ea5f760bb29185332 a5e8c1d8c71f01d98ae2ec63a57c118664f9764d 2023-10-11T21:30:06+04:00 shibe2 CLBlast: Fix temporary buffer size for f16 conversion (wsize)
1a159553f921a9209fed8c714494e57b3649f232 281ef73c258cc1eebec8a64264240432d5878c4b 2023-10-17T17:11:01+02:00 staviq tokenizer : special token handling (#3538)
940efa95fec0b8a98c226a889d2ad839dfeeae0d 11bff290458f12f020b588792707f76ec658a27a 2023-10-16T23:58:00+03:00 Georgi Gerganov llava : fix tokenization to not add bos between image embeddings and user prompt (#3645)
2a4bcbacead886996f175f33479d1d874a3e577f 424b6381c4daeed62e6600e0402e72f39845b58d 2023-10-13T12:33:16+02:00 Daniel Bevenius llama : remove n_threads from llama_decode_internal (#3614)
233fc1c69f6f415f35363e18a755f9610e89161b c5b49360d0d9e49f32e05a9116e90bd0b39a282d 2023-10-10T18:59:52+02:00 goerch Minor improvements in GPT2 tokenizer (#3567)
f5f9121de140eff558f13b5c5e78a3a3b6b94377 11ea5c7d96f2c28e1c99659e08ec0a44574056e2 2023-10-10T09:50:23+02:00 Jan Ploski llm : add MPT support (#3417)
11ea5c7d96f2c28e1c99659e08ec0a44574056e2 95bd60a0a69f57e9a2ff1269667ea484a1a9bb40 2023-10-10T09:31:21+02:00 vvhg1 infill. : fix tokenization (#3508)
3a716b4dae545c3db307594fbc509a95d3e21b6e 1faaae8c2bdc4a21302e367e0754c3fe74a8113e 2023-10-07T06:57:01+02:00 goerch Fix for #3454 (#3455)
9ca79d5cbbc8d43f2bff951404b6a40ff1ee3788 0c731ca4039ccff86ffab90eaae4ca98037c4496 2023-10-06T10:10:13-06:00 Kerfuffle kv cache slot search improvements (#3493)
97af49fa395df77e4c18af0e1655b2fee67c9686 16820a5a0d885113f21021ce934f0b0027b9d69a 2023-10-06T07:44:24-05:00 Jhen-Jie Hong server : reuse llama_sample_token common util (#3494)
e8b8d32e8663ffc55a02c9721af3a5190382cbb0 8f3a642ec1d878b2d0a0d15e3a4277f522790d4c 2023-10-05T09:02:55-05:00 Jhen-Jie Hong server : fix incorrect num_tokens_predicted (#3480)
ac2219fef34eb5b713c286c34c6e4162c39c8f3b 48be797ffbd80b062f55778e09e97180eb25d2ab 2023-10-03T21:04:01+03:00 Georgi Gerganov llama : fix session saving/loading (#3400)
ff5a3f0c09dfa0a8e0bf76d1748df5c6dee0e8ff 1c84003c08027f5d3a4cb876f51d6b6224a34d0e 2023-10-03T09:16:26+02:00 goerch Work on the BPE tokenizer (#3252)
16bc66d9479edd5ee12ec734973554d4493c5dfa 0512d66670de3f650c579519833c085014b0f200 2023-09-28T21:42:38+02:00 slaren llama.cpp : split llama_context_params into model and context params (#3301)
0e76a8992c8200237bbc6471a53fb8796b3872f7 2db94d98eda56982d80238840b0652b4137a2a84 2023-09-28T20:40:11+02:00 xaedes train : finetune LORA (#2632)
ecf90b1a5114034bc0939b3968f549fe4d63cf6d 2619109ad57d7a75388a9cce51e5da645410d92e 2023-09-28T14:30:15-04:00 Cebtenzzre gguf : make token scores and types optional (#3347)
ec893798b7a2a803466cc8f063051499ec3d96f7 45855b3f1c7bdd0320aa632334d0b3e8965c26c4 2023-09-28T19:04:36+03:00 Georgi Gerganov llama : custom attention mask + parallel decoding + no context swaps (#3228)
b08e75baea294e366628b898e85c0bd359b58115 e6616cf0db2b63189fc34d0076f654af9adecdf8 2023-09-16T13:41:33+02:00 goerch Fixing the last deviations from sentencepiece indicated by test-tokenizer-1 (#3170)
35f73049af6c676a106a5a990a819ae0bc3fcd7d 71ca2fad7d6c0ef95ef9944fb3a1a843e481f314 2023-09-14T09:14:44-07:00 Leng Yue speculative : add heuristic algorithm (#3006)
71ca2fad7d6c0ef95ef9944fb3a1a843e481f314 1b6c650d16048d6427dd502a9627e72837265844 2023-09-13T15:19:44+02:00 goerch whisper : tokenizer fix + re-enable tokenizer test for LLaMa (#3096)
15b67a66c2f2d6032415b28a699b5131962318f1 be8c9c245bd129ebabb80e0a7a8dd7daeb4d30af 2023-09-07T15:52:34+02:00 slaren llama-bench : use two tokens in the warmup run for prompt evals (#3059)
c4f496648c1e32efeb714200e7eae7fc7cfbb223 fec2fb19e4229aac58c98171c46e77144b99f8a3 2023-09-07T15:49:09+03:00 Georgi Gerganov metal : fix kernel_norm (fixes Falcon on Metal) (#3057)
921772104ba2219bfdc2b2980d05ebc0aa0c92a4 2ba85c8609309a59d49c45ab43c31800b7ba141c 2023-09-05T08:46:17+03:00 Georgi Gerganov speculative : add grammar support (#2991)
37301347767d555d0a66c043ce4ef6ead8e61c55 d9151e6f570eb20bfd54427bd8a337d9b1a08018 2023-09-03T19:18:09+09:00 opparco llama : fix bpe tokenize from byte (#2889)
afc43d5f82588d2ed71ea104e8262f5e5da13980 6460f758dbd472653296044d36bed8c4554988f5 2023-09-03T11:48:49+03:00 Alon cov : add Code Coverage and codecov.io integration (#2928)
cff7b0bf07cb46e1ad4fd199f6bdeb538925c8c4 340af42f09a80e32f4998857b4f0543e41124525 2023-09-02T23:52:13-06:00 Kerfuffle convert.py : BPE fixes (#2938)
950929442070874d45561d2a4b68b010457767de 35092fb54712d032860f3976a6fc1ae1f84a4a28 2023-08-30T12:42:51+03:00 alonfaraj make : add test and update CI (#2897)
dc07dc492ef9640bbb82904d7c7679f7bdcf6d76 ad9ddcff6ef322db5cf13785bd7c856b610d242e 2023-08-30T02:25:50-06:00 Kerfuffle convert : various script cleanups/fixes + merges and special token handling (#2842)
8341a25957b319a03d4a811176cd5ad7f2b0fbd4 849408957c687cde4ab32c147107f643fc55130b 2023-08-30T08:29:32+02:00 staviq main : log file (#2748)
fa3582f509a2715e80a473e79f88dcd1ebff44c2 e37e69dcc3d52f21222a63cafed2a71b3f6b53c6 2023-08-29T23:55:45+03:00 Kawrakow Tell users attmepting to run perplexity with too few tokens to use more (#2882)
e37e69dcc3d52f21222a63cafed2a71b3f6b53c6 53885d7256909ec3e2176cdc2477f3986c15ec69 2023-08-29T23:55:03+03:00 Kawrakow 10X faster BPE tokenizer (#2876)
44c117f41ee01c5ac8fb86bba041f08d8b87b46d 43033b7bb4858da4f591715b3babdf906c9b7cbc 2023-08-28T21:51:47+02:00 xaedes train : mem usage and other improvements (#2439)
230d46c723edf5999752e4cb67fd94edb19ef9c7 463173a6c0ff353055eb90665794884c888c790f 2023-08-27T15:13:31+01:00 Olivier Chafik examples : update llama2.c converter to read vocab and write models in GGUF format (#2751)
463173a6c0ff353055eb90665794884c888c790f eaa13a48ff4136f01c1cdb79cacd61b67ec53095 2023-08-27T16:50:33+03:00 Kawrakow llama : speedup tokenization (#2831)
edd4c1481708fcd788b0e423268304fd26e2b125 1591e2e590762011b43b10a9b6e04f13f98f2aa5 2023-08-27T14:19:19+03:00 Georgi Gerganov llama : more tokenizer fixes (#2810)
c1ac54b77aaba10d029084d152be786102010eb2 730d9c681e339b76407659344e5a2cd50af7d7d5 2023-08-26T16:11:45-07:00 Bruce MacDonald server : add `/detokenize` endpoint (#2802)
72f895c923ba98b8f2af294440206f35915c0501 50526f37eba0b28336700890242ff282b949cd83 2023-08-26T14:12:56-04:00 Dr. Tom Murphy VII Ph.D main : fix bug (penalize_nl=false doesn't work) + suppress warning on mingw (#1528)
2ba83c8685177faea3399db9564f9c52df75c366 bae5c5f679e043371bc2b4dffff8d4964d6cb953 2023-08-26T13:45:53+02:00 klosax Fix spm whitespaces (#2806)
c82742ac9cd96fd34aa961978805c1d8a361d589 28b2c996ca0ab90a5669946084f13443ec98e241 2023-08-25T11:18:48-04:00 Matt Pulver llama : add llama_beam_search() (#2267)
29674ab4e847fcaba60cc6558f0d46d5f74ae279 5439a0ab57c16b556ffa91a0953df5e46b1e7fb4 2023-08-25T18:32:45+08:00 Jhen-Jie Hong server : display token probabilities in the UI (#2489)
2e5f70a25fc4576e9ed78603fe493eb7702c37a3 d0f77b1353fc820d1ff1e6b87bc6bedde315938d 2023-08-24T14:49:30-07:00 Marcus Dunn Added `enum` to `llama_token_get_type` return type (#2774)
cf658adc832badaaa2ca119fe86070e5a830f8f6 a192860cfec89a38d59a943623bf595b1fe4495b 2023-08-23T23:08:04+03:00 Georgi Gerganov llm : add Falcon support (#2717)
95385241a91a616788a3bb76d12c9b7b2379ca2d 335acd2ffd7b04501c6d8773ab9fcee6e7bf8639 2023-08-23T20:33:05+01:00 Olivier Chafik examples : restore the functionality to import llama2.c models (#2685)
5290c38e6e9b66ee2b543e560e301c1a1a90929c cc34dbda9681418a2b18382446b90cdcec398d82 2023-08-23T16:46:03+02:00 klosax main : insert bos if no tokens (#2727)
b8ad1b66b23f9b2e6e4531e9a62753323036a556 f5fe98d11bdf9e7797bcfb05c0c3601ffc4b9d26 2023-08-23T02:12:12-05:00 Xiao-Yong Jin server : allow json array in prompt or content for direct token input (#2306)
777f42ba18b29f25c71ff8de3ecf97b8017304c0 46ef5b5fcf4c366e1fb27726b6394adbbf8fd0ea 2023-08-22T17:39:39-06:00 Kerfuffle Improve handling of special tokens in GGML to GGUF converter (#2725)
46ef5b5fcf4c366e1fb27726b6394adbbf8fd0ea c63bb1d16a70c03440671b76954bb767513cead8 2023-08-22T23:10:42+02:00 goerch llama : fix whitespace escaping in tokenizer (#2724)
6381d4e110bd0ec02843a60bbeb8b6fc37a9ace9 dadbed99e65252d79f81101a392d0d6497b86caa 2023-08-21T23:07:43+03:00 Georgi Gerganov gguf : new file format with flexible meta data (beta) (#2398)
cb1c0727bd59803b439b6a3af121c99e6393ff3d 9e232f0234073358e7031c1b8d7aa45020469a3b 2023-08-21T11:11:31+03:00 Kawrakow HellaSwag: split token evaluation into batches if needed (#2681)
220d9318647a8ce127dbf7c9de5400455f41e7d8 81844fbcfd93a162b7aeaea9e4f2ab1358f7f97e 2023-08-02T16:21:11+08:00 ldwang readme : add Aquila-7B model series to supported models (#2487)
ee1b497c985f61d6ec519c39fcfed78a3c6f1d06 d73b8d48b45d6e2c0ae9bb8c39623c4024adc275 2023-07-29T02:10:05+08:00 eric8607242 llama : support more diverse tokenizers? (#2420)
fce48caf9a6b9930eee9e2a5971428cdff403ba8 875086bdb95ce1f3294439811536533199e3b579 2023-07-25T21:22:09+08:00 ldwang convert.py : support bpe tokenizer (#2228)
84e09a7d8bc4ab6d658b5cd81295ac0add60be78 2f9cf974a066ac0e03fbb235d834b01b0164d743 2023-07-23T23:58:10-04:00 Evan Jones llama : add grammar-based sampling (#1773)
355c80f49e32b0b15c0a457f3bad380e57f5b9ac 83a00ce69bef9124c0702424a012ea799128b77d 2023-07-23T06:16:48-05:00 AustinMroz examples : simplify vim plugin (#2327)
1d1630996920f889cdc08de26cebf2415958540e db4047ad5cd8eae04db3b2efe0245e69a376601a 2023-07-09T05:59:53-03:00 oobabooga llama : remove "first token must be BOS" restriction (#2153)
f257fd255044decffad93dee2502875ce66ad80c 7ee76e45afae7f9a7a53e93393accfb5b36684e1 2023-07-05T03:06:12+09:00 jwj7140 Add an API example using server.cpp similar to OAI. (#2009)
cc45a7feb8412e84ff292207621412fffc0d3d51 55dbb915cc2a95048f56e667b09dfad38d840421 2023-07-04T02:43:55+08:00 Howard Su Fix crash of test-tokenizer-0 under Debug build (#2064)
d7d2e6a0f0c74f7a570dae384dfff371ac744d2a 46088f72318981341a2d646f12f6eee6aec06d65 2023-07-03T05:38:44+08:00 WangHaoranRobin server: add option to output probabilities for completion (#1962)
ca7c3f4da5d144d4cd1dd44903552e6ba49b8ec8 b97ca431db35ec96a339a721acb1219c1dd78bed 2023-06-19T18:14:09+03:00 Kawrakow cuda : faster k-quants on older GPUs (#1930)
b24c3049d96557c24782e4d32feaae65f47277af 0ede372a51fd8160688e01b587582666c14e94e5 2023-06-18T17:41:26+02:00 Johannes Gäßler Added tokens per second to info prints (#1928)
794db3e7b982fee37e3995db9c3a216a57ff65e3 5ddf7ea1fb42bac21026de2f77e0f9c069b92234 2023-06-17T07:53:04-04:00 Randall Fitzgerald Server Example Refactor and Improvements (#1570)
e32089b2c20b1b87b22912f4a8b93fe01647d5b9 2347e45e7bdb09c9a7d74b2c0bc86c2b65f0c343 2023-06-13T21:04:40+02:00 xaedes train : improved training-from-scratch example (#1652)
74a6d922f12ccfe16b0c265f43be8978c6f25e98 e4caa8da59c1c97dc23fa336f4d726984a20560f 2023-06-12T22:39:21+03:00 Kawrakow Metal implementation for all k_quants (#1807)
fa84c4b3e80199a5683438f062009c031a06c4fa 12b063f0ecf280e98028e444fc492ee6222cdcdc 2023-06-11T08:19:17-06:00 Kerfuffle Fix issue where interactive mode crashes when input exceeds ctx size (#1789)
e9b66ee9829039d4ab54550d6222e42a0b31e52a 4f0154b0bad775ac4651bf73b5c216eb43c45cdc 2023-06-10T11:28:11+03:00 Kawrakow metal : add Q4_1 implementation (#1785)
72ff5282bf0388c60821f504c4c8cc2b1f491aa6 0bf7cf1b296fc9fca05411b37afdf08a531487d2 2023-06-08T22:28:21+03:00 Kawrakow metal : add Q2_K implementation (#1762)
0f291e1f65c1d68201e71ce99c89562a36686b6d 8fc8179919a11738910db07a800f2b176f8adf09 2023-06-08T19:46:22+03:00 Kawrakow metal : Q6_K implementation (#1752)
4161bdc04debb70bf5f275492b4d89fd9330087c 0035858273ebe0694926bf4414d279f3e1cd109d 2023-06-08T10:08:23+03:00 Kawrakow metal : add Q4_K implementation (#1733)
99009e72f8072fa552eb02efee436be596c71cdd 5220a991a5e92bddad9542267ab445a2c033681c 2023-06-05T22:56:18+03:00 Kawrakow ggml : add SOTA 2,3,4,5,6 bit k-quantizations (#1684)
2e6cd4b02549e343bef3768e6b946f999c82e823 7e4ea5beff567f53be92f75f9089e6f11fa5dabd 2023-05-22T23:33:24+02:00 0cc4m OpenCL Token Generation Acceleration (#1459)
affc76edfdefa7b326f526e463cc65ff13fcfb92 ea600071cb005267e9e8f2629c1e406dd5fde083 2023-05-20T14:19:28+02:00 Johannes Gäßler cuda : loading models directly into VRAM, norm calculation on GPU, broadcasting for ggml_mul (#1483)
7694b52b9a206b93d59139c3c7c9b55da0f5aa59 79e3efb0e97b65b6cc72cd9ee970fa8189ad79a4 2023-05-19T10:24:59-07:00 Jason McCartney main : make reverse prompt option act as a stop token in non-interactive mode (#1032)
905d87b70aa189623d500a28602d7a3a755a4769 f954edda935a70a14cf0cc45ecc7fe7d60cf3e4b 2023-05-13T15:38:36+02:00 Johannes Gäßler ggml : GPU-accelerated token generation (#1412)
f954edda935a70a14cf0cc45ecc7fe7d60cf3e4b f048af0230ad5381bb20b9e3c1467ec6fc7debdf 2023-05-13T14:56:40+02:00 xaedes ggml : implement backward pass for llama + small training-llama-from-scratch example (#1360)
b9fd7eee57df101d4a3e3eabc9fd6c2cb13c9ca1 b608b55a3ea8e4760c617418538465449175bdb8 2023-05-12T00:23:08+03:00 Georgi Gerganov ggml : remove bit shuffling (#1405)
b608b55a3ea8e4760c617418538465449175bdb8 cf348a60e0af3905acd1d297cb064b918265b7ac 2023-05-11T10:10:19-05:00 CRD716 prompts : model agnostic DAN (#1304)
f9a6364912fd0463fddfdbc9ef9f79fdc281570d 95078cc554fe03d4512363c7e4dec963f0047c72 2023-05-08T17:41:54+03:00 Georgi Gerganov llama : require first token to be BOS (#1303)
018f2279f5fe3ef743bd8254b23ea8f0efae7e73 9411288271ab548216902a029f42a0a38ebcedb7 2023-04-22T02:27:06+08:00 源文雨 cmake : link threads publicly to ggml (#1042)
9411288271ab548216902a029f42a0a38ebcedb7 8687c1f2581d059cd5b6a9502f89bd343566062a 2023-04-21T11:18:09-07:00 Alex Klinkhamer main : evaluate tokens in batches after swapping context (#1014)
1bfc153e2f35ddd9d64b084e8d1a5e6fa57ad1c9 3d59769c3bb7e72c915646ddb1e239b1face19f5 2023-04-21T17:18:26+02:00 Kawrakow ggml : a faster version for Q4_1 x Q8_0 dot products (#1083)
884e7d7a2bfd7325b107442d6758983f5886ed3d 7cd5c4a3e9106151d48f328bb3c94c298a211f18 2023-04-19T20:10:08+03:00 Georgi Gerganov ggml : use 8-bit precision for Q4_1 intermediate results (#1047)
723dac55fa2ba7adc6e3fc8609781d1ad0378906 0f07cacb05f49704d35a39aa27cfd4b419eb6f8d 2023-04-14T00:03:03-07:00 comex py : new conversion script (#545)
e986f94829bae0b9e66b326acbbba179931c84f1 c0bb1d3ce21005ab21d686626ba87261a6e3a660 2023-04-02T12:23:04+02:00 Christian Falch Added api for getting/setting the kv_cache (#685)
cbef542879962fdc491656cd0c8cadd65a5f1356 9733104be5389ebb1ff05095eca2a70280cd875a 2023-03-29T21:31:24+02:00 Pavol Rusnak py : cleanup the code
2e17dfd80a473099dacc0f41c9146d233c6a5972 20a1a4e09c522a80e2a0db51643d25fa38326065 2023-03-23T15:22:47-05:00 rabidcopy Replace EOS with newline to prevent context/memory being flushed by EOS in interactive mode (#333)
a50e39c6fe36be3de0941b3c05aaf9c37912fd47 a140219e81cfb80356438112cd2290d701b282bb 2023-03-23T14:15:48Z Stephan Walter Revert "Delete SHA256SUMS for now" (#429)
8eea5ae0e5f31238a97c79ea9103c27647380e37 93208cfb929c2323e5d2ac6bf354e278040e70ed 2023-03-23T12:26:19+02:00 anzz1 Delete SHA256SUMS for now (#416)
305ba6f0e6daa3796aad9dd18053a1945dd4cc58 4122dffff958cd137175b58f1f27c0913528d7ba 2023-03-22T18:16:35+01:00 tjohnman Don't force immediate interactive without `-i` (#354)
56e659a0b271436e24813a801640d015e7b05328 40ea807a972ec7b5a426f034ebfa593b5e7a06ed 2023-03-22T17:09:38+01:00 Erik Scholz fix perplexity after c-api refactor (#390)
f5a77a629bd0f37ae1696747633ab42a5530ec15 da0e9fe90ccf6e73597eb19dd0cfc0a28363fb3b 2023-03-22T07:32:36+02:00 Georgi Gerganov Introduce C-style API (#370)
353ec251a42491f5192c48561da4b444ef67f23c 89d5d90f3b6d25f134da7a8e252c3432bffcf674 2023-03-21T14:21:50-03:00 Fabio R. Sluzala We could use std::unordered_map over std::map (#305)
486ae645fd3eda8b9d7413d5ff34fb65a3e337fb 3ab3e6582f7320c2b6568c892fdfc8215caf7e6c 2023-03-21T09:27:42-07:00 Gary Linscott Compute perplexity over prompt (#270)
6a612959e1b6c37b68b6b141329751a2902b1030 d5f56a5e5a0069329a81f96460221e7afb1daddc 2023-03-21T17:05:06+01:00 tjohnman Check for reverse prompt by characters instead of tokens (#292) (#330)
d5f56a5e5a0069329a81f96460221e7afb1daddc 3bfa3b43b7319b71853bfc7d3cf4e9767c24bbc8 2023-03-21T17:04:43+01:00 tjohnman Check for reverse prompt by characters instead of tokens (#292) (#330)
e0ffc861fae5ac8b40ce973f822d03db02929d36 8f644a0a859938c787d329d27f98e03c58d7df27 2023-03-21T08:34:49-07:00 Kevin Kwok Update IPFS links to quantized alpaca with new tokenizer format (#352)
eb34620aeceaf9d9df7fcb19acc17ad41b9f60f8 2e664f1ff413995506c9a54f3a8d5b8c64e37a91 2023-03-21T17:29:41+02:00 Georgi Gerganov Add tokenizer test + revert to C++11 (#355)
6b6d5b5024faaf82019d08cde5e8a9d69c6ca316 a791a68b613b162c88a83f5f0225223bc167c762 2023-03-21T03:33:10+08:00 Qingyou Meng Fixed tokenizer.model not found error when model dir is symlink (#325)
0f1b21cb90ac6b84a9af70cafb8e13b5389e3b32 074bea2eb1f1349a0118239c4152914aecaa1be4 2023-03-20T18:05:20+01:00 Bernat Vadell Docker - Fix publish docker image in GitHub Registry (#235)
074bea2eb1f1349a0118239c4152914aecaa1be4 5cb63e2493c49bc2c3b9b355696e8dc26cdd0380 2023-03-20T03:17:23-07:00 Mack Straight sentencepiece bpe compatible tokenizer (#252)
368d0c8a9ebae16a20e1c8971b21ee888bdefad5 50fae10d0339f2bd639f69dd679c0201d939a265 2023-03-19T19:31:17+01:00 tjohnman Respect the maximum number of tokens in interactive. (#298)
d7def1a7524f712e5ebb7cd02bab0f13aa56a7f9 6f61c18ec9a30416e21ed5abfb1321bdb14979be 2023-03-18T17:10:47-07:00 Ronsor Warn user if a context size greater than 2048 tokens is specified (#274)
a81d0c2a171a4446e6a21a3ec74a0c0768d71184 b2de7f18dfbb93463eeb5b4392117bbe82d5bd1b 2023-03-18T04:17:19-07:00 Gary Linscott Fix n^2 loop in tokenization (#254)
c9f670a17755311aa28c411f5c7f3c8c05434770 4f546091102a418ffdc6230f872ac56e5cedb835 2023-03-17T21:05:58+01:00 thement Implement non-greedy tokenizer that tries to maximize token lengths (#242)
956dfda8ad8cea7961e22e0384bbc315bf79aed2 113e685d18ac4edb20f647fd34b000941556f6a6 2023-03-15T12:37:50-07:00 Ronsor Use `tokenizer.vocab_size()` instead of hardcoding 32000 in convert-pth-to-ggml.py (#142)
460c48254098b28d422382a2bbff6a0b3d7f7e17 c80e2a8f2adeda202cbffe76ef800f134e51f03f 2023-03-13T00:35:51+01:00 Matvey Soloviev Fix token count accounting
Can't render this file because it contains an unexpected character in line 173 and column 173.
@@ -0,0 +1,940 @@
f131bf1908b8c5dd1f49d7ae7f616506fc471666 33d96dae28e17208ef61a71dba40cda3c04f135a 2026-05-27T09:38:51+08:00 wangbomeng fix patch of qwen2.5vl,n_patch of minicpm = 64,fix n_ctx_slot,comment out M-ROPE
ebce9e1a548c2329aa97f53b8b2ad50d968088dc e850ff4de25ad1221abc9bf3bb30df252ccd9c36 2026-05-27T09:38:00+08:00 Yunzhe Jia origin/runtime_replace Refactor cal-llm integration by removing runtime capacity loading and adjusting request handling
38ca6895815671a87ceec86b4aa4eb976580ce76 ddd60c928224b52eb4e1e60e01e8a1ecbb80ee45 2026-05-20T16:37:13+08:00 Yunzhe Jia Add support for cal-llm profile dumping to JSONL file
2716130010c58f1cdd9d94f0e2f8e047bc92dc66 b35bda124ccd4ed581dd6088d3ffa4931c2809b6 2026-05-18T08:40:54+08:00 Yunzhe Jia fix n_ctx_slot error by adding runtime capacity loading for cal-llm
3b14ed556c15529fe1f94b649f49db7156dfaf67 dde8b8228081769c8d8f1e0751d47fa7875f8423 2026-05-14T14:34:25+08:00 Yunzhe Jia - Removed references to CALRT from clip.h, mtmd-helper.cpp, mtmd-helper.h, mtmd.cpp, and mtmd.h. - Updated server.cpp to conditionally include CAL-LLM support. - Introduced option LLAMA_SERVER_USE_CAL_LLM in CMakeLists.txt to enable CAL-LLM integration. - Refactored server context to handle CAL-LLM requests and responses. - Updated image processing logic to remove CALRT-specific implementations. - Ensured compatibility with existing llama functionality while integrating new CAL-LLM features.
99dd308adb8488fa869bb669e3335e646a938eff 06c7852e99e34c71e24e3ef6001cb54c72970e4d 2026-04-21T15:50:01+08:00 wangbomeng tag: v0.2.1 server: fix max_seq_len
ed62eb33447f993d578e156a3c7e38c91b420ece 015e988a271573a7c11e2a4b45084e1219d69d50 2026-04-21T15:05:22+08:00 wangbomeng try server-test:not success
d8b2aaa00049978cebac15041f960d75b552f97b b6f29ec8140028619efaa50aa6e73146cecf631d 2026-04-13T11:23:44+08:00 wangbomeng server: fix context-shift
b6f29ec8140028619efaa50aa6e73146cecf631d 6d55eae7e76b768acfcec045b8e84cded8ae3b55 2026-04-13T11:23:31+08:00 wangbomeng server: fix context-shift
a2d5bf362d6c9a546f9deadf4f8975605a915d33 bd3a57a11aa008e0b5dc2a30f82fcd3a02587208 2026-04-09T21:01:46+08:00 Bomeng Wang server: comment fixed time
b8153b6b8f244b223c9f4c2940ae1f212634519e 82842cfc3fa3d5c004c4540aeff8a81f38509bee 2026-04-09T15:07:02+08:00 wangbomeng server: fix limit tokens to max_seq_len
82842cfc3fa3d5c004c4540aeff8a81f38509bee 622a22991089c6debd5f4b57738f3df3a0bda8b5 2026-04-09T15:06:26+08:00 wangbomeng server: fix limit tokens to max_seq_len
622a22991089c6debd5f4b57738f3df3a0bda8b5 5f47a738ba56a37d0ff281a16212f41979568e35 2026-04-09T10:36:31+08:00 wangbomeng server: comment circle print
ecf01a17651cd7b1e8b85fd6075e83831463ee23 99d2078e89305035d87d966cee7987c7d50b3925 2026-04-09T09:47:55+08:00 Yunzhe Jia fix n_parallel problem
18814f9bf1a423ebe8f32d6043c9cbc5b21b0218 bbee06d6d851e3f84f75b578047967d7e0e4a8dc 2026-04-08T13:55:52+08:00 wangbomeng server : reset inference time
398ecf71f5f574037ce33f84dd1576fa164909ad 6d5e83902bdd3142a8ff0d3db19f02a8619e95a0 2026-03-27T02:01:23+08:00 wangbomeng rm llama-server_old.cpp
6d5e83902bdd3142a8ff0d3db19f02a8619e95a0 e4eaab700333490e80ebefc8d023f6c1adfcc312 2026-03-27T00:57:11+08:00 wangbomeng server: printf calrt commit ID
41e6636ea1fb3884e41fb2023f92b0e7262ef09b d0a1b2c758440720d42fa108b3444f54593daa73 2026-03-12T16:36:07+08:00 Bomeng Wang tag: v0.0.1 server: correct the max_seq_len judgment
583c387efaf7bc030574e554088de79d09a27fbd 0edc14a60a2d5596f71d728c655e3523da924d89 2026-02-27T02:24:56+08:00 wangbomeng caserver: lim generated tokens to n_ctx_per_seq
0edc14a60a2d5596f71d728c655e3523da924d89 aa0a17d719326a63e0d6fea60aa0ced44e7abc33 2026-02-27T01:57:39+08:00 wangbomeng caserver: limit generated tokens to n_ctx_per_seq
d81d7b190ff5f21325167936496dfe5ab48b922e e492f5dc8cec17529f53ef2bbdf7b502107f8148 1f5accb8d0056e6099cd5b772b1cb787dd590a13 2025-11-04T14:43:32+08:00 Yunzhe Jia Merge branch 'master' into dev
48bd26501b08a3f0bff1249db47f313641f7bebb 622cd010ff4a65bef67edbf2f9bf4707c01f98f7 2025-11-03T15:38:23+02:00 Georgi Gerganov server : add props.model_alias (#16943)
cd5e3b57541ecc52421130742f4d89acbcf77cd4 87c9efc3b297b8a498716b1db3d061842e6fc85b 2025-11-02T18:14:04+02:00 Georgi Gerganov server : support unified cache across slots (#16736)
2f68ce7cfd20e9e7098514bf730e5389b7bba908 e4a71599e5846110159955dec0008eb4aa24222b 2025-11-01T19:49:51+01:00 Pascal webui: auto-refresh /props on inference start to resync model metadata (#16784)
e4a71599e5846110159955dec0008eb4aa24222b dd5e8cab512c7752392b6e51a6f118f348fb3f16 2025-11-01T17:14:54+01:00 Pascal webui: add HTML/JS preview support to MarkdownContent with sandboxed iframe (#16757)
c22473b580807929fd9e3a3344a48e8cfbe6c88f 0f715b4e759acceccb9f437cfd2a988fff85514a 2025-10-31T10:54:19+02:00 Georgi Gerganov server : don't print user inputs to console (#16871)
0f715b4e759acceccb9f437cfd2a988fff85514a d2d931f173b8a736b08999436e9259aafddec718 2025-10-31T09:51:26+01:00 Daniel Bevenius server : fix typos in server.cpp comments [no ci] (#16883)
16724b5b6836a2d4b8936a5824d2ff27c52b4517 b52edd25586fabb70f0c21b274473b307cf14499 2025-10-30T14:22:23-04:00 chansikpark server : bump request URI max length to 32768 (#16862)
b52edd25586fabb70f0c21b274473b307cf14499 517b7170e1a4d733583c4b07c5b7a49acc05911c 2025-10-30T18:42:57+02:00 Georgi Gerganov server : remove n_past (#16818)
8b11deea4663f29d3e042ce1056ba643264cd5f1 b9ce94017729465895402cbcfffb51fa926c15e3 2025-10-30T04:34:15+01:00 Oliver Simons Hide latency of bias and gate-loading (#16847)
3eb2be1ca5f37480aeb16102970d9e65f43347fe e41bcce8f0b53032a1fed275cd253e931c041cf6 2025-10-29T06:29:12-07:00 Max Krasnyansky Hexagon Op queue & dispatch optimizations (#16820)
338074c383c81366320d176d83b94b0a567ee0c2 851553ea6b24cb39fd5fd188b437d777cb411de8 2025-10-29T08:14:39+02:00 YaelLogic sycl: add RMS_NORM_BACK operation support (#16808)
85a7d8677bf2200981e52f744a21d5267964ffcf a8ca18b4b815a2abdbecb958ee5f4c542d69aac7 2025-10-28T20:19:44+02:00 Georgi Gerganov memory : remove KV cache size padding (#16812)
ad8d36beffd791db10c94eb9e964afb891e3ca55 c053e18a66dd95dc340aa61317877c2a41d4e3cf 2025-10-28T03:50:33+02:00 tamarPal sycl: add SSM_CONV operation support (#16800)
5a4ff43e7dd049e35942bc3d12361dab2f155544 10640e31aab0819f31c1e1f2d008b019ee737232 2025-10-27T13:51:28-07:00 Diego Devesa llama : disable pipeline parallelism if compute buffer allocation fails (#16748)
0bf47a1dbba4d36f2aff4e8c34b06210ba34e688 dd62dcfab97e420949519fd0eac9fca7bf97e635 2025-10-23T21:30:17+02:00 Johannes Gäßler server: add memory breakdown print (#16740)
8cf6b42d467d05fa7d9776d2bcc69974ecce6900 9de9672adb0f4ca4e39483ac3ffed52b3f70a55d 2025-10-23T11:32:24+02:00 matteo server : send partial stop string when <EOG> is reached (#15007)
63d2fc46e17a06be5b4b5823a5ada088317f1f0a a2e0088d9242bd9e57f8b852b05a6e47843b5a45 2025-10-22T13:47:09-07:00 Max Krasnyansky Add experimental ggml-hexagon backend for the Hexagon NPU (#16547)
9b9201f65a22c02cee8e300f58f480a588591227 19a5a3edfd306516cc419679d69d6435943b6816 2025-10-22T16:58:23+02:00 Pascal webui: introduce OpenAI-compatible model selector in JSON payload (#16562)
13f2cfad4170c096c51a02c24a6a158cb47f1480 06332e28672356b964d6dfc2ba4657e20581cd43 2025-10-20T12:41:13+02:00 Aleksander Grygier Enable per-conversation loading states to allow having parallel conversations (#16327)
41386cf365d894134ee0813d15e2f5d76f6a4d8e 3d4e86bbeb15f487d6da6174ba6191b7c212cc25 2025-10-17T18:02:52+03:00 Radoslav Gerganov rpc : report actual free memory (#16616)
466c1911ab736f0b7366127edee99f8ee5687417 0cb7a0683b0529172472d74d21f05470a607f297 2025-10-15T22:24:51+03:00 safranowith cpu : add FLOOR, CEIL, ROUND and TRUNC unary operators (#16083)
f9fb33f2630b4b4ba9081ce9c0c921f8cd8ba4eb f4ce81c45e7bd910e36bf44c253fc5255c49b1e4 2025-10-15T16:22:20+02:00 Aleksander Grygier Add server-driven parameter defaults and syncing (#16515)
17304cbcc1dd24de7741cbe57925d58e90a98ac1 3e3cb19f6449f9168a128eaeae01f8f41b049acc 2025-10-15T16:53:12+03:00 Georgi Gerganov server : fix img token logs (#16595)
554fd578a5ed78a10f371f5850c6a69aa83df15a fa882fd2b1bcb663de23af06fdc391489d05b007 2025-10-15T12:51:27+03:00 Georgi Gerganov server : fix mtmd checkpoints (#16591)
7ea15bb64c81e3813eb0babf9a57e1bc5697f569 9c7185dd28416cf67f5e3b268381f311b5e3da56 2025-10-14T07:51:36-05:00 Jeff Bolz vulkan: Improve build time for MSVC (#16545)
bc07349a7f87ba6eb31ed4b0ea9d9a7352185213 e60f241eacec42d3bd7c9edd37d236ebf35132a8 2025-10-14T08:48:50+03:00 Georgi Gerganov server : dynamic token limit for prompt cache (#16560)
81d54bbfd599811b354c39f04550888168be7780 c7be9febcbafa9af7d1b9443f86475c59c9c5f87 2025-10-12T18:06:41+02:00 Pascal webui: remove client-side context pre-check and rely on backend for limits (#16506)
31d0ff1869aa2ea31f4e96d5877d0343e9a2171b 97870e64975b26c5e06a3540a8dc0ff601351e86 2025-10-11T21:39:04+08:00 Yann Follet server / ranking : add sorting and management of top_n (#16403)
e60f01d941bc5b7fae62dd57fee4cec76ec0ea6e 81086cd6a3ca1252f0dc0f938171648399179c53 2025-10-10T22:15:05+03:00 Georgi Gerganov server : fix division by zero when reporting stats (#16501)
68ee98ae181a5c83a5cc6261daeee69a1f588c15 cdb6da468cc33323955a523738d2e1675aeb5e9a 2025-10-10T17:11:07+03:00 Radoslav Gerganov server : return HTTP 400 if prompt exceeds context length (#16486)
cdb6da468cc33323955a523738d2e1675aeb5e9a 6d69ab3f262eca3f0c6ad0ce075d2c80b9924d0e 2025-10-10T13:22:27+03:00 Radoslav Gerganov server : log requests to /v1/completions (#16495)
1faa13a1187051af66b0fd9f0d6effe4c77f0b3e 1deee0f8d494981c32597dca8b5f8696d399b0f2 2025-10-09T22:54:57+02:00 Pascal webui: updated the chat service to only include max_tokens in the req… (#16489)
d00cbea63c671cd85a57adaa50abf60b3b87d86f 8328fd4bae76fc027f8ca0e9a05acd3788dabe3f 2025-10-09T18:54:51+03:00 Georgi Gerganov server : host-memory prompt caching (#16391)
12bbc3fa50b6df03318a4451c9a2210200a0b28d 9d0882840e6c3fb62965d03af0e22880ea90e012 2025-10-08T22:18:41+02:00 Pascal refactor: centralize CoT parsing in backend for streaming mode (#16394)
d2ee056e1df0fdf646270fb5621e9f92084b59a7 b2c08c9ec4cd59ed88c1ebdd94f109af5ccc978e 2025-10-08T17:20:18+09:00 issixx server : fix cancel pending task (#16467)
7fdd16b432d247121fe5fe7b21f8805f85266c85 74b8fc17f92ada295a648e3c5eb28f46bca7d892 2025-10-08T10:57:29+03:00 Georgi Gerganov server : improve context checkpoint logic (#16440)
df1b612e29ba97a2e67db339b1e8c7465702b7e8 4e0388aa8a1f4ef1065701dc9c3947aea0a1b9a5 2025-10-07T15:57:14+03:00 Georgi Gerganov server : add `/v1/health` endpoint (#16461)
c61ae20d05bd4fdd8551311325a2845336449426 0123ff38f53d34752f29239a29d0e40a6dc4110f 2025-10-07T09:59:13+03:00 Radoslav Gerganov rpc : update documentation (#16441)
c5fef0fcea3b978a2318b1af170209ecec7c37b4 ca71fb9b368e3db96e028f80c4c9df6b6b370edd 2025-10-06T03:53:31-04:00 Oleksandr Kuvshynov server: update readme to mention n_past_max metric (#16436)
898acba6816ad23b6a9491347d30e7570bffadfd e29acf74fea996014380d59d31aa504ae8964258 2025-10-04T12:49:16+03:00 Radoslav Gerganov rpc : add support for multiple devices (#16276)
f6dcda390004b627ef30af378d0c01ad2519289e 606a73f53175077429484b23dcf799f69a31d0bd 2025-10-03T13:34:51-05:00 ddh0 server : context checkpointing for hybrid and recurrent models (#16382)
ad126479c25cf983a0f994a08ba0911cf49ed62b 77233277c912d495d1069543ca540c21a2f9e5b4 2025-10-03T11:45:16+02:00 Daniel Bevenius ci : change macos-13 to macos-15-intel (#16401)
77233277c912d495d1069543ca540c21a2f9e5b4 e308efda8e54e3f07578937a45a5d83624eb7970 2025-10-03T11:30:39+02:00 Aleksander Grygier Capture model name only after first token (streaming) or completed request (#16405)
136bda78c5679b266362b39c58338fff46fd2592 5113efd34ceda709292de26c72716c49e024fb32 2025-10-03T09:11:34+02:00 Aleksander Grygier webui : Fix messages payload sent to chat completions (#16402)
2be72c2b121ee99f33927149265ce6073ade9e59 95ce0985449c52fb9d6849b95563f7cf933ea0e3 2025-10-02T15:16:25+08:00 Neo Zhang Jianyu SYCL: Update to oneAPI 2025.2 (#16371)
aa9538a63aef35f0224b2502f13b19d650a8ce04 e74c92e84236b2bab3f3c77bee4ead94928be360 2025-10-01T07:40:26+02:00 Aleksander Grygier webui: Remove running `llama-server` within WebUI `dev.sh` script (#16363)
16b0ca0d2e63fc1a0a43795f8552f9cb61d9f7a5 8d78cd2613ccdeb3cc86f59bc8f9ddd31cfbd3ed 2025-09-30T19:18:54+02:00 Pascal Chatapi ignore empty sampling (#16330)
98c8269abefdfa8fde47dfb2769ceebc8b704e86 2790ecc304e384d9075c55d0628d8bf440025dc4 2025-09-30T17:42:57+08:00 Yunzhe Jia server: adapt to calrt
2811c65286ae954bec87049f75b86dc022006dcc d8359f5fde480da030bf75c7711573c7c4d993ba 2025-09-28T12:04:46+01:00 Imad Saddik Fixed a few typos in the README of the LLaMA.cpp HTTP Server [no ci] (#16297)
234e2ff8ed09716fb553437596779399bee31b11 3f81b4e91c1d5f098148af117e3f13cf4b077f52 2025-09-27T18:17:08+02:00 Adrien Gallouët server : remove old LLAMA_SERVER_SSL (#16290)
1a189278944d030211f336e103e96b65f976c361 e0539eb6aed346d4b25a6ea019044e88771e7690 2025-09-26T18:35:42+02:00 Aleksander Grygier Allow viewing conversations even when llama server is down (#16255)
d0991da39d3c39b3980c24cdfccb9a4c95a46870 aa719c2f886c445b78113bf1e5849f1fce4124a7 2025-09-25T11:36:47+02:00 Daniel Bevenius server : add support for external server for tests (#16243)
c498fc82fe5b83fc8c6e1627286bdc1f93caddbf e7a5130a20cf45a3358308356c249734ca982143 2025-09-25T10:20:02+03:00 Radoslav Gerganov rpc : use ggml logging facilities
4b9f4cb0f89a88de4bdf97727d0457b0c648804c 85e72271ba1ce78adf34fd8997803c991e617ca6 2025-09-23T13:59:34+08:00 Aaron Teo devops: add s390x containers (#15915)
5c6106a696af2b00ce01d14ba525979d5a32b199 ec65fb52f0cc890e5085a6c5995ab08a156265fb 2025-09-22T10:58:02+03:00 Georgi Gerganov contrib : update roles (#16113)
1eeb523c3e0c7ffbd59469f5463dcbdecba3535e 5bb4a3edec297e74b0f7bd4ed5d0fdd12e28d858 2025-09-21T08:31:55+02:00 Giuseppe Scrivano vulkan: optimize UMA buffer operations and fix driver hangs (#16059)
459c0c2c1a400f960d7b8e8d94d31a8426f80986 be79d9fdd95ab8955527c4aaa67b90e8b9516718 2025-09-20T07:56:30+02:00 Benni server: fix SSE and OpenAI compatibility for error messages when streaming (#16109)
be79d9fdd95ab8955527c4aaa67b90e8b9516718 f432d8d83e7407073634c5e4fd81a3d23a10827f 2025-09-19T15:15:21-07:00 ssweens llama-bench: add --devices and --list-devices support (#16039)
246c0d9c795fb25da8268625d597580155a3672f 3edd87cd055a45d885fa914d879d36d33ecfc3e1 2025-09-18T23:07:18+02:00 Adrien Gallouët cmake : fix static linking for OpenMP on Unix-like systems (#16031)
4ca088b036313c2d8e682f4cfeb7c29edd85d0b9 703f9e32c4eb3166f8d63007c26e31a1466c21af 2025-09-18T16:22:50+01:00 Eric Curtin Add resumable downloads for llama-server model loading (#15963)
2b6b55a59f590a1e1eb2dcd09d5b8b6feb9cc748 e58174cecbc45bf79bf653cd2c984395940c6ef4 2025-09-18T13:36:57+03:00 Radoslav Gerganov server : include usage statistics only when user request them (#16052)
0320ac5264279d74f8ee91bafa6c90e9ab9bbb91 a7a98e0fffed794396b3fbad4dcdbbc184963645 2025-09-17T20:38:12+03:00 Georgi Gerganov metal : refactor + optimize v2 (#15995)
8ff206097c2bf3ca1c7aa95f9d6db779fc7bdd68 77475530b8bbea3bf578632507e1284cdfe2c8c0 2025-09-16T16:17:08+02:00 jacekpoplawski llama-bench: add --n-cpu-moe support (#15952)
b907255f4bd169b0dc7dca9553b4c54af5170865 28c39da7c645185ade5436767929d7ec33006033 2025-09-15T19:51:35+03:00 yael-works SYCL: Add COUNT_EQUAL operator support (#15991)
6c019cb04e86e2dacfe62ce7666c64e9717dde1f 9dcd200d57bc6f05a59a6a8df361d5d183af4124 2025-09-14T21:17:04+02:00 Sigbjørn Skjæret server : only attempt to enable thinking if using jinja (#15967)
50f4281a6f5c3a5d68bdeb12f904fa01e0e2ba91 55758b00cae1451a0d789c50a5eb8c9bee42b9a0 2025-09-13T07:49:49-07:00 Diego Devesa llama : allow using iGPUs with --device (#15951)
4bf5549269d99bac936a65892da2312cc71b2421 f4e664f838cc65d89fa845c48c372e43852112e4 2025-09-12T16:31:50+01:00 Eric Curtin Add docker protocol support for llama-server model loading (#15790)
f088b6a84f6aed0abb619dbb9d375e726fc888a6 304ac5693d1e2124f83e0584bc5eea6311d3d3b4 2025-09-12T17:02:55+03:00 Georgi Gerganov server : adjust prompt similarity thold + add logs (#15913)
304ac5693d1e2124f83e0584bc5eea6311d3d3b4 6c88ad8fa741a2182a2dcf8c5353ae4b5c66e656 2025-09-12T13:24:21+02:00 Ruben Ortlam Vulkan iGPU device selection overhaul and PCI ID API support (#15947)
e68aa10d8f3d26fdad5b912540362d79de5460e3 0a16bf52e6874369cb4fd2bdc4863ef984b688e7 2025-09-08T13:10:07-05:00 Jeff Bolz vulkan: sort graph to allow more parallel execution (#15850)
88021565f08e0b7c4e07ac089a15ec16fae9166c 56920f56651908d5cce7a310dabf54ac4f6fbb7f 2025-09-08T10:59:48-04:00 Jesse chat : Deepseek V3.1 reasoning and tool calling support (OpenAI Style) (#15533)
56920f56651908d5cce7a310dabf54ac4f6fbb7f b0d52998b962bd2681c34bf52af993af79f178b8 2025-09-08T21:50:05+07:00 Xuan-Son Nguyen server : bring back timings_per_token (#15879)
3b15924d71237a43bb5ad71f5b885ee66a821342 79bc429262268ad2ac8a364cfe6c2d6b9c5f008a 2025-09-07T10:19:45+02:00 Daniel Bevenius ggml WebGPU: remove userdata from request adapter callback (#15527)
3c3635d2f20424d557b5b0605a2a356214ffe048 61bdfd5298a78593be649a1035ee2a120b13c4f0 2025-09-06T19:45:24+07:00 Xuan-Son Nguyen server : speed up tests (#15836)
61bdfd5298a78593be649a1035ee2a120b13c4f0 01806e77714ae8a78130d432945b959a0956c56f 2025-09-06T18:35:04+07:00 Xuan-Son Nguyen server : implement prompt processing progress report in stream mode (#15827)
fd621880f3fd908424e675a41715a2dc760247a2 4281c7b315f8a904549fe527039b976e08098d1a 2025-09-05T17:32:39-06:00 Gabe Goodhart aLoRA Support (#15327)
5fac79cbc77b6d12c9feb5f34fc63586b35fd561 408ff524b40baf4f51a81d42a9828200dd4fcb6b 2025-09-05T14:31:24-06:00 Gabe Goodhart Thinking model disabled assistant prefill (#15404)
dcbe998a6d8f13b6c9cb36bbe7b355ced2ac3842 87932ec016f0ec81e98a13ce5212851f8c12458a 2025-09-05T14:34:07+08:00 Yunzhe Jia add calrt API used in server side
5d6688de08e73acc2532d668380801ed79d704eb 4fd1242bef6cb2325b4ff1c1a80f3b54b64508a6 2025-09-05T04:36:23+02:00 Daniel Bevenius model-conversion : add --embeddings flag to modelcard.template [no ci] (#15801)
c1c354e44c06d259679bb5bb7a8fa9f0b28480e4 a68d9144262f1d0ef4f6ba7ad4a7e73e977ba78c 2025-09-04T20:20:14+08:00 Chenguang Li CANN: Refactor ND to NZ workspace to be per-device (#15763)
a68d9144262f1d0ef4f6ba7ad4a7e73e977ba78c badb80cadbc40e047b30c43611aba575fc8d6845 2025-09-04T11:50:23+02:00 Xuan-Son Nguyen server: add exceed_context_size_error type (#15780)
8c3fdf44ecf08335942f2ba558955f55e88c7991 f6da8cb86a28f0319b40d9d2a957a26a7d875f8c 2025-09-03T09:48:35+02:00 Daniel Bevenius model-conversion : add missing curl script [no ci] (#15761)
0d161f021aa33ec0e90cce96f5d1a88925557327 4efd5a83163ff383285b3a4c2106feabf5c69557 2025-08-31T20:11:58+03:00 Georgi Gerganov server : enable /slots by default and make it secure (#15630)
d82f6aa34a216f5df1945cdfe121ba5e6cd80be0 3d16b29c3bb1ec816ac0e782f20d169097063919 2025-08-30T00:12:53+02:00 Sergey Alirzaev server : removed obsolete doc (#15670)
792b44f2ed9668cce7f267ff0ae4950ed9b4a5de 81017865ee444cf49ce0136f2be1e41a0270ff91 2025-08-29T19:25:40+02:00 ExtReMLapin server : add documentation for `parallel_tool_calls` param (#15647)
c8d0d14e77c3c45df5cbbddde9c2b4c377ec4e7a 84ab83cc0b4b7e769451ee48e4c7d1acef91ef25 2025-08-28T17:09:05+03:00 Georgi Gerganov kv-cache : fix find_slot to not search for continuous slot (#15638)
84ab83cc0b4b7e769451ee48e4c7d1acef91ef25 55042b3692cb1467c9ee15c62c4a9fbf180f89e3 2025-08-28T15:49:50+02:00 Sigbjørn Skjæret model : jina-embeddings-v3 support (#13693)
fbef0fad7a7c765939f6c9e322fa05cd52cf0c15 da54f9f1a2db07aaae390024ac466e7867685d94 2025-08-27T20:58:09+02:00 Johannes Gäßler server: higher timeout for tests (#15621)
0115cfb7c1dec0753aecb34f3af4338bf9de8eeb 3a617cb18121a85eed17ac5585788810c5d9c1e0 0d5a470223fc90b6b6807921d68011ff06ae7f9e 2025-08-26T15:19:56+08:00 Yunzhe Jia Merge branch 'master' into dev
5a6bc6b1a6cb665a944426c2055794950e524bf5 6b64f74b55628e4193f4fb00313f07dbd8556528 2025-08-25T14:25:25+02:00 Daniel Bevenius model-conversion : add model card template for embeddings [no ci] (#15557)
611f419cff11e4952228162a1c44cb35dff2274a b1afcab804e3281867a5471fbd701e32eb32e512 2025-08-23T13:16:17-05:00 Jeff Bolz vulkan: optimize rms_norm, and allow the work to spread across multiple SMs (#15281)
4afb0a746f22abaa545b3ebdb76a400d7da3a713 e288693669cf9d0a71e2f2b8bd57305f06340257 2025-08-22T08:10:14Z 65a server : Support multimodal completion and embeddings prompts in JSON format (#15108)
cd36b5e5c7fed2a3ac671dd542d579ca40b48b54 3f196be84b1376945737163e35a91e29e3e24d2f 2025-08-21T19:13:45+03:00 Georgi Gerganov llama : remove deprecated llama_kv_self API (#15472)
245be739df942861ddc52331b095b40f18e2a3f1 b2caf67db1208fd38a0570785c39f7370d906d8a 2025-08-21T11:47:52+02:00 Copilot ci : add copilot-instructions.md (#15286)
1b0db8f6e08951969e2447c2d18bf638effb8f75 29f538ac630d6544406a0702476e36808a6bd1b3 2025-08-21T07:19:22+02:00 stduhpf server : fix webui (#15462)
1bc664a26a1d93a48baf2483a7ff95291ca8bcb8 13aeb7aef284daed4ad07dc14b4b3e2a42b5ea97 2025-08-21T07:10:08+09:00 teo server: fix OpenAI API compatibility for usage statistics in chat streams (#15444)
1a99c2d948209d9ea5eac8b6dc0a297107244540 37f10f955f70e0158d50343d0b9a3f92d194daae 2025-08-20T18:32:05+08:00 xiaobing318 cmake : fix target include directories (#15450)
d2fcd91cf96b46f4485ce46b4e3a32bf0df37715 a6d3cfe7fa6ea1fb0e1ba8243b731db22ddc0b49 2025-08-19T16:46:37+03:00 Georgi Gerganov server : disable context shift by default (#15416)
9d262f4bad0d37838100133537aaf0a83835ed12 f0d3c7405c323784a60f14ddddfbac3f7404d417 2025-08-19T08:45:26+03:00 Georgi Gerganov server : remove swa_full warning (#15399)
d1d82416006e7ff41780cb0e9b5f28d30a267497 618575c5825d7d4f170e686e772178d2aae148ae 2025-08-18T16:51:42+02:00 davidef server : fix incoming tasks not process in order (#15395)
e5155e698645242d4f019267ecc40ea9bad81b09 21c17b5befc5f6be5992bc87fc1ba99d388561df 2025-08-17T18:28:58-04:00 Oleksandr Kuvshynov server : export max observed n_past value (#15361)
de2192794f4e8e04f2e8167ef2424905145e88fc 2e2b22ba6607414a5d619ac6d2f034b5b02214e5 2025-08-16T04:18:31-05:00 Jeff Bolz vulkan: Support mul_mat_id with f32 accumulators (#15337)
ff27f80a74bbe5303acd511a6781a1de6d619b3c d3248d9b6557c75d59954c594bb53cf517591e91 2025-08-15T21:11:22+08:00 Aaron Teo ggml: initial IBM zDNN backend (#14975)
5ba36f61033d2819be27e2abb70e9a3bd20c0fde b204a5a234f4cf0b3f449476da639a5510c6d157 2025-08-14T16:23:56+02:00 uvos HIP: Cleanup hipification header (#15285)
b204a5a234f4cf0b3f449476da639a5510c6d157 646944cfa8961afd914dd6637739b3cda9a72e11 2025-08-14T09:23:11-05:00 Aldehir Rojas gpt-oss: implement harmony parsing (#15181)
d32e03f4495d3efa1c5126f53b449f1d429c5664 3973163bff40f7f5161b0f08a0011729e2b0406a 2025-08-14T14:59:50+03:00 Georgi Gerganov server : add SWA checkpoints (#15293)
b3e16665e14032d1276f9d0263acef8321b6f518 c24f4e26883a91219af5acfaf1471ca7ef582683 2025-08-13T15:43:00+02:00 Sigbjørn Skjæret server : enable -td and -tbd parameters (#15172)
e885445bc1719d2e289a9b2e11714e0f994e68be 648ebcdb739abfb5a9be14f4c5c0fd19ff268ef0 2025-08-13T05:28:21-05:00 Aldehir Rojas server : filter out harmony thought messages (#15278)
07aa869a91837d95fcb5612c65a188763ac38647 00f35d509e5367bf19ccaf4b4adddc38db4811c6 2025-08-13T11:30:45+02:00 Sigbjørn Skjæret ci : add more python requirements to copilot-setup-steps (#15289)
6028bf74351d35a06bd98498624f8c2f029f7d1a bc5182272c373267352bc689e5fca276934bea2d 2025-08-13T10:04:46+02:00 Oliver Simons CUDA: Optimize `reduce_rows_f32` kernel, leading up to 25x perf improvement on kernel-level and 10% perf increase for Gemma3n (#15132)
53d0a1265826f40c5dbc01d06aeab9e14fcbd69b 27093afe78912494073eb043fec93a007e49653c 2025-08-11T14:48:41+02:00 Xuan-Son Nguyen server : allow specifying reasoning_format in HTTP request (#15238)
cd3069dfcbeee8e0e96cffb93b0ebb9e595e273a 50e81bdf5db563ab57a9a722b08f96fa8a76c927 2025-08-11T11:21:19+02:00 Daniel Bevenius kv-cache : log (debug) all streams in find_slot (#15176)
4850b52aedceeb70bb4fe49f2d7cd1df6ee98682 cd6983d56d2cce94ecb86bb114ae8379a609073c 2025-08-08T23:04:36+02:00 Johannes Gäßler server-bench: external OAI servers, sqlite (#15179)
36d3f00e142696f708ab297b9f8f1c825594712d 5fd160bbd9d70b94b5b11b0001fd7f477005e4a0 2025-08-07T05:31:48+02:00 Daniel Bevenius requirements : fix PyTorch uint64 compatibility (#15134)
c42293848dd9f03eba9a6c1b85a600b398f06541 1cbf442f50a154aac0bf35d7b8b3436a2cdfd6f5 2025-08-06T15:46:06+08:00 Yunzhe Jia sync with calrt API
f906275537d14c8fc7c6976d944233771fd6672c a9f7541ec25c4c8547daf5ff48700ad2836e2b7d 2025-08-02T10:12:41+02:00 Johannes Gäßler server: enable token array inputs for OAI API (#15001)
94933c8c2eeaa9a7983e3f6c08af76bd86724094 c1dacaa99b4ead6edbac928cd2da59436573f6b0 2025-07-31T05:25:23-07:00 g2mt server : implement universal assisted decoding (#12635)
a9f77a8be348deeb11fb3d54d412bf583003c90d 8a4a85627702b569d7d2810f2de06a4321656e9d 2025-07-31T14:08:23+02:00 Lukas Straub server : add openai-style logit_bias support (#14946)
41e78c567e9a8c652e405f4f909deb598deecd31 ad4a700117d1746799d2d6599e526e2c3a7938d2 2025-07-30T18:07:11+02:00 Daniel Bevenius server : add support for `embd_normalize` parameter (#14964)
00131d6eaf4df029e1ec84de868c2c5957503007 1e15bfd42c3938506e0da5939bf7f42780965f01 2025-07-30T15:12:02+03:00 Georgi Gerganov tests : update for LLAMA_SET_ROWS=1 (#14961)
bbd0f917797e9d524680f1b30d34a46eb06d7651 0a5036bee9cfb946870689db4400e9e0d17844c9 2025-07-29T10:40:50+02:00 Johannes Gäßler server-bench: make seed choice configurable (#14929)
c556418b600ad5792440942079d93e393595688b db16e2831c0f344f041af3d067db81c42b16eb22 2025-07-28T18:59:04+03:00 Radoslav Gerganov llama-bench : use local GPUs along with RPC servers (#14917)
f1a4e72de5950ab7136aeadddd675caf30dd6b3f 4762ad7316dcdec20016ab5985fb46a27902204d 2025-07-27T04:05:34-05:00 Jeff Bolz vulkan: skip empty set_rows to avoid invalid API usage (#14860)
793c0d7f46384001738c337d7afa46b45ae32745 ce111d39d666f4a3b6a561ad020f6feb8cc67790 2025-07-25T10:47:39-06:00 Gabe Goodhart metal: SSM_SCAN performance (#14743)
c12bbde37258c6d053322d1cedd4a9672109ae58 3f4fc97f1d745f1d5d3c853949503136d419e6de 2025-07-25T01:07:26-07:00 Diego Devesa sched : fix multiple evaluations of the same graph with pipeline parallelism (#14855)
3f4fc97f1d745f1d5d3c853949503136d419e6de 2df255da3cea108de0ae9b302ffdd31674b6d88d 2025-07-25T03:05:37+08:00 R0CKSTAR musa: upgrade musa sdk to rc4.2.0 (#14498)
adef81781a15083f218eae6c488b95cdad781971 48b86c4fdb1b1246d9fe17d2d53e3a1c2a0c3245 2025-07-22T09:24:22+08:00 Molly Sophia server : allow setting `--reverse-prompt` arg (#14799)
b4efd77f8ab407836ca73a5176f041650c5b2411 2be60cbc2707359241c2784f9d2e30d8fc7cdabb 2025-07-21T09:24:51+02:00 IsaacDynamo server : add parse_special option to /tokenize endpoint (#14783)
2adf8d83acdb9b1bf58db6c9729ac9dc6847a58b 021cc28bef4dd7d0bf9c91dbbd0803caa6cb15f2 2025-07-18T17:33:41+03:00 Georgi Gerganov parallel : add option for different RNG seeds (#14757)
086cf81e88fb75287b71ff19c08a206b7bc2e02f d9b691081c04ec5fb0daa9d2b979f915c142963d 2025-07-17T09:22:11+02:00 Tarek Dakhran llama : fix parallel processing for lfm2 (#14705)
225e7a1438f4ea85eaa7b5ef3ab3b266ee4d9c06 ab140198211385b85eeeb0abd549a4bbe259e10d 2025-07-16T16:35:42+03:00 Georgi Gerganov llama : add high-throughput mode (#14363)
6ffd4e9c442e99afac3d138543ebf86d5fc5ee03 e4841d24d3485ea4af54f8b65a19ec3123f0ff3c 2025-07-16T14:04:12+03:00 Georgi Gerganov server : pre-calculate EOG logit biases (#14721)
e4841d24d3485ea4af54f8b65a19ec3123f0ff3c 538cc77f7f44dfa047dba6a06d90c86dda69cf1d 2025-07-16T19:12:22+09:00 Shunta Saito llama : fix parallel processing for plamo2 (#14716)
538cc77f7f44dfa047dba6a06d90c86dda69cf1d 5cae76654113160f691f581930b69fc5535e8159 2025-07-16T12:13:57+03:00 Georgi Gerganov server : fix handling of the ignore_eos flag (#14710)
5cae76654113160f691f581930b69fc5535e8159 4b91d6f71f14040979bcdb7b6729b3bca93ec1c1 2025-07-16T09:33:28+02:00 Johannes Gäßler scripts: synthetic prompt mode for server-bench.py (#14695)
79e0b68c178656bb0632cb8602d2940b755077f8 c81f4192f91a1e209c1eec7a84fe5371ef9175da 2025-07-16T12:00:42+08:00 Min-Hua llama: add LLAMA_API to deprecated llama_kv_self_seq_div (#14708)
494c5899cb76859f32ddd913534f2685fd684a3d 0f4c6ec0f1a9607ba67071f8a02c69b0afc2f91e 2025-07-14T13:14:30+02:00 Johannes Gäßler scripts: benchmark for HTTP server throughput (#14668)
0c1df14b5f8d992805cb22d0b77b44092a18aeab b3ad3a0191994d6c47b2bd389d5c7431526ecd2c 2025-07-12T06:21:02-04:00 Douglas Hanley server : fix pooled embedding output (#14645)
0aedae00e6fb48680324a5ac5da9cba0e35de6b5 6bdda13981d6c8189b7dc4f9fb8ecb91c21529f8 2025-07-10T18:20:13-06:00 Gabe Goodhart model : Granite Four (#13550)
4a5686da22057867c23bd4a6be941ddc8c51e585 98bab638fb28cf95a5a66dd2d51b40d6c8f6d69a 2025-07-09T14:59:57-04:00 compilade llama : support Jamba hybrid Transformer-Mamba models (#7531)
04655063c47af6cbced295c8c7ad369402b15300 20b7bf8a32259ad9189a4797fd3e3a859c537b99 2025-07-09T12:03:49+04:00 ibrahim khadraoui model : add support for Falcon-H1 family (#14534)
17a1f0d2d407040ee242e18dd79be8bb212cfcef 8f22dc0a53338c629c1ef8fa878d8e39bfe627c9 2025-07-08T11:47:33+03:00 Alawode Oluwandabira server: Add ability to mount server at prefix (#14544)
ddef99522d1ba74193b7394e803fab8db5c78bae 668168814601d2aef6161ce49ab186bc74177ae7 2025-07-05T09:17:14+02:00 Sigbjørn Skjæret server : fix assistant prefilling when content is an array (#14360)
a70c8a0c4b4c1606cd9a0ba889ce61aa88610095 9067487c4411efb20400103fcccfdd389c80d428 2025-07-03T10:53:35+03:00 Georgi Gerganov kv-cache : use ggml_set_rows (#14285)
c839a2da1a0d4275c3a98f70c3a7627487573a46 e9b6350e61d592634263a14b3d77ecbf6c1fb096 2025-06-30T17:48:24+08:00 xiaobing318 cmake : Remove redundant include path in CMakeLists.txt (#14452)
caf5681fcb47dfe9bafee94ef9aa8f669ac986c7 83790b0e7e09ab17238b16452a33053a71dbdfad 2025-06-29T20:02:53+02:00 matteo server : support jinja extra template kwargs (Qwen3 enable_thinking feature), from command line and from client (#13196)
83790b0e7e09ab17238b16452a33053a71dbdfad f47c1d7106e49062279bcc57fc1077c0db61e278 2025-06-29T19:29:57+02:00 Renat server : fix appearance of the chats list context menu for Safari (#14322)
bd9c981d7226107f18deb8344c3301450311bb8b 27208bf657cfe7262791df473927225e48efe482 2025-06-29T02:43:36-05:00 Jeff Bolz vulkan: Add fusion support for RMS_NORM+MUL (#14366)
8f52c6f8abb2ed9ad967cc0bfb90acb073011193 d2f325130c4ed77a3dcff2c23a926587fb08e2cc 2025-06-26T15:10:45+08:00 Yunzhe Jia Squashed commit of the following:
1b809cee225222094a0ff5be8467240487ce4ae4 abf241045d09cad70dc797b0fba393ad09ee2cbe 2025-06-24T08:59:11Z Nigel Bosch server : move no API key doc to /health (#14352)
901e20bbe571fbde48d13eb188f4e7cdc7562fb6 0142961a2e67909e33cdf410274b56c08c5dce7a 2025-06-24T02:17:58-04:00 Bartowski jinja : Add Mistral-Small-3.2-24B-Instruct-2506.jinja (#14349)
8308f98c7fb778e54bf75538f5234d8bd20915e9 6369be07359d03723f38c0a4a014ff0f698a0738 2025-06-20T15:07:21+02:00 Nicolò Scipione sycl: add usage of enqueue_functions extension (#14244)
d67341dc18fc5cc63362880ab2f8f9ecfc7932e7 456af35eb70177b8dd5779b6d4c21bb020f9cebd 2025-06-19T16:01:03+03:00 aa956 server : add server parameters for draft model cache type (#13782)
edc4a29effe716956fdfd2bc5b9cba2a6d8492f8 ed3290ab34493fd3d2e0f925f816a401da4f2dfd 2025-06-19T00:08:14-05:00 Gabe Goodhart memory : Hybrid recurrent cache (#13979)
89fea80d298184d1cd93564f48e060d9f541f4b4 6adc3c3ebc029af058ac950a8e2a825fdf18ecc6 2025-06-16T22:33:27+03:00 Georgi Gerganov server : fix incorrect usage of llama_get_embeddings() (#14225)
d3e64b9f490cee41b7b9aa275dae2f6568ae3054 3ba0d843c6bd3faea5cf5e53dc7f3c82be20bffb 2025-06-16T14:14:00+03:00 Georgi Gerganov llama : rework embeddings logic (#14208)
cd355eda7df1898d25d433b4bdaa4b4b479e0bad 30e5b01de2a0bcddc7c063c8ef0802703a958417 2025-06-15T23:36:22+02:00 Eric Curtin server : When listening on a unix domain socket don't print http:// and port (#14180)
c311ac664d68d10781a3e7b9f02d9d9520837d80 b9912ac570de8945ae9383c9ca8291027bf287dd 2025-06-15T10:08:58+03:00 Georgi Gerganov cparams : rename LLAMA_MAX_PARALLEL_SEQUENCES to LLAMA_MAX_SEQ (#14188)
3cb203c89f60483e349f841684173446ed23c28f 2e42be42bd6bf1dcc643d6ac4e77419bfe5dd24f 2025-06-14T18:25:15+02:00 Piotr llama-chat : Do not throw when tool parsing fails (#14012)
ffad04397399ea1650fda6560c7c753059804876 0889eba570126f8a2f5a0e88fde776bbc91cca66 2025-06-13T11:18:25+03:00 Georgi Gerganov server : fix SWA condition for full context reprocess (#14163)
c61285e7396c8e526fe7794c19e8d4f1c99bfc51 09cf2c7c655c90e53e100f29b830a788bab0653d 2025-06-13T08:45:37+01:00 Ewan Crawford SYCL: Bump oneMath commit (#14152)
7d516443dd7766569110b38e6374649bee6eb1c4 f6e1a7aa8787b5c00acba6370cb70a0beff48b1e 2025-06-12T11:51:38+03:00 Georgi Gerganov server : re-enable SWA speculative decoding (#14131)
2baf07727f921d9a4a1b63a2eff941e95d0488ed 7ae2932116a4de3141cbc8c488f7f6e4e06d8171 2025-06-11T06:43:43-04:00 Taylor server : pass default --keep argument (#14120)
1f7d50b2936023b26eb218e944e62834b80a2ce0 4c763c8d1b4d4de20bf364ec1837430783cba984 2025-06-11T00:19:25-05:00 Jeff Bolz vulkan: Track descriptor pools/sets per-context (#14109)
dad5c44398b78467943ed0a603ea427fe9f6fc62 55f6b9fa6563f6ae49113f9abdc980c12348cc1c 2025-06-10T18:20:14-04:00 compilade kv-cache : avoid modifying recurrent cells when setting inputs (#13834)
2bb0467043258bdc58dbaefb33786f1731b38937 b8e2194efc529378be45ab9b27d6648a5b81458a 2025-06-10T02:41:01-04:00 Isaac McFadyen rpc : nicer error messages for RPC server crash (#14076)
87d34b381d5868e75586210ec17b5ef5deddc276 b460d16ae858c6624fd37aec316622a4060ca325 2025-06-09T12:57:58+03:00 Georgi Gerganov server : fix LRU check (#14079)
228f34c9ceefa3ea4f4d6933edd858121e8106cb 0974ad7a7cd4bca846b15c484ff3be890135a52c 2025-06-07T18:58:20+05:30 Akarshan Biswas SYCL: Implement few same quantized type copy kernels (#13739)
745aa5319b9930068aff5e87cf5e9eef7227339b 487a5e0401423bba02cd6e97e4d45131bb20b22b 2025-06-06T14:11:15+03:00 Georgi Gerganov llama : deprecate llama_kv_self_ API (#14030)
7f37b6cf1e2c1b90bf0d9c8d91904b4b6c512748 3a077146a4761fdbd24bdd8eb098f46b8adc4dda 2025-06-05T15:29:22+03:00 Georgi Gerganov memory : migrate from llama_kv_cache to more generic llama_memory (#14006)
363757628848a27a435bbf22ff9476e9aeda5f40 ea394d7ab1f8101716d48ce9421c94c71b93a00f 2025-06-02T21:34:40+03:00 Georgi Gerganov server : disable speculative decoding for SWA models (#13970)
c9bbc77931d223ed7e7cbcf1cb057bc02fd0db19 bfd322796cd838f906535ff3352624fc46338894 2025-06-02T10:15:44-07:00 Olivier Chafik `server`: update deepseek reasoning format (pass reasoning_content as diffs) (#13933)
c04621711a893cbd09cff6c927cb005bc6749e36 0fc16b42e8793364918e830c234c1f3caec29dae 2025-06-01T11:42:16+03:00 Georgi Gerganov parallel : fix n_junk == 0 (#13952)
e15898d1c7e87f1b3d14e0a3c385eeb424b085fe 803f8baf4f741d2f0465c46c33f285886b97a071 2025-05-31T08:26:10-07:00 Olivier Chafik server: allow unclosed thinking tags (#13931)
12d0188c0dc6146ffde6d277a93f232ccbe699f8 eb3949938e82a128855bc0676220bb2ce6e4228d 2025-05-31T10:24:04+03:00 Georgi Gerganov kv-cache : refactor + add llama_memory_state_i (#13746)
dd665cc9d4b378626cde11ea0c4c91f514fdc994 df0c0c7d02f951dc639d48fd536f79200460ac83 2025-05-30T19:38:07+03:00 Georgi Gerganov parallel : increase the variability of the prompt lengths (#13927)
53f925074de02c5304b00c14b4d6d8910c58667d db38704f0133be7832123495fa8fc2601ea999d4 2025-05-30T16:25:45+03:00 Georgi Gerganov sync : vendor (#13901)
10961339b26bd2eff01d5479e8879f435da261b7 d98f2a35fcf4a8d3e660ad48cd19e2a1f3d5b2ef 2025-05-28T22:35:22+02:00 Xuan-Son Nguyen mtmd : move helpers to dedicated library (⚠️ breaking change) (#13866)
c962ae3382a1e759c8517a229549ee53685313a1 a3938fb53d0b5183db4f5a6db21fd9122a0e4780 2025-05-28T22:33:54+08:00 Sky server: fix remove 'image_url'/'input_audio' json-object effectlly for 'llama_params' in multimodal-model-mode (#13853)
952f3953c1b61cc70e79e536c42ddce6a5ea5ea7 81713121ee56755ba4a147d1a1e3fa248ec31a66 2025-05-27T04:05:18-07:00 Diego Devesa ggml : allow CUDA graphs when using pipeline parallelism (#13814)
cdf94a18023c92f41808ec874ba577d914674717 a26c4cc11ec7c6574e3691e90ecdbd67deeea35b 2025-05-26T14:34:27-07:00 Olivier Chafik server: --offline mode (#13804)
03f582ae8fccecff225c30a2802461b44761e822 88c125f2acce0e25e5fc8481ab0681415fc64a10 2025-05-26T08:03:57-07:00 Olivier Chafik server: fix streaming crashes (#13786)
d74e94c1b3ac02db01e47008e1f8d371029d81ac f13847cfb560d92492b480cca2c5d6aa9473cde3 2025-05-26T06:56:49-07:00 Olivier Chafik `server`: fix format of streamed tool call deltas (diff name, fix id location) (#13800)
f13847cfb560d92492b480cca2c5d6aa9473cde3 79c137f77677b3c8ee3c60a7da033721b938399a 2025-05-26T06:16:37-07:00 Olivier Chafik server: fix regression on streamed non-chat completion w/ stops (#13785)
e121edc4324a640be11b7e567edd39b721b0f8e4 2f099b510f460374acd52742b494595e3e3442d3 2025-05-26T00:30:51+01:00 Olivier Chafik `server`: add `--reasoning-budget 0` to disable thinking (incl. qwen3 w/ enable_thinking:false) (#13771)
de2ef53a4b2c0d703749a309d19fe68fd8f1b9ac c508256db2de2b032e19c8ed833f4683c827c9a1 2025-05-25T16:34:36+03:00 Georgi Gerganov kv-cache : rework kv_cell (#13706)
d785f9c1fd1a1929c6d0e2a0b12cae5db867908b 4032ca406632212b075e3c61c2a4476128321410 2025-05-25T10:45:49+01:00 Olivier Chafik server: fix/test add_generation_prompt (#13770)
f5cd27b71da3ac375a04a41643d14fc779a8057b a2d02d5793fd9af7a7224773456501691b95fd02 2025-05-25T01:48:08+01:00 Olivier Chafik `server`: streaming of tool calls and thoughts when `--jinja` is on (#12379)
9ecf3e66a38f20e41d221f62f05b17f70d040839 faaaff5f947064d13ef8b98659d81a1384c3e57b 2025-05-23T11:03:47+02:00 Xuan-Son Nguyen server : support audio input (#13714)
797990c4bca0dca5be295c63e3fb2800dc0a69c2 ab86335760ebb441574eb47f886fa1ee302e2131 2025-05-22T20:42:48+02:00 Xuan-Son Nguyen mtmd : add ultravox audio input (#13623)
cc74d5be990e37f201591fd868a92e64abdbf902 5be24af73d77ea23d399726f1d2a01a70ee86331 2025-05-22T16:33:39+03:00 Georgi Gerganov server : pad small embedding batches (#13692)
5fbfe384d4659f81c47a477eb8ee97692c7ffef9 c76532e7ba128bb097bf6836bf0f5592e1b56b76 2025-05-21T19:46:56+03:00 Georgi Gerganov server : improve error reporting (#13680)
c76532e7ba128bb097bf6836bf0f5592e1b56b76 2aa777d86d3f7bb80b93e226f1c25e47825f6a83 2025-05-21T19:40:35+03:00 antichristHater convert : add qwen2vl support for unsloth merges (#13686)
0d5c74216170ef97e5e7511563837263f2d1a496 42158ae2e8ead667a83f07247321ce85f32ace66 2025-05-21T15:15:27+02:00 Robin Davidsson server : Add the endpoints /api/tags and /api/chat (#13659)
42158ae2e8ead667a83f07247321ce85f32ace66 797f2ac0625b22edeff03cc30e0f988da6b6b068 2025-05-21T16:07:57+03:00 Dorin-Andrei Geman server : fix first message identification (#13634)
a4090d1174aed22dde5cacce2a4c27656b987a2f b69f1647f9953cb3773266d2c83a92fd0e7e6d66 2025-05-20T16:13:16+03:00 Georgi Gerganov llama : remove llama_kv_cache_view API + remove deprecated (#13653)
e298d2fbd082a52c0f6ed02729f94e9bf630cf17 f0adb80bf7c2c0d80abb04f4533b5513622d9964 2025-05-20T08:05:46+03:00 Georgi Gerganov kv-cache : add SWA support (#13194)
f71f40a2847d4c9f57b86cd206e0a27b2bfb6d1c d30cb5a7fa17362c47e94a023276f169916e0d03 2025-05-19T11:46:09+01:00 Alberto Cabrera Pérez ci : upgraded oneAPI version in SYCL workflows and dockerfile (#13532)
6a2bc8bfb7cd502e5ebc72e36c97a6f848c21c2c e3a7cf6c5bf6a0a24217f88607b06e4405a2b5d9 2025-05-17T17:59:48-04:00 Isaac McFadyen server : added --no-prefill-assistant flag (#13608)
518329b2d4434d0683c30b741b4f4cf5734b5f99 2f5a4e1e09567e09be8b84a5f976334de9539d17 2025-05-17T12:58:55+03:00 Georgi Gerganov parallel : add option for non-shared and larger prompts (#13598)
6aa892ec2aa7fe0c93e87c4b970d83a942fb9454 aea9f8b4e73876739bf88fb705502f291294e469 2025-05-16T21:50:00+02:00 Xuan-Son Nguyen server : do not return error out of context (with ctx shift disabled) (#13577)
3cc1f1f1d24472a6558c942b1c78989ff4b0e569 c753d7bed0dc2cc2d5c42dfa9806cba91748392e 2025-05-15T14:24:50+02:00 Xuan-Son Nguyen webui : handle PDF input (as text or image) + convert pasted long content to file (#13562)
c753d7bed0dc2cc2d5c42dfa9806cba91748392e b2838049ccf50859cea4c390e81405c2fb01e820 2025-05-15T08:40:58+02:00 Piotr Wilkin (ilintar) server : proper error handling for missing elements in messages array (OpenAI compatible backend) (#13540)
aa48e373f256df9608395ee6881e7010840d6202 e3a9421b78da5c810d812e6348a405f5acc39f34 2025-05-15T02:39:51+01:00 Olivier Chafik `server`: inject date_string in llama 3.x template + fix date for firefunction v2 (#12802)
053174436f3b3cbb01077f26ff17809537b832c7 360a9c98e13d35f322b4c5b1309aab0cc90ed82b 2025-05-14T15:42:10+03:00 Georgi Gerganov server : passthrough the /models endpoint during loading (#13535)
360a9c98e13d35f322b4c5b1309aab0cc90ed82b 09d13d94fb169093095416ac6323551c37b75339 2025-05-14T13:35:07+02:00 Xuan-Son Nguyen server : fix cache_tokens bug with no cache_prompt (#13533)
d486dd3e8ecfba0170f8632a1530540de560f4a3 21ca987fba504d273ea28ebc4d3e5b3736a11c8e 2025-05-14T10:07:31+02:00 Luca Stefani webui: Allow pasting file from clipboard (#13526)
71bdbdb58757d508557e6d8b387f666cdfb25c5e f0995d28ce3d15095b6845d94ce4465e46575873 2025-05-13T17:07:21+02:00 Xuan-Son Nguyen clip : clip.h become private API (⚠️ breaking change) (#13510)
91159ee9df84edb72ccf874e353d2414f3a8c60d 22cdab343b63edd0906f1c132616746085f81983 2025-05-12T18:56:42+07:00 Anudit Nagar server : allow content to be null in oaicompat_completion_params_parse (#13477)
9a390c4829cd3058d26a2e2c09d16e3fd12bf1b1 09232370fc6426aa5dd9be01a8271b9c28f5af3a 2025-05-11T11:08:26-04:00 Anthony Umfer tools : fix uninitialized llama_batch in server (#13436)
3b24d26c22b9d92b5aa39930988700c84e524cf4 43dfd741a5da77982e0a94d1e522a2481dfb914d 2025-05-10T18:44:49+02:00 Xuan-Son Nguyen server : update docs (#13432)
33eff4024084d1f0c8441b79f7208a52fad79858 17512a94d636c4b6c1332370acb3e5af3ca70918 2025-05-09T19:29:37+02:00 Xuan-Son Nguyen server : vision support via libmtmd (#12898)
b486ba05bf973aae3652b3fd593e0b257d3a41d4 02115dcd9a6d0c03b527d5bee8c1493ab819ddbd 2025-05-09T10:31:07+03:00 Radoslav Gerganov rpc : add rpc_msg_set_tensor_hash_req (#13353)
d9c4accaff30926e8a5fd8a2429e549158a845e0 15e03282bb432631193464100c2237a3b6bcfe4c 2025-05-09T09:06:37+02:00 Xuan-Son Nguyen server : (webui) rename has_multimodal --> modalities (#13393)
ee01d71e585f4a17ae83ec55d77acfdcf0bfa798 8c83449cb780c201839653812681c3a4cf17feed 2025-05-08T18:51:45+02:00 Xuan-Son Nguyen server : (webui) fix a very small misalignment (#13387)
8c83449cb780c201839653812681c3a4cf17feed 1a844be132dbe865358e1de81136920c1d35ac73 2025-05-08T15:37:29+02:00 Xuan-Son Nguyen server : (webui) revamp the input area, plus many small UI improvements (#13365)
233461f8121455f957a47e6a22a77b3bc88277b0 b34c859146630dff136943abc9852ca173a7c9d6 2025-05-05T17:12:19-03:00 oobabooga sampling : Integrate Top-nσ into main sampling chain (and add it to the server) (#13264)
b34c859146630dff136943abc9852ca173a7c9d6 9b61acf06041dcbaff6afa5f28940e93297f8520 2025-05-05T17:03:31+03:00 igardev server : Webui - change setText command from parent window to also send the message. (#13309)
27aa2595321c4d9cc4086a8e67bdea204b8309b0 9fdfcdaeddd1ef57c6d041b89cd8fb7048a0f028 2025-05-04T23:43:42+02:00 Xuan-Son Nguyen mtmd : add C public API (#13184)
fab647e8842c5f80da7e8f2c625dab6a0e19e5d4 dcf886007de4b8e5200f461a13233315f897fb9d 2025-05-02T09:48:31+03:00 Georgi Gerganov server : add cache reuse card link to help (#13230)
e2e1ddb93a01ce282e304431b37e60b3cddb6114 d9d398f84f96d16c308d4976f5e90222ecc2a492 2025-04-29T20:33:10+02:00 matteo server : Prefilling assistant message in openai compatible API (#13174)
43ddab6eeeaab5a04fe5a364af0bafb0e4d35065 1831f538f720d1d99fba146f24f0a8e970838cc4 2025-04-28T21:00:20+03:00 Ville Vesilehto fix(rpc): Improve input validation and error handling (#13069)
77d5e9a76a7b4a8a7c5bf9cf6ebef91860123cba d5fe4e81bd447124836ecfb47d794f8768665b9f 2025-04-26T22:05:31+08:00 SXX ggml: move fp16/bf16 conversion optimizations to CPU backend + export conversion APIs (#13107)
ab47dec3d37aa1927c2ec590e166b76141374ed3 7b53389c24a507564be39e1ea82746a39749059b 2025-04-22T16:16:10+03:00 Georgi Gerganov security : add note about RPC and server functionality (#13061)
35370ba94593c3abc9550328377d461fc4f822b7 8d6600576318dfc6b091fca744b0fd36a5e5255f 2025-04-18T19:58:12+02:00 Xuan-Son Nguyen server : use std::move whenever possible (#12936)
b9154ecff93ff54dc554411eb844a2a654be49f2 2db9ba1464f3de0aceb2b5289963e69fc369cb66 2025-04-18T10:04:51+02:00 Xuan-Son Nguyen mtmd : add methods to access `mtmd_image_tokens` (#12906)
2db9ba1464f3de0aceb2b5289963e69fc369cb66 2f74c354c0f752ed9aabf7d3a350e6edebd7e744 2025-04-18T10:13:42+03:00 Radoslav Gerganov rpc : add RPC_CMD_HELLO (#12955)
c94085df2871d2cad11f6411304d7798d7dd4cdd e8a62631b3b05bcf2ad0e0c686881a9f3e3f03ca 2025-04-11T23:37:41+03:00 Georgi Gerganov server : add VSCode's Github Copilot Chat support (#12896)
e8a62631b3b05bcf2ad0e0c686881a9f3e3f03ca b6930ebc421e20399663bbd3bc7b7266d5236d06 2025-04-11T13:04:14-07:00 yuri@FreeBSD rpc : Set cache directory in rpc-server.cpp on FreeBSD (#12903)
578754b3157d662c2fdd51eaa62b6c1f43d3172c b2034c2b55b36b2192bdefb3b295db2a911370f5 2025-04-11T15:32:14+02:00 Ewan Crawford sycl: Support sycl_ext_oneapi_limited_graph (#12873)
8b9cc7cdd8a0dcf0176c60c755322c95b5965299 64eda5deb9859e87a020e56bab5d2f9ca956f1de 2025-04-10T22:57:16+02:00 Xuan-Son Nguyen llava : introduce libmtmd (#12849)
64eda5deb9859e87a020e56bab5d2f9ca956f1de fe5b78c89670b2f37ecb216306bed3e677b49d9f 2025-04-10T17:24:44+02:00 Xuan-Son Nguyen convert : ability to lazy-load safetensors remotely without downloading to disk (#12820)
a19b5cef16d885c44c635da4a5c97113c1577de8 78a1ba0a4f2bfed5b8b8e312592143d22e531698 2025-04-08T19:54:51+03:00 Georgi Gerganov llama : fix FA when KV cache is not used (i.e. embeddings) (#12825)
78a1ba0a4f2bfed5b8b8e312592143d22e531698 2dabf759e7c8c827d38cdd18d0792070e6a4f4e1 2025-04-08T18:37:06+02:00 Xuan-Son Nguyen server : fix thread.join() on exit (#12831)
8ca6e1c3a4deb6bb27ee294bfd5706098d94ae88 656babd6c21a3b9b3622324cfcc80a2ab78da25b 2025-04-08T14:14:59+05:00 characharm server : webui : Improve Chat Input with Auto-Sizing Textarea (#12785)
b7723942970b70412793f1926a35cfb93d5c157c 23106f94ea2bc3da929afb7330655fd5515d08dc 2025-04-04T09:09:52-05:00 Nauful Shaikh server : webui : Upgrade daisyui, tailwindcss. (#12735)
a10b36c91a091f4606710fba4e9327fd71e0e738 83a88bd6affbe148a622ac730952ac5b8b585979 2025-04-02T14:32:59+03:00 Georgi Gerganov llama : refactor kv cache guard (#12695)
3891e183c61c1e25c2c61afe68d7b95019ea3f89 af6ae1efb27a9a7c3f7f7f84639d2243f7303ac1 2025-03-20T07:02:18+01:00 Daniel Bevenius examples : command.wasm updates (whisper/2904)
5d01670266859444366e4f333ade5e0e5e2ae63d ef03229ff423dd1991f4f44ef1352f03334d86eb 2025-03-28T01:05:44-07:00 Benson Wong server : include speculative decoding stats when timings_per_token is enabled (#12603)
2099a9d5dbdcd2841d02dd396a71d0de70bf4490 296901983700f3c37449bcb555d85d27150a679d 2025-03-27T23:41:04+01:00 Piotr server : Support listening on a unix socket (#12613)
77f9c6bbe55fccd9ea567794024cb80943947901 18b663d8e4ef352a9a15ff15d695fc3258801d60 2025-03-23T19:30:26+01:00 Marius Gerdes server : Add verbose output to OAI compatible chat endpoint. (#12246)
517b5ddbf002b91fd6d6daf5d8db8c88a0173039 a9b59288e222f39fc0311dc66944ed5a86c815fa 2025-03-20T01:22:06+05:30 Gaurav Garg CUDA: Improve flash decoding kernel GPU occupancy for BS=1 case (#12183)
810e0af3f50379682dd46b7967c4aadf3f8286f6 eba92d64c3f6d86de2e6b4dd3a540d2805a22b0c 2025-03-18T12:05:42+02:00 Georgi Gerganov server : fix warmup draft cache type (#12446)
7dfad387e3f6ac98d383ded2d175eb59736a3993 60c902926c928f9c2cd6390ce411876f92feeaf3 2025-03-18T07:27:50+08:00 Molly Sophia llama: Add support for RWKV v7 architecture (#12412)
b1b132efcba216c873715c483809730bb253f4a1 01e8f2138b2e40902afe2983ecbf503a08d74b1d 2025-03-17T23:55:13+05:30 Gaurav Garg cuda : enable CUDA Graph on CUDA Toolkit < 12.x (#12394)
8fcb563613e20a04dd9791f0a9b8a41086428c09 add2a3aa5a1571211aa5c7303b8e80c8d1824b91 2025-03-14T13:47:05+01:00 fairydreaming Load all MoE experts during warmup (#11571)
add2a3aa5a1571211aa5c7303b8e80c8d1824b91 c522ce4143a2b5c277f1e5f65cd570dbd0626466 2025-03-14T11:21:17+01:00 Victor server: fix "--grammar-file" parameter (#12285)
2048b5913d51beab82dfe29955f9008130b936c0 f08f4b3187b691bb08a8884ed39ebaa94e956707 2025-03-13T06:10:05-04:00 Ishaan Gandhi server : fix crash when using verbose output with input tokens that are not in printable range (#12178) (#12338)
4e39a3c332f84b890e91353ec448502cb8373a6f be421fc429795d135786f5a0e489709220a9c43a 2025-03-10T10:59:03Z Olivier Chafik `server`: extract <think> tags from qwq outputs (#12297)
1e2f78a00450593e2dfa458796fcdd9987300dfc 0fd7ca7a210bd4abc995cd728491043491dbdef7 2025-03-09T19:08:20+02:00 Georgi Gerganov server : add speculative decoding presets for FIM (#12287)
7ab364390f92b0b8d83f69821a536b424838f3f8 7c7f3b7f435f41f2508e0e3010f0013cd8335156 2025-03-07T20:54:30+02:00 Georgi Gerganov server : infill gen ends on new line (#12254)
8fad3c7a7c54a25a1ca38dfb08244df55288e675 7cf64f6beecf54c6ac71503181f154667fd4228a 2025-03-07T11:15:33+01:00 Sigbjørn Skjæret server : Log original chat template parsing error (#12233)
06a92a193a07afe445929607be9d5e4d033956fb a057897ad4e48e3df0354256e0cc80dadcb57595 2025-03-05T15:25:45+08:00 Clauszy server : fix cache reuse logic (#12161)
1a24c4621f0280306b0d53a4fa474fc65d3f1b2e becade5de77674696539163dfbaf5c041a1a8e97 2025-03-04T06:24:07Z Olivier Chafik `server`: fix deadly typo in response_format.json_schema.schema handling (#12168)
2679c3b55d1c9c3fed56dea00fea713622e42594 c43af9276b119dae7436b7878d59671d0f6b1a97 2025-03-03T16:17:36+01:00 Daniel Bevenius ci : set GITHUB_ACTION env var for server tests (#12162)
9660ffef582ca275092b621c87085a6eea136a90 c950a1f69269bff416d74349a82d78181ce6f0f8 2025-03-03T20:54:08+08:00 ag2s20150909 ggml : fix kleidiai build (#12159)
70680c48e5f77d2d3138712a6582bd8c1e548922 c43a3e7996e585e2addde1e44057a4f3cdbadef8 2025-02-28T05:41:47-08:00 William Tambellini ggml : upgrade init_tensor API to return a ggml_status (#11854)
d7cfe1ffe0f435d0048a6058d529daf76e072d9c a82c9e7c23ef6db48cebfa194dc9cebbc4ac3552 2025-02-25T18:52:56Z Olivier Chafik docs: add docs/function-calling.md to lighten server/README.md's plight (#12069)
401af80b546005a06854827b732e3b46979ae028 c132239bfbc1aae3a96dfee3350afcb491f64ade 2025-02-25T11:52:52Z rhjdvsgsgks server: handle echo=false on /v1/completions (#12060)
0b52745649062c04b546aab662cfdb220f4f0621 4d1051a40ffc2fdff80bc532eea5b9568b85c156 2025-02-25T10:40:22Z Olivier Chafik server: support add_generation_prompt query param (#12062)
3e9a2860e996657fc10db8393cf65adc40703082 58d07a8043a1395177cf77b3e4f388e34182ae64 2025-02-25T01:29:33-08:00 Vitali Lovich llama : expose llama_model_n_head_kv in the API (#11997)
7a2c913e66353362d7f28d612fd3c9d51a831eda 08d5986290cc42d2c52739e046642b8252f97e4b 2025-02-24T09:09:51-07:00 Alex Brooks llava : Add Granite Vision Support (#11794)
cf756d6e0a314e0fe25ff944341d79ea8c94cc96 d70908421ff22b013e8209f2d12e5c750663c620 2025-02-22T12:46:31+02:00 Georgi Gerganov server : disable Nagle's algorithm (#12020)
c392e5094deaf2d1a7c18683214f007fad3fe42b c5d91a74006c49376590ef2b67420bc7ce206397 2025-02-21T03:43:22+09:00 momonga server (webui): Fix Premature Submission During IME Conversion (#11971)
d07c621393fab6cf32f3add2aa65e4d5331d4a67 abd4d0bc4f1a9a0e429bc8ee0d5ece2a394a0a39 2025-02-19T12:29:52+01:00 Daniel Bevenius common : add llama.vim preset for Qwen2.5 Coder (#11945)
b58934c1836b5ea51dbacbe899eee125775e77c9 63e489c025d61c7ca5ec06c5d10f36e2b76aaa1d 2025-02-19T00:01:44+02:00 igardev server : (webui) Enable communication with parent html (if webui is in iframe) (#11940)
63e489c025d61c7ca5ec06c5d10f36e2b76aaa1d 63ac12856303108ee46635e6c9e751f81415ee64 2025-02-18T18:03:23Z Olivier Chafik tool-call: refactor common chat / tool-call api (+ tests / fixes) (#11900)
63ac12856303108ee46635e6c9e751f81415ee64 5137da7b8c3eaa090476a632888ca178ba109f8a 2025-02-18T14:21:41+01:00 Xuan-Son Nguyen server : add TEI API format for /rerank endpoint (#11942)
09aaf4f1f5b69b5173b7fcd24eab96729f6b242a 73e2ed3ce3492d3ed70193dd09ae8aa44779651d 2025-02-18T17:12:49+08:00 xiaobing318 docs : Fix duplicated file extension in test command (#11935)
c4d29baf3236b011730b6ccaae6852e781fb1b91 2eea03d86a2d132c8245468c26290ce07a27a8e8 2025-02-17T11:25:12+01:00 Antoine Viallon server : fix divide-by-zero in metrics reporting (#11915)
0f2bbe656473177538956d22b6842bcaa0449fab fe163d5bf3fb8e99c96ff6d21775fa3d1daee3cf 2025-02-16T18:11:22+01:00 Xuan-Son Nguyen server : bump httplib to 0.19.0 (#11908)
f3552296924e704c11ca936907b9cad7873db8e2 fc1b0d0936e4dfc52a81f38e7420c7d23f6caa88 2025-02-15T10:11:36Z Olivier Chafik server: fix type promotion typo causing crashes w/ --jinja w/o tools (#11880)
c1f958c0381e797135b7d42a677542133264193c c48f630d1c1942fce08aa7cb18a53ace443cd611 2025-02-13T17:22:44+01:00 Reza Rahemtola server : (docs) Update wrong tool calling example (#11809)
c48f630d1c1942fce08aa7cb18a53ace443cd611 bd6e55bfd3f3af3e5705cf87a10e5178cef7c3c1 2025-02-13T14:46:59+01:00 Daniel Bevenius llama : add --completion-bash option (#11846)
c7f460ab882065ec5696e3d51e24dbf67b539287 27e8a23300e30cd6ff6107ce262acf832ca60597 2025-02-13T10:05:16Z Olivier Chafik `server`: fix tool-call of DeepSeek R1 Qwen, return reasoning_content (Command 7RB & DeepSeek R1) unless `--reasoning-format none` (#11607)
e4376270d971cff7992bdb6c5412a739195b1459 3e693197724c31d53a9b69018c2f1bd0b93ebab2 2025-02-13T01:25:34-05:00 Oleksandr Kuvshynov llama.cpp: fix warning message (#11839)
a394039db004c6ee00098250d160b5aa018c2314 be3bbd62153820ff6d358c817360927f429105c4 2025-02-13T01:02:38+01:00 Diego Devesa ggml-cpu : add chunking support to mul_mat_id (#11666)
31afcbee0eebbc998ab311aa314e389d60aa2127 5c4284d57bbc613121e90de5271f1cbc95d55872 2025-02-12T22:47:11Z Woof Dog server : (webui) Give copy button back to all message bubbles (#11814)
a18f481f99962638092d6f1c98b1d34d3e3256de b9ab0a4d0b2ed19effec130921d05fb5c30b68c5 2025-02-11T14:06:45+01:00 Daniel Bevenius server : use common_token_to_piece instead of common_detokenize (#11740)
507f9174fe856772b6c7c17e81be442de7ee6d1e 19b392d58dc08c366d0b29bd3b9c6991fa4e1662 2025-02-10T21:23:17+01:00 Xuan-Son Nguyen server : (webui) introduce conversation branching + idb storage (#11792)
0893e0114e934bdd0eba0ff69d9ef8c59343cbc3 d7b31a9d84297b493a61c9a8ee3a458e7ccc64a7 2025-02-10T18:03:28+01:00 Xuan-Son Nguyen server : correct signal handler (#11795)
55ac8c7791ff44aeb82bd7fe3ca2041844fc77f1 e6e658319952f7ad269dc11275b9edddc721fc6d 2025-02-08T21:54:50+01:00 Xuan-Son Nguyen server : (webui) revamp Settings dialog, add Pyodide interpreter (#11759)
e6e658319952f7ad269dc11275b9edddc721fc6d aaa55053076f3d5d7da4d9a877cb77e112dabed4 2025-02-08T19:09:55Z Woof Dog server : (webui) increase edit textarea size (#11763)
aaa55053076f3d5d7da4d9a877cb77e112dabed4 bdcf8b6a56f4d49d3420ae5b21cdf9a116040551 2025-02-08T18:08:43+02:00 Georgi Gerganov server : minor log updates (#11760)
0cf867160ca9d492e06c0bc688b337cffd1eb187 d2fe216fb2fb7ca8627618c9ea3a2e7886325780 2025-02-08T10:42:34+01:00 Xuan-Son Nguyen server : (webui) fix numeric settings being saved as string (#11739)
2d219b389e8c8c40bce547b08c8aa7add60fde1f 333820d7491cd31c707a340ff23b984a84e40154 2025-02-07T08:55:47-05:00 Christian Fillion vocab : ignore invalid UTF-8 input in the BPE tokenizer (#11729)
7ee953a64a40c09438b2064539becdbc577cefd0 ec3bc8270bc67b58955748d40a3e558a05b2d8f2 2025-02-07T04:33:27-05:00 Christian Fillion llama : add llama_sampler_init for safe usage of llama_sampler_free (#11727)
b7552cfcbc7defccd8bdefd0a7b9c47d145ed3d7 225bbbfa39930cda38a2e5d1f3e5b38226732009 2025-02-07T09:15:22+01:00 Daniel Bevenius common : add default embeddings presets (#11677)
1d20e53c40c3cc848ba2b95f5bf7c075eeec8b19 2fb3c32a1634488a5265d1304ab37628eeb5480d 2025-02-06T09:29:13-05:00 Patrick Peng rpc: fix known RCE in rpc-server (ggml/1103)
2fb3c32a1634488a5265d1304ab37628eeb5480d 9ab42dc722ad19a12af80f38a06474d498f96da3 2025-02-06T17:32:29+01:00 Xuan-Son Nguyen server : (webui) migrate project to ReactJS with typescript (#11688)
902368a06b915b860236cfc97ff885b2aceae256 c3db0480bb820e120249014b380e1f4badf2a1c1 2025-02-05T19:52:31-06:00 Charles Duffy metal : avoid breaking build when metal API predates TARGET_OS_VISION (#11690)
3962fc1a7956dd0afacfbce10fd1a3ffd3ad857e 1bef571f6a23c36a26dabacba631763f9a893b83 2025-02-04T18:25:42+01:00 Xuan-Son Nguyen server : add try..catch to places not covered by set_exception_handler (#11620)
db288b60cb49eab69703f995379b8d75c18bf5b3 106045e7bb8db481bb2ebbc60e3b53cb27ada117 2025-02-04T15:48:53Z Olivier Chafik `tool-call`: command r7b fix for normal responses (#11608)
f117d84b48104992ba16961b35a96fa93efbb355 534c46b53c23613628d72e93c63ea01ea4d1e2ac 2025-02-04T19:15:24+08:00 Jhen-Jie Hong swift : fix llama-vocab api usage (#11645)
b3451785aca16fbf4214eeba7e4612676cdf8ccb 1d1e6a90bcf485ad2dee309c31cf19bd802465e5 2025-02-04T00:10:52+01:00 Xuan-Son Nguyen server : (webui) revert hacky solution from #11626 (#11634)
1d1e6a90bcf485ad2dee309c31cf19bd802465e5 5598f475be3e31430fbe17ebb85654ec90dc201e 2025-02-03T22:16:27Z Woof Dog server : (webui) allow typing and submitting during llm response (#11626)
5598f475be3e31430fbe17ebb85654ec90dc201e 8ec05832fa8409c49b3bbd13f957c6ae8486e618 2025-02-03T16:45:38+01:00 Daniel Bevenius server : remove CPPHTTPLIB_NO_EXCEPTIONS define (#11622)
d92cb67e37abc23b1c6f7b0ef27a9889da8537e3 6eecde3cc8fda44da7794042e3668de4af3c32c6 2025-02-03T09:42:55Z mashdragon server : (webui) Fix Shift+Enter handling (#11609)
bfcce4d693617ec843d0b2510f6ee16e6bc6720d 69804487e0b10f2c5c06316f0ac0eb6ada68433f 2025-02-02T09:25:38Z Olivier Chafik `tool-call`: support Command R7B (+ return tool_plan "thoughts" in API) (#11585)
ff227703d6d6e1888bdc7af6138514092ffcdb96 0cec062a638700495673f5494d200b74340538be 2025-02-01T23:55:32-08:00 Michał Moskal sampling : support for llguidance grammars (#10224)
a83f528688324a21484a97af1d1be5e1bc8d4c8e b1bcd309fc8ac929cbd4a6207b3a19886bda031f 2025-01-31T14:15:25Z Olivier Chafik `tool-call`: fix llama 3.x and functionary 3.2, play nice w/ pydantic_ai package, update readme (#11539)
4a2b196d03d52da31236390e9f5694a88d43d11d 1bd3047a939e561adfb3c7dd2e17c4cc7a4e4e6f 2025-01-31T08:12:40Z Olivier Chafik server : fix --jinja when there's no tools or schema (typo was forcing JSON) (#11531)
a2df2787b32e0846205f7151dfad88ceab592beb 553f1e46e9e864514bbd6bf4009146db66be0541 2025-01-31T06:04:53+01:00 Daniel Bevenius server : update help metrics processing/deferred (#11512)
4314e56c4f8c5091f45732f39bd94c0c6c323798 496e5bf46bab757d05e18227cb4e17055ae42f42 2025-01-30T11:05:00+01:00 Daniel Bevenius server : use lambda instead of std::bind (#11507)
496e5bf46bab757d05e18227cb4e17055ae42f42 7919256c57f05c09b0b50ec9abb37ff62dab7251 2025-01-30T04:11:53-05:00 Isaac McFadyen server : (docs) added response format for /apply-template [no ci] (#11503)
e0449763a4f335cca374254a72892141f41eaa59 eb7cf15a808d4d7a71eef89cc6a9b96fe82989dc 2025-01-30T05:48:14+01:00 Daniel Bevenius server : update json snippets in README.md [no ci] (#11492)
eb7cf15a808d4d7a71eef89cc6a9b96fe82989dc 66ee4f297cff3c7ce98b31dbc0ce909d41b9e408 2025-01-29T12:45:44-06:00 Nigel Bosch server : add /apply-template endpoint for additional use cases of Minja functionality (#11489)
e51c47b401f8cb5f21630a05171e2529cde4d186 2711d0215ff6a1ecb2202ac8c1f135bceed7057b 2025-01-29T16:34:18+01:00 Daniel Bevenius server : update auto gen files comments [no ci] (#11484)
cf8cc856d7d02165bd08593b4757e1256a62d501 d0c08040b6c8bebeade7b8d5764df6cf901678d5 2025-01-28T16:03:42-07:00 peidaqi server : Fixed wrong function name in llamacpp server unit test (#11473)
49b0e3cec4b67dc9f4debe3a16acd4c819f751d6 20a758155bc5f37290b20ea44d76ba99c4e7f2cb 2025-01-25T16:36:44+01:00 Xuan Son Nguyen server : fix cleaning up stream task (#11418)
c07e87f38bd0c22ec6dbc852ae50aaa1c64632d4 564804b79b78df1469ec8646869972de5e885ec4 2025-01-24T09:02:38+01:00 stduhpf server : (webui) put DeepSeek R1 CoT in a collapsible <details> element (#11364)
58456616408c828a1ce6d2481940fd1c97bce3b5 f211d1dc10332b7e89a4abd1041903fa63bfed27 2025-01-23T13:56:05+01:00 Xuan Son Nguyen server : add more clean up when cancel_tasks is called (#11340)
12c2bdf2de34f747d13b270fc9d3b52490bf194f c64d2becb13f2a7c0145b516a05f028d949a046b 2025-01-22T17:44:40+01:00 Diego Devesa server : fix draft context not being released (#11354)
6171c9d25820ccf676b243c172868819d882848f e28245f35f2faaf249dd352998b3693a8cc28c51 2025-01-21T13:18:51Z Olivier Chafik Add Jinja template support (#11016)
f30f099228f774209aa3010b78dfbe5d262e69aa f26c87417999209e7f4576b4f3ecf7a5b9c66a29 2025-01-18T14:12:05+01:00 Xuan Son Nguyen server : implement cancellable request (#11285)
0ccd7f3eb2debe477ffe3c44d5353cc388c9418d f446c2cf6a56a750b67c967505e717a996d2f2fd 2025-01-15T05:44:38+01:00 Daniel Bevenius examples : add embd_to_audio to tts-outetts.py [no ci] (#11235)
c5bf0d1bd7eb8762edca47e0a95f64e6fbfaf5b1 091592d758cb55af7bfadd6c397f61db387aa8f3 2025-01-14T14:09:33+03:30 ebraminio server : Improve code snippets direction between RTL text (#11221)
504af20ee4eae72080a56d59d744f6774f7901ce 84a44815f704aaed8e8edec7a39e846a975c7ba9 2025-01-13T22:53:31+03:30 ebraminio server : (UI) Improve messages bubble shape in RTL (#11220)
437e05f714cdd67757405221578d3f95f8228b63 ca001f6656c1c3d29ef479b3aa5d669453e63be5 2025-01-13T17:16:39+03:30 ebraminio server : (UI) Support for RTL text as models input or output (#11208)
afa8a9ec9b520137bbd1ca6838cda93ee39baf20 c05e8c9934f94fde49bc1bc9dc51eed282605150 2025-01-12T11:32:42+02:00 Georgi Gerganov llama : add `llama_vocab`, functions -> methods, naming (#11110)
8eceb888d7b7f5e93d20a4f85ca6511022b87040 f8feb4b01af374ad2fce302fd5790529c615710b 2025-01-09T11:28:29+01:00 Daniel Bevenius server : add tooltips to settings and themes btn (#11154)
53ff6b9b9fb25ed0ec0a213e05534fe7c3d0040f 017cc5f446863316d05522a87f25ec48713a9492 2025-01-07T18:01:58+01:00 Johannes Gäßler GGUF: C++ refactor, backend support, misc fixes (#11030)
e6e7c75d94adf4d39e846d30807c531ff22865e7 09186fabbe05236f2b9446ba6c643cb737540d10 2025-01-06T15:36:08+02:00 Georgi Gerganov server : fix extra BOS in infill endpoint (#11106)
6369f867a410416239d9f20ec27c2b1d6a9fee52 47182dd03fe04a4ffda5d7f4c8a109ae0056cf56 2025-01-06T10:28:17+01:00 Daniel Bevenius llama : rename missed batch params/vars to ubatch (#10059)
47182dd03fe04a4ffda5d7f4c8a109ae0056cf56 3e6e7a6bc2c4b980a0cf0fcb5cb3b79a965b5f14 2025-01-06T10:55:18+02:00 Georgi Gerganov llama : update llama_model API names (#11063)
2f0ee84b9b02d2a98742308026f060ebdc2423f1 0da5d860266c6928b8c9408efbd264ae59fedda6 2025-01-02T18:06:12+01:00 Pierrick Hymbert server: bench: minor fixes (#10765)
0da5d860266c6928b8c9408efbd264ae59fedda6 a45433ba209ee0b33d02c7dc4c31f29894ad83a6 2025-01-02T15:05:18+01:00 Xuan Son Nguyen server : allow using LoRA adapters per-request (#10994)
45095a61bfd164e87563a0dc0fbd7b0e9891590b 5896c65232c7dc87d78426956b16f63fbf58dcf6 2024-12-31T15:22:01+01:00 Xuan Son Nguyen server : clean up built-in template detection (#11026)
5896c65232c7dc87d78426956b16f63fbf58dcf6 bc7b1f86324279a3dabb705c04ad754a2b27df16 2024-12-31T12:34:13+01:00 Xuan Son Nguyen server : add OAI compat for /v1/completions (#10974)
f865ea149d71ef883e3780fced8a20a1464eccf4 16cdce7b68218959e0658e2f95b4572573d5008e 2024-12-28T10:09:19-05:00 Isaac McFadyen server: added more docs for response_fields field (#10995)
16cdce7b68218959e0658e2f95b4572573d5008e d79d8f39b4da6deca4aea8bf130c6034c482b320 2024-12-28T15:08:54Z Alexey Parfenov server : fix token duplication when streaming with stop strings (#10997)
9ba399dfa7f115effc63d48e6860a94c9faa31b2 2cd43f4900ba0e34124fdcbf02a7f9df25a10a3d 2024-12-24T21:33:04+01:00 Reza Kakhki server : add support for "encoding_format": "base64" to the */embeddings endpoints (#10967)
09fe2e76137dde850b13313f720e7ffa17efdefa 30caac3a68a54de8396b21e20ba972554c587230 2024-12-24T19:39:49+03:00 NeverLucky server: allow filtering llama server response fields (#10940)
14b699ecde8f1e9e251ebff9eca39ebc5603b83b 485dc01214f266afff7004bc702498b491abc404 2024-12-23T12:52:25+01:00 Xuan Son Nguyen server : fix missing model id in /model endpoint (#10957)
485dc01214f266afff7004bc702498b491abc404 86bf31cfe684849157f0875b4f0ebccac7034547 2024-12-23T12:02:44+01:00 Xuan Son Nguyen server : add system_fingerprint to chat/completion (#10917)
86bf31cfe684849157f0875b4f0ebccac7034547 b92a14a841fb4dfaf27b29d982ec8ba5289a3bff 2024-12-23T10:39:30+02:00 Radoslav Gerganov rpc-server : add support for the SYCL backend (#10934)
0ca416c91aea4549d9c77e3efeca403e15aa6c75 21ae3b9be83820565d1a720999b7f63ce95b4920 2024-12-20T14:12:06+01:00 Xuan Son Nguyen server : (UI) fix copy to clipboard function (#10916)
57bb2c40cd94c5a09f5210ed8264cc93b21c4b7e a3c33b1dce2d4f25040b75f66629104bd1e40128 2024-12-19T15:40:08+01:00 Xuan Son Nguyen server : fix logprobs, make it OAI-compatible (#10783)
0bf2d10c5514ff61b99897a4a5054f846e384e1e 7bbb5acf125d1d2840cac7d31b9aaa72210dd5ec 2024-12-18T19:27:21+02:00 Georgi Gerganov tts : add OuteTTS support (#10784)
7bbb5acf125d1d2840cac7d31b9aaa72210dd5ec 152610eda91217ac409342cd976d05f5114ad39f 2024-12-18T04:00:07-10:00 Gaetan Bisson server: avoid overwriting Authorization header (#10878)
152610eda91217ac409342cd976d05f5114ad39f 0e70ba686e6c717a0aa41d88284e2a392c2bd0cd 2024-12-18T13:01:41+02:00 Georgi Gerganov server : output embeddings for all tokens when pooling = none (#10861)
0e70ba686e6c717a0aa41d88284e2a392c2bd0cd 46828872c31b25df16169cbbf5c2225fa9cb0675 2024-12-18T11:05:29+02:00 Georgi Gerganov server : add "tokens" output (#10853)
46828872c31b25df16169cbbf5c2225fa9cb0675 6b064c92b4c0228e333193c167f2c98d2ec8d9bc 2024-12-18T09:55:09+01:00 Xuan Son Nguyen server : (embeddings) using same format for "input" and "content" (#10872)
d62b532c52e0118323277eaa5f442e11ce6505ed 081b29bd2a3d91e7772e3910ce223dd63b8d7d26 2024-12-17T17:24:22-05:00 DAN™ Use model->gguf_kv for loading the template instead of using the C API. (#10868)
05c3a444b8b017b01b366b725ba22c740aae6b38 382bc7f2e8ffd0b89f23e840d097e21f301197ba 2024-12-17T16:00:24Z krystiancha server : fill usage info in embeddings and rerank responses (#10852)
227d7c5a7f4cc7734fde8a4ef4382d613486d3c8 7b1ec53f56bb72c49e4c8434157895f94d3709c2 2024-12-17T09:52:09+01:00 Xuan Son Nguyen server : (UI) fix missing async generator on safari (#10857)
5478bbcd173e7027af7689493c7421719f5c43df b5ae1ddff93403300fc79c7ab5ee73b8cfbb3457 2024-12-15T05:55:54-06:00 Vinesh Janarthanan server: (UI) add syntax highlighting and latex math rendering (#10808)
89d604f2c87af9db657d8a27a1528bc4b7579c29 e52aba537a34d51a65cddec6bc6dafc9031edc63 2024-12-14T22:29:45Z Michelle Tan server: Fix `has_next_line` in JSON response (#10818)
a76c56fa1a3d27467eb97468d8c3b2fe1243b61a c27ac678dd393af0da9b8acf10266e760c8a0912 2024-12-13T12:23:52-08:00 lhez Introducing experimental OpenCL backend with support for Qualcomm Adreno GPUs (#10693)
5555c0c1f66d766c544c30699190dec0285bcbfc 973f328b1e92a6406030442dfd15b29449e89747 2024-12-11T22:40:40Z CentricStorm docs: update server streaming mode documentation (#9519)
973f328b1e92a6406030442dfd15b29449e89747 235f6e14bf0ed0211c51aeff14139038ae1000aa fb18934a97425c42c8b32a1baaa94f0080eb051d 2024-12-11T23:14:46+02:00 Georgi Gerganov Merge pull request #10788 from ggerganov/gg/gguf-py-0.11.0
235f6e14bf0ed0211c51aeff14139038ae1000aa 1a31d0dc00ba946d448e16ecc915ce5e8355994e 2024-12-11T20:52:14+01:00 Xuan Son Nguyen server : (UI) add tok/s, get rid of completion.js (#10786)
4b4d92b0986e3b627b9a9ef4782973108bf47691 43041d2eb32623d5b6ca734313327abe96f73146 2024-12-11T10:47:43Z CentricStorm docs: fix server documentation formatting (#10776)
b685daf3867c54e42a9db484d7b92619021d4510 dafae66cc242eb766797194d3c85c5e502625623 2024-12-10T14:23:17-06:00 Jeff Bolz vulkan: request round-to-even for fp16 in im2col/rope_head (#10767)
750cb3e246f7e544124cf18cb0c5e0c8b7e38738 a86ad841f103e471ac0fd7ee8852d1eb5015ce89 2024-12-10T18:23:24+01:00 Andreas Kieslinger CUDA: rename macros to avoid conflicts with WinAPI (#10736)
a86ad841f103e471ac0fd7ee8852d1eb5015ce89 a05e2afcc241c1ecd38ec5cb4c579d90cdf3f918 2024-12-10T17:22:34Z Yüg server : add flag to disable the web-ui (#10762) (#10751)
ce8784bdb153ff7794dde5a50b0ebfa51baa6171 e52522b8694ae73abf12feb18d29168674aa1c1b 2024-12-08T23:04:29+01:00 Xuan Son Nguyen server : fix format_infill (#10724)
e52522b8694ae73abf12feb18d29168674aa1c1b 06d70147e6480c021e493c442ae0f0d83ae366de 2024-12-08T20:38:51+01:00 Xuan Son Nguyen server : bring back info of final chunk in stream mode (#10722)
3573fa8e7b7f0865638b52b4e9b4d2006f0558a2 d9c3ba2b7749c00df477599aa141a98b4521aa2c 2024-12-07T20:21:09+01:00 Xuan Son Nguyen server : (refactor) no more json in server_task input (#10691)
ce4a7b849388b67d45ad420bdd82d5efcd55647a 19d8762ab61df8286367588a80b9c7db4cb568db 2024-12-07T18:02:05+02:00 Georgi Gerganov server : various fixes (#10704)
19d8762ab61df8286367588a80b9c7db4cb568db c2a16c0bdbe2e51adf318918bad82f0c3e3d6f3b 2024-12-07T13:37:50+01:00 Djip007 ggml : refactor online repacking (#10446)
c2a16c0bdbe2e51adf318918bad82f0c3e3d6f3b 3df784b3050f657ea681f804187ce5bddb433e88 2024-12-07T11:52:44+02:00 Georgi Gerganov server : fix free of spec context and batch (#10651)
f162d45a21b27f7613f14539f9a4932d6ff3ca48 6c5bc0625fae6909cb40def15bc4bb45db6f7f4d 2024-12-06T13:29:05+01:00 Xuan Son Nguyen common : bring back --no-warmup to server (#10686)
6c5bc0625fae6909cb40def15bc4bb45db6f7f4d 7736837d62efed1dbebfe579472fca041eda12d6 2024-12-06T11:14:32+01:00 Xuan Son Nguyen server : (refactoring) do not rely on JSON internally (#10643)
7736837d62efed1dbebfe579472fca041eda12d6 c9c6e01daedac542b174c235872569fce5385982 2024-12-05T23:36:41+02:00 Plamen Minev fix(server) : not show alert when DONE is received (#10674)
1da7b765692764a8b33b08da61cbee63812a7bd9 59f4db10883a4f3e855cffbf2c3ab68430e95272 2024-12-04T22:38:20+02:00 Georgi Gerganov server : fix speculative decoding with context shift (#10641)
91c36c269bca75b2d08119c653512cd20b4ea2ba 1cd3df46bd49a0c1c78da8b68c956448a73b7476 2024-12-03T19:38:44+01:00 Xuan Son Nguyen server : (web ui) Various improvements, now use vite as bundler (#10599)
efb6ae963031709fc331e6e48cc4606ac8f9c3a7 667d70d1704dfa6977505f5d01d4638669b90dce 2024-12-02T19:27:24+01:00 PAB feat: add `GGML_UNARY_OP_ARGMAX` Metal kernel (ggml/1019)
3b4f2e33e2cbfca621e623c4b92b88da57a8c2f4 82bca2257b3cec72676abb26011f1b99fcdab29d 2024-12-03T12:54:30+01:00 Xuan Son Nguyen llama : add missing LLAMA_API for llama_chat_builtin_templates (#10636)
70b98fadbc8c07a0144f3b50a4d7ab7e2aeff878 642330ac7cea11dc1f9d3df2b8f3dbd10b5e3f3e 2024-12-03T11:20:00+02:00 Georgi Gerganov server : fix default draft model parameters (#10586)
642330ac7cea11dc1f9d3df2b8f3dbd10b5e3f3e 8648c521010620c2daccfa1d26015c668ba2c717 2024-12-02T22:10:19+01:00 Xuan Son Nguyen llama : add enum for built-in chat templates (#10623)
64ed2091b24b2f9747148fdf49a34ed5938762c3 991f8aabeec89d801300bb179e52013fb0eb0584 2024-12-02T21:45:54+08:00 haopeng server: Add "tokens per second" information in the backend (#10548)
86dc11c5bcf34db2749d8bd8d4fa07a542c94f84 6acce3971098772a8aacb10fe8550b4119110581 2024-12-01T12:33:12+01:00 alek3y server : bind to any port when specified (#10590)
b782e5c7d453b3f1fa8dc6c34cde7e2fa946af93 3a8e9af402f7893423bdab444aa16c5d9a2d429a 2024-11-29T21:48:56+01:00 Xuan Son Nguyen server : add more test cases (#10569)
f095a649ec390e04dfab1b04e646ae8549dafaef 678d7994f4da0af3d29046be99950ac999ee9762 2024-11-29T00:18:02-06:00 Jeff Bolz vulkan: get the first command buffer submitted sooner (#10499)
6c595676899013102fdb0aa4b06a49954300c94a 890719311b6535e572f15965c6d7ec4ac2537f60 2024-11-28T19:17:49+01:00 Xuan Son Nguyen server : (tests) don't use thread for capturing stdout/stderr, bump openai client library (#10568)
45abe0f74ee281aea6e5283c1e738061256cfcae 0bbd2262a3263f37385297b30de37941836e57f7 2024-11-26T16:20:18+01:00 Xuan Son Nguyen server : replace behave with pytest (#10416)
7db3846a94ce7683b3e8120abe427457edf840c9 c6807b3f28cc3dbfda3ec390bcb87e69fb5634e2 2024-11-26T13:05:20+01:00 Diego Devesa ci : publish the docker images created during scheduled runs (#10515)
84e1c33cde9e0a7aafcda2d4f21ba51c300482d7 811872a59daefb25fc0c4326bcb6d8ae893c2f7c 2024-11-26T13:36:40+02:00 Georgi Gerganov server : fix parallel speculative decoding (#10513)
9fd8c2687f5aa2f095ac6e12a376e1c0583888e8 47f931c8f9a26c072d71224bc8013cc66ea9e445 2024-11-25T22:28:27+02:00 Georgi Gerganov server : add more information about error (#10455)
47f931c8f9a26c072d71224bc8013cc66ea9e445 106964e3d266740f571b5aad7b57545b4a901ac9 2024-11-25T21:50:07+02:00 Georgi Gerganov server : enable cache_prompt by default (#10501)
a9a678a6b2264e5895533217b0cf8f250534cc58 9ca2e677626fce759d5d95c407c03677b9c87a26 2024-11-25T08:11:55-08:00 brucepro Add download chat feature to server chat (#10481)
9ca2e677626fce759d5d95c407c03677b9c87a26 5931c1f233c616083d64e41a228249d58e039aa5 2024-11-25T16:31:38+02:00 Georgi Gerganov server : add speculative decoding support (#10455)
5a8987793f3e7c1fbfa6806bfcd17d578071b6c9 d9d54e498d38ec99bbc0031022f9c92711e97bbc 2024-11-25T17:31:10+08:00 Neo Zhang Jianyu [SYCL] Fix building Win package for oneAPI 2025.0 update (#10483)
6dfcfef0787e9902df29f510b63621f60a09a50b 599b3e0cd40432cd1975a8906f3db70bbe53b627 2024-11-22T17:44:08+08:00 蕭澧邦 ci: Update oneAPI runtime dll packaging (#10428)
bcdb7a23862b61aa307fc462fadfe1e2e653d010 f245cc28d4eb900efad0bc740145f58d713c6e4f 2024-11-16T18:26:54+05:00 MaggotHATE server: (web UI) Add samplers sequence customization (#10255)
9901068ac78838745e604fffb4601d315a610456 231f9360d94446cd083b6b116f63991b1328c484 2024-11-15T05:48:49-04:00 Xuan Son Nguyen server : (web UI) add copy button for code block, fix api key (#10242)
5a54af4d4f588f109f31e456483fdf77096399d9 1607a5e5b08f4e55f118af3d7de325949d8f1835 2024-11-15T04:09:12+01:00 Romain Biessy sycl: Use syclcompat::dp4a (#10267)
fb4a0ec0833c71cff5a1a367ba375447ce6106eb 5ea926dad7f62ebccff7b24784bd1e01a06d13ae 2024-11-13T20:00:35+02:00 Michael Podvitskiy llama : propagate the results of `graph_compute` (#9525)
ff7fb670d0a62897c5662536aeb53422c549fbe8 0e712a5acbbdd1593e5aeb86d4f6b896a11b438c 2024-11-13T11:16:30Z Alexey Parfenov server : add missing docs (#10269)
0e712a5acbbdd1593e5aeb86d4f6b896a11b438c a0ec17b32ec6077f5ca22fe833ebdc9b86795a4d 2024-11-13T19:15:23+08:00 Jhen-Jie Hong server : fix incorrect res in validate_model_chat_template (#10272)
b141e5f6efbab3a00633df88c4f9425bfe8b78ab 4b3a9212b602be3d4e2e3ca26efd796cef13c55e 2024-11-11T08:38:43+02:00 Georgi Gerganov server : enable KV cache defrag by default (#10233)
505f33274d60676320216b662a97672a76ec600e 160687b3ed002eee83a04de83a9cd752f928ced1 2024-11-11T00:42:25+05:00 MaggotHATE server : (web UI) Add back sampler settings (#10239)
76c6e7f10551960e4ec9e14e0535b72081f1c7ad a71d81cf8c1afb26b166f897c94ee1581f9fac7d 2024-11-07T18:44:38-04:00 Xuan Son Nguyen server : minor UI fix (#10207)
a71d81cf8c1afb26b166f897c94ee1581f9fac7d eec4d71737b32f312e0082b671629a0368e1a20d 2024-11-07T17:31:10-04:00 Xuan Son Nguyen server : revamp chat UI with vuejs and daisyui (#10175)
b11f9ba9b8ce319f04b88afe40d264e6b7f4ba46 94d8cb8be13b7c4d04eeca5a2b956b9148e6f222 2024-11-06T13:29:01+02:00 Georgi Gerganov server : remove hack for extra parallel slot (#10187)
9e0ecfb697d297355e43c20559d29bcc71beb0c3 6a066b9978533e2ab9890b7f4f8c0262d91798b3 2024-11-04T16:33:29+01:00 Xuan Son Nguyen server : clarify /slots endpoint, add is_processing (#10162)
42cadc74bda60afafb45b71b1a39d150ede0ed4d 45950415ed985830c59bf42cf9c9216b20cf08ef 2024-11-02T16:34:56Z sasha0552 server : fix slot selection by lru (#10126)
45950415ed985830c59bf42cf9c9216b20cf08ef 1926d6e39d6f6358bc1a4c52316a560178be7233 2024-11-02T18:34:00+02:00 Georgi Gerganov server : fix endpoint checks (#10135)
d865d1478cd4e403f82d793c2afcd0f943412f05 1804adb0cfee4811eaf633741503d683a46e4c77 2024-11-01T13:33:14Z sasha0552 server : fix smart selection of available slot (#10120)
e597e50794f07ec8dc24b9efb18f94ec6386fda0 85679d37f34f66783cc04664a06c405b28e8e035 2024-11-01T11:09:59+08:00 Zhenwei Jin build: fix build error in Windows env with OneAPI setup (#10107)
0a683e8088d849626e7471f9e2ed381f7dbdf2e9 dea5e86051aadcdf42f7db7a8855a78d8f5ff3d6 2024-10-31T06:02:35-07:00 Kevin Gibbons server : include scheme when printing URL (#10106)
8125e6cbfcf2b3b9066e4d923aca9295526730f5 8841ce3f439de6e770f70319b7e08b6613197ea7 2024-10-28T08:49:32+02:00 Georgi Gerganov server : don't overfill the batch during infill (#10018)
bc5ba007b2c83ac95875e68724dabfc12159fc61 958367bf530d943a902afa1ce1c342476098576b 2024-10-25T10:13:46+03:00 Georgi Gerganov server : check that the prompt fits in the slot's context (#10030)
958367bf530d943a902afa1ce1c342476098576b 40f2555797f97314de749873cdc29dc102be66e2 2024-10-24T21:51:22+02:00 Xuan Son Nguyen server : refactor slot input data, move tokenizer to HTTP thread (#10023)
0a1c750c80147687df267114c81956757cc14382 190a37d7977eb5bd6a729299bd1e371208c87149 2024-10-23T13:27:51-06:00 wwoodsTM server : samplers accept the prompt correctly (#10019)
6b8447352df3d662b56280c8fc38d7f092885787 674804a99617b4f90292b4080ecab450ea3d30ba 2024-10-22T16:16:01+08:00 leo-pony [CANN] Adapt to dynamically loadable backends mechanism (#9970)
afd9909a6481402844aecefa8a8908afdd7f52f1 87421a23e8c60e00a7b227d501e8aab2a1aff7ce 2024-10-18T14:33:58+03:00 Radoslav Gerganov rpc : backend refactoring (#9912)
87421a23e8c60e00a7b227d501e8aab2a1aff7ce 60ce97c9d809f4b040e90b597468b839df5728d0 2024-10-18T06:46:16+01:00 Ouadie EL FAROUKI [SYCL] Add SYCL Backend registry, device and Event Interfaces (#9705)
60ce97c9d809f4b040e90b597468b839df5728d0 8901755ba328643c9ab071c20e1939ea52951a0e 2024-10-18T13:34:36+08:00 Ma Mingfei add amx kernel for gemm (#8998)
8901755ba328643c9ab071c20e1939ea52951a0e 6f55bccbb8835d42147add4ee48807450f5ff535 2024-10-18T07:32:19+03:00 Georgi Gerganov server : add n_indent parameter for line indentation requirement (#9929)
1f66b699c48cb5ab3265ed72c48e8549b1674291 0e41b300ed28f7fe185d938b2e3d56a0bf7411ed 2024-10-16T08:35:53Z Alexey Parfenov server : fix the disappearance of the end of the text (#9867)
223c25a72fcc3f65cdfd7f5d57edd5b44b550e18 fbc98b748e7b075e327bcf13237057f647678049 2024-10-15T16:28:55+03:00 Georgi Gerganov server : improve infill context reuse (#9894)
fbc98b748e7b075e327bcf13237057f647678049 dcdd535302fc9702a4709be25f56540d65163a44 2024-10-15T15:54:55+05:00 MaggotHATE sampling : add XTC sampler (#9742)
dcdd535302fc9702a4709be25f56540d65163a44 4c42f93b22146c83b763d8cbee5fafc512746649 2024-10-15T12:48:44+03:00 Georgi Gerganov server : update preact (#9895)
a89f75e1b7b90cb2d4d4c52ca53ef9e9b466aa45 13dca2a54a394757d56fdd652b9f0df08f44ea22 2024-10-14T15:04:36+08:00 VoidIsVoid server : handle "logprobs" field with false value (#9871)
d4c19c0f5cdb1e512573e8c86c79e8d0238c73c4 c7181bd294757dd80a7904e3dd0fea2d0be914e7 2024-10-13T21:31:35+03:00 Georgi Gerganov server : accept extra_context for the infill endpoint (#9874)
c7181bd294757dd80a7904e3dd0fea2d0be914e7 92be9f12164f18ce845a5bab60cefa5f7fec6836 2024-10-13T18:52:48+03:00 Georgi Gerganov server : reuse cached context chunks (#9866)
edc265661cd707327297b6ec4d83423c43cb50a5 1bde94dd024b632f98428f4bf2ce483295130779 2024-10-12T16:14:27+03:00 Georgi Gerganov server : add option to time limit the generation phase (#9865)
1bde94dd024b632f98428f4bf2ce483295130779 95c76e8e92ecc93f784b185eafae36a0e7ad2fa3 2024-10-12T16:06:31+03:00 Georgi Gerganov server : remove self-extend features (#9860)
95c76e8e92ecc93f784b185eafae36a0e7ad2fa3 11ac9800aff532715a5bc7991062c68ba3472e6e 2024-10-12T14:51:54+03:00 Georgi Gerganov server : remove legacy system_prompt feature (#9857)
11ac9800aff532715a5bc7991062c68ba3472e6e 943d20b4111c746bcd9dbc7e4771de313b08b50c 2024-10-12T08:21:51+03:00 Georgi Gerganov llama : improve infill support and special token detection (#9798)
0e9f760eb12546704ef8fa72577bc1a3ffe1bc04 cf8e0a3bb9c0e93e371773b282054cdbbb231038 2024-10-10T20:14:55+02:00 Diego Devesa rpc : add backend registry / device interfaces (#9812)
458367a90606448a9c0262b276947c9e536086e0 fa42aa6d8902cc4eaf31866b3b3b7b61b69da930 2024-10-08T13:27:04+02:00 Xuan Son Nguyen server : better security control for public deployments (#9776)
7254cdf7e8d6312840509ca8d766358c687c6266 cad341d88924788b940997c55e7bef000c99e784 2024-09-29T23:18:02+02:00 Johannes Gäßler ggml: fix gradient allocation logic (ggml/966)
f4d2b8846a6b34419ff9e9491aee6cd95e444bfc 1b2f992cd2cff0b69e5abe78bb8888d51ed19d67 2024-09-28T17:42:03+03:00 Georgi Gerganov llama : add reranking support (#9510)
1b2f992cd2cff0b69e5abe78bb8888d51ed19d67 739842703e32cd43443c45e0b4f6647cc4e6b3d6 2024-09-28T14:32:46+02:00 slaren test-backend-ops : use flops for some performance tests (#9657)
95bc82fbc0df6d48cf66c857a4dda3d044f45ca2 7691654c68aa5316108f881136c59f815ccb6809 2024-09-26T17:38:31+08:00 Neo Zhang Jianyu [SYCL] add missed dll file in package (#9577)
afbbfaa537a96f562c34df4542930fa951b40d9e 3d6bf6919f7b10726421779cd344f2da05421c68 2024-09-25T14:05:13+02:00 Xuan Son Nguyen server : add more env vars, improve gen-docs (#9635)
3d6bf6919f7b10726421779cd344f2da05421c68 904837e0cb2f5f01bf5d5901b7aa57a026860ae4 2024-09-25T01:06:52-06:00 Gabe Goodhart llama : add IBM Granite MoE architecture (#9438)
0aa15011e315659640504731d1d05663837130fa b0f27361f3539a81d983a8b045f3c61e682d9fc0 2024-09-23T23:04:39-07:00 StrangeBytesDev server : add newline after chat example (#9616)
0b3bf966f47bf2ba88e5d4e3ed429602008c7e63 f0c7b5edf82aa200656fd88c11ae3a805d7130bf 2024-09-23T22:23:54+02:00 Xuan Son Nguyen server : add --no-context-shift option (#9607)
f0c7b5edf82aa200656fd88c11ae3a805d7130bf 1d48e98e4f3316bd2f6b187d288c7b6cb88d5cb3 2024-09-23T11:42:43-07:00 Max Krasnyansky threads: improve ggml_barrier scaling with large number of threads (#9598)
6026da52d6942b253df835070619775d849d0258 eca0fab44eb449ed34e17a9b651ae7398b494117 2024-09-19T12:44:53+03:00 Georgi Gerganov server : clean-up completed tasks from waiting list (#9531)
8a308354f6520df6bea851b435bd8054ee5617b4 f799155ab8279cfa668086ce584aa52ecc05f5e5 2024-09-18T01:50:34-05:00 Vinesh Janarthanan server : match OAI structured output response (#9527)
f799155ab8279cfa668086ce584aa52ecc05f5e5 faf67b3de4688f47c3b1019c89df255df2fd59b4 2024-09-18T14:28:20+08:00 Eric Zhang server : fix OpenSSL build (remove obsolete `LOG_INFO`) (#9529)
8b836ae731bbb2c5640bc47df5b0a78ffcb129cb 8344ef58f8cdb8ebd6faf4463ca32ae91c374c81 2024-09-17T09:35:38-04:00 Bert Wagner arg : add env variable for parallel (#9513)
0226613853133c081b55bb892a41bb5eacc0bc94 503147a9f9d195d6a14e7c998df23b6eb61f2bae 2024-09-17T01:19:46-07:00 Max Krasnyansky threadpool : skip polling for unused threads (#9461)
441b72b91f818fe69497e5816f87969e90c73c43 c4965a64f72ac9434c21cf0e1c3421d13e889155 2024-09-16T01:20:01-05:00 Vinesh Janarthanan main : option to disable context shift (#9484)
dcdcee3a744f39714503ee2b19c49b7c7b6209c9 1f4111e540bacec8d00ca9fd96417bf4c1339394 2024-09-14T17:36:44+08:00 VoidIsVoid server: add data: [DONE] to /chat/completions stream response (#9459)
feff4aa8461da7c432d144c11da4802e41fef3cf 0abc6a2c25272d5cf01384dda8ee8bfec4ba8745 2024-09-13T14:23:11+02:00 Xuan Son Nguyen server : add loading html page while model is loading (#9468)
0abc6a2c25272d5cf01384dda8ee8bfec4ba8745 bd35cb0ae357185c173345f10dc89a4ff925fc25 2024-09-13T09:53:38+03:00 Georgi Gerganov llama : llama_perf + option to disable timings during decode (#9355)
78203641fee3b1f82abaff0c7f667e1b4a286390 e6b7801bd189d102d901d3e72035611a25456ef1 2024-09-12T22:30:11+02:00 Mathijs Henquet server : Add option to return token pieces in /tokenize endpoint (#9108)
8d300bd35fbe23b35a4e1ece0cf0fe8f43331029 49006c67b4c6cc2e7c75a875b4d6e161ebae287c 2024-09-10T22:40:59+02:00 matteo enable --special arg for llama-server (#9419)
bfe76d4a17228bfd1565761f203123bc4914771b 293bebe0773c907c0c866213856eeba41b035df1 2024-09-09T23:36:09+02:00 Xuan Son Nguyen common : move arg parser code to `arg.cpp` (#9388)
1b9ae5189cd279c6b45e36d43e4f9ccae628d02f e32d0816edfd247784f6780b0bb9ae0bceef5e47 2024-09-07T20:43:51+02:00 Xuan Son Nguyen common : refactor arg parser (#9308)
df270ef74596da8f1178f08991f4c51f18c9ee82 947538acb8617756a092042ff7e58db18dde05ec 2024-09-07T15:16:19+03:00 Georgi Gerganov llama : refactor sampling v2 (#9294)
9b2c24c0993487d3b34a873980e292da571481f3 134bc38ecf3e2c5460581badce289a1ffa680453 2024-09-06T23:21:29+02:00 Xuan Son Nguyen server : simplify state machine for slot (#9283)
4a1411b4f17b6569dc0a067e5914dcc0f738b370 8ebe8ddebd68526757c631cd019de009697c63c2 2024-09-06T14:06:04+02:00 Xuan Son Nguyen server : fix missing lock (#9334)
9bc6db28d011d47a5f318dc4aebbe7927fac4629 32b2ec88bc44b086f3807c739daf28a1613abde1 2024-09-05T21:48:47-04:00 compilade ggml-quants : ternary packing for TriLMs and BitNet b1.58 (#8151)
32b2ec88bc44b086f3807c739daf28a1613abde1 1031771faaba28d07b4ec6a812cb21532efc8c31 2024-09-06T06:34:36+08:00 awatuna Update build.yml (#9184)
82e3b03c11826d20a24ab66d60f4de58f48ddcdb 9379d3cc1718e9ec6ab5ffcb60a06bbe048a61ee 2024-09-04T11:08:32+03:00 Radoslav Gerganov rpc : make RPC servers come first in the device list (#9296)
b69a480af4db8ffd6cbb2efe7ed8132bc7d39073 48baa61eccdca9205daf8d620ba28055c2347b64 2024-09-03T10:00:36+03:00 Georgi Gerganov readme : refactor API section + remove old hot topics
48baa61eccdca9205daf8d620ba28055c2347b64 f1485161e58d562099dd050f8ac3a9ea9f4cd765 2024-09-02T22:08:38+02:00 Xuan Son Nguyen server : test script : add timeout for all requests (#9282)
6e7d133a5f9409dd257fad90d7f320721b07a1b2 b60074f1c26d8354053a952844ef3f7ebefd8803 2024-09-02T17:11:51+02:00 Xuan Son Nguyen server : refactor multitask handling (#9274)
8f1d81a0b6f50b9bad72db0b6fcd299ad9ecd48c a47667cff41f5a198eb791974e0afcc1cddd3229 2024-09-01T22:38:17+08:00 Molly Sophia llama : support RWKV v6 models (#8980)
42c76d1358021ccdbe8ba89109c143dd7ae166df 9f7d4bcf5c27d37b0c7da82eeaf9c1499510554b 2024-08-29T19:20:53-04:00 Faisal Zaghloul Threadpool: take 2 (#8672)
9f7d4bcf5c27d37b0c7da82eeaf9c1499510554b 1d1ccce67613674c75c9c7e3fa4c1e24e428ba48 2024-08-27T18:28:06+08:00 Jan Boon server : fix crash when error handler dumps invalid utf-8 json (#9195)
a77feb5d71831c61e455541e8a655b9f0337ea8c 2e59d61c1b321431c597c1f12249273427d5640d 2024-08-27T11:07:01+02:00 Xuan Son Nguyen server : add some missing env variables (#9116)
e5edb210cd361689da41f032f1b36c45ff1bf9be 0c41e03ceba1aafaf469476a56347419d5785376 2024-08-26T12:16:57+03:00 Georgi Gerganov server : update deps (#9183)
a1631e53f6763e17da522ba219b030d8932900bd fc54ef0d1c138133a01933296d50a36a1ab64735 2024-08-21T17:58:11-04:00 compilade llama : simplify Mamba with advanced batch splits (#8526)
fc54ef0d1c138133a01933296d50a36a1ab64735 b40eb84895bf723c7b327a1e3bf6e0e2c41877f8 2024-08-21T11:04:34+02:00 Xuan Son Nguyen server : support reading arguments from environment variables (#9105)
18eaf29f4c5f7c8e89412f3a9a0392a9e4e01d75 554b049068de24201d19dde2fa83e35389d4585d 2024-08-19T10:10:21+03:00 Radoslav Gerganov rpc : prevent crashes on invalid input (#9040)
8b3befc0e2ed8fb18b903735831496b8b0c80949 d565bb2fd5a2a58b9924a7a34e77a87c78c52137 2024-08-16T17:19:05+02:00 Xuan Son Nguyen server : refactor middleware and /health endpoint (#9056)
d565bb2fd5a2a58b9924a7a34e77a87c78c52137 ee2984bdaf10c14d440ad873a049bcc09b786d9b 2024-08-16T21:34:41+08:00 tc-mb llava : support MiniCPM-V-2.6 (#8967)
37501d9c79ed5897db4b73ea7502211d25b3f763 4af8420afba39de4968adf2695ce12fd42422a13 2024-08-15T15:28:05+08:00 Riceball LEE server : fix duplicated n_predict key in the generation_settings (#8994)
234b30676a97ce227b604c38beb9dcaca406dea9 5fd89a70ead34d1a17015ddecad05aaa2490ca46 2024-08-15T08:21:57+02:00 Jiří Podivín server : init stop and error fields of the result struct (#9026)
98a532d474c73d3494a5353024cb6a4fbbabbb35 43bdd3ce188cd247bda7c1bd1ad01fa64e566690 2024-08-14T02:51:02-04:00 compilade server : fix segfault on long system prompt (#8987)
5ef07e25ac39e62297a67208c5bcced50835a2dd 4134999e01f31256b15342b41c4de9e2477c4a6c 2024-08-12T10:21:50+03:00 Georgi Gerganov server : handle models with missing EOS token (#8997)
7c3f55c10051c634546247387c5c359c9d499360 911b437f228e75aa3d235acec21bfddd23ecce2f 2024-08-10T11:43:26+02:00 fairydreaming Add support for encoder-only T5 models (#8900)
3071c0a5f218f107dabd13b73f6090af683ef5ec 4305b57c80eff4f0df5f6acb60b292f03b8f0dd0 2024-08-09T18:33:53+08:00 tc-mb llava : support MiniCPM-V-2.5 (#7599)
daef3ab233fc02e4c53afd9b07366379876f00d1 345a686d8271a24db20d31789c0d4b9ed51dcb0c 2024-08-09T08:32:02+02:00 Mathieu Geli server : add one level list nesting for embeddings (#8936)
1e6f6554aa11fa10160a5fda689e736c3c34169f 641f5dd2a6422941faa9f32ab5cb50fc1b24c1f5 2024-08-06T17:33:39+02:00 Xuan Son Nguyen server : add lora hotswap endpoint (WIP) (#8857)
a3738b2fa7c60ef2c4592435d1aa7fb8f1f69c3e 655858ace0cf2720e56eb01f84ad05e0c94ada3c 2024-08-04T17:28:08+02:00 0cc4m vulkan : implement Stable Diffusion operators (ggml/904)
978ba3d83d17b10fdf9807006048432b5b3769fc ecf6b7f23e664afd7ff856ec39034240ce438daa 2024-08-04T18:16:23Z ardfork Server: Don't ignore llama.cpp params (#8754)
ecf6b7f23e664afd7ff856ec39034240ce438daa 01aae2b4975b57a265ce8194928fd87f2d71027e 2024-08-04T03:55:03-07:00 Brian Cunnie batched-bench : handle empty `-npl` (#8839)
afbbcf3c04e3c6420cad3d72571478cd62ac176c ed9d2854c9de4ae1f448334294e61167b04bec2a 2024-07-31T18:59:09-05:00 Igor Okulist server : update llama-server embedding flag documentation (#8779)
01aec4a6310ab0160483196db0e726d78d4c94b6 41cd47caab88c442edc50e90c8d8d0ac3e82768d 2024-07-25T18:10:16-04:00 Yaiko server : add Speech Recognition & Synthesis to UI (#8679)
4b0eff3df58d8d86e47348fb73d54da3194d416d 8a4bad50a8ed24ed1e9df003521468dcc37320e8 2024-07-25T13:43:27+05:30 Ujjawal Panchal docs : Quantum -> Quantized (#8666)
b841d0740855c5af1344a81f261139a45a2b39ee 64cf50a0ed62d41e4f6c13e08a9b6b0816f46c6e 2024-07-23T17:37:42+03:00 Vali Malinoiu server : fix URL.parse in the UI (#8646)
938943cdbf4dd79005a394d732bc226f9e34e0ff 751fcfc6c33ea5f43cadd4d976f8fb176871df5e 2024-07-23T13:10:17+03:00 Georgi Gerganov llama : move vocab, grammar and sampling into separate files (#8508)
566daa5a5b38018b2727950bbd280239adb981b6 6f11a83e4e7700fdf353ed4a29599cb662c792f6 2024-07-22T15:44:53+02:00 Jiří Podivín *.py: Stylistic adjustments for python (#8233)
628154492a0b2dcc954a3af99e5c267097568eae 04bab6b7da0ed2b0a57174a57784d602aabb6c10 2024-07-22T16:02:09+08:00 Jan Boon server : update doc to clarify n_keep when there is bos token (#8619)
69c487f4ed57bb4d4514a1b7ff12608d5a8e7ef0 07283b1a90e1320aae4762c7e03c879043910252 2024-07-20T22:25:26+02:00 Johannes Gäßler CUDA: MMQ code deduplication + iquant support (#8495)
be0cfb41752551a4680ee7dfd29f2a05b50db442 b57eb9ca4fb79f3163c6a69e154ff76157a4f716 2024-07-19T14:34:55+03:00 Georgi Gerganov readme : fix server badge
0d2c7321e9678e91b760ebe57f0d063856bb018b 672a6f101839a150180fc28891ebed379c8f2353 2024-07-18T18:43:49+08:00 Eric Zhang server: use relative routes for static files in new UI (#8552)
3807c3de04cde853418033c95e96642876545f3e e02b597be3702174e7b47b44cd03e1da1553284b 2024-07-18T16:06:22+08:00 RunningLeon server : respect `--special` cli arg (#8553)
f17f39ff9cb71fa7b0eda0c649bb0ce9b2d8a6b8 9104bc20edf47f74dc49379b7d61d0c6e85a4882 2024-07-15T08:04:56-04:00 M-A server: update README.md with llama-server --help output [no ci] (#8472)
4e24cffd8cccd653634e24ee461c252bd77b1426 6af51c0d96e6268769fc05c98d5b1a5e832c0017 2024-07-12T14:48:15+03:00 Georgi Gerganov server : handle content array in chat API (#8449)
c3ebcfa148e867a68e78fd5c4f0c23e8f84c788b 8a4441ea1a2564578134404f31158c318e9c0bf3 2024-07-12T03:14:12-05:00 Douglas Hanley server : ensure batches are either all embed or all completion (#8420)
278d0e18469aacf505be18ce790a63c7cc31be26 dd07a123b79f9bd9e8a4ba0447427b3083e9347a 2024-07-10T20:08:17-04:00 Clint Herron Initialize default slot sampling parameters from the global context. (#8418)
dd07a123b79f9bd9e8a4ba0447427b3083e9347a f4444d992c16b6b9442f4770c7c3a10b19a08343 2024-07-10T12:35:18-04:00 Clint Herron Name Migration: Build the deprecation-warning 'main' binary every time (#8404)
0f1a39f3439825acf7e3a1663566d410be152170 83321c6958acf20747d288031174cc1bf8816e33 2024-07-10T07:14:51-05:00 Dibakar Gope ggml : add AArch64 optimized GEMV and GEMM Q4 kernels (#5780)
a59f8fdc85e1119d470d8766e29617962549d993 fd560fe680c72fd0a0af2bc8881add20ad919071 2024-07-09T18:26:40-04:00 Clint Herron Server: Enable setting default sampling parameters via command-line (#8402)
3fd62a6b1c9ca7b7c0093e984cc9c133c6f2726d a8db2a9ce64cd4417f6a312ab61858f17f0f8584 2024-07-07T15:04:39-04:00 compilade py : type-check all Python scripts with Pyright (#8341)
cb4d86c4d723af87d3d7e3177e9485f200391384 86e7299ef5dff0f388922dc6fcbce009e99d8005 2024-07-07T11:10:38+02:00 Bjarke Viksøe server: Retrieve prompt template in /props (#8337)
807b0c49ff7071094f97ebc3a0a8e2b9e274f503 f8c4c0738d72d2162736edd72dd5db8b269adca1 2024-07-04T15:46:11+02:00 fairydreaming Inference support for T5 and FLAN-T5 model families (#5763)
a95631ee97bb24861af6bdeec380270459631e8e f3f65429c44bb195a9195bfdc19a30a79709db7b 2024-06-26T19:26:13+03:00 Georgi Gerganov readme : update API notes
f3f65429c44bb195a9195bfdc19a30a79709db7b 88540445615e77a0177fcca43aaa8e9d8eea6864 2024-06-26T18:33:02+03:00 Georgi Gerganov llama : reorganize source code + improve CMake (#8006)
6777c544bdd8c5d9de3220d6e2557957bbbf2a4f 163d50adaf8897d8b734d701ff332de6be63d484 2024-06-26T01:45:58+01:00 Olivier Chafik `json`: fix additionalProperties, allow space after enum/const (#7840)
dd047b476c8b904e0c25e5dbc5bee6ffde2f6e17 925c30956dd17723c3a25297bcd0a609aec60663 2024-06-25T19:20:06+02:00 slaren disable docker CI on pull requests (#8110)
925c30956dd17723c3a25297bcd0a609aec60663 c8ad35955ad2c68db172dcd0e857423ab128518d 2024-06-25T08:13:27-07:00 joecryptotoo Add healthchecks to llama-server containers (#8081)
48e6b92cc378c937e59719f2c0f482bf76c9ca81 3791ad219323389106dc3fd80814eb5bbb7b80de 2024-06-25T13:56:49+02:00 Xuan Son Nguyen Add chat template support for llama-cli (#8068)
3791ad219323389106dc3fd80814eb5bbb7b80de f702a90e245499283d6de0b287701c723cda2a87 2024-06-25T16:57:35+05:30 HanishKVC SimpleChat v3.1: Boolean chat request options in Settings UI, cache_prompt (#7950)
6a2f298bd784403c5c33eebb822217ec5d9b5590 11318d9aa1f668aa10407a5cb9614371af32f3ce 2024-06-23T18:03:08+03:00 Aarni Koskela server : fix JSON-Scheme typo (#7975)
b6b9a8e606da7764bd3649c2ea574979c85abd43 45c0e2e4c1268c2d7c8c45536f15e3c9a731ecdc 2024-06-23T13:14:45+02:00 slaren fix CI failures (#8066)
ba5899315283eb1df3902363daf79bdc5eefe426 a7854743c5e6216a6178824a603aa9479728ddd5 2024-06-19T23:57:10Z sasha0552 server : fix smart slot selection (#8020)
e6ecc2be470e3c5c6c5c9d8b90aa83a1f7725084 a94e6ff8774b7c9f950d9545baf0ce35e8d1ed2f 2024-06-18T09:37:20+03:00 Georgi Gerganov whisper : use ggml_backend_sched (whisper/2239)
1c641e6aac5c18b964e7b32d9dbbb4bf5301d0d7 963552903f51043ee947a8deeaaa7ec00bc3f1a4 2024-06-13T00:41:52+01:00 Olivier Chafik `build`: rename main → llama-cli, server → llama-server, llava-cli → llama-llava-cli, etc... (#7809)
704a35b183748954013bd875bbbfdd9eaca14e62 dcf752707d96eb305f546526c7bc5d01f0831130 2024-06-12T14:42:29+03:00 Georgi Gerganov server : restore numeric prompts (#7883)
dcf752707d96eb305f546526c7bc5d01f0831130 f2b5764beb35583295e2475479c18f249b139b58 2024-06-12T17:05:35+08:00 Meng, Hengyu update intel docker oneapi-basekit to 2024.1.1-devel-ubuntu22.04 (#7894)
14f83526cd27f638c856ea6eff08110b9860eb2a 6fe42d073f0554eada93ac9d40574025aeedb703 2024-06-11T12:18:58-04:00 Deven Mistry fix broken link in pr template (#7880) [no ci]
fd5ea0f897ecb3659d6c269ef6f3d833e865ead7 c28a83902cf6ab6a9e085ad6d4cc2e95c4ccfe40 2024-06-10T14:18:41+02:00 slaren ci : try win-2019 on server windows test (#7854)
d9da0e4986f121c727bdd9579a6688097b11602c 1f0dabda8d5c131f9d4632aa41de74317cdd61fb 2024-06-10T14:59:55+03:00 Georgi Gerganov server : improve "prompt" handling (#7847)
57bf62ce7cb75cca589943e2050d29bff4026e76 3e2ee443159724e2d3a0741f6b167e599ec088aa 2024-06-09T11:24:29-04:00 Nicolás Pérez docs: Added initial PR template with directions for doc only changes and squash merges [no ci] (#7700)
3e2ee443159724e2d3a0741f6b167e599ec088aa 42b53d192f4e3abf1b7c8e424628424504ea5dc5 2024-06-09T12:50:35+02:00 mgroeber9110 server: do not remove whitespace at the start of a completion chunk (#7830)
fe1e3917cfa0f9397a765cfd0aef880674d938d5 d4d915d351d1f1270d56184bdd46672893e8a5d8 2024-06-09T01:43:39+02:00 slaren Revert "[SYCL] Update rpc-server.cpp to include SYCL backend (#7682)" (#7808)
7a16ce7db2a74a223f0f3b9cee66d4539c5bce8f da799b41891e34aac86ce4e173f9c4c0afd4fab3 2024-06-08T07:50:31Z sasha0552 server : smart slot selection using Longest Common Prefix (#7728)
7027b27d765db95d4ac6b569d976e387a8715881 a5cabd76491f07494c5b8267f921c73f5e2bbfb4 2024-06-07T11:15:49+02:00 Johannes Gäßler server: update cache_prompt documentation [no ci] (#7745)
a5cabd76491f07494c5b8267f921c73f5e2bbfb4 d5c938cd7716b9a2ace49a43a469dfbffcff4d28 2024-06-07T15:09:45+08:00 woodx server : do not get prompt in infill mode (#7286)
ee459f40f65810a810151b24eba5b8bd174ceffe f83351f9a62a6262f1fc3d08f320033089cddfb5 2024-06-06T19:19:59+03:00 Georgi Gerganov server : fix --threads-http arg (#7801)
55b2d0849d3ec9e45e4a4d9e480f5fa7977872a6 f5d7b268ec4bf8628aa6ccc9f6631d0230dde76f 2024-06-06T10:07:06+01:00 Olivier Chafik grammars: x{min,max} repetition operator (#6640)
2d08b7fbb483c14bd2b173d4cd51ea3a4f862e8f d67caea0d6e6c303d31b01d0a010973e6c908dff 2024-06-06T07:19:49+02:00 slaren docker : build only main and server in their images (#7782)
1442677f92e45a475be7b4d056e3633d1d6f813b 554c247caffed64465f372661f2826640cb10430 2024-06-04T21:23:39+03:00 Georgi Gerganov common : refactor cli arg parsing (#7675)
6d1616944d9efd342ed2a4fd318722adfc9febcd bde7cd3cd949c1a85d3a199498ac98e78039d46f 2024-06-04T10:01:09+03:00 Georgi Gerganov ggml : prevent builds with -ffinite-math-only (#7726)
bde7cd3cd949c1a85d3a199498ac98e78039d46f a5735e4426b19a3ebd0c653ad8ac01420458ee95 2024-06-03T20:03:26+03:00 Radoslav Gerganov llama : offload to RPC in addition to other backends (#7640)
a5735e4426b19a3ebd0c653ad8ac01420458ee95 0b832d53ba0ffcc759c8d62ede3772dd62321f8e 2024-06-04T00:14:15+09:00 Masaya, Kato ggml : use OpenMP as a thread pool (#7606)
7c4e5b7eae26581869e782015d9deca947c34997 9422c5e34bbd302493b77a8f6d546154a1f4fe82 2024-06-02T13:39:08-04:00 Austin chore : add ignore rule for generated server themes (#7689)
9422c5e34bbd302493b77a8f6d546154a1f4fe82 e141ce624af57bdffbaf57014a044eb1d9689230 2024-06-02T19:13:54+10:00 nickp27 [SYCL] Update rpc-server.cpp to include SYCL backend (#7682)
2e666832e6ac78194edf030bd1c295e21bdb022c 2ac95c9d5678d05e253691fb1f26471675bff5ad 2024-06-01T21:31:48+02:00 Yazan Agha-Schrader server : new UI (#7633)
2ac95c9d5678d05e253691fb1f26471675bff5ad 750f60c03e4d3f53fa51910551ce87a3d508d2d7 2024-06-01T21:50:18+05:30 HanishKVC SimpleChat: Simple histogram/repeatMatching driven garbageTrimming, Settings UI, Streaming mode, OpenAi Compat (Model, Authorization Bearer), Save/Restore session, Auto Settings UI (#7548)
a323ec60af14a33d560df98f2cc41b4112cb4f80 0515ad93f48df63bbff204eddb0cac75e8585c65 2024-05-31T22:23:04+03:00 Georgi Gerganov server : update js (#7670)
972b555ab935705f3437abd5909a5c46852811f6 3854c9d07f67de7f8cd6d86117bfaef47549b05a 2024-05-30T09:52:39+02:00 Johannes Gäßler README: explain parallel build [no ci] (#7618)
3854c9d07f67de7f8cd6d86117bfaef47549b05a eb57fee51f7b4d78039f003249873c2eb46f12f6 2024-05-30T14:19:08+08:00 Meng, Hengyu [SYCL] fix intel docker (#7630)
e2b065071c5fc8ac5697d12ca343551faee465cc 0548a4187f2e53b8fc6d9ff0f4c71988f708ff42 2024-05-28T17:53:37+08:00 Neo Zhang [SYCL]fix ggml_sycl_mul_mat_id() to match the change of api (#7436)
9335b969e86a222e247adacedf814d8abfff8847 c41767154eb82aa3fe7568fc816c3402b78eae94 2024-05-28T06:55:51+02:00 mgroeber9110 server: do not remove whitespace at the start of a completion chunk (#7524)
b9adcbbf92fc7096bee23fe61496d25652ebf765 9588f196b1d7b21bdff013fcf958c249576b2619 2024-05-26T06:26:34+05:30 HanishKVC SimpleChat Completion Mode flexibility and cleanup, Settings gMe, Optional sliding window (#7480)
27891f6db03de6e3fd5941983838c29bef253352 fbca2f27fc7fa9aa4a8ad0357478fdb908472908 2024-05-24T23:47:56+10:00 Brian docker.yml: disable light-intel and server-intel test (#7515)
fbca2f27fc7fa9aa4a8ad0357478fdb908472908 0df0aa8e43c3378975269a51f9b876c8692e70da 2024-05-24T14:31:13+02:00 fairydreaming Add support for ArcticForCausalLM (#7020)
3015851c5ac7334fb544a23a70a284c117b87044 55ac3b7aeaf52f19786ed96e885d89521fc0f6c8 2024-05-23T14:29:26+02:00 Daniel Bevenius llama : add getters for n_threads/n_threads_batch (#7464)
1e374365d170b7f692fd7753c145e21bc14486c8 197ff91462dd05bb9a3be03578114abf0c355536 2024-05-22T23:23:21+05:30 HanishKVC SimpleChat: a simple and dumb web front end for testing /chat/completions and /completions end points and try chat (#7350)
201cc11afa0a1950e1f632390b2ac6c937a0d8f0 6369bf04336ab60e5c892dd77a3246df91015147 2024-05-22T04:28:32+08:00 liuwei-git llama : add phi3 128K model support (#7225)
d7e852c1bc8e85bf62a6f1aede08cd2de723404a 917dc8cfa67a72fb7c8bf7392270da3bf4833af4 2024-05-21T14:39:48+02:00 jaime-m-p Tokenizer SPM fixes for phi-3 and llama-spm (bugfix) (#7425)
917dc8cfa67a72fb7c8bf7392270da3bf4833af4 fabf30b4c4fca32e116009527180c252919ca922 2024-05-20T20:15:57+02:00 jaime-m-p Tokenizer SPM fixes for phi-3 and llama-spm (#7375)
3bc10cb485dd7efa4da6c64e73ad0c9e2bfe0821 6bf9b66fa3f263ca2175dcb5f6d0a658581e1dfb 2024-05-20T15:10:03+03:00 Georgi Gerganov server : fix temperature + disable some tests (#7409)
1cc0155d04918cb3017afa472acea51b77483c4a e932094d58f513d5996c3efc9f6fed8238894c57 2024-05-20T10:16:41+03:00 Georgi Gerganov server : tuning tests (#7388)
e932094d58f513d5996c3efc9f6fed8238894c57 2789baf480ba7dc9281b65f601f0918e58920f54 2024-05-20T08:56:05+03:00 Georgi Gerganov server : return error on too large embedding input (#7389)
1b01f06db0cff5f5f600bb754fc39fde565ed56a 41858392e17abead21735309bf17cb55183d8c31 2024-05-19T16:26:02+02:00 Johannes Gäßler server: add test for token probs (#7347)
41858392e17abead21735309bf17cb55183d8c31 6aade19ee74b896c59929676629340b36be3e22c 2024-05-19T16:06:33+02:00 Johannes Gäßler server: fix seed being reported back (#7382)
cb42c294279bc4a0a4e926a7b5a5568049f12fa7 d233b507cd19fcc2d8d8963ecc6a3eb7a33f2ecc 2024-05-18T11:10:47+02:00 Johannes Gäßler server: correct --threads documentation [no ci] (#7362)
f4bd8b3d260bb09491ba63c77ab7012b744362ef 51e9d02599336e62948d29f1d6c05addeb921ac2 2024-05-17T17:25:44+03:00 Radoslav Gerganov rpc : set SO_REUSEADDR for the server socket (#7320)
d273c1402b25086fd91aef2467ac13f2e49fa0ea 27b040691cbe45314147c2745e891a38e9c048d4 2024-05-17T15:11:45+03:00 Aarni Koskela py : convert-hf-to-gguf-update improvements (#7340)
27b040691cbe45314147c2745e891a38e9c048d4 29c60d8cddcfd14fa8a6bf023a6c4eb8692c76ba 2024-05-17T13:24:38+02:00 fairydreaming llama : use n_embd_head_v when reshaping kqv (#7327)
ee94172d33399d2e814ca05c8a3ff8c523ebb093 934266c0e0b2aa9781fdba2deb112c161ff038a9 2024-05-17T10:00:17+03:00 Radoslav Gerganov server : add support for the RPC backend (#7305)
9c4fdcbec8c7fcc428e723b0d8a1cf1f351ba642 24ecb58168dce81646c2ed425690a106591c8c6d 2024-05-17T02:11:03+02:00 Leon Knauer [Server] Added --verbose option to README [no ci] (#7335)
24ecb58168dce81646c2ed425690a106591c8c6d 9afdffe70ebf3166d429b4434783bb0b7f97bdeb 2024-05-16T20:43:45+02:00 Pierrick Hymbert Revert "server bench: fix bench not waiting for model load (#7284)" (#7334)
583fd6b000ec9ad1b465b5c98524f4a0ae388077 9f773486ab78d65f5cca3f7e31c862b7043bf721 2024-05-15T08:44:16+02:00 Johannes Gäßler server bench: fix bench not waiting for model load (#7284)
4f0263633b40e94e8b69fd6e7e4395cfedfd5c12 1265c670fd8e41e1947352c96c5179adda97fb2c 2024-05-14T10:11:24-04:00 Steve Grubb server: free sampling contexts on exit (#7264)
5e31828d3e35c76ecfee665bc23771a4bec1d130 541600201e6480f54ae09e58d16b154d4b4b331d 2024-05-14T14:27:19+03:00 Radoslav Gerganov ggml : add RPC backend (#6829)
541600201e6480f54ae09e58d16b154d4b4b331d efc8f767c8c8c749a245dd96ad4e2f37c164b54c 2024-05-14T09:33:42+02:00 slaren llama : disable pipeline parallelism with nkvo (#7265)
e586ee42595500c53938e937b6b6ad5353ad76dc cbf75894d256f1861f6409565db599365de3d4b8 2024-05-12T19:40:08-07:00 Benjamin Findley change default temperature of OAI compat API from 0 to 1 (#7226)
cbf75894d256f1861f6409565db599365de3d4b8 0d5cef78aeafae4d4e6d56e2d4bcda771af58cc9 2024-05-13T08:04:29+08:00 Neo Zhang [SYCL] Add oneapi runtime dll files to win release package (#7241)
0d5cef78aeafae4d4e6d56e2d4bcda771af58cc9 dc685be46622a8fabfd57cfa804237c8f15679b8 2024-05-13T08:02:55+08:00 Neo Zhang [SYCL] update CI with oneapi 2024.1 (#7235)
988631335a20d06497f58be0b8ba13adb4323a22 f99e1e456eaf69cc38c1982a2693ce41c0f897ef 2024-05-11T04:13:02-04:00 Steve Grubb server : free llama_batch on exit (#7212)
5ae3426b0b64672991563d4c28b2018b9f961467 b83cc3f5b303ff30c52874b2d5864dc6385ebf9f 2024-05-11T10:11:28+02:00 Johannes Gäßler server: fix reported top tokens for temperature 0 (#7203)
4e3880978f8b1bf546dd4e6f3b524d6b8739c49c f89fe2732c5709f6e86d5f4aee2e6d2a561f2eb2 2024-05-10T07:01:08-04:00 Justine Tunney Fix memory bug in grammar parser (#7194)
d46dbc76f8770caec0175f1e57777173c70556a0 0961d866044143eefec5b525e991611f73fd4f6e 2024-05-09T16:40:42+03:00 Georgi Gerganov readme : add scheduled server workflow status badge
47345248827f426038098d016ed11975021b4919 07cd41d0965829463eff73eda3348aedbfd3a444 2024-05-09T17:34:37+08:00 Albert Jin opencl : alignment size converted from bits to bytes (#7090)
bd1871fa2b1bf8a081b43ba9bc85f8ffd46fac46 26458af1d63c85195cd96cd1673051e332d06d30 2024-05-08T20:12:06+01:00 JohnnyB server : add themes + favicon (#6848)
911b3900dded9a1cfe0f0e41b82c7a29baf3a217 ad211edef5db1f1fb955874b7ca6a67bd0c88708 2024-05-08T14:27:58+02:00 Johan server : add_special option for tokenize endpoint (#7059)
1fd9c1741d864d01cd7ec6d67227b92d7bfabf22 4cd621c26de2095cd7c4464bdec5fe2e696ef3f3 2024-05-08T13:24:14+02:00 Xuan Son Nguyen clean up json_value & server_log (#7142)
3855416027cb25d9a708ffa5581cf503a87856a6 c0e6fbf8c380718102bd25fcb8d2e55f8f9480d1 2024-05-08T02:30:09-04:00 Justine Tunney ggml : introduce bfloat16 support (#6412)
af0a5b616359809ce886ea433acedebb39b12969 b6aa6702030320a3d5fbc2508307af0d7c947e40 2024-05-07T23:07:58+02:00 Johannes Gäßler server: fix incorrectly reported token probabilities (#7125)
260b7c65296fba0568eeb1ff05244ea0be206b54 53d6c52e227dedef347b21e28febcfb9caeecdad 2024-05-07T13:44:29-05:00 Kyle Mistele server : update readme with undocumented options (#7013)
8f8acc8683a00ce40fa5a81161a079d2167126e6 ca3632602091e959ed2ad4c09c67a7c790b10d31 2024-05-05T13:38:55+02:00 Sigbjørn Skjæret Disable benchmark on forked repo (#7034)
cf768b7e71cbcc9886c753ae963c2b68893d02e4 fcd84a0f5a584ab5271745d7ffef21c8a6bc7b0c 2024-05-04T13:10:15-03:00 Jeximo Tidy Android Instructions README.md (#7016)
03fb8a002df2e96104f9e06de9c78d2a8ed91e92 92139b90af4841d7fd060b526bdd443b621770ff 2024-05-04T12:06:40+03:00 maor-ps If first token generated from the server is the stop word the server will crash (#7038)
3ea0d36000e2314baba7e9fc6a97f08670a6f7e4 1613ef8d8eb2479ba55c4d598e08c8f3f18a0fed 2024-05-01T17:52:55+02:00 Johannes Gäßler Server: add tests for batch size, different seeds (#6950)
9c67c2773d4b706cf71d70ecf4aa180b62501960 952d03dbead16e4dbdd1d3458486340673cc2465 2024-04-30T12:16:08+03:00 Georgi Gerganov ggml : add Flash Attention (#5021)
8843a98c2ba97a25e93319a104f9ddfaf83ce4c4 b8c1476e44cc1f3a1811613f65251cf779067636 2024-04-30T00:52:50+01:00 Olivier Chafik Improve usability of --model-url & related flags (#6930)
b7368332e24c5b2c8038bf8267f43632783fcc35 928e0b7013c862cf10701957b3d654aa70f11bd8 2024-04-27T17:50:48+02:00 Pierrick Hymbert ci: server: tests python env on github container ubuntu latest / fix n_predict (#6935)
928e0b7013c862cf10701957b3d654aa70f11bd8 0c4d489e29e53589bf13a801fe7c94b7b546d8f6 2024-04-26T19:08:30+01:00 agray3 Reset schedule earlier to allow overlap with ggml graph computation on device (#6933)
0c4d489e29e53589bf13a801fe7c94b7b546d8f6 017e6999b5184234370b22a2f868e1be911e8d88 2024-04-26T20:06:33+02:00 Pierrick Hymbert quantize: add imatrix and dataset metadata in GGUF (#6658)
bbe3c6e76157a5d806fdc155451f0ca8936248ee 7f5ff558eed0f732af8f25c2ab0645610bdec80c 2024-04-26T12:27:25+02:00 Pierrick Hymbert ci: server: fix python installation (#6925)
7f5ff558eed0f732af8f25c2ab0645610bdec80c 9e4e077ec50fde6049b128662c72d37a3c28e34b 2024-04-26T12:15:30+02:00 Pierrick Hymbert server: stop generation at `n_ctx_train` if `n_predict` is not set (#6638)
9e4e077ec50fde6049b128662c72d37a3c28e34b 83b72cb086ce46a33dececc86bfe4648b6120aa8 2024-04-26T11:11:51+02:00 Pierrick Hymbert ci: server: fix python installation (#6922)
83b72cb086ce46a33dececc86bfe4648b6120aa8 d4a9afc1009f0da88d04b2c5f672d81d5ae94675 2024-04-26T10:41:53+03:00 Georgi Gerganov Merge pull request from GHSA-p5mv-gjc5-mwqv
d4a9afc1009f0da88d04b2c5f672d81d5ae94675 7d641c26ac73956a54b204cabefe85c764823678 2024-04-26T09:27:49+02:00 Pierrick Hymbert ci: server: fix python installation (#6918)
7d641c26ac73956a54b204cabefe85c764823678 5790c8dac1a4f0aa80b4efee3b962d8c04c829e8 2024-04-26T09:26:59+02:00 Pierrick Hymbert ci: fix concurrency for pull_request_target (#6917)
5790c8dac1a4f0aa80b4efee3b962d8c04c829e8 46e12c4692a37bdd31a0432fc5153d7d22bc7f72 2024-04-26T09:26:16+02:00 Pierrick Hymbert bench: server add stop word for PHI-2 (#6916)
3fe847b5747676ee1bf90371c46ed0bc66b57240 37246b1031b1680c0dcaf20aef736d6b446203fa 2024-04-24T12:54:24+02:00 mgroeber9110 server : do not apply Markdown formatting in code sections (#6850)
37246b1031b1680c0dcaf20aef736d6b446203fa 28103f4832e301a9c84d44ff0df9d75d46ab6c76 2024-04-24T05:15:29-05:00 Kyle Mistele common : revert showing control tokens by default for server (#6860)
28103f4832e301a9c84d44ff0df9d75d46ab6c76 c0d1b3e03e27634ac2871761f5033cf9324d472d 2024-04-24T11:08:36+02:00 Johannes Gäßler Server: fix seed for multiple slots (#6835)
5cf5e7d490dfdd2e70bface2d35dfd14aa44b4fb 40f74e4d739e9250431cf339ae7588b28d8d0663 2024-04-21T18:48:53+01:00 Olivier Chafik `build`: generate hex dump of server assets during build (#6661)
40f74e4d739e9250431cf339ae7588b28d8d0663 b9cc76d87e3d7ae5900f19d4fe8f8976d0a35888 2024-04-21T18:36:45+03:00 Georgi Gerganov llama : add option to render special/control tokens (#6807)
b8109bc0139f15a5b321909f47510b89dca47ffc aed82f6837a3ea515f4d50201cfc77effc7d41b4 2024-04-21T00:29:50+08:00 Jan Boon doc : server tests require llama to be built with curl enabled (#6788)
637e9a86c220718d008b54842dfd294aa96d3b7a 9958c81b798a5872087b30b360e4674871f2479e 2024-04-19T13:19:01+02:00 Pierrick Hymbert server: static: upstream upgrade (#6765)
3272896d79465fd2befef3425dac8e83933b7ea4 7fc16a2c32650d46e79b382ecc6720f58c82f31b 2024-04-15T14:18:47+02:00 Pierrick Hymbert server : revert "minor layout improvements" (#6684)
ab9a3240a9da941fdef5cd4a25f2b97c2f5a67aa fbbc030ba93561fac842af994c5c6c4c1147f13b 2024-04-12T19:43:38+01:00 Olivier Chafik JSON schema conversion: ⚡️ faster repetitions, min/maxLength for strings, cap number length (#6555)
24ee66ed0d908d156bd0d1747b63a636a495cd7a 91c736015b66ba1d0b82cbae6313b6d5eaa61b68 2024-04-12T13:49:21+02:00 Pierrick Hymbert server : coherent log output for KV cache full (#6637)
cbaadc92942c50aab599a9e4c163afc1f44f7c26 1bbdaf6ecda6f0a360dfb307b256fcb6838c560b 2024-04-11T19:47:34+01:00 Olivier Chafik grammars: 1.5x faster inference w/ complex grammars (vector reserves / reuses) (#6609)
400d5d722d7edf7de0cf24a18c42b183c65047d2 5dc9dd7152dedc6046b646855585bd070c91e8c8 2024-04-09T01:31:47-07:00 Ed Lee server : detect search query to start webchat (#6554)
e3c337d87ca650972105a51c6ce302dd236c07ad beea6e1b16e783a0886e78dec01002a8c00db24d 2024-04-08T06:02:30-07:00 Rick G llama : support negative ith in llama_get_ API (#6519)
beea6e1b16e783a0886e78dec01002a8c00db24d 87fb5b4234d4b9c56ac94cf7aa229c8fd7defdb0 2024-04-08T20:43:30+08:00 Jan Boon llama : save and restore kv cache for single seq id (#6341)
b66aec675c1571a06b3570b858ae711246f96f84 57dd02c44b2a0eb79e28f6c5eb8242a5d2d3174d 2024-04-03T22:57:20+02:00 Daniel Bevenius backend : fix typo in scheduler documentation (ggml/781)
57dd02c44b2a0eb79e28f6c5eb8242a5d2d3174d 75cd4c77292034ecec587ecb401366f57338f7c0 2024-04-06T10:31:33-04:00 Clint Herron Tests: Added integration tests for GBNF parser (#6472)
75cd4c77292034ecec587ecb401366f57338f7c0 a8bd14d55717754a1f48313a846a2b16fa998ad2 2024-04-06T05:40:47+02:00 Pierrick Hymbert ci: bench: support sse and fix prompt processing time / server: add tokens usage in stream OAI response (#6495)
0a1d889e27d6aaa3293dd2c692b849a9bcf4b474 7dda1b727ef1730783a6077136d28b83e70dd397 2024-04-04T17:31:22+01:00 Ed Lepedus server: add cURL support to server Dockerfiles (#6474)
2e66913e5f56209f4c949f98e431925b78e7e84d 8120efee1d9931b514aeb5a047209d576f23286c 2024-04-04T11:03:00-04:00 Shakhar Dasgupta server: allow penalizing repetition of newlines on server webpage (#6431)
7a2c92637ae265654a68f62e6a7610b358255d3f 4bcd6b959ca3991084ad1d8464caf2a734e29b1d 2024-04-04T11:57:58+02:00 Pierrick Hymbert ci: bench: add more ftype, fix triggers and bot comment (#6466)
4399f13fb9462cd06f3f154d0aee738425000fea 1a43c7254ed5de91d09274b853db843c518f1b64 2024-04-04T09:34:58+03:00 Georgi Gerganov server : remove obsolete --memory-f32 option
1a43c7254ed5de91d09274b853db843c518f1b64 72d73af65132792a52433952ca4729b01c36cde2 2024-04-04T01:33:48-05:00 Xiao-Yong Jin server : add option to disable KV offload (#6468)
5fb1574c8112c757fc202fdae279da883f34e610 60cdf40cc32f0ad4cb11e0ca8fd38f3b93d8d640 2024-04-03T13:22:57-07:00 Fattire A few small fixes to server's README docs (#6428)
60cdf40cc32f0ad4cb11e0ca8fd38f3b93d8d640 bb43cf7e9d86d69ffd9c7f008f75db890a35b45a 2024-04-03T20:09:52+02:00 JH23X server : handle exception on wrong type in request (#6452)
5d4f12e4624bf4435ba26753814bedd4e9b62803 154d4ee39c38e231fb5c3910df14d2fc920fdf1b 2024-04-03T18:56:37+01:00 Ed Lepedus server: add cURL support to `server.Dockerfile` (#6461)
226e819371eec0f298d9075198394a07b23ecfa9 c50a82ce0f71558cbb8e555146ba124251504b38 2024-04-01T12:36:40+02:00 Pierrick Hymbert ci: server: verify deps are coherent with the commit (#6409)
057400a3fd457f4f214684eeb171444663b47a23 b75c38166cf0c66793a32d5c3d6cb69929dd083d 2024-03-29T08:23:22+01:00 Daniel Bevenius llama : remove redundant reshape in build_kv_store (#6369)
28cb9a09c4d10a489be1238abe7a858dcd4d65f2 cfc4d75df6399b36153ef739f2c1abee4c114bb8 2024-03-28T11:27:56+01:00 Pierrick Hymbert ci: bench: fix master not schedule, fix commit status failed on external repo (#6365)
6902cb7f2e3479f364ee177118200fb7e4e9fc92 d2d8f389960a106b66313ff1621bdb1aaaaaa285 2024-03-28T16:50:48+08:00 Eric Zhang server : stop gracefully on SIGTERM (#6348)
a016026a3ac16d8c9b993a3573f19b9556d67de4 53c7ec53d5eca26b2c0c648605543a5fa6c12817 2024-03-27T20:26:49+01:00 Pierrick Hymbert server: continuous performance monitoring and PR comment (#6283)
1740d6dd4e00dedda87d6820b0e0d8e70dade340 0642b22cd12af278d6e7e459b73411947c169381 2024-03-27T08:08:59+01:00 Mateusz Charytoniuk readme : add php api bindings (#6326)
0642b22cd12af278d6e7e459b73411947c169381 a4f569e8a316cbd33d2b4de94b694d111507475a 2024-03-27T13:55:29+08:00 Eric Zhang server: public: use relative routes for static files (#6325)
557410b8f06380560155ac7fcb8316d71ddc9837 55c1b2a3bbd470e9e2a3a0618b92cf64a885f806 2024-03-26T10:46:41-04:00 compilade llama : greatly reduce output buffer memory usage (#6122)
3d032ece8e6973441273601ca2981130608e287d e190f1fca6f60d80944f9e8709d343a025c4d245 2024-03-26T16:47:43+08:00 Jan Boon server : add `n_discard` parameter (#6300)
ad3a0505e3b6cd777259ee35e61d428357ffc565 95ad616cddda50273e955bfe192328acd9aa4896 2024-03-25T09:42:17+01:00 Xuan Son Nguyen Server: clean up OAI params parsing function (#6284)
ddf65685105a39a57b1e7f80c3aa502a6313af24 d03224ac9840351023ff8abcf4aa0542258a53df 2024-03-24T12:04:25+08:00 Meng, Hengyu [SYCL] offload op (#6217)
f482bb2e4920e544651fb832f2e0bcb4d2ff69ab 1997577d5e121568ae39f538021733ccd4278c23 2024-03-23T18:07:00+01:00 Pierrick Hymbert common: llama_load_model_from_url split support (#6192)
1997577d5e121568ae39f538021733ccd4278c23 476b0251b27fb64c575507024a671e639d675594 2024-03-23T18:00:38+01:00 Pierrick Hymbert server: docs: `--threads` and `--threads`, `--ubatch-size`, `--log-disable` (#6254)
1b26aebe4de4f048ac99996efd8a2c9af150904d 50ccaf5eacb50a2ca378a4ef0dc7aeb45fead652 2024-03-23T13:18:45+01:00 Pierrick Hymbert server: flush stdout after logging in both text and json layout (#6253)
72114edf068a9b2f54d3b09e9a198f611be397e8 2f0e81e053b41ca28e73a841e7bdbf9820baaa57 2024-03-22T13:07:44Z Olivier Chafik json-schema-to-grammar : fix order of props + non-str const/enum (#6232)
6b8bb3a31d260a01020497c5f01025c34222fcb9 68e210b3543e0cc71268bee0920441747679ee13 2024-03-22T19:12:05+08:00 Jan Boon server : fix n_keep always showing as 0 in response (#6211)
68e210b3543e0cc71268bee0920441747679ee13 b3e94f26bab8e3b5338b5902e5af5bb01894cb4a 2024-03-22T13:08:28+02:00 Georgi Gerganov server : enable continuous batching by default (#6231)
be07a03217376c53b1d95e5f658adbbbb2831555 d0a71233fbf8ade8ef06ad8e6b81d1d7b254895f 2024-03-22T06:41:24+08:00 Jan Boon server : update readme doc from `slot_id` to `id_slot` (#6213)
f372c49ccdc561ab96fb3c7d2b7cbc0f89a4b359 924ce1dce7fdf54894b462d03e7b608a6e574c32 2024-03-21T11:52:35-06:00 semidark Corrected typo to wrong file (#6199)
5b7b0ac8dfdd800c0fd0dc69b69991e8cb19fb46 1943c0198125a0da1a200390e82cf461f9080d99 2024-03-21T11:50:43Z Olivier Chafik json-schema-to-grammar improvements (+ added to server) (#5978)
91f8ad167dcd24b54615b468d9dd764ebe1d37ad 6b7e76d28cdf4361740054140708c71828453522 2024-03-20T13:30:36+01:00 Xuan Son Nguyen Server: version bump for httplib and json (#6169)
bc0baab2ea8f806961dd3fb9f534cfeb59a2e1fc d795988d9e09f75412efe2134512914c42780ad5 2024-03-20T14:14:32+02:00 Georgi Gerganov server : allow to override -ngl in tests (#6170)
47cc7a7bf9793f81a6dfe7c2096c499403f64dd6 bd60d82d0cc8b6852ec535495a5042dbdf05de24 2024-03-20T16:32:34+05:30 Karthick Server: Handle n_keep parameter in the request (#6174)
bd60d82d0cc8b6852ec535495a5042dbdf05de24 6c0b287748327741b113d7d6018b68c63039b1c5 2024-03-20T01:33:49-04:00 Jared Van Bortel server tests : more pythonic process management; fix bare `except:` (#6146)
a56d09a4407f29c21e149b44fd5308f83aa1cb09 d84c48505f60bcd358b82a751d40418c4d235643 2024-03-16T13:20:53+01:00 Pierrick Hymbert ci : close inactive issue with workflow (#6053)
877b4d0c628cc70dddb5df72ed8fc14d126ca7e8 12247f4c69a173b9482f68aaa174ec37fc909ccf 2024-03-15T13:43:02-07:00 Theia Vogel llama : add support for control vectors (#5970)
12247f4c69a173b9482f68aaa174ec37fc909ccf 4e9a7f7f7fb6acbddd1462909c8d696e38edbfcc 2024-03-15T16:41:22-04:00 Andrew Canis llama : add Command-R support (#6033)
4e9a7f7f7fb6acbddd1462909c8d696e38edbfcc 3020327f6cd6d2ce50528dd65f4b199d2ea8b1ae 2024-03-15T22:31:05+08:00 Ting Lou llava : change API to pure C style for Rust FFI bindgen (#6079)
43241adf22e8231ffaf3827d2c9310cc0ffd5ac5 a44bc969e4cd62ca9f4332e17fe3c51f2093e7c6 2024-03-14T12:15:39+01:00 Pierrick Hymbert server: disable debug release type sanitizer, simplify trigger (#6047)
76a936c8939c249a7c3e8e66dfefbab13eae194f 463628372d5fe3a0c1e5864aa5fc57deb7387039 2024-03-13T20:33:56+02:00 Georgi Gerganov readme : update API changes and hot topics
f30ea47a87ed4446ad55adb265755dc9102956a2 d8fd0ccf6ac8b07791ffd1575eed436930854ae3 2024-03-13T18:54:21+01:00 slaren llama : add pipeline parallelism support (#6017)
99b71c068f624521ad977e08e41589e2971fa1c7 306d34be7ad19e768975409fc80791a274ea0230 2024-03-13T11:39:11+01:00 Xuan Son Nguyen Server: Use multi-task for embeddings endpoint (#6001)
05b06210c954491cf0f12034b0a62bd4d69ce78b 83796e62bc9f6caae6228168e359890f51e60fee 2024-03-11T17:49:47+02:00 Georgi Gerganov llama : more consistent names of count variables (#5994)
83796e62bc9f6caae6228168e359890f51e60fee 828defefb66fc8a25404f5de845897145bf34061 2024-03-11T17:47:47+02:00 Georgi Gerganov llama : refactor unicode stuff (#5992)
828defefb66fc8a25404f5de845897145bf34061 caa106d4e05a0ab94225c220b81f9e2cd522339b 2024-03-11T14:40:42+01:00 Jakub N Update server docker image URLs (#5997)
caa106d4e05a0ab94225c220b81f9e2cd522339b 3202361c5b1ba15e695b31209567ef42c22c5c32 2024-03-11T10:56:41+01:00 Xuan Son Nguyen Server: format error to json (#5961)
332bdfd7980718abf664bfa5460f2288a3314984 ecab1c75de68de7c41c254e2ae170d3b07bee6d4 2024-03-11T17:09:32+09:00 Minsoo Cheong server : maintain chat completion id for streaming responses (#5988)
fa8a809a9119411bc9c3f00026550d0343f4d9b7 bcebd7dbf62fd7b293d5ed089023e4e733269c71 2024-03-10T18:17:47+01:00 Pierrick Hymbert server: ci: windows build and tests (#5968)
621e86b331f8b0e71f79fd82a4ae1cd54c3e4396 77d1ac7e00bf049b9f2bba1b5a310a78318c49c4 2024-03-09T23:41:49+01:00 Pierrick Hymbert server: benchmark: chat/completions scenario and other llm servers comparison (#5941)
77d1ac7e00bf049b9f2bba1b5a310a78318c49c4 d894f352bf433157232dc8dc54eacd50014e898e 2024-03-09T22:04:00+02:00 Georgi Gerganov server : print chat template info
d894f352bf433157232dc8dc54eacd50014e898e 098dbaab449f5309a54871ba7e5acef72ae696de 2024-03-09T19:55:54+01:00 slaren perplexity : support using multiple sequences to allow larger batch sizes (#5946)
58308a0ecce7cc261b802f4803c38d420063db21 5b09797321430f08caf0473143a962916ab2ea89 2024-03-09T17:34:15+02:00 Georgi Gerganov server : fix metrics init (#5964)
5b09797321430f08caf0473143a962916ab2ea89 97c09585d65a95864773b4d25d66d0f708baf38d 2024-03-09T15:53:59+02:00 Georgi Gerganov ggml : remove old quantization functions (#5942)
97c09585d65a95864773b4d25d66d0f708baf38d fb215c3832236fec7380c4fb618bd7154cb196ef 2024-03-09T15:47:47+02:00 Georgi Gerganov server : clarify some items in the readme (#5957)
fb215c3832236fec7380c4fb618bd7154cb196ef 2c4f566c88322ebf2f9bd11b01b5ebdaa0130b89 2024-03-09T21:27:58+09:00 SeungWon Jeong server : normalize embeddings (#5956)
0db32beaf09d90b8959d3d0cc493ed1e45685353 8a3012a4ad08112bb3dc3f1399afec4e93780c44 2024-03-09T11:16:53Z Alexey Parfenov server : fix passing prompt as tokens (#5955)
9674aaf35cb81478eb38c3f3ebde713ec72fbb79 950ba1ab84db199f0bbdecdb2bb911f35261b321 2024-03-09T12:34:18+02:00 Georgi Gerganov server : simplify logic for empty prompts (#5953)
950ba1ab84db199f0bbdecdb2bb911f35261b321 e1fa9569ba8ce276bc7801a3cebdcf8b1aa116ea 2024-03-09T11:27:53+01:00 Xuan Son Nguyen Server: reorganize some http logic (#5939)
e1fa9569ba8ce276bc7801a3cebdcf8b1aa116ea fd72d2d2a5e79d61ccef6af3d15f16e5e5cbc352 2024-03-09T02:57:09-07:00 Gabe Goodhart server : add SSL support (#5926)
fd72d2d2a5e79d61ccef6af3d15f16e5e5cbc352 c2101a2e909ac7c08976d414e64e96c90ee5fa9e 2024-03-09T10:30:04+01:00 Pierrick Hymbert server: tests: add truncated prompt tests, better kv cache size (#5933)
c2101a2e909ac7c08976d414e64e96c90ee5fa9e 515f7d0d4fce41c752fc253acf30707c3be2531e 2024-03-08T17:31:00-05:00 compilade llama : support Mamba Selective State Space Models (#5328)
76e868821a94072fbc87cb1fcca291694319eae8 e457fb3540e0aaec47cfde0abf784c213f9216ee 2024-03-08T12:25:04+01:00 Pierrick Hymbert server: metrics: add llamacpp:prompt_seconds_total and llamacpp:tokens_predicted_seconds_total, reset bucket only on /metrics. Fix values cast to int. Add Process-Start-Time-Unix header. (#5937)
af37fd8b30e37ccbffdd82e6f48559e2fb7ce7dd 581ed5c4fe3a8909aaa8313633ac443f471ba755 2024-03-08T12:40:02+02:00 Georgi Gerganov server : fix EOS token detection with disabled cache (#5938)
55a2a900ff4a02fc33708ac7858d595d289a3f2a 2002bc96bf2cbf5ab981a17d7e994d817c9801f5 2024-03-07T19:42:39+09:00 Minsoo Cheong server : add `/v1/completions` endpoint (#5914)
2002bc96bf2cbf5ab981a17d7e994d817c9801f5 ceca1aef0738b57951cd12c603c3477e75312dec 2024-03-07T11:41:53+02:00 Georgi Gerganov server : refactor (#5882)
21b08674331e1ea1b599f17c5ca91f0ed173be31 6a87ac3a52668e117d97bcea07b529c93188b303 2024-03-05T16:08:35+08:00 Neo Zhang Jianyu [SYCL] fix mul_mat fault in CI/unit-test (#5862)
29ae62d2ae163e2b68aa0ad3bf2ab4636de0c957 e0843afe1b37890b631bc7d3d2da2ed36c862b91 2024-03-04T22:31:20+02:00 Georgi Gerganov llama : fix embeddings (#5796)
231ae28f078c3148d097b301f2145f1e3e816cc1 475df1d6cf817060028d3ff763cb8097d4ec40d6 2024-03-03T12:44:03+02:00 Georgi Gerganov readme : add API changes section
e6029348e86c3810d4435faee54ba822cb43e2ef 8ef969afcec1645d2d9c3ab1fc82263bba968989 2024-03-03T09:35:23+01:00 Pierrick Hymbert ci : schedule slow server tests only on Release or on demand (#5839)
8ef969afcec1645d2d9c3ab1fc82263bba968989 fa974646e1a2024fc7dc9e6f27cf1f2f5d4a3763 2024-03-03T08:48:36+01:00 Pierrick Hymbert server : init http requests thread pool with --parallel if set (#5836)
9731134296af3a6839cd682e51d9c2109a871de5 4a6e2d6142ab815c964924896891e9ab3e050632 2024-03-02T22:00:14+01:00 Pierrick Hymbert server: tests: passkey challenge / self-extend with context shift demo (#5832)
38d16b142624bdd7c41d9955752b7f7b59c5e048 c2224f003bf9cf558b1a3c57033563e11a4de9a5 2024-03-01T20:00:58+02:00 Georgi Gerganov server : remove api_like_OAI.py proxy script (#5808)
5cb02b4a012bb16c6c699c0c62c05ffa653eee0f 6ea0f010ff6967034528d9e0b8330b9b0f0b7c13 2024-03-01T10:08:08+01:00 Pierrick Hymbert server: allow to override threads server pool with --threads-http (#5794)
f105471ef6aa4727afac8240da398590d7277f45 38d152160898b0173ffe4dc7df5daadcbd2eceb0 2024-03-01T09:59:43+02:00 Georgi Gerganov server : fix newlines in help (#5785)
052051d8ae4639a1c3c61e7da3237bcc572469d4 d5ab29757ebc59a30f03e408294ec20628a6374e 2024-02-29T21:42:11+01:00 Xuan Son Nguyen Server: normalize naming (#5779)
08c5ee87e4cceb603ecceac90734fcdade57311b 78aacf36344df724cdca9f1e1af849b2d2519cb8 2024-02-28T18:43:38+02:00 Georgi Gerganov llama : remove deprecated API (#5770)
a693bea1e6762a17b78b6ddf4611e54136941ea2 adcb12a9bad87bc96f2f158c95892b3d04aa7ffb 2024-02-28T09:55:37+01:00 Xuan Son Nguyen server : hit Ctrl+C twice to exit (#5734)
efc72253f7987ed7bdc8bde9d9fa5c7cac2f6292 7c4263d4261d6ee6f0539d53eb9e1b4d120ba8af 2024-02-28T01:39:15-07:00 Jorge A server : add "/chat/completions" alias for "/v1/...` (#5722)
b11a93df41921846a10628a7c306d5c82a549939 a33e6a0d2a66104ea9a906bdbf8a94d050189d91 2024-02-26T23:15:48+01:00 Xuan Son Nguyen fix server hangs on empty prompt (#5733)
4804215cb833841ffb15a710a16b77ca0a29eb4b 8a533f0d9078396ebaee9ba213038a1322976dee 2024-02-26T11:41:34+01:00 Pierrick Hymbert server: CI fix trailing space (#5728)
8a533f0d9078396ebaee9ba213038a1322976dee 269de86ba073b5dc9ce687c11a3bc4d7d873b962 2024-02-26T09:56:10+01:00 Pierrick Hymbert server: CI tests reduce build matrix (#5725)
e3965cf35aac00d4e24998c8a3d0093ae1d98bd3 8b350356b28f782deab63d8b0e9ae103ceb25fcd 2024-02-25T22:48:33+01:00 Pierrick Hymbert server: tests - slow inference causes timeout on the CI (#5715)
8b350356b28f782deab63d8b0e9ae103ceb25fcd bf08e00643fd529f748f0a858fd79f3061e3fa18 2024-02-25T21:46:29+01:00 Pierrick Hymbert server: docs - refresh and tease a little bit more the http server (#5718)
f7625019c51ca437a5840576d92362cfa710e4a2 abbabc5e51d0d4656b438aec10b7fae9479ef37d 2024-02-25T13:43:50-05:00 compilade server : fix crash when system prompt is bigger than batch size (#5714)
930b1780269a69948d106e2d1b838ab7661f679a d52d7819b8ced70c642a88a59da8c78208dc58ec 2024-02-25T13:50:32+01:00 Pierrick Hymbert server: logs - unified format and --log-format option (#5700)
d52d7819b8ced70c642a88a59da8c78208dc58ec 12894088170f62e4cad4f8d6a3043c185b414bab 2024-02-25T13:49:43+01:00 Pierrick Hymbert server: concurrency fix + monitoring - add /metrics prometheus compatible endpoint (#5708)
9e359a4f47c1b2dceb99e29706c9f7403d32ab5e 4c4cb30736582cacb1a164a9d4bc8e17b1014be7 2024-02-24T19:16:04+01:00 Pierrick Hymbert server: continue to update other slots on embedding concurrent request (#5699)
525213d2f5da1eaf4b922b6b792cb52b2c613368 fd43d66f46ee3b5345fb8a74a252d86ccd34a409 2024-02-24T12:28:55+01:00 Pierrick Hymbert server: init functional tests (#5566)
fd43d66f46ee3b5345fb8a74a252d86ccd34a409 54fbcd2ce6c48c9e22eca6fbf9e53fb68c3e72ea 2024-02-23T19:31:54Z AlpinDale server : add KV cache quantization options (#5684)
a46f50747b2028f7f9c9883b26bfba12bf92556e c5688c6250430d2b8e0259efcf26c16dfa4c1f46 2024-02-22T09:33:24+01:00 Xuan Son Nguyen server : fallback to chatml, add AlphaMonarch chat template (#5628)
c5688c6250430d2b8e0259efcf26c16dfa4c1f46 4ef245a92a968ba0f18a5adfd41e51980ce4fdf5 2024-02-22T08:27:32Z Alexey Parfenov server : clarify some params in the docs (#5640)
1ecea255ebb70750b52688393f37a63606b90e3f a00a35cef93e057eace8351a667d14d152a91ebc 2024-02-21T15:47:48+01:00 Pierrick Hymbert server: health: fix race condition on slots data using tasks queue (#5634)
6560bed3f066c876682464762cad90f1e28e3f1b 06bf2cf8c406e6b70dbf9b431a02fa0ad845b9df 2024-02-20T11:07:22-08:00 CJ Pais server : support llava 1.6 (#5553)
9c405c9f9a7cfd23511fd6b2de05dc72481119b4 5207b3fbc500f89dfe528693e96540956dbaed96 2024-02-20T15:58:27+01:00 Xuan Son Nguyen Server: use llama_chat_apply_template (#5593)
c0a8c6db371cb3e4379900867b948879f5842201 b9111bd209c7b11b0592450a6ed2e0ca545b2c84 2024-02-20T08:48:19+01:00 Pierrick Hymbert server : health endpoint configurable failure on no slot (#5594)
5ee99c32f5e47c8d32634eff9a47fb32a24c276b c145f8a132b2fe1d1e65987faddbd9a40bef7a12 2024-02-18T11:11:16-08:00 Robey Holderith common, server : surface min_keep as its own parameter (#5567)
c145f8a132b2fe1d1e65987faddbd9a40bef7a12 689a091bbe0537ee9abff3e15a1d74f5f3561165 2024-02-18T18:39:57+01:00 Pierrick Hymbert server : slots monitoring endpoint (#5550)
e75c6279d1c8e7abb82a331f5de7124eed402de2 36376abe05a12a8cb3af548a4af9b8d0e2e69597 2024-02-18T17:31:28+01:00 Pierrick Hymbert server : enhanced health endpoint (#5548)
36376abe05a12a8cb3af548a4af9b8d0e2e69597 66c1968f7a2e895675425e875b6589f1233a1b52 2024-02-18T17:30:09+01:00 Pierrick Hymbert server : --n-predict option document and cap to max value (#5549)
66c1968f7a2e895675425e875b6589f1233a1b52 1dcc3fde004787e6fc4d84c9de0bb34cd2901a3e 2024-02-18T08:23:16-08:00 Daniel Hiltgen server : graceful server shutdown (#5244)
6dcc02d2444c779c18d49c364c5d5c5728b6b484 5f5808ca7b7f23a1fa7a77241842bb84a0e55108 2024-02-16T11:33:25Z Alexey Parfenov server : add "samplers" param to control the samplers order (#5494)
5f5808ca7b7f23a1fa7a77241842bb84a0e55108 f486f6e1e5e9d01603d9325ab3e05f1edb362a95 2024-02-16T11:00:56+01:00 Rőczey Barnabás server : fix system prompt cli (#5516)
f486f6e1e5e9d01603d9325ab3e05f1edb362a95 60ed04cf82dc91ade725dd7ad53f0ee81f76eccf 2024-02-16T01:31:07-08:00 bmwl ggml : add numa options (#5377)
0d4177126b0556e202efb85bf3f768be81076400 7930a8a6e89a04c77c51e3ae5dc1cd8e845b6b8f 2024-02-15T09:01:57+01:00 Elbios llava : fix memory management bug (#5491)
aa2341298924ac89778252015efcb792f2df1e20 f5ca054855dea83f424003162f26de376e5643f6 2024-02-14T08:38:35+01:00 John llava : support v1.6 (#5267)
684780141a08200ec98eba3e982dbafd1d0b5000 85910c5b30f6e268321be8df044f5528a6efac52 2024-02-11T13:38:14Z Alexey Parfenov server : allow to specify tokens as strings in logit_bias (#5003)
907e08c1109f498b01036367804cff3082c44524 f026f8120f97090d34a52b3dc023c82e0ede3f7d 2024-02-11T11:16:22+01:00 Xuan Son Nguyen server : add llama2 chat template (#5425)
7c777fcd5dd4af7079e33390cf6a19c328a2666f e5ca3937c685d6e012ac4db40555d6ec100ff03c 2024-02-09T02:49:49-08:00 Riley Stewart server : fix prompt caching for repeated prompts (#5420)
0ef46da632c32faa1a538e5dc180994e8bbb46e1 ee1628bdfea8b0079fed0140ac2f00ef1b465b57 2024-02-07T02:17:25-06:00 Xiao-Yong Jin llava-cli : always tokenize special tokens (#5382)
f3e2b4fa3f81a410ecb7dec929c259ef8d8dbb7d f68664ac241a6b5c233d8f1051eef20929b06008 2024-02-07T01:15:19-05:00 Justin Parker server : update `/props` with "total_slots" value (#5373)
213d1439fadefe182f69c5f7e8dd3b4b6572ebcb 17c97fb0620448b37516a3f53fea6c482b0a30a4 2024-02-06T18:08:38Z Alexey Parfenov server : remove model.json endpoint (#5371)
8a79c591de9b7ff3242a94f68b7fb5a17ed8c2be 31e790322133a4b1d0684527ea446e765e8a96cf 2024-02-06T04:20:59-05:00 Justin Parker server : include total "num_slots" in props endpoint (#5349)
31e790322133a4b1d0684527ea446e765e8a96cf 4ffc7a17d4e80c5f3f905139cb570ed9b6934fcb 2024-02-06T04:20:00-05:00 Michael Coppola server : add `dynatemp_range` and `dynatemp_exponent` (#5352)
4ffc7a17d4e80c5f3f905139cb570ed9b6934fcb 906cff55c2848fda091d888a1585915ec0c9ea9e 2024-02-06T08:16:23Z Niall Coates server : various fixes for the prompt field in /completion (#5300)
a2d60c9158435ae9a6f14632f07f1acf7a3becef e6f81775323f6f4e4a30abf022a6028fa86b79ac 2024-02-05T08:10:22Z Alexey Parfenov server : allow to get default generation settings for completion (#5307)
4be04c8965578edc09194fab769b4b922b8444f5 5d55b0cd827bb0fcfedfa329a82bd5d6ef2c93ca 2024-02-05T10:43:57+03:00 Нияз Гарифзянов scripts : add non-interactive server-llm.sh (#5303)
e437b37fd0b2b97e6c6ff1045ec7f901faa6498a 2d40085c26794e29c434480b9e06738e89e5686f 2024-02-02T14:23:40+02:00 Georgi Gerganov scripts : parse wtype in server-llm.sh (#5167)
6b91b1e0a92ac2e4e269eec6361ca53a61ced6c6 e805f0fa9951081ce0a86378a7aa52b6f636b82d 2024-02-02T08:56:31+01:00 Xuan Son Nguyen docker : add build for SYCL, Vulkan + update readme (#5228)
5cb04dbc16d1da38c8fdcc0111b40e67d00dd1c3 efb7bdbbd061d087c788598b97992c653f992ddd 2024-01-31T17:30:17+02:00 Georgi Gerganov llama : remove LLAMA_MAX_DEVICES and LLAMA_SUPPORTS_GPU_OFFLOAD (#5240)
e0085fdf7c758f0bc2746fc106fb29dd9df959de e6f291d15844398f8326940fe5ad7f2e02b5aa56 2024-01-30T21:19:26+02:00 Georgi Gerganov Revert "server : change deps.sh xxd files to string literals (#5221)"
e6f291d15844398f8326940fe5ad7f2e02b5aa56 4003be0e5feef320f3707786f22722b73cff9356 2024-01-30T20:17:30+02:00 Georgi Gerganov server : fix context shift (#5195)
4003be0e5feef320f3707786f22722b73cff9356 fea4fd4ba7f6b754ac795387b275e1a014a77bde 2024-01-30T12:15:05-06:00 JohnnyB server : change deps.sh xxd files to string literals (#5221)
813416991ab0d1caa0d12f93ac4e8a24a2add0a3 5589921ef84a4fb1c6d1c9c34d626a5a83033db6 2024-01-30T10:18:02+01:00 divinity76 main : allow empty --prompt-cache file (#5176)
6685cc41c237544623b4b5651eceb9c4280728cc ceebbb5b21b971941b2533210b74bf359981006c 2024-01-30T17:11:46+08:00 Wu Jian Ping server : improve README (#5209)
c82d18e863fcde91b4b1109b1d0c73ea4470c405 14fef85e2d5361e6b4dd7a9ecf22bb817362997d 2024-01-29T21:48:10+08:00 Wu Jian Ping server : embeddings compatibility for OpenAI (#5190)
2307523d322af762ae06648b29ec5a9eb1c73032 0f648573dde61c510560f68244f70ece7e60d8c1 2024-01-28T18:03:59+01:00 0cc4m ggml : add Vulkan backend (#2059)
39baaf55a160909bb9428bd981014218761a20cb 6db2b41a76ee78d5efdd5c3cddd5d7ad3f646855 2024-01-28T01:55:31-06:00 Kyle Mistele docker : add server-first container images (#5157)
ec903c034131848da9222536ff18da07ec0882a0 a1d6df129bcd3d42cda38c09217d8d4ec4ea3bdd 2024-01-27T14:38:05+01:00 Maximilian Winter server : add self-extend support (#5104)
48c857aa10aea73210a4a72da3f1a6f99269e75d 413e7b0559f922bd4de5e9eec548829d111651b1 2024-01-26T13:42:20+01:00 Xuan Son Nguyen server : refactored the task processing logic (#5065)
2bed4aa3f37cb4e39e16e9ec7b595a7738fd5faf 125d03a5036a02a983c8e98c2cdc126e061afb8e 2024-01-23T08:11:39+01:00 Xuan Son Nguyen devops : add intel oneapi dockerfile (#5068)
125d03a5036a02a983c8e98c2cdc126e061afb8e 011e8ec577fd135cbc02993d3ea9840c516d6a1c 2024-01-23T01:51:27-05:00 Michael Coppola llama.vim : added api key support (#5090)
780e24a22eb595b705cbe8284771e9ceff1c4dd2 3ce7e8f8e7ccfce07e5947ac5f1f3f4628cf68ea 2024-01-22T21:15:08+08:00 Reinforce-II ggml : parallelize FP32 conversion when using BLAS (#5045)
7dcbe39d36b76389f6c5cd3b151928472b7e22ff 726c0fa9a2da976e9c5d5c51e185d9dd453fc9e5 2024-01-21T14:42:44+02:00 Kawrakow Add ability to evauate multiple choice tasks (#5047)
7051aacfac0057fa5fac9ea46c55bffc3892d810 2b3b999cacc7ad1207c32fbdf3479a19c06e1a34 2024-01-19T11:39:11+02:00 Kawrakow winogrande: evaluate log-probs in parallel (#5036)
821f0a271e7c9ee737945245dd7abfa22cc9b5b0 96d7f56d2918ffde1995dbb32392571deb76d7fc 2024-01-18T21:33:05+01:00 Xuan Son Nguyen server : defer tasks when "slot unavailable" (#5018)
3e945cc1e9c06d2001031360e4e303e9548fb02c ad19812cda4062c9f154ef16315df41fbe6a770a 2024-01-18T19:18:21+02:00 Kawrakow HellaSwag: speed up by parallelizing log-prob evaluation (#5020)
ad19812cda4062c9f154ef16315df41fbe6a770a 682986a08eb5cb04865d2e713449f17304d266d8 2024-01-18T15:33:01+02:00 Georgi Gerganov perplexity : faster HellaSwag via batching (#5017)
4feb4b33eeb1756e46084a4db9230b279af1a480 959ef0c0df725c013c7f712eaa7790b8e38a8e20 2024-01-16T18:41:42+01:00 Maximilian Winter examples : add complete parallel function calling example (#4974)
4be5ef556de830c5c4f6e45c05ef4427823fe607 0ea069b87bd296c556824e57455433b6c0357340 2024-01-13T20:45:45+02:00 Georgi Gerganov metal : remove old API (#4919)
0ea069b87bd296c556824e57455433b6c0357340 f172de03f11465dc6c5a0fc3a22f8ec254c6832c 2024-01-13T19:31:26+02:00 Georgi Gerganov server : fix prompt caching with system prompt (#4914)
356327feb3f66980ab687040495d722696d98970 ee8243adaa9a9f51ff449213383874e49efe368f 2024-01-13T09:20:46-05:00 Ziad Ben Hadj-Alouane server : fix deadlock that occurs in multi-prompt scenarios (#4905)
ee8243adaa9a9f51ff449213383874e49efe368f 15ebe59210e7fd9817ff67f51fa1a5ee2d004294 2024-01-13T14:16:11Z makomk server : fix crash with multimodal models without BOS token (#4904)
e7e4df031b9e29d4b55a4e0b0295187f6b213db1 584d674be622fbf1578694ada6e62eebedbfd377 2024-01-12T20:07:38+01:00 slaren llama : ggml-backend integration (#4766)
1d118386fea031f01550f8cd47a5c86296e5333f 7edefbd79cc6dea96640edc54c6b94b2b2496d8b 2024-01-11T23:23:49+02:00 Georgi Gerganov server : fix infill when prompt is empty (#4833)
4330bd83feb39683de4bd7a34cfcf672ff8ac3e4 27379455c38cb13f24de92dbd6fcdd04eeb1b9d9 2024-01-11T19:02:48+01:00 Laura server : implement credentialed CORS (#4514)
27379455c38cb13f24de92dbd6fcdd04eeb1b9d9 eab67950068e4b125007d027232c47d2a5831cd0 2024-01-11T12:51:17-05:00 Michael Coppola server : support for multiple api keys (#4864)
eab67950068e4b125007d027232c47d2a5831cd0 d8d90aa343c22fe01429d3540e47ded87e9dcb9d 2024-01-11T12:41:39-05:00 Behnam M server : add `LOG_INFO` when model is successfully loaded (#4881)
43f76bf1c362c067fce46bb8dcda0b64af8a9533 2f043328e3116724d15b915b5c6078e2df860a69 2024-01-11T16:14:52Z pudepiedj main : print total token count and tokens consumed so far (#4874)
2f043328e3116724d15b915b5c6078e2df860a69 2a7c94db5fb67b2f8882d2d16a11bf5d8d12d397 2024-01-11T09:33:26-05:00 Isaac McFadyen server : fix typo in model name (#4876)
7a9f75c38b5e62fe27b8a5a3ed823b4a3714024b 5c1980d8d4c4e0c0af77359f81cc44d90b3f250b 2024-01-11T02:12:05-05:00 Behnam M server : update readme to document the new `/health` endpoint (#4866)
5c1980d8d4c4e0c0af77359f81cc44d90b3f250b cd108e641dbdedd8c5641c4cec1762f751f38136 2024-01-11T09:10:34+02:00 Georgi Gerganov server : fix build + rename enums (#4870)
cd108e641dbdedd8c5641c4cec1762f751f38136 57d016ba2d46a6e22517a31a75cebb48f9e234b6 2024-01-10T14:56:05-05:00 Behnam M server : add a `/health` endpoint (#4860)
128de3585b0f58b1e562733448fc00109f23a95d 8c5833031857c9e9ada61948bae894ab9c785f86 2024-01-09T05:02:05-05:00 Behnam M server : update readme about token probs (#4777)
8c5833031857c9e9ada61948bae894ab9c785f86 18c2e1752c3b387689e9e73d7d8a1a3b1511ce23 2024-01-09T10:12:43+01:00 Zsapi server : add api-key flag to documentation (#4832)
67984921a70a7e680a24494aeb7575a66e90685d c75ca5d96f902564cbbbdd7f5cade80d53c288bb 2024-01-07T08:45:26+02:00 Georgi Gerganov server : fix n_predict check (#4798)
012cf349aec8ffb47c9def5dc018240fa3721e8b a91928014fcf51fe297823fcff0788de4f14206e 2024-01-04T19:56:33+02:00 Georgi Gerganov server : send token probs for "stream == false" (#4714)
e5804313a1edaf00726ed0b96ecced07accbf50c dc891b7f7a23158d54f9383790b92c79cc5906c1 2024-01-04T03:17:09-05:00 Michael Coppola server : fix options in README.md (#4765)
f2eb19bd8bc9f5730d6e05d7a52a9e19bf5ac099 f3f62f0d835d559e80714bbeb05d03125574e3dd 2024-01-03T03:43:19-05:00 Justin Parker server : throw an error when `slot unavailable` (#4741)
f3f62f0d835d559e80714bbeb05d03125574e3dd 0ef3ca2ac62016c0c545de1c89dc2e3e130f4a99 2024-01-02T21:07:47+02:00 Georgi Gerganov metal : optimize ggml_mul_mat_id (faster Mixtral PP) (#4725)
0ef3ca2ac62016c0c545de1c89dc2e3e130f4a99 540938f8904707dd74cb3be18495f853b312e72f 2024-01-02T15:48:49Z Phil H server : add token counts to html footer (#4738)
0040d42eeb237197054cc7790df5776eacfa608e 83e633c27efdf0eb0ba54249e784b0ea760b1007 2024-01-02T06:15:16-08:00 Marcus Dunn llama : replace all API facing `int`'s with `int32_t` (#4577)
5d7002d4372ebf107cfaf46fcd90df27b204f330 26f3071d714f0b27ad7f021a46a66a1085480258 2024-01-02T04:38:15-06:00 minarchist server : add --override-kv parameter (#4710)
58ba655af054715c0516ee270ad028ad9e74f357 edd1ab7bc34c10a780ee7f9a4499f7689cdad36d 2024-01-02T10:57:44+02:00 Georgi Gerganov metal : enable shader debugging (cmake option) (#4705)
9fbda719de18a9400a064c28759c39d55d687d3e 39d8bc71edcb8b6f99d46fa4216af7a15232e218 2023-12-30T23:24:42+02:00 Georgi Gerganov clip : refactor + bug fixes (#4696)
24a447e20af425fa44cf10feaa632b6bb596c80f a20f3c7465d6d1b33767757c2760643b799a81bf 2023-12-30T15:07:48+07:00 automaticcat ggml : add ggml_cpu_has_avx_vnni() (#4589)
db49ff8ed7f0bb201176703441cc02911b08ef2a 60f55e888c29cbd87c4238dd19e85d0eef87245d 2023-12-29T06:24:12-08:00 Justine Tunney server : replace sleep with condition variables (#4673)
60f55e888c29cbd87c4238dd19e85d0eef87245d b93edd22f55d3e5268263c3edcdae1818505c078 2023-12-29T22:22:44+08:00 SakuraUmi server : fix OpenAI server sampling w.r.t. penalty. (#4675)
b93edd22f55d3e5268263c3edcdae1818505c078 82d6eab224862a7044069fb9211dc4b29124264b 2023-12-29T06:22:10-08:00 Karthik Sethuraman server : allow to generate multimodal embeddings (#4681)
441f51dca004debf8b275f1bdc08e0f1af7fd8f8 38b3de4658292582a8941a2be5c77b40ce6ac0f2 2023-12-29T19:23:27+09:00 Tamotsu Takahashi ci : build with CLBlast + ggml-opencl use GGML_API (whisper/1576)
65e5f6dadbba4b496bba27f573e473c66b446496 ea5497df5d138c83b2b0ca70aefdc4b1175c1001 2023-12-28T11:20:00-08:00 Justine Tunney Fix OpenAI server sampling w.r.t. temp and seed (#4668)
6123979952385847d8348e295d77d6e01da8aa84 b9ec82d262cb20d7f0a8a1157bfa9aace40e2625 2023-12-23T09:31:49Z Alexey Parfenov server : allow to specify custom prompt for penalty calculation (#3727)
31f27758faf4a4bd08101a57c7ec3a473f771f86 56fa50819f7a3ca2128f63b81c17c08a4454479e 2023-12-21T11:57:48-08:00 Marcus Dunn llama : allow getting n_batch from llama_context in c api (#4540)
2994f0c5a2e8c96955b422dedc93ec2595d16b82 b1306c439490c7fa4ec33594500d980d1e9e15e6 2023-12-17T19:39:02-05:00 Jared Van Bortel decode : fix logits_valid for legacy API (#4516)
0ffc92d2d23a789625f018840469af045be1e3c0 8edd2b40fdbcafbf630f2cf29306b29d5cb48c42 2023-12-17T17:02:16+02:00 olexiyb server : disable llm logs if SERVER_VERBOSE is off (#3792)
8edd2b40fdbcafbf630f2cf29306b29d5cb48c42 eb16dae7e70ca97396190698b29c0f9ee3388e88 2023-12-17T15:57:56+01:00 AdithyanI server : fix grammar being ignored (#4494)
eb16dae7e70ca97396190698b29c0f9ee3388e88 62bd52b7bf90819e75f427a95a484cd5eee0b3c7 2023-12-17T14:56:09Z Alexey Parfenov server : fix possible ambiguity in content type charset (#4501)
62bd52b7bf90819e75f427a95a484cd5eee0b3c7 5daa5f54fdcd2b5228add1a4c43a1897b2168f35 2023-12-17T15:54:37+01:00 mzcu server : allow requests larger than 8K (#4500)
88ae8952b65cbf32eb1f5703681ea592e510e570 ee4725a686643669a8587142fa068cbf29de3ce2 2023-12-15T13:49:01+02:00 ShadovvBeast server : add optional API Key Authentication example (#4441)
948ff137ec37f1ec74c02905917fa0afc9b97514 4d98d9a65665eee3838cef936641f640e3f5b649 2023-12-13T23:57:15+04:00 shibe2 server : fix handling of characters that span multiple tokens when streaming (#4446)
fecac45658a99eddc4d6e36ba0310ca8f87a77f0 9494d7c4774ab745490b5a19570ff7747a194143 2023-12-12T04:12:35-06:00 kalomaze server : tweak default sampling parameters (#4367)
d9d4cfef64ea416dd66632173787d03ffb180cc7 41a11aaf99feff4901e4c8dc48ad00766c5da4e9 2023-12-12T11:25:29+02:00 Vladimir Zorin server : fix local model name in server (#4420)
bcc0eb4591bec5ec02fad3f2bdcb1b265052ea56 81bc9214a389362010f7a57f4cbc30e5f83a2d28 2023-12-07T13:03:17+02:00 Georgi Gerganov llama : per-layer KV cache + quantum K cache (#4309)
05cd6e5036d72d0930de4d8f6be7bce09e8dda24 caa9249217c5fd524b900add5ddcbeaa20cbcb12 2023-12-06T20:21:59+02:00 Georgi Gerganov server : recognize cache_prompt parameter in OAI API (#4347)
23b5e12eb5a76489b4c3ee22213a081da68b1809 d208995c6da66f252d4054c1c5a90eb8ccb7a2f7 2023-12-04T17:04:21+01:00 Daniel Bevenius simple : update error message for KV cache check (#4324)
33e171d1e9fc4903f9314b490d77fb8d58331b63 6949b50df56ee58a2d76d45487942cb211c08629 2023-12-03T01:10:43-08:00 Ed Lee server : fix OpenAI API `stop` field to be optional (#4299)
6949b50df56ee58a2d76d45487942cb211c08629 d7b800b8bc490a221acbd83c575206a907f2f6e2 2023-12-03T10:03:25+01:00 Rickard Edén py : add grammar to oai like api (#4294)
1d144112c0fbbb4ecc07dbcf4f05a380148bd6de f43f09366dfd018e4568e23a232aaa8c4f7cfc78 2023-11-30T17:25:49-05:00 Ziad Ben Hadj-Alouane server : add --log-disable to disable logging to file (#4260)
f43f09366dfd018e4568e23a232aaa8c4f7cfc78 d2809a3ba2780e00fce5a6149a7eda09f1c0e906 2023-11-30T17:25:04-05:00 Ziad Ben Hadj-Alouane server : add single-client multi-prompt support (#4232)
e2bd725f4b39bc5c6234858d158e01248f5ab5bd 1f5cd83275fabb43f2ae92c30033b384a3eb37b4 2023-11-30T20:50:40Z rhjdvsgsgks py : fix oai proxy (#3972)
af19d3573481d409b3c4e55494810eb1f65a9aae e9c13ff78114af6fc6a4f27cc8dcdda0f3d389fb 2023-11-25T11:29:06+02:00 Georgi Gerganov server : OAI API compatibility (#4198)
6b0a7420d03b9d13cb0e9439a01ce8476d8bf093 d103d935c0e75769a6a597f7a64cab72c6cc3e79 2023-11-23T19:07:56+02:00 Georgi Gerganov llama : KV cache view API + better KV cache management (#4170)
9d5949f04b1f8b76184818abbd99938c2020803f ff8238f71d56245f4a6dbea693f4ebd81263464d 2023-11-23T12:34:20+01:00 Daniel Bevenius examples : fix typo in parallel example doc comment (#4181)
936c79b2275a8f15f3512e63de615c676904d650 262005ad9ded375e9c544a02c18ef6254fe185a2 2023-11-19T11:54:10-05:00 SoftwareRenderer server : relay error messages (#4131)
9e87ef60e18d69338c5efea314aa7e718bf2040a c7cce1246e248124117ae5bc058923e3ade95f11 2023-11-17T16:24:07+01:00 Jannis Schönleber common : improve yaml log escaping (#4080)
4760e7cc0b68570d58f55e8dda469805d1759d0d bb50a792ec2a49944470c82694fa364345e95170 2023-11-13T14:16:23+02:00 Georgi Gerganov sync : ggml (backend v2) (#3912)
532dd74e38c29e16ea1cfc4e7eedb4f2fab3f3cd e86fc56f7521ca4b18d1d9939e82abd40c2f1c01 2023-11-11T22:04:58-08:00 Richard Kiss Fix some documentation typos/grammar mistakes (#4032)
d96ca7ded77df764db797b68b4a29e34c5b56285 34b0a082074b073eb14c2bd93c0c070e20ddcd16 2023-11-11T05:48:21Z Alexey Parfenov server : fix crash when prompt exceeds context size (#3996)
4a4fd3eefad5bd17ab6bcd8e2181b4f62eae76cf df9d1293defe783f42bc83af732d3c670552c541 2023-11-11T06:49:33+08:00 Jhen-Jie Hong server : allow continue edit on completion mode (#3950)
57ad015dc3011b046ed5a23186c86ea55f987c54 875fb42871a0f5a88fbe31a0b5edd697b84038e4 2023-11-09T04:00:34+02:00 Mihai server : add min_p param (#3877)
381efbf480959bb6d1e247a8b0c2328f22e350f8 2833a6f63c1b87c7f4ac574bcf7a15a2f3bf3ede 2023-11-06T22:36:23+01:00 Damian Stewart llava : expose as a shared library for downstream projects (#3613)
bb60fd0bf6bb270744d86dd45b3a95af01b7de45 132d25b8a62ea084447e0014a0112c1b371fb3f8 2023-11-05T23:15:27+07:00 Thái Hoàng Tâm server : fix typo for --alias shortcut from -m to -a (#3958)
50337961a678fce4081554b24e56e86b67660163 0e40806c1cb3bdf9955ed807ffbe212be85b4c67 2023-11-01T20:11:02+02:00 Georgi Gerganov llm : add llm_build_context (#3881)
f0e209324a7f663225791897877bf610f1af152d ca190bca8e844d171020d6147687e71472d71734 2023-11-01T11:29:07+02:00 Georgi Gerganov scripts : add server-llm.sh (#3868)
ca190bca8e844d171020d6147687e71472d71734 71e3718abdb2771b50c9606d3a7569623a0b0afe 2023-11-01T09:28:28Z Adrian Hesketh server : re-enable completion and embedded at the same time (#3876)
82a6646e0221216c41edcdf99f5a44bb051391f5 ba231e8a6dd8ad82acfe0e4d492ff7cef6b3f0a1 2023-10-28T15:43:01+03:00 Aarni Koskela metal : try cwd for ggml-metal.metal if bundle lookup fails (#3793)
34b2a5e1ee4fe6295fb4420eb91131d743694c65 6961c4bd0b5176e10ab03b35394f1e9eab761792 2023-10-26T22:53:37+03:00 Georgi Gerganov server : do not release slot on image input (#3798)
ad939626577cd25b462e8026cc543efb71528472 1717521cdb976a2219888b0e5cba36e210eee9df 2023-10-24T16:10:43-04:00 cebtenzzre server : add parameter -tb N, --threads-batch N (#3584) (#3768)
1717521cdb976a2219888b0e5cba36e210eee9df b2f7e04bd312eaf97eee0523aa09d950d585626b 2023-10-24T23:08:20+03:00 Georgi Gerganov server : do not block system prompt update (#3767)
5be6c803fa5378f62a1590f3ad8c6b64c7c0c2ce 6336701c9378c23c85d1c0e464b663ca2bbb8e60 2023-10-23T12:40:03-07:00 Marcus Dunn llama : remove token functions with `context` args in favor of `model` (#3720)
438c2ca83045a00ef244093d27e9ed41a8cb4ea9 9e70cc03229df19ca2d28ce23cc817198f897278 2023-10-22T22:53:08+03:00 Georgi Gerganov server : parallel decoding and multimodal (#3677)
d3956aea53369455008159cc405ed4c496976692 22c69a27945e7acf9690dd3210d316f22182751c 2023-10-22T20:09:51+02:00 vvhg1 main : escape prompt for cfg_negative_prompt and consecutive inputs in main with interactive (#3623)
d1031cf49c3b958b915fd558e23453471c29ac33 8cf19d60dc93809db8e51fedc811595eed9134c5 2023-10-20T21:07:23+03:00 Georgi Gerganov sampling : refactor init to use llama_sampling_params (#3696)
a0edf73bda31c7c4e649e6f07c6fd30a729929cd f439e506e8ae8b01df2ae2156380f8156d7553e3 2023-10-20T13:06:10+03:00 Georgi Gerganov server : fix uninitialized sampling context (close #3685)
0e89203b517c95ec6675eda75d200a60d1e8921d c67fe68e417f766970fb1feaf2e66458aa24116a 2023-10-18T16:21:57+03:00 Georgi Gerganov speculative : add tree-based sampling example (#3624)
3ad1e3f1a10c1f66b4f1cd7510e0977fadbc0dfd 1142013da40e98946a109b141dd858f0ed996051 2023-10-17T18:51:02+02:00 coezbek server : documentation of JSON return value of /completion endpoint (#3632)
b016596d903641f8825cd94bb6742e1de0c21017 6b3ae4da92485f979a0f45774fcf68597634db0b 2023-10-12T15:51:53+09:00 Aarni Koskela server : add completion mode (no chat) (#3582)
57dd55e2c742bfc50e0f5c6fb95c14118cff44f6 b8fe4b5cc9cb237ca98e5bc51b5d189e3c446d13 2023-10-12T09:29:04+03:00 Georgi Gerganov server : fix kv cache management (#3588)
a8bdd65525ae86dea905e9866ad369b53e30ac14 70c29da118cdb02bfcbd0376c32b5b2236e48e48 2023-10-11T15:42:22-04:00 Michael Coppola server : add parameter -tb N, --threads-batch N (#3584)
11ea5c7d96f2c28e1c99659e08ec0a44574056e2 95bd60a0a69f57e9a2ff1269667ea484a1a9bb40 2023-10-10T09:31:21+02:00 vvhg1 infill. : fix tokenization (#3508)
8e6716a102e390e930594d51302730184dac83cc 9c38d181d40b9d27f8f42152c18e7c70bfffcf37 2023-10-08T03:55:58-07:00 Ryder Wishart api_like_OAI.py : compat with Microsoft Guidance (#2746)
9c38d181d40b9d27f8f42152c18e7c70bfffcf37 a1202a31ed8c35705bd09fe91c3e7410c619bd70 2023-10-08T06:52:57-04:00 arcrank api_like_OAI.py : simplify function (#2796)
cb13d73a720c42d1958bff79b6869d77b26b8cea 9ca79d5cbbc8d43f2bff951404b6a40ff1ee3788 2023-10-06T21:39:33+03:00 Mihai server : docs fix default values and add n_probs (#3506)
9ca79d5cbbc8d43f2bff951404b6a40ff1ee3788 0c731ca4039ccff86ffab90eaae4ca98037c4496 2023-10-06T10:10:13-06:00 Kerfuffle kv cache slot search improvements (#3493)
a8777ad84e00cda0399e827cdf971e2c3fab1da2 97af49fa395df77e4c18af0e1655b2fee67c9686 2023-10-06T14:16:38+01:00 pudepiedj parallel : add option to load external prompt file (#3416)
97af49fa395df77e4c18af0e1655b2fee67c9686 16820a5a0d885113f21021ce934f0b0027b9d69a 2023-10-06T07:44:24-05:00 Jhen-Jie Hong server : reuse llama_sample_token common util (#3494)
e8b8d32e8663ffc55a02c9721af3a5190382cbb0 8f3a642ec1d878b2d0a0d15e3a4277f522790d4c 2023-10-05T09:02:55-05:00 Jhen-Jie Hong server : fix incorrect num_tokens_predicted (#3480)
ac2219fef34eb5b713c286c34c6e4162c39c8f3b 48be797ffbd80b062f55778e09e97180eb25d2ab 2023-10-03T21:04:01+03:00 Georgi Gerganov llama : fix session saving/loading (#3400)
48be797ffbd80b062f55778e09e97180eb25d2ab f56e1baec361b5381e32ee6b6e56e4f00e002dfe 2023-10-03T10:09:28-07:00 Alex Klinkhamer llama : expose model's rope_freq_scale in the API (#3418)
c97f01c362ac102c6994edb80008f8608539553a f5ef5cfb18148131fcf45bdd2331f0db5ab7c3d0 2023-10-02T09:42:02+02:00 vvhg1 infill : add new example + extend server API (#3296)
7f1a0fe709ea1a861da2f3759f58a28bf8953c12 16bc66d9479edd5ee12ec734973554d4493c5dfa 2023-09-29T03:51:52+08:00 Qu Zongfu ggml : release the requested thread pool resource (#3292)
0e76a8992c8200237bbc6471a53fb8796b3872f7 2db94d98eda56982d80238840b0652b4137a2a84 2023-09-28T20:40:11+02:00 xaedes train : finetune LORA (#2632)
ec893798b7a2a803466cc8f063051499ec3d96f7 45855b3f1c7bdd0320aa632334d0b3e8965c26c4 2023-09-28T19:04:36+03:00 Georgi Gerganov llama : custom attention mask + parallel decoding + no context swaps (#3228)
dc6897404e141c74cbbf8030ecfebd74e1815411 527e57cfd8a9a26bf622c0510c21c2508a24be26 2023-09-27T17:48:33+02:00 Rickard Hallerbäck metal : reusing llama.cpp logging (#3152)
be8c9c245bd129ebabb80e0a7a8dd7daeb4d30af be6beeb8d75294552c4918fce06d7b84eebf3d79 2023-09-07T15:45:01+02:00 Kawrakow metal : parallel RoPE on Metal (#3024)
e4386f417faf894f6706eec005e24d142b577fcb 35195689cd835464779c247b1c22ab9247418fd1 2023-09-04T10:28:55+02:00 Aarni Koskela server : add a subtle loading animation to the edit box (#2466)
571083f508266c4eb5cb5457d836df5dd3c173ce f04d0028444bc9b3d4225fba47e19d4c3aeb3741 2023-09-02T08:31:46+08:00 Jhen-Jie Hong server : avoid aniprompt in probabilities of final response (#2849)
44c117f41ee01c5ac8fb86bba041f08d8b87b46d 43033b7bb4858da4f591715b3babdf906c9b7cbc 2023-08-28T21:51:47+02:00 xaedes train : mem usage and other improvements (#2439)
c1ac54b77aaba10d029084d152be786102010eb2 730d9c681e339b76407659344e5a2cd50af7d7d5 2023-08-26T16:11:45-07:00 Bruce MacDonald server : add `/detokenize` endpoint (#2802)
730d9c681e339b76407659344e5a2cd50af7d7d5 c7d92e6dfec3f54849f3a0ba373054d29f321ea2 2023-08-26T14:13:36-06:00 Kerfuffle convert.py : advanced option (#2753)
2ba83c8685177faea3399db9564f9c52df75c366 bae5c5f679e043371bc2b4dffff8d4964d6cb953 2023-08-26T13:45:53+02:00 klosax Fix spm whitespaces (#2806)
bae5c5f679e043371bc2b4dffff8d4964d6cb953 232caf3c1581a6cb023571780ff41dc2d66d1ca0 2023-08-26T10:07:43+02:00 lon examples : skip unnecessary external lib in server README.md how-to (#2804)
29674ab4e847fcaba60cc6558f0d46d5f74ae279 5439a0ab57c16b556ffa91a0953df5e46b1e7fb4 2023-08-25T18:32:45+08:00 Jhen-Jie Hong server : display token probabilities in the UI (#2489)
cf658adc832badaaa2ca119fe86070e5a830f8f6 a192860cfec89a38d59a943623bf595b1fe4495b 2023-08-23T23:08:04+03:00 Georgi Gerganov llm : add Falcon support (#2717)
b8ad1b66b23f9b2e6e4531e9a62753323036a556 f5fe98d11bdf9e7797bcfb05c0c3601ffc4b9d26 2023-08-23T02:12:12-05:00 Xiao-Yong Jin server : allow json array in prompt or content for direct token input (#2306)
46ef5b5fcf4c366e1fb27726b6394adbbf8fd0ea c63bb1d16a70c03440671b76954bb767513cead8 2023-08-22T23:10:42+02:00 goerch llama : fix whitespace escaping in tokenizer (#2724)
226255b44ef2c2794bfac48d101d35a9c2dbb965 930523c8e1cbbee5449c055daa894917fac6805e 2023-08-22T08:32:00+08:00 Jhen-Jie Hong server : fallback to default if client param is null (#2688)
6381d4e110bd0ec02843a60bbeb8b6fc37a9ace9 dadbed99e65252d79f81101a392d0d6497b86caa 2023-08-21T23:07:43+03:00 Georgi Gerganov gguf : new file format with flexible meta data (beta) (#2398)
1f0bccb27929e261744c979bc75114955da49e98 f63564adfaa157ca387071d6b9a06cfaef0ef576 2023-08-19T00:45:36+03:00 Georgi Gerganov server : better default prompt (#2646)
f63564adfaa157ca387071d6b9a06cfaef0ef576 2d8b76a110d76ff6b5728ff0af8477531e4db60e 2023-08-19T05:41:32+08:00 Jhen-Jie Hong server : update xxd usage for older versions compatibility (#2649)
10151bee2e38b5711335c4a38f6ca93b50223acf 0992a7b8b18a89e29a205efb48ceb559c9a08203 2023-08-17T23:34:01Z staviq server : support for saving templates in browser LocalStorage (#2486)
3ebb00935f3f0522b75df49c2769ab1774b91380 d783f7982e0e823a2626a9956359c0d36c1a7e21 2023-08-15T06:14:14+08:00 Jhen-Jie Hong server : add missing /json-schema-to-grammar.mjs (#2616)
d75561df207d22790609ee0ad924302f66ac2599 348acf188c9fbe66396990f2dc83229df367969b 2023-08-14T15:36:42+02:00 Cheng Shao server : add --numa support (#2524)
2feb8934eb75ca63f3c42724229cce1df9579c8e 5517d6e69214cdead000a76983b9fe175c3f8329 2023-08-14T16:20:17+08:00 Jhen-Jie Hong server : fix default grammar by use empty string in the UI (#2604)
5517d6e69214cdead000a76983b9fe175c3f8329 f31b5397143009d682db90fd2a6cde83f1ef00eb 2023-08-14T15:16:54+08:00 Jhen-Jie Hong server : implement json-schema-to-grammar.mjs & add grammar param in the UI (#2588)
53dc399472d5bd35ee739b865e843b1996bd3814 9ca4abed893685692f90413e4d43153af12342d9 2023-08-12T06:35:14+08:00 Equim server: fixed wrong variable name in timing json (#2579)
1638757767072a4957f52b9e3594f0b67610631b 916a9acdd0a411426690400ebe2bb7ce840a6bba 2023-08-10T12:16:38+02:00 Martin Krasser Fix grammar-based sampling issue in server (#2566)
182af739c4ce237f7579facfe8f94dc53a1f573f 4329d1acb01c353803a54733b8eef9d93d0b84b2 2023-08-04T15:00:57-04:00 Cebtenzzre server: regenerate completion.js.hpp (#2515)
5f631c26794b6371fcf2660e8d0c53494a5575f7 415e99fec27be5a2e4283f1937afd17eb33fbd66 2023-08-04T06:37:24-05:00 Stephen Nichols Fixing race condition in server and partial stream handling in frontend. (#2391)
415e99fec27be5a2e4283f1937afd17eb33fbd66 ff966e7ca6af127c9405523cdb07ef8fa01bf6d6 2023-08-04T19:29:52+08:00 l3utterfly Stream save llama context data to file instead of allocating entire buffer upfront (#2488)
c574bddb368424b5996cbee2ec45ec050967d404 86aeb27734481751592abd85590020b40d9224c8 2023-08-01T20:54:28+08:00 Bono Lv fix a typo in examples/server/README.md (#2478)
86aeb27734481751592abd85590020b40d9224c8 1873ff586bd8499a18f763632711bf15d253585e 2023-08-01T01:56:23-07:00 ebraminio server : Support dark mode (#2414)
34ae1caf7fdea4c4c09087002e15e6230102e6a9 d91f3f0c55663719ea03b76311e8c36ed55eb0e2 2023-07-29T03:02:10+09:00 nhamanasu examples : server chat mode with llama2 (#2400)
d5512b782b27ff698007dcd175da18959d5f163f c798308e3a425eae050a1f249a576fa8c6433327 2023-07-25T11:36:17+02:00 slaren server: add rms_norm_eps parameter (#2380)
c798308e3a425eae050a1f249a576fa8c6433327 41c674161fb2459bdf7806d1eebead15bc5d046e 2023-07-25T10:27:34+03:00 Henri Vasserman [Server] Escape HTML in webchat (#2368)
b3f138d05849ccbce67303ac17b50ebbc268128a 5b2b2dc6ae8086bff7c9b3c17fb435cf319b7185 2023-07-24T17:54:22+03:00 Aarni Koskela Chat UI extras (#2366)
4f06592cc6b83979e4b442e8cb97b3948c857188 70d26ac3883009946e737525506fa88f52727132 2023-07-23T17:31:17-03:00 IgnacioFDM Add gqa parameter support to the server (#2351)
355c80f49e32b0b15c0a457f3bad380e57f5b9ac 83a00ce69bef9124c0702424a012ea799128b77d 2023-07-23T06:16:48-05:00 AustinMroz examples : simplify vim plugin (#2327)
24baa54ac1ff3d4156a2360deb1473af04a9b1a2 dd6c67d3cbb7b360747f776412bf01976aa32f4b 2023-07-22T12:34:51+02:00 whoreson examples : basic VIM plugin
9cf022a1889e50113fd348dc96b4557fc75a6296 e782c9e735f93ab4767ffc37462c523b73a17ddc 2023-07-21T09:42:21+02:00 Przemysław Pawełczyk make : fix embdinput library and server examples building on MSYS2 (#2235)
294f424554c1599784ac9962462fc39ace92d8a5 45a1b07e9b20c33d71d8c849ff27d693a75a0269 2023-07-19T15:06:40+08:00 Rinne llama : extend API to get max devices at runtime (#2253)
6e7cca404748dd4b1a3affd0d1296e37f4ac0a6f a6803cab946c817fb7aaf2a40b317f5d3e373bd1 2023-07-15T06:34:16-04:00 Xiao-Yong Jin llama : add custom RoPE (#2054)
3ec7e596b2ba3f43c22f441254ca2bcfa91102ba 917831c63a4138814d23da1917bf2b5d5b9faa6c 2023-07-12T01:12:35+09:00 Jinwoo Jeong docker : add '--server' option (#2174)
5656d10599bd756dc0f17284e418e704200b43f3 1d1630996920f889cdc08de26cebf2415958540e 2023-07-10T11:49:56-04:00 Evan Miller mpi : add support for distributed inference via MPI (#2099)
1d656d6360359cfdaaf5d64ed9690047b600dbcb 72421402834141df6cbdcf595fe46dbd11874dce 2023-07-08T00:24:01+08:00 Qingyou Meng ggml : change ggml_graph_compute() API to not require context (#1999)
31cfbb1013a482e89c72146e2063ac4362becae7 983b555e9ddb36703cee4d22642afe958de093b7 2023-07-05T16:51:13-04:00 Tobias Lütke Expose generation timings from server & update completions.js (#2116)
983b555e9ddb36703cee4d22642afe958de093b7 ec326d350c72afd23709a409944728a607188cc0 2023-07-05T18:03:19Z Jesse Jojo Johnson Update Server Instructions (#2113)
8567c76b5326e862be0755a8dc1dd988223fcae3 924dd22fd3ba93e097f8d19ba5cda919ca2fe2fb 2023-07-05T15:13:35Z Jesse Jojo Johnson Update server instructions for web front end (#2103)
f257fd255044decffad93dee2502875ce66ad80c 7ee76e45afae7f9a7a53e93393accfb5b36684e1 2023-07-05T03:06:12+09:00 jwj7140 Add an API example using server.cpp similar to OAI. (#2009)
7ee76e45afae7f9a7a53e93393accfb5b36684e1 acc111caf93fc6681450924df9f99679c384c59e 2023-07-04T10:05:27-04:00 Tobias Lütke Simple webchat for server (#1998)
acc111caf93fc6681450924df9f99679c384c59e 23c7c6fc9182b041f006b86ea1e7f99911ecf344 2023-07-04T15:38:04+03:00 Henri Vasserman Allow old Make to build server. (#2098)
1cf14ccef12e19c5a5b0b17ab456242d1f8c7fdd cc45a7feb8412e84ff292207621412fffc0d3d51 2023-07-04T00:05:23+03:00 Henri Vasserman fix server crashes (#2076)
d7d2e6a0f0c74f7a570dae384dfff371ac744d2a 46088f72318981341a2d646f12f6eee6aec06d65 2023-07-03T05:38:44+08:00 WangHaoranRobin server: add option to output probabilities for completion (#1962)
b1ca8f36a9cdbcee5f5c425df717611a1040a897 b8c8dda75fdf5fdea49c80af36818e7c30fe0ddf 2023-07-01T23:42:43+08:00 Qingyou Meng ggml : disable GGML_TASK_INIT and GGML_TASK_FINALIZE by default (#1995)
b853d456018b10820686362af41b2f2f75f1eec6 9225baef71407d799a6f7f563b77fd7f82791416 2023-06-26T13:57:59-04:00 zrm ggml : add NUMA support (#1556)
c2a08f87b8d180115d04b8688f383d1b2761b16d 66a2555ba6cab954c56d653b29c27bfbbacfbfb1 2023-06-25T08:48:36Z anon998 fix server sampling: top k sampler first (#1977)
527b6fba1d237befb324fd846bda7418c0fa394d d7b7484f74d486f77feb4c0b7af7e1718ed91651 2023-06-24T11:47:58+03:00 Didzis Gosko llama : make model stateless and context stateful (llama_state) (#1797)
20568fe60f00155fa25e92eb3a7f6b911d557967 18b35625c3c19c64b7818a12460ba5ddb006dfdc 2023-06-20T01:12:39+03:00 Henri Vasserman [Fix] Reenable server embedding endpoint (#1937)
fc45a81bc642b9ef33d9004f2b363d558438a6c9 794db3e7b982fee37e3995db9c3a216a57ff65e3 2023-06-17T17:13:05+05:00 Faez Shakil exposed modules so that they can be invoked by nix run github:ggerganov/llama.cpp#server etc (#1863)
794db3e7b982fee37e3995db9c3a216a57ff65e3 5ddf7ea1fb42bac21026de2f77e0f9c069b92234 2023-06-17T07:53:04-04:00 Randall Fitzgerald Server Example Refactor and Improvements (#1570)
9dda13e5e1f70bdfc25fbc0f0378f27c8b67e983 37e257c48e350cf03c353c10d31e777f8d00123d 2023-06-15T18:36:38+01:00 Srinivas Billa readme : server compile flag (#1874)
4bfcc855abdb2c9fcc3c5a84747974521909fa41 6b8312e7979b852f6b6ac9d29cd51fda16c17948 2023-06-15T20:29:48+03:00 Georgi Gerganov metal : parallel command buffer encoding (#1860)
e32089b2c20b1b87b22912f4a8b93fe01647d5b9 2347e45e7bdb09c9a7d74b2c0bc86c2b65f0c343 2023-06-13T21:04:40+02:00 xaedes train : improved training-from-scratch example (#1652)
17366df842e358768c0df7024484fffecfc7865b 44f906e8537fcec965e312d621c80556d6aa9bec 2023-06-06T21:33:23+02:00 Johannes Gäßler Multi GPU support, CUDA refactor, CUDA scratch buffer (#1703)
7552ac586380f202b75b18aa216ecfefbd438d94 5d1830b99dfd85bb6279adb4dd94aa444afd5b5e 2023-05-29T19:31:44+03:00 Georgi Gerganov ggml : sync cgraph import / export API
1b78ed20818b72306edc7208b9bfb69a1a0d3297 337aea11390221bc925e4acb1f603f1649af2735 2023-05-28T11:48:57-06:00 Kerfuffle Only show -ngl option when relevant + other doc/arg handling updates (#1625)
0df7d63e5ba0ab8856476e121a03b985d6f15c9d 97c9b77c4fc5e2283755c4418759cfc5fc73ad05 2023-05-27T11:04:14-06:00 Kerfuffle Include server in releases + other build system cleanups (#1610)
7e4ea5beff567f53be92f75f9089e6f11fa5dabd 7780e4f479dc5af106287c164b8e186cd9b6215c 2023-05-21T11:51:18-06:00 Steward Garcia examples : add server example with REST API (#1443)
affc76edfdefa7b326f526e463cc65ff13fcfb92 ea600071cb005267e9e8f2629c1e406dd5fde083 2023-05-20T14:19:28+02:00 Johannes Gäßler cuda : loading models directly into VRAM, norm calculation on GPU, broadcasting for ggml_mul (#1483)
ec2e10c4443209da56b431b24dd0845b60e757fb d2c59b8ba498ab01e65203dde6fe95236d20f6e7 2023-05-20T11:06:11+03:00 Georgi Gerganov llama : add llama_init_backend() API (close #1527)
7694b52b9a206b93d59139c3c7c9b55da0f5aa59 79e3efb0e97b65b6cc72cd9ee970fa8189ad79a4 2023-05-19T10:24:59-07:00 Jason McCartney main : make reverse prompt option act as a stop token in non-interactive mode (#1032)
5ea43392731040b454c293123839b90e159cbb99 ee9654138ab0ae5f138f4abddf56ca234ea3c352 2023-05-18T19:31:01+02:00 Erik Scholz make kv_f16 the default for api users (#1517)
f954edda935a70a14cf0cc45ecc7fe7d60cf3e4b f048af0230ad5381bb20b9e3c1467ec6fc7debdf 2023-05-13T14:56:40+02:00 xaedes ggml : implement backward pass for llama + small training-llama-from-scratch example (#1360)
dd7eff57d8491792010b1002b8de6a4b54912e5c 7fc50c051ae8a78e9643fdf172d12e20f2dd9b6c 2023-04-29T08:34:41+03:00 Ivan Stepanov llama : new sampling algorithms (#1126)
c4fe84fb0d28851a5c10e5a633f82ae2ba3b7fae 1d78fecdab4087028a38517e86ed129f077174d8 2023-04-24T07:40:02+03:00 Georgi Gerganov llama : refactor get / set state + remove redundant kv cache API (#1143)
b6e7f9b09e9c340ec97a2fae61c1eb8db861f2f9 50cb666b8a2e35a49b08c0f6bc81138c8f6f2ac1 2023-04-22T08:21:32+02:00 xaedes llama : add api for getting/setting the complete state: rng, logits, embedding and kv_cache (#1105)
a32f7acc9f54dba1c728cb1e596bd00bf3b4eb5f 43ffdefb7424f79a3d510c199e2ea86684b4f824 2023-04-14T15:37:11+02:00 Pavol Rusnak py : cleanup dependencies (#962)
95ea26f6e92d620a5437f576b80868aee7f808d6 82d146df9b43cf677e0dbce20b03cf864958a0cc 2023-04-13T14:46:23+02:00 SebastianApel benchmark : add tool for timing q4_0 matrix multiplication (#653)
f963b63afa0e057cfb9eba4d88407c6a0850a0d8 aaf3b23debc1fe1a06733c8c6468fb84233cc44f 2023-04-08T12:24:37-07:00 comex Rewrite loading code to try to satisfy everyone:
e986f94829bae0b9e66b326acbbba179931c84f1 c0bb1d3ce21005ab21d686626ba87261a6e3a660 2023-04-02T12:23:04+02:00 Christian Falch Added api for getting/setting the kv_cache (#685)
f4f5362edb01b05c383b23f36d7b3489c77061b5 863f65e2e32dc1e6d23c96a4811bf382d6b2a548 2023-03-24T15:23:09Z Gary Mulder Update README.md (#444)
56e659a0b271436e24813a801640d015e7b05328 40ea807a972ec7b5a426f034ebfa593b5e7a06ed 2023-03-22T17:09:38+01:00 Erik Scholz fix perplexity after c-api refactor (#390)
f5a77a629bd0f37ae1696747633ab42a5530ec15 da0e9fe90ccf6e73597eb19dd0cfc0a28363fb3b 2023-03-22T07:32:36+02:00 Georgi Gerganov Introduce C-style API (#370)
5cb63e2493c49bc2c3b9b355696e8dc26cdd0380 da5303c1ea68aa19db829c634f1e10d08d409680 2023-03-20T08:24:11Z Stephan Walter Add tqdm to Python requirements (#293)
7392f1cd2cef4dfed41f4db7c4160ab86c0dfcd9 ad5fd5b60cfdfbfb22b0f2bc9e9f6c9692768f8d 2023-03-19T12:38:44-06:00 Suaj Carrot Improved quantize script (#222)
Can't render this file because it contains an unexpected character in line 268 and column 129.
File diff suppressed because it is too large Load Diff
@@ -0,0 +1,419 @@
f86112d6758298241ab2fa84ad4f0f7b1ace35c6 d1bc743c10080fed1253686ce01749b42611ded4 2026-05-29T16:40:38+08:00 wangbomeng add dump_pos,fix pos_tensor of pre_by_embeds
f131bf1908b8c5dd1f49d7ae7f616506fc471666 33d96dae28e17208ef61a71dba40cda3c04f135a 2026-05-27T09:38:51+08:00 wangbomeng fix patch of qwen2.5vl,n_patch of minicpm = 64,fix n_ctx_slot,comment out M-ROPE
a43741244a646d3f8fa3ff01bb9b7d059223d0a5 b2003d6c90ef0fa26ab9e930ba3e22b355eb3d39 2026-05-15T14:39:53+08:00 wangbomeng run llama-passkey successfully, fix llama-bench, copy 3 times input to infer qwen2.5vl
3b14ed556c15529fe1f94b649f49db7156dfaf67 dde8b8228081769c8d8f1e0751d47fa7875f8423 2026-05-14T14:34:25+08:00 Yunzhe Jia - Removed references to CALRT from clip.h, mtmd-helper.cpp, mtmd-helper.h, mtmd.cpp, and mtmd.h. - Updated server.cpp to conditionally include CAL-LLM support. - Introduced option LLAMA_SERVER_USE_CAL_LLM in CMakeLists.txt to enable CAL-LLM integration. - Refactored server context to handle CAL-LLM requests and responses. - Updated image processing logic to remove CALRT-specific implementations. - Ensured compatibility with existing llama functionality while integrating new CAL-LLM features.
b2003d6c90ef0fa26ab9e930ba3e22b355eb3d39 7800c772d44a7415640ec1669a691232939927cf 2026-05-13T15:24:24+08:00 wangbomeng try passkey and embedding
7800c772d44a7415640ec1669a691232939927cf dde8b8228081769c8d8f1e0751d47fa7875f8423 2026-05-13T15:23:54+08:00 wangbomeng try passkey and embedding
dde8b8228081769c8d8f1e0751d47fa7875f8423 fabcc7dac4b34d83fe430980bb364b81087c7ee9 2026-05-12T10:46:08+08:00 wangbomeng clip:add minicpm patch;
5eb46fffbd2e260c540fb112314ad67bbb8f56b6 005112c51e00d998b457337ca3dad53fc46e2d0b 2026-04-24T16:24:51+08:00 wangbomeng clip: add image_to_patches; calrt: vision copy data from bf16 to fp32
005112c51e00d998b457337ca3dad53fc46e2d0b 509670642e8090a1713f5d73590b549be827aaef 2026-04-24T16:24:31+08:00 wangbomeng clip: add image_to_patches; calrt: vision copy data from bf16 to fp32
e24f775ee26ea5249d5ff6cd23b8a0a17fe1438d a206460e610aef995e36e50b33e8bd41fe477541 2026-04-15T10:01:09+08:00 wangbomeng calrt: add copy_data_to_ibuf for vision model
a206460e610aef995e36e50b33e8bd41fe477541 d8b2aaa00049978cebac15041f960d75b552f97b 2026-04-14T10:23:43+08:00 wangbomeng calrt: support mixture of prefill_by_ids and prefill_by_embeds
6dacdd2cf9574214ca272a86674e7bd7ba21c4f0 3e6ad64467771224f072e5bad90e270951ba4cdf 2026-03-23T14:42:28+08:00 wangbomeng calrt: add multimodal
3e6ad64467771224f072e5bad90e270951ba4cdf b37b7d9756feb3dac2db526eeab38b572a095d47 2026-03-23T14:36:41+08:00 wangbomeng calrt: add multimodal
d81d7b190ff5f21325167936496dfe5ab48b922e e492f5dc8cec17529f53ef2bbdf7b502107f8148 1f5accb8d0056e6099cd5b772b1cb787dd590a13 2025-11-04T14:43:32+08:00 Yunzhe Jia Merge branch 'master' into dev
070ff4d5356083d60b807bb34d36b31c3653a29e bf7b0c9725ed0c406c5debaea022ec7258430634 2025-11-03T11:11:18+01:00 Xuan-Son Nguyen mtmd: add --image-min/max-tokens (#16921)
bf7b0c9725ed0c406c5debaea022ec7258430634 fcfce040e816c542f374ad51461b3561d73c4bc9 2025-11-03T10:25:55+01:00 Xuan-Son Nguyen mtmd: pad mask for qwen2.5vl (#16954)
bcfa87622ae46be6345a8e3dfdbdc5ba5414042b a2054e3a8ff0da3978a4acc18c349ff58554d336 2025-11-03T00:41:08+01:00 Sascha Rogmann feat(webui): improve LaTeX rendering with currency detection (#16508)
6b9a52422bac0f50dd8f1f8386744fa3ce9783bf 2f966b8ed87514e74bb96592217226cb6a6974dd 2025-11-02T13:08:04-08:00 Zhiyong Wang model: add Janus Pro for image understanding (#16906)
2f966b8ed87514e74bb96592217226cb6a6974dd cd5e3b57541ecc52421130742f4d89acbcf77cd4 2025-11-02T22:21:48+02:00 Georgi Gerganov clip : use FA (#16837)
cf659bbb8ef9eb048e5153a27cf787fd83c05560 d8b860a219c2415faac8cc0e50b48b4aa11e3b64 2025-11-01T15:51:36+01:00 Xuan-Son Nguyen mtmd: refactor preprocessing + support max/min pixels (#16878)
d261223d24e97f2df50220e4a5b7f0adb69bba81 dcca0d3ab840ebe9b2ccd4719033d408eeb758d7 2025-10-30T23:19:14+08:00 JJJYmmm model: add support for qwen3vl series (#16780)
bacddc049a00786df44e682262f6e298742bfbc3 229bf686287d18f82c44e89888cc662145ecfdb4 2025-10-30T07:18:50-04:00 Tianyue-Zhao model: Add support for CogVLM model (#15002)
144a4ce824b6bd0e48d62009d10cae1daf5308db f549b0007dbdd683215820f7229ce180a12b191d 2025-10-29T14:09:50+01:00 Sigbjørn Skjæret vendor : sync minja (#16500)
1c1409e13169d0ced4b1b4d39fb5b268b7525091 7a0e900e3615fa46c074a7fdf900b47d3c0a1c7e 2025-10-28T03:51:41-07:00 Sam Malayek embedding: add raw option for --embd-output-format (#16541)
10640e31aab0819f31c1e1f2d008b019ee737232 80d28f104c0c3e61c11d6af073642b246a9fc19c 2025-10-27T21:50:22+01:00 Acly ggml : fix interpolate with align-corners and ne=1 (#16700)
06332e28672356b964d6dfc2ba4657e20581cd43 72d53e6c4decee8b339e49aed8cc0e234b9639dc 2025-10-20T16:27:09+08:00 takuya kodama llama-batch: fix build fails with `-Werror=missing-braces` (#16614)
7062dd8460685d6700ed7621e50a22c6f3400ca3 0398752dd450dfabdd1b9e289f6364c2600f6ab5 2025-10-20T15:44:21+08:00 takuya kodama llama-context: only warn on pooling_type when user specified (#16674)
0398752dd450dfabdd1b9e289f6364c2600f6ab5 4f73d0a95120687e2c527739f771330a5271259a 2025-10-19T23:54:31+02:00 Giuseppe Scrivano model : add Granite Hybrid types (#16635)
e38b7c6e9e4453e3b3e96d76e38bc2ccb6bce458 5016b7286240d29f8f640039989b84ea3a854344 2025-10-13T22:42:37+03:00 Georgi Gerganov graph : support cacheless embeddings with FA and iSWA (#16528)
4b2dae383df708e2afc49c4859a81cd074f5ac10 41aac5c69b5fb281bc1f486afb053f78101bb39e 2025-10-12T09:29:13+03:00 Georgi Gerganov common : update presets (#16504)
e60f01d941bc5b7fae62dd57fee4cec76ec0ea6e 81086cd6a3ca1252f0dc0f938171648399179c53 2025-10-10T22:15:05+03:00 Georgi Gerganov server : fix division by zero when reporting stats (#16501)
56b4795842d852152222ca7a2d4304008facf1b9 2c0d875ae6c6043fbbafd2831e160955e9ca6af1 2025-10-09T14:35:22+02:00 Daniel Bevenius model-conversion : add support for SentenceTransformers (#16387)
e08db4259521de493b7aeb49dadf29ebd1ee966a 12bbc3fa50b6df03318a4451c9a2210200a0b28d 2025-10-09T08:39:18+02:00 Saba Fallah model: EmbeddingGemma Adding Support for SentenceTransformers Dense Modules (#16367)
b2c08c9ec4cd59ed88c1ebdd94f109af5ccc978e 7fdd16b432d247121fe5fe7b21f8805f85266c85 2025-10-08T10:57:53+03:00 Georgi Gerganov metal : mark FA blocks (#16372)
74b8fc17f92ada295a648e3c5eb28f46bca7d892 aeaf8a36f06b5810f5ae4bbefe26edb33925cf5e 2025-10-07T13:48:56-07:00 Reese Levine ggml webgpu: profiling, CI updates, reworking of command submission (#16452)
ef4c5b87ea2556ff8ca99cca3abdf48bdbca22f2 c61ae20d05bd4fdd8551311325a2845336449426 2025-10-07T10:32:32+03:00 Georgi Gerganov presets : fix pooling param for embedding models (#16455)
1d6092fc72f4d10f4486ac95edfd414bc08b62b8 8ae32dc9ecd7aeebf3a5b43557e0552a0a04cd4f 2025-10-07T08:22:35+03:00 Georgi Gerganov tests : add -INF blocks to the KQ mask in the FA tests (#16380)
c08002a1988348403a5fd59b1fa3de3a10a6f92f 3a002afafa8e06555f11aed88b02d055d8a166f3 2025-10-06T10:59:40-06:00 Gabe Goodhart chat : Granite Docling stopping (#16438)
ca71fb9b368e3db96e028f80c4c9df6b6b370edd 35266573b968e1c947b367782fb4b3eddbb4f3c0 2025-10-05T06:57:47-06:00 Gabe Goodhart model : Granite docling + Idefics3 preprocessing (SmolVLM) (#16206)
e29acf74fea996014380d59d31aa504ae8964258 128d522c04286e019666bd6ee4d18e3fbf8772e2 2025-10-04T11:42:56+02:00 Acly vulkan : incremental shader builds (#16341)
ad126479c25cf983a0f994a08ba0911cf49ed62b 77233277c912d495d1069543ca540c21a2f9e5b4 2025-10-03T11:45:16+02:00 Daniel Bevenius ci : change macos-13 to macos-15-intel (#16401)
e74c92e84236b2bab3f3c77bee4ead94928be360 b2ba81dbe07b6dbea9c96b13346c66973dede32c 2025-09-30T16:24:36-04:00 Bartowski model : support GLM 4.6 (make a few NextN/MTP tensors not required) (#16359)
0124ac989f7e7bf08803788f66dbe4106bdcdd58 2811c65286ae954bec87049f75b86dc022006dcc 2025-09-28T19:25:58+08:00 Aaron Teo devops: switch to using ubuntu-22.04-s390x image (#16302)
72b24d96c6888c609d562779a23787304ae4609c 624207e676ab5eb3ce7af631902bb45fb73a8359 2025-09-27T02:58:29+05:30 Vinkal model : make minicpm embedding_scale, residual_scale and logit_scale optional with legacy defaults (#16273)
624207e676ab5eb3ce7af631902bb45fb73a8359 807e8c6d310952f2f5656afc63dab9d7083dcb5c 2025-09-27T02:03:33+08:00 Aaron Teo devops: add s390x & ppc64le CI (#15925)
00217cd41388328c93e9e9644921c4319bb03bcc 3b337b01a1a85c2f5b49376e8c0bbdb3f521528e 2025-09-26T13:19:23+03:00 Radoslav Gerganov ci : create git tags for released docker images (#16008)
aa3ee0eb0b80efca126cedf9bcb4fb5864b46ce3 d0991da39d3c39b3980c24cdfccb9a4c95a46870 2025-09-25T12:02:36+02:00 Daniel Bevenius model-conversion : add embedding prompt file support (#15871)
4b9f4cb0f89a88de4bdf97727d0457b0c648804c 85e72271ba1ce78adf34fd8997803c991e617ca6 2025-09-23T13:59:34+08:00 Aaron Teo devops: add s390x containers (#15915)
c6db9a10278f40b4b8d3f6931728f2cce2356daa d05affbab7d1364fa7ac06c03cd33f03235ae840 2025-09-22T10:49:58+02:00 GideonSerf embedding : fix typos in README (#16171)
3913f8730ec6d6245480affc30ae3049107956f4 76888d202ed2b835ae19ea9f9db6baf39e419297 2025-09-16T15:25:57+02:00 Daniel Bevenius ggml : fix padding in timestep embedding kernels (#15932)
dc381aa9a6dc45f00673471d34b8bddd30e77570 10d197409bd9537ff302ad09966fe406882fef9d 2025-09-15T14:38:52-07:00 Diego Devesa docker : enable rocWMMA in ROCm images, add gfx1151 (#15997)
b8e09f08b9a91c0401bc67d17a17c90756420346 6c019cb04e86e2dacfe62ce7666c64e9717dde1f 2025-09-14T23:00:59+02:00 Sigbjørn Skjæret model : add grok-2 support (#15539)
9de447d94e1ae9d1a36e5a2e5bf47483352c0d9c 0f0a3c2851134d49955f3c85afbb0b1bb47c3e07 2025-09-10T17:31:40+02:00 Daniel Bevenius ggml-cpu : fix padding in ggml_timestep_embedding (#15917)
e7b6d83b524bbc24a1343d862de6dba8e8eddbd6 2cfef4d117d67ab1dec002915b48a15d11ee1973 2025-09-10T14:17:09+02:00 Daniel Bevenius tests : filter out no-ops from coverage report (#15900)
70cd37dbbebdb7a2f84f08207f18eabb0b291a55 acc1b008cfd95e63d5f99a370dbffb98e5a99d2c 2025-09-09T06:06:52+02:00 Daniel Bevenius requirements : update transformers/torch for Embedding Gemma (#15828)
233d773d02c37982badddf3994e9953a175f34da a885dcff11a7b73f9377812d6151f6b15d307de0 2025-09-08T09:44:34+02:00 Daniel Bevenius convert : force setting sliding_window from original config (#15867)
5d6688de08e73acc2532d668380801ed79d704eb 4fd1242bef6cb2325b4ff1c1a80f3b54b64508a6 2025-09-05T04:36:23+02:00 Daniel Bevenius model-conversion : add --embeddings flag to modelcard.template [no ci] (#15801)
fb15d649ed14ab447eeab911e0c9d21e35fb243e 856ed0947f27b4ec3ad269fceda0402fbab263d3 2025-09-04T18:10:29+02:00 Daniel Bevenius llama : add support for EmbeddingGemma 300m (#15798)
d1e2adba65208d6de3d7f6f23b00c562ff5bb777 c1c354e44c06d259679bb5bb7a8fa9f0b28480e4 2025-09-04T15:40:44+02:00 Daniel Bevenius llama : set n_outputs to 1 to avoid 0 outputs mean-pooling (#15791)
661ae31c9c68201577e70278285b349a5a662caf 407c23786dd0d3a503e9429eead96e611d3950c9 2025-09-03T19:59:16+02:00 Oliver Simons CUDA: Optimize `rms_norm_f32` kernel and its fused variants, giving 1-6% perf E2E (#15715)
40a751ea9a94364da73537b86502a808ebe1fc3a 5eae9348835037046f33fafd852df7c952c95209 2025-09-03T12:50:47+02:00 Daniel Bevenius model-conversion : remove hardcoded /bin/bash shebangs [no ci] (#15765)
8c3fdf44ecf08335942f2ba558955f55e88c7991 f6da8cb86a28f0319b40d9d2a957a26a7d875f8c 2025-09-03T09:48:35+02:00 Daniel Bevenius model-conversion : add missing curl script [no ci] (#15761)
84ab83cc0b4b7e769451ee48e4c7d1acef91ef25 55042b3692cb1467c9ee15c62c4a9fbf180f89e3 2025-08-28T15:49:50+02:00 Sigbjørn Skjæret model : jina-embeddings-v3 support (#13693)
46d9caa27a0281150e8cf082308c0f9e7576ebe5 5a0e3ef6f00c658fbae53797f02d5a360ebf8fec 2025-08-28T09:26:48+02:00 Daniel Bevenius model-conversion : add mmproj conversion target (#15628)
62cef26ac5b6b7acb635d3dc963813b43952dc2b 8f5afa94c4f929da71f560db7c9f38ef6a783d95 2025-08-26T16:12:29+02:00 Daniel Bevenius model-conversion : add qat-q4 quantization targets (#15588)
79a546220c719e6a70627b243a478ab8d84dc9e1 85cc1ae998e4898d9fa992cb9b8620338cee97bf 2025-08-26T12:54:19+02:00 Xuan-Son Nguyen mtmd : support Kimi VL model (#15458)
c4e9239064a564de7b94ee2b401ae907235a8fca 39842a7f73012eb42816ca4f26411782bd3da7c5 2025-08-26T16:05:55+08:00 tc-mb model : support MiniCPM-V 4.5 (#15575)
dfd9b5f6c7586c88588f06a644c131bec071a0a1 5a6bc6b1a6cb665a944426c2055794950e524bf5 2025-08-25T15:00:43+02:00 Daniel Bevenius model-conversion : set pooling type to none in logits.cpp (#15564)
5a6bc6b1a6cb665a944426c2055794950e524bf5 6b64f74b55628e4193f4fb00313f07dbd8556528 2025-08-25T14:25:25+02:00 Daniel Bevenius model-conversion : add model card template for embeddings [no ci] (#15557)
330c3d2d21b55bca5517db7d2eea2ea8f131df4a e92734d51bcb82cc35f0a6b5a14928f0036b2c90 2025-08-23T01:31:54-05:00 Jeff Bolz vulkan: optimize mul_mat_id loading row ids into shared memory (#15427)
4afb0a746f22abaa545b3ebdb76a400d7da3a713 e288693669cf9d0a71e2f2b8bd57305f06340257 2025-08-22T08:10:14Z 65a server : Support multimodal completion and embeddings prompts in JSON format (#15108)
e288693669cf9d0a71e2f2b8bd57305f06340257 a0f98dd604d34826eb5ea2560d1e23fe726921df 2025-08-22T09:29:08+02:00 Tarek Dakhran readme : model : mtdm : lfm2 improvements (#15476)
2758fa10dab0556e6c3f130e664750fd6773dc7c b108e429043ee5c9fc8fa4957a0a52c3e490d5c9 2025-08-21T12:16:54+02:00 Daniel Bevenius examples : add model conversion tool/example (#15455)
b108e429043ee5c9fc8fa4957a0a52c3e490d5c9 245be739df942861ddc52331b095b40f18e2a3f1 2025-08-21T05:06:46-05:00 Michael Giba ci : fix -Werror=return-type in clip.cpp so ci/run.sh can run without issue (#15221)
f08c4c0d8d0cb6caaf8b7ad316039232b9fa059c 6d7f1117e3e3285d0c5c11b5ebb0439e27920082 2025-08-18T22:53:52+02:00 Xuan-Son Nguyen mtmd : clean up clip_n_output_tokens (#15391)
f44f7931729022c57319a0124931120a169e0da9 ae532eac2c1df1d8edc3d2719145895b966de1bf 2025-08-18T03:23:56-04:00 compilade ggml-quants : fix make_qp_quants NANs and IQ1 assertion errors (#15379)
65349f26f2299e06477ec8e85e46243046801358 1fe00296f587dfca0957e006d146f5875b61e43d 2025-08-16T23:33:54+02:00 Tarek Dakhran model : support vision LiquidAI LFM2-VL family (#15347)
cf9e5648a7ae02f7728fefcbcfd2979d83c96e8f fba5c0d680b555cbac563fef57b33bc5c9621e08 2025-08-11T22:12:12+08:00 rainred mtmd : Fix MinicpmV model converter and clip to avoid using hardcode. (#14750)
36d3f00e142696f708ab297b9f8f1c825594712d 5fd160bbd9d70b94b5b11b0001fd7f477005e4a0 2025-08-07T05:31:48+02:00 Daniel Bevenius requirements : fix PyTorch uint64 compatibility (#15134)
ef0144c087b33e5b8da42d529ac71aaf05cb49df 2721257e3e2c4c944ac8a08221113ee7cb503f1b 2025-08-05T04:29:25+10:00 Sam model: support GLM 4.5 family of models (#14939)
711d5e6fe66eb6cd7a10d71cec4567321848be08 f738989dcb9ccbe468c945553eafbeef7b869675 2025-08-02T05:51:02-05:00 Douglas Hanley convert : fix Qwen3-Embedding pre-tokenizer hash (#15030)
339bd0268c498c89529cd0e90c44883c211e3745 f906275537d14c8fc7c6976d944233771fd6672c 2025-08-02T03:44:50-05:00 Douglas Hanley model : support Qwen3-Embedding (#15023)
952a47f455fbd92e2659b98b9b6317a2dafeb532 36e5fe7bcd6640f4ff974d4c5cb04a13b5b29bce 2025-07-31T23:22:17+08:00 tc-mb mtmd : support MiniCPM-V 4.0 (#14983)
41e78c567e9a8c652e405f4f909deb598deecd31 ad4a700117d1746799d2d6599e526e2c3a7938d2 2025-07-30T18:07:11+02:00 Daniel Bevenius server : add support for `embd_normalize` parameter (#14964)
00131d6eaf4df029e1ec84de868c2c5957503007 1e15bfd42c3938506e0da5939bf7f42780965f01 2025-07-30T15:12:02+03:00 Georgi Gerganov tests : update for LLAMA_SET_ROWS=1 (#14961)
a118d80233d3bf92569c051346fd2638f87bf202 61550f8231dc0aa478e2f537c5009ede6878ce22 2025-07-30T00:25:05-05:00 Douglas Hanley embeddings: fix extraction of CLS pooling results (#14927)
749e0d27f0247337869f4698f59dd7fafba94326 64bf1c3744053cf7def10aeed21ff48883ee755b 2025-07-25T19:08:04+08:00 kiwi mtmd : fix 32-bit narrowing issue in export-lora and mtmd clip (#14503)
3f4fc97f1d745f1d5d3c853949503136d419e6de 2df255da3cea108de0ae9b302ffdd31674b6d88d 2025-07-25T03:05:37+08:00 R0CKSTAR musa: upgrade musa sdk to rc4.2.0 (#14498)
86f5623d904cfd392fdeb14a143097b4074660f6 39cffdf18855e0d2beba62572542251d87421e73 2025-07-24T17:50:51+08:00 yummy llama : fix MiniCPM inference after Granite Four changes (#14850)
c8ade30036139e32108fee53d8b7164dbfda4bee e28c0b80c249b5618c3a0d5e960f63929f380ac9 2025-07-22T12:51:03+02:00 stduhpf Mtmd: add a way to select device for vision encoder (#14236)
b526ad2668944a7b2b1721f60679153646313831 938b785764683c298e7805e712f8728489cc2f18 2025-07-20T23:55:32+07:00 rspOverflow Documentation: Further revisions to the Vulkan section in build.md (#14785)
21c021745d781edf9c44b4972ef6cbbf53b0ecff b0f0ecc3dce806c68609d375a2b3edc430d8db18 2025-07-16T08:18:51-07:00 Reese Levine ggml: Add initial WebGPU backend (#14521)
68e37a61a7b24863f67541db65b4f6195962a268 cbc68be51d88b1d5531643b926a4b359c3cff131 2025-07-16T01:11:42+09:00 Shunta Saito model : add PLaMo-2 support (#14560)
0c1df14b5f8d992805cb22d0b77b44092a18aeab b3ad3a0191994d6c47b2bd389d5c7431526ecd2c 2025-07-12T06:21:02-04:00 Douglas Hanley server : fix pooled embedding output (#14645)
0aedae00e6fb48680324a5ac5da9cba0e35de6b5 6bdda13981d6c8189b7dc4f9fb8ecb91c21529f8 2025-07-10T18:20:13-06:00 Gabe Goodhart model : Granite Four (#13550)
4a5686da22057867c23bd4a6be941ddc8c51e585 98bab638fb28cf95a5a66dd2d51b40d6c8f6d69a 2025-07-09T14:59:57-04:00 compilade llama : support Jamba hybrid Transformer-Mamba models (#7531)
8f22dc0a53338c629c1ef8fa878d8e39bfe627c9 53903ae6fa5f1caf187889c839cdd1ad25da4018 2025-07-08T10:24:06+02:00 Xuan-Son Nguyen model : add hunyuan moe (#14425)
e1a7059053a9b8958f2d57a21fc46dbc7fb24f8e 12f55c302b35cfe900b84c5fe67c262026af9c44 2025-07-07T23:35:35+02:00 Sigbjørn Skjæret llama : fix incorrect minicpm3 v_states shape (#14571)
1b2aaf28acd632b79bc3b07acb5dad877dc7dbb1 343b6e94b61674ac94e64ede7b7ea3365793f7ed 2025-07-01T15:44:11+02:00 Grzegorz Grasza Add Vulkan images to docker.md (#14472)
c839a2da1a0d4275c3a98f70c3a7627487573a46 e9b6350e61d592634263a14b3d77ecbf6c1fb096 2025-06-30T17:48:24+08:00 xiaobing318 cmake : Remove redundant include path in CMakeLists.txt (#14452)
8f52c6f8abb2ed9ad967cc0bfb90acb073011193 d2f325130c4ed77a3dcff2c23a926587fb08e2cc 2025-06-26T15:10:45+08:00 Yunzhe Jia Squashed commit of the following:
5d5c066de8a3d2cb32f04c4d5ad1560945f30bf3 40bfa04c95c19fb42bafd4e21b5c2a7771846801 2025-06-22T21:44:57+09:00 yuiseki mtmd : fix Pixtral OOM with large images by capping image_size to 1024 (#14326)
aa0ef5c578eef4c2adc7be1282f21bab5f3e8d26 bb16041caef45cd4348cd6f84906b5dfec7a1f6a 2025-06-21T18:12:05+02:00 Sigbjørn Skjæret gguf-py : fix Qwen3-Embedding eos token (#14314)
edc4a29effe716956fdfd2bc5b9cba2a6d8492f8 ed3290ab34493fd3d2e0f925f816a401da4f2dfd 2025-06-19T00:08:14-05:00 Gabe Goodhart memory : Hybrid recurrent cache (#13979)
89fea80d298184d1cd93564f48e060d9f541f4b4 6adc3c3ebc029af058ac950a8e2a825fdf18ecc6 2025-06-16T22:33:27+03:00 Georgi Gerganov server : fix incorrect usage of llama_get_embeddings() (#14225)
d3e64b9f490cee41b7b9aa275dae2f6568ae3054 3ba0d843c6bd3faea5cf5e53dc7f3c82be20bffb 2025-06-16T14:14:00+03:00 Georgi Gerganov llama : rework embeddings logic (#14208)
40643edb86eb10b471b0f57d4f3f7eb0e06a0df7 3cfbbdb44e08fd19429fed6cc85b982a91f0efd5 2025-06-13T17:32:56+01:00 Svetlozar Georgiev sycl: fix docker image (#14144)
26ff3685bfbaa4c8838d7afd988b17dd5eb99f92 60c666347becacff81cd4bc9a52038ba71038e41 2025-06-13T15:17:53+02:00 ddpasa docs : Update multimodal.md (#14122)
2c90da4c7ec694797f524042aaafbb047a7e65ff ec9e0301fef6476df83e94842c3b625501c95566 2025-05-30T16:31:48+08:00 zhangkaihuo llama : use llm_build_granite for minicpm (#13911)
c962ae3382a1e759c8517a229549ee53685313a1 a3938fb53d0b5183db4f5a6db21fd9122a0e4780 2025-05-28T22:33:54+08:00 Sky server: fix remove 'image_url'/'input_audio' json-object effectlly for 'llama_params' in multimodal-model-mode (#13853)
26b79b6cb3e7840ff15729350e95907e19f9f480 1e8659e65ad0f640674d2785d02b556ab938728c 2025-05-28T10:05:54+02:00 Xuan-Son Nguyen convert : fix tensor naming conflict for llama 4 vision (#13836)
bc583e3c63c04a11d287c108ea9e6a515ead0423 72b090da2c50e540143fd312a2f9aa5f151e6136 2025-05-27T14:06:10+02:00 Xuan-Son Nguyen mtmd : support Qwen 2.5 Omni (input audio+vision, no audio output) (#13784)
79c137f77677b3c8ee3c60a7da033721b938399a 22229314fc46b2f741bb21b12cde71f6c6a60b52 2025-05-26T14:03:54+03:00 Georgi Gerganov examples : allow extracting embeddings from decoder contexts (#13797)
40aaa8a403df5dcfb515eb2fd7a817fd99779526 a08c1d2845dc279d58d826ef3c3ecad97cbbcef7 2025-05-25T14:06:32+02:00 Xuan-Son Nguyen mtmd : add support for Qwen2-Audio and SeaLLM-Audio (#13760)
a08c1d2845dc279d58d826ef3c3ecad97cbbcef7 d785f9c1fd1a1929c6d0e2a0b12cae5db867908b 2025-05-25T14:04:49+02:00 ddpasa docs : add Moondream2 pre-quantized link (#13745)
4032ca406632212b075e3c61c2a4476128321410 515fdbf7ed839dfe6a24aeb6225936609a7f6d6d 2025-05-25T10:29:43+02:00 Piotr Jasiukajtis llama : add support for Qwen3 MoE tied word embeddings (#13768)
cc74d5be990e37f201591fd868a92e64abdbf902 5be24af73d77ea23d399726f1d2a01a70ee86331 2025-05-22T16:33:39+03:00 Georgi Gerganov server : pad small embedding batches (#13692)
92ecdcc06a4c405a415bcaa0cb772bc560aa23b1 f71f40a2847d4c9f57b86cd206e0a27b2bfb6d1c 2025-05-19T13:04:14+02:00 Xuan-Son Nguyen mtmd : add vision support for llama 4 (#13282)
3cc1f1f1d24472a6558c942b1c78989ff4b0e569 c753d7bed0dc2cc2d5c42dfa9806cba91748392e 2025-05-15T14:24:50+02:00 Xuan-Son Nguyen webui : handle PDF input (as text or image) + convert pasted long content to file (#13562)
d486dd3e8ecfba0170f8632a1530540de560f4a3 21ca987fba504d273ea28ebc4d3e5b3736a11c8e 2025-05-14T10:07:31+02:00 Luca Stefani webui: Allow pasting file from clipboard (#13526)
21ca987fba504d273ea28ebc4d3e5b3736a11c8e be1d4a13db26750fac702ceb3af88ae4f39dc9f4 2025-05-14T09:59:12+02:00 ddpasa docs: Update link to ggml-org in multimodal.md (#13513)
71bdbdb58757d508557e6d8b387f666cdfb25c5e f0995d28ce3d15095b6845d94ce4465e46575873 2025-05-13T17:07:21+02:00 Xuan-Son Nguyen clip : clip.h become private API (⚠️ breaking change) (#13510)
b4726345aca49e2ad62d615e6e370b3dbad6434f bf7937112058f2815fc3825a9ff7b536ecafa3bb 2025-05-13T15:33:58+02:00 Xuan-Son Nguyen mtmd : remove libllava, remove clip-quantize-cli (⚠️ breaking change) (#13460)
de4c07f93783a1a96456a44dc16b9db538ee1618 10d2af0eaa0aafd7c6577b279dfa5221ff44a63f 2025-05-12T15:06:51+02:00 Xuan-Son Nguyen clip : cap max image size 1024 for qwen vl model (#13478)
3eac209319a6726fd9687c6188fc6b916b65953d a634d75d1bb4034b8c945042ceea268b5b895730 2025-05-11T11:35:52+02:00 City mtmd : support InternVL 3 38B and 78B mmproj (#13443)
15e6125a397f6086c1dfdf7584acdb7c730313dc 3b24d26c22b9d92b5aa39930988700c84e524cf4 2025-05-10T19:57:54+02:00 Xuan-Son Nguyen mtmd : add hard limit on image resolution for qwen2vl / qwen2.5vl (#13434)
33eff4024084d1f0c8441b79f7208a52fad79858 17512a94d636c4b6c1332370acb3e5af3ca70918 2025-05-09T19:29:37+02:00 Xuan-Son Nguyen server : vision support via libmtmd (#12898)
d9c4accaff30926e8a5fd8a2429e549158a845e0 15e03282bb432631193464100c2237a3b6bcfe4c 2025-05-09T09:06:37+02:00 Xuan-Son Nguyen server : (webui) rename has_multimodal --> modalities (#13393)
f05a6d71a0f3dbf0730b56a1abbad41c0f42e63d ee01d71e585f4a17ae83ec55d77acfdcf0bfa798 2025-05-08T14:25:39-04:00 Matt Clayton mtmd : Expose helper_decode_image_chunk (#13366)
8c83449cb780c201839653812681c3a4cf17feed 1a844be132dbe865358e1de81136920c1d35ac73 2025-05-08T15:37:29+02:00 Xuan-Son Nguyen server : (webui) revamp the input area, plus many small UI improvements (#13365)
6562e5a4d6c58326dcd79002ea396d4141f1b18e 51fb96b1ff2e1cc98b2492a012b7d93531a6a9a8 2025-05-08T14:28:33+03:00 Georgi Gerganov context : allow cache-less context for embeddings (#13108)
814f795e063c257f33b921eab4073484238a151a d879433824ac3c16b3b5f00075895d0ee9688e34 2025-05-07T16:36:33+02:00 Diego Devesa docker : disable arm64 and intel images (#13356)
6c7fd67b647a76846d1691cd181011dff4549d02 141a908a59bbc68ceae3bf090b850e33322a2ca9 2025-05-07T15:23:11+08:00 piDack llama : support tie embedding for chatglm models (#13328)
32916a49072f01c43e20df374af5f8a1f70d6963 ffc727203af1061fdeb49efef30f76171722e403 2025-05-06T22:40:24+02:00 Xuan-Son Nguyen clip : refactor graph builder (#13321)
5215b91e9377ce23e4ccc92ec3156bf5c7f892a3 ae803bfc3d0fc2d0d3e1cce22ee103a30939e104 2025-05-05T12:54:44+02:00 Xuan-Son Nguyen clip : fix confused naming ffn_up and ffn_down (#13290)
27aa2595321c4d9cc4086a8e67bdea204b8309b0 9fdfcdaeddd1ef57c6d041b89cd8fb7048a0f028 2025-05-04T23:43:42+02:00 Xuan-Son Nguyen mtmd : add C public API (#13184)
36667c8edcded08063ed51c7d57e9e086bbfc903 3bf785f3efa89ed28294fbf73054558a2b034bfb 2025-05-03T20:07:54+02:00 Xuan-Son Nguyen clip : revert the change of BOI/EOI token for GLM-edge (⚠️ breaking change) (#13259)
2f567611c0234bbca0a4009762acb47b56866095 7d2123484e6ba8fcd90fff8c01661b9dbbefdc9d 2025-05-02T11:42:30-04:00 Jared Van Bortel llama-model : support Qwen2 embedding models and pooling_mode_lasttoken (#13245)
7d2123484e6ba8fcd90fff8c01661b9dbbefdc9d 074e42ab31de4c99aa7d9d2d239660f64b2380d6 2025-05-02T11:41:54-04:00 Jared Van Bortel convert : use correct context length for nomic-embed-text-v2 (#13216)
074e42ab31de4c99aa7d9d2d239660f64b2380d6 c642bc014c105728ce45015813351dc5a37f60a2 2025-05-02T17:17:15+02:00 Xuan-Son Nguyen convert : converting mmproj for Qwen2/2.5VL from convert_hf_to_gguf (#13209)
e84773ab604fe0d935d03741df003716398dc57b fab647e8842c5f80da7e8f2c625dab6a0e19e5d4 2025-05-02T14:20:27+06:00 Shakil Ahmed mtmd-cli : fix out_of_range when input image path is empty (#13244)
b6e4ff69b8abd509647b531bd5b4e86950204f66 e0f572c8466e70d35cbd70ee536ad8fc83b2acac 2025-05-01T21:32:21+02:00 Loïc Carrère clip : (minicpmv) Re-enable upscaling of images smaller than the CLIP image size (#13237)
b5769d92b4510c77691ad9e3f8b643c2ba202e53 8936784f7a1ec4f91637d04b77fdc90ec36ebac9 2025-04-29T15:47:55+02:00 Daniel Bevenius ggml : suppress Windows compiler warnings (whisper/3075)
8936784f7a1ec4f91637d04b77fdc90ec36ebac9 13c9a3319b65469e883c49dd1c478abedc410157 2025-05-01T17:05:42+02:00 Xuan-Son Nguyen mtmd : add **vision** support for Mistral Small 3.1 (#13231)
a70183eb0079fdf6ebeaed12966338a039461b5d 8d33d740c308fe0049515668aac0e561269afe9e 2025-05-01T03:09:41-04:00 Jared Van Bortel llama-model : fix the reported size class for nomic-embed-text-v2-moe (#13223)
3e168bede4d27b35656ab8026015b87659ecbec2 ceda28ef8e310a8dee60bf275077a3eedae8e36c 2025-04-30T16:56:24+02:00 Xuan-Son Nguyen convert : improve model arch handling (#13122)
07c2e2f76cce9a61c110b6995fbb90ccea2c3aaa 44cd8d91ff2c9e4a0f2e3151f8d6f04c928e2571 2025-04-30T13:06:15+02:00 Xuan-Son Nguyen convert : correct typo image_mean --> image_std (#13208)
00e3e5a194e88e604e7c91391b9e90332888fd72 e98b3692be4cd8fbbd9a56fbacc2f2bf0bf26a68 2025-04-29T11:47:04+02:00 Xuan-Son Nguyen mtmd : add qwen2vl and qwen2.5vl (#13141)
5f5e39e1ba5dbea814e41f2a15e035d749a520bc eaea3253244dc4bbe07f6cd81325847ccc6cf93e 2025-04-28T15:52:15-04:00 AT model : Nomic Embed Text V2 with Mixture-of-Experts (MoE) architecture (#12466)
eaea3253244dc4bbe07f6cd81325847ccc6cf93e 43ddab6eeeaab5a04fe5a364af0bafb0e4d35065 2025-04-28T21:23:19+02:00 Xuan-Son Nguyen clip : fix model size display (#13153)
5fa9e63be82225fb3249c76f39ddda3e5bdec0a3 a4c340f974f9b7ac0c1aae897aabaa54549a97e5 2025-04-28T12:18:59+02:00 Xuan-Son Nguyen clip : refactor set input for cgraph + fix qwen2.5vl input (#13136)
59e991c23cc44cb5fb657e7b9358cac21fb79828 ca2bb89eac2097ab4620448737e58af8452e444b 2025-04-27T18:43:37+08:00 LostRuins Concedo Fixes Qwen2.5VL segfault during inference with https://github.com/ggml-org/llama.cpp/pull/12402 as has_qwen2vl_merger migration was incomplete (#13133)
ca2bb89eac2097ab4620448737e58af8452e444b 2d451c80590b9ac250322769ac13d3b4870dbcf7 2025-04-27T16:10:34+08:00 HimariO clip : Add Qwen2.5VL support (#12402)
4753791e70acd4d4e02f2098f14a03df26c992bd 77d5e9a76a7b4a8a7c5bf9cf6ebef91860123cba 2025-04-26T22:39:47+02:00 Xuan-Son Nguyen clip : improve projector naming (#13118)
edb18b6e8f5ea6509ad43057f8bb98fc557dbc4e 514c45608f93f66106a712dee1abe062099ce790 2025-04-25T14:31:42+02:00 Xuan-Son Nguyen clip : fix pixtral on some GPU backends (#13097)
13be08daf992c89d5169518229b3740041c0f419 226251ed56b85190e18a1cca963c45b888f4953c 2025-04-24T22:17:04+02:00 Xuan-Son Nguyen clip : remove boi/eoi embeddings for GLM-edge model (#13081)
226251ed56b85190e18a1cca963c45b888f4953c 87616f0680947800ecba3e9f6bc6e101943bf8e6 2025-04-24T22:29:22+03:00 Georgi Gerganov embeddings : fix batch sizes (#13076)
56304069599f4dd9749d94b9bca2c2c65bb27c02 ecda2ec4b347031a9b8a89ee2efc664ce63f599c 2025-04-24T02:32:35+05:00 pl752 llama-mtmd-cli: Sigint rework in mtmd vision example (#13080)
ecda2ec4b347031a9b8a89ee2efc664ce63f599c eb1776b15a32d832f1266deeeab75b9d255c5849 2025-04-23T20:21:59+02:00 Xuan-Son Nguyen mtmd : Support Pixtral 12B (#13065)
84a9bf2fc2875205f0806fbbfbb66dc67204094c 2016f07bd106c73699ecbaace80f55db5ed95dac 2025-04-21T15:32:58+02:00 Xuan-Son Nguyen mtmd : merge llava, gemma3 and minicpmv CLI into single `llama-mtmd-cli` (#13012)
2016f07bd106c73699ecbaace80f55db5ed95dac 6602304814e679cc8c162bb760a034aceb4f8965 2025-04-20T23:29:36+02:00 Xuan-Son Nguyen convert : experimental support for `--mmproj` flag (#13023)
6602304814e679cc8c162bb760a034aceb4f8965 66168204be9559dc841f06f0025f3da01d9a8546 2025-04-20T03:15:41-07:00 Jeffrey Morgan llava: fix errors in clip.h on certain compilers (#13030)
37b9f0d29d7301dd0ec5dfae8f357ccee96325d7 6408210082cc0a61b992b487be7e2ff2efbb9e36 2025-04-19T09:15:45+02:00 Xuan-Son Nguyen clip : refactor, add `image_manipulation` and `llava_uhd` classes (#13011)
b9154ecff93ff54dc554411eb844a2a654be49f2 2db9ba1464f3de0aceb2b5289963e69fc369cb66 2025-04-18T10:04:51+02:00 Xuan-Son Nguyen mtmd : add methods to access `mtmd_image_tokens` (#12906)
510676475f885ec064ff147af9f20ee7a9b12a50 daa422881a0ec7944771bcc8ff8de34d11f5bd3b 2025-04-15T14:07:42+05:30 Akarshan Biswas SYCL: Add ROPE vision kernel (#12887)
daa422881a0ec7944771bcc8ff8de34d11f5bd3b eccc7a1602f0752507de4aaad1008b9618a282c8 2025-04-15T07:49:57+01:00 Juk Armstrong llama : DeepSeek V2/V3 MLA implementation (#12801)
e59ea539b83d2c7947c99bd350549364dbba450c c94085df2871d2cad11f6411304d7798d7dd4cdd 2025-04-12T01:29:03-04:00 Matt Clayton llava: Fix cpu-only clip image encoding sefault (#12907)
0c509239445088f21265580b86733c5b184261d9 fccf9cae83e6c6cd31a0ecb403d237638e427d0a 2025-04-11T12:09:39+02:00 Xuan-Son Nguyen clip : use smart pointer (⚠️ breaking change) (#12869)
12e9158f25cb47e97ca9b8083e1ec7415f262260 5b1f13cb64dbb0de7e95dae86725928d350c188c 2025-04-11T09:24:34+02:00 Daniel Bevenius xcf : add check for visionos build version (#12854)
b0091ecc1e5c0f689be856fade3803a534f35c9f 31f7803bc4e7c0dcc279ee04c2ecfb76b2afdd3e 2025-04-09T23:17:12Z Rudi Servo docker : added all CPU to GPU images (#12749)
d9a63b2f2e91cdcb0eda211b7f49fadcdea0f664 8ed71242f464dc0a3fb3cffcfe064e55bdec72f9 2025-04-09T17:22:30+08:00 R0CKSTAR musa: enable freediskspace for docker image build (#12839)
65a69e6e1b6d55cd5f78f8bcdfaba8a8c59a8d96 47277d6d1d0d515cff34292a1a78a0d1b7252350 2025-04-09T10:09:53+02:00 Xuan-Son Nguyen clip : do not print ftype (#12832)
b32efad2bc42460637c3a364c9554ea8217b3d7f a19b5cef16d885c44c635da4a5c97113c1577de8 2025-04-08T16:01:58-04:00 Matt Clayton llava: improve clip_ctx destructor to not memleak load_image_size (#12834)
a19b5cef16d885c44c635da4a5c97113c1577de8 78a1ba0a4f2bfed5b8b8e312592143d22e531698 2025-04-08T19:54:51+03:00 Georgi Gerganov llama : fix FA when KV cache is not used (i.e. embeddings) (#12825)
2dabf759e7c8c827d38cdd18d0792070e6a4f4e1 1d343b4069c74b2c7b19ae84260cd98aa2320a9a 2025-04-08T21:49:13+08:00 dm4 llava: add more helper functions to check projector types in clip context (#12824)
0364178ca2452bd241a4cdd4350d0d7a6ff8c4b4 c6ff5d2a8da2587cc78c9ede9171dfc3f076c757 2025-04-05T17:17:40+02:00 Xuan-Son Nguyen clip : refactor clip_init, add tests (#12757)
f52d59d771dc231fc2ac39adacf157ddefc97730 52de2e594979be52f0da92601747aa44a13e50e4 2025-03-31T11:07:07+02:00 Sigbjørn Skjæret llava : fix clip loading GGUFs with missing description (#12660)
5dec47dcd411fdf815a3708fd6194e2b13d19006 f125b8dccff34439a26bf750c9edef358c48c1f8 2025-03-27T08:08:08-07:00 lhez opencl: add multi and vision rope, `gelu_quick` and `im2col` (#12600)
02082f1519565fc7b49de211b28bc5404a69209b df4d20cd53d5bb6fc21c1dc65f026d53b566d097 2025-03-26T22:06:04+08:00 Ivy233 clip: Fix llama-llava-clip-quantize-cli quantization error under CUDA backend (#12566)
2b65ae30299b9c67e25c51ee567e9a2ef22279ab 48d7021c61ceda6fcf1a7294d2115b8e1a53ae95 2025-03-24T09:20:47-07:00 lhez opencl: simplify kernel embedding logic in cmakefile (#12503)
0fd8487b142b2b92565bc95b39ddc440955a237c 108e53c2f1b57b79c8bcf9773fba5a82e2f1eeb5 2025-03-19T10:15:23Z Guus Waals Fix visionOS build and add CI (#12415)
108e53c2f1b57b79c8bcf9773fba5a82e2f1eeb5 a686171ea71ed8cb8a324850d146cb65a001e141 2025-03-19T09:08:49+01:00 Sigbjørn Skjæret llama : add support for GPT2, Bloom and CodeShell tied word embeddings (#12456)
99aa304fb900654ec338749f64e62895b9a88afd 8551c44d840a7db50adb958ccaf464dc3ded82e7 2025-03-18T17:24:33+01:00 Xuan-Son Nguyen llama : add support for EXAONE tied word embeddings (#12451)
7841fc723e059d1fd9640e5c0ef19050fcc7c698 bf69cfe62f9ccc01112c0232a55820b95a8c1fda 2025-03-12T09:30:24+01:00 Xuan-Son Nguyen llama : Add Gemma 3 support (+ experimental vision capability) (#12343)
96e1280839561aaabb73851f94972a2cd37b2d96 2c9f833d17bb5b8ea89dec663b072b5420fc5438 2025-03-11T09:20:16+01:00 Xuan-Son Nguyen clip : bring back GPU support (#12322)
8352cdc87b207a735d34c431a36c425728cb4586 1e2f78a00450593e2dfa458796fcdd9987300dfc 2025-03-10T16:33:24+08:00 tc-mb llava : fix bug in minicpm-v code (#11513)
5e2d57b2b2e43eadbe6d66ba3e873a824b95e725 f1648e91cf6c52e9593810aa70857e412d474c09 2025-03-07T15:35:57+08:00 BB-fat metal : simplify kernel arguments using a struct (#3229) (#12194)
d6c95b0740510231b3797b80d6d3440d8fe188b6 d76a86d967ef491d530400b08bc8ef8a14807936 2025-03-07T06:23:16+01:00 Daniel Bevenius metal : fix default.metallib build (#12224)
e9b2f84f145fbd458dcb98f227bd09370918be6e e721c05c9336a72fbb59d5c75967360bc67036c6 2025-03-06T16:33:21+08:00 Aaron Teo llava: add big-endian conversion for image encoder (#12218)
16e4b22c5e58ee200ede913fd7b7b8ba92132ce8 074c4fd39df3af974e10fbee6cc6db5d9304655b 2025-03-05T17:16:01+02:00 Plamen Minev ggml : fix GGMLMetalClass ODR (#12200)
a057897ad4e48e3df0354256e0cc80dadcb57595 5bbe6a9fe9a8796a9389c85accec89dbc4d91e39 2025-03-05T06:30:31+01:00 Daniel Bevenius llama : add xcframework build script (#11996)
84d5f4bc195b9540fcb902d869015fba7ef6baa4 438a83926afcff3643ffef5543db67545ceffe39 2025-02-28T04:31:47-07:00 Alex Brooks Update granite vision docs for 3.2 model (#12105)
4d1051a40ffc2fdff80bc532eea5b9568b85c156 3e9a2860e996657fc10db8393cf65adc40703082 2025-02-25T02:46:05-07:00 Alex Brooks Add Doc for Converting Granite Vision -> GGUF (#12006)
7a2c913e66353362d7f28d612fd3c9d51a831eda 08d5986290cc42d2c52739e046642b8252f97e4b 2025-02-24T09:09:51-07:00 Alex Brooks llava : Add Granite Vision Support (#11794)
36c258ee921dbb5c96bdc57c0872e4a9a129bef6 f3e64859edb0d55d4223ead78672597cd1a218df 2025-02-22T22:28:28+08:00 Ting Lou llava: build clip image from pixels (#11999)
ee02ad02c56ff36a5edd22d8617ab3f9546ce7fe c392e5094deaf2d1a7c18683214f007fad3fe42b 2025-02-20T23:11:03-07:00 Alex Brooks clip : fix visual encoders with no CLS (#11982)
bf42a23d0a515a508aecf10fde1d52c5ed5104c6 c2ea16f260445d1f2bd9fee78fb8acb2b3aaaad4 2025-02-16T01:52:23-06:00 Jeff Bolz vulkan: support multi/vision rope, and noncontiguous rope (#11902)
b7552cfcbc7defccd8bdefd0a7b9c47d145ed3d7 225bbbfa39930cda38a2e5d1f3e5b38226732009 2025-02-07T09:15:22+01:00 Daniel Bevenius common : add default embeddings presets (#11677)
902368a06b915b860236cfc97ff885b2aceae256 c3db0480bb820e120249014b380e1f4badf2a1c1 2025-02-05T19:52:31-06:00 Charles Duffy metal : avoid breaking build when metal API predates TARGET_OS_VISION (#11690)
1ec208083cb896dd8772a2f962151fa3d4a74e36 9f4cc8f8d310b13ab3fc93a9be81b1d1376a7fa6 2025-02-05T14:45:40+07:00 SAMI llava: add quantization for the visual projector LLAVA, Qwen2VL (#11644)
0cec062a638700495673f5494d200b74340538be 53debe6f3c9cca87e9520a83ee8c14d88977afa4 2025-02-02T15:48:46+08:00 piDack llama : add support for GLM-Edge and GLM-Edge-V series models (#10573)
b636228c0ad0db95bf73008094c6145a05615cf6 325afb370a1a7b32b5fe46a749bc840c66db9765 2025-01-29T09:38:54+01:00 Daniel Bevenius embedding : enable --no-warmup option (#11475)
f643120bad8ab3a753daa64aaac8288ee5800e06 6e84b0ab8e10b8f6f99a32855f976ebcd35b0353 2025-01-28T11:42:32+01:00 Nuno docker: add perplexity and bench commands to full image (#11438)
466ea66f338d63109540dae1df97ccfdbf4cd08f 5f0db9522f347b095f84c3033d6c1c1895402e25 2025-01-25T07:26:01+08:00 jiahao su CANN: Add Ascend CANN build ci (#10217)
3e3357fd77bcf5bd8cfcc53ca53d4a5532e67e1b 6171c9d25820ccf676b243c172868819d882848f 2025-01-22T15:35:48+08:00 tc-mb llava : support Minicpm-omni (#11289)
8f70fc3d1b1d3c17b61842330dd106d391cc1227 1244cdcf14900dd199907b13f25d9c91a507f578 2025-01-13T13:38:20+01:00 Daniel Bevenius llama : remove 'd' from bad special token log (#11212)
2739a71e4b88474833b64aa974ca4515574fd3c4 ba8a1f9c5b675459c55a83e3f97f10df3a66c788 2025-01-11T05:50:33+01:00 Daniel Bevenius convert : sort print supported models [no ci] (#11179)
ff3fcabc727b2dd0c477d23a258217b27cc639fb c3f9d25706ac84297067aeaa662c1f1af42ed443 2025-01-10T11:30:53+01:00 Daniel Bevenius convert : add --print-supported-models option (#11172)
5e3b08d606b5b0caaea16541b504c3bba8f3ec1d db68c93b57bfdf6da1fbdae81080382d6998cbc9 2025-01-04T10:53:54+02:00 Georgi Gerganov ggml : do not install metal source when embed library (ggml/1054)
9ba399dfa7f115effc63d48e6860a94c9faa31b2 2cd43f4900ba0e34124fdcbf02a7f9df25a10a3d 2024-12-24T21:33:04+01:00 Reza Kakhki server : add support for "encoding_format": "base64" to the */embeddings endpoints (#10967)
0ca416c91aea4549d9c77e3efeca403e15aa6c75 21ae3b9be83820565d1a720999b7f63ce95b4920 2024-12-20T14:12:06+01:00 Xuan Son Nguyen server : (UI) fix copy to clipboard function (#10916)
d408bb9268a988c5a60a5746d3a6430386e7604d 5cab3e4aaa892df4620b720f20a503a1bbbe7a52 2024-12-19T18:47:15+02:00 Georgi Gerganov clip : disable GPU support (#10896)
2fffc52b50992ac5bc64db19d33c39cbc06f52cf 7585edbdebd02861e0994dae67c9338731fb3fc5 2024-12-19T06:04:51-07:00 Sukriti Sharma llama : fix Roberta embeddings (#10856)
0bf2d10c5514ff61b99897a4a5054f846e384e1e 7bbb5acf125d1d2840cac7d31b9aaa72210dd5ec 2024-12-18T19:27:21+02:00 Georgi Gerganov tts : add OuteTTS support (#10784)
152610eda91217ac409342cd976d05f5114ad39f 0e70ba686e6c717a0aa41d88284e2a392c2bd0cd 2024-12-18T13:01:41+02:00 Georgi Gerganov server : output embeddings for all tokens when pooling = none (#10861)
46828872c31b25df16169cbbf5c2225fa9cb0675 6b064c92b4c0228e333193c167f2c98d2ec8d9bc 2024-12-18T09:55:09+01:00 Xuan Son Nguyen server : (embeddings) using same format for "input" and "content" (#10872)
8dd19a48129d578972ea3d98896edbbf492891a9 130d0c90bd26b25e3a713b17a61a5d4eb0a66405 2024-12-16T19:34:38+09:00 gn64 vulkan : fix soft_max.comp division by zero (whisper/2633)
05c3a444b8b017b01b366b725ba22c740aae6b38 382bc7f2e8ffd0b89f23e840d097e21f301197ba 2024-12-17T16:00:24Z krystiancha server : fill usage info in embeddings and rerank responses (#10852)
ba1cb19cdd0d92e012e0f6e009e0620f854b6afd 56eea0781cbd2608ed8ff524955495569b9264be 2024-12-14T20:43:46+08:00 HimariO llama : add Qwen2VL support + multimodal RoPE (#10361)
a76c56fa1a3d27467eb97468d8c3b2fe1243b61a c27ac678dd393af0da9b8acf10266e760c8a0912 2024-12-13T12:23:52-08:00 lhez Introducing experimental OpenCL backend with support for Qualcomm Adreno GPUs (#10693)
11e07fd63bac1cb642380a7a3eac03fd8703e948 4601a8bb6784d2ab8b4b605354b51979fbeea1d3 2024-12-13T18:23:50+01:00 Corentin REGAL fix: graceful shutdown for Docker images (#10815)
784a14aa496a66cc43e76014a1bf4333b4a2a55a c5ede3849fc021174862f9c0bf8273808d8f0d39 2024-12-07T00:02:14-07:00 Sukriti Sharma convert : add support for Roberta embeddings (#10695)
8d0cfd554a9ae545ff94d27e04458f537b4e8c0e 2759916d86b70e7aceaed4d0b4e7ed126f0f9e51 2024-12-04T17:42:50+08:00 JFLFY2255 llama: Support MiniCPM-1B (with & w/o longrope) (#10559)
01e6d9bb71eb71fe1f811f2fdef15753232cd0f2 cc98896db858df7aa40d0e16a505883ef196a482 2024-12-04T08:26:37+08:00 piDack clip : add sycl support (#10574)
7db3846a94ce7683b3e8120abe427457edf840c9 c6807b3f28cc3dbfda3ec390bcb87e69fb5634e2 2024-11-26T13:05:20+01:00 Diego Devesa ci : publish the docker images created during scheduled runs (#10515)
50d5cecbda3b0d03344eed326287adc1f6c7f3ef 9fd8c2687f5aa2f095ac6e12a376e1c0583888e8 2024-11-25T22:05:39+01:00 Diego Devesa ci : build docker images only once daily (#10503)
9336db462c0c34bbe2055413fe4e16442626c38b 96fa2c5e2d6cb5319f34c3a7fb0cec05694b22f1 2024-11-24T02:02:34-07:00 Gabe Goodhart convert : XLMRoberta Type Vocab Size (#10458)
57f8355b29a8c7dfcd1fb6094758ad85644f8535 9901068ac78838745e604fffb4601d315a610456 2024-11-15T12:10:45+01:00 Romain Biessy sycl: Update Intel docker images to use DPC++ 2025.0 (#10305)
5b359bb1e3585de45bec79fd6c18934897662cdf e89213492d3e01705739789733f0f2d250b4c449 2024-11-09T15:35:46+08:00 SXX ggml: fix zero division in dne calculation in CUDA COUNT_EQUAL operator when ne is small (#10213)
d05b3127bd30515955aa4ee2bacdb68ebafe88f4 76c6e7f10551960e4ec9e14e0535b72081f1c7ad 2024-11-08T17:34:06+08:00 Jhen-Jie Hong swift : exclude ggml-metal-embed.metal (#10211)
a71d81cf8c1afb26b166f897c94ee1581f9fac7d eec4d71737b32f312e0082b671629a0368e1a20d 2024-11-07T17:31:10-04:00 Xuan Son Nguyen server : revamp chat UI with vuejs and daisyui (#10175)
8f275a7c4593aa34147595a90282cf950a853690 8d8ff715367480b856ad86ac3888e9742b13a6fa 2024-10-29T17:52:56+09:00 Changyeon Kim ggml: Add POOL2D OP for GPU acceleration to the Vulkan backend in the MobileVLM model. (#9763)
674804a99617b4f90292b4080ecab450ea3d30ba e94a138d644a9b34da61805f7aeb8af595c61b53 2024-10-22T09:40:02+02:00 Daniel Bevenius arg : fix typo in embeddings argument help [no ci] (#9994)
cf8e0a3bb9c0e93e371773b282054cdbbb231038 c7499c557cc1efafaf0a6bc12963c39826299703 2024-10-11T02:10:37+08:00 R0CKSTAR musa: add docker image support (#9685)
1927378bcce20ba72b6c89d5977b854a4bcaeb5d 6f1d9d71f4c568778a7637ff6582e6f6ba5fb9d3 2024-10-01T02:31:36-04:00 compilade convert : refactor rope_freqs generation (#9396)
f4d2b8846a6b34419ff9e9491aee6cd95e444bfc 1b2f992cd2cff0b69e5abe78bb8888d51ed19d67 2024-09-28T17:42:03+03:00 Georgi Gerganov llama : add reranking support (#9510)
9a913110cf471a8287ac06c43cbe307d3cf6df99 43bcdd9703ec19af7d2a519640b5ed6f4aac3d53 2024-09-28T12:08:43Z nopperl llama : add support for Chameleon (#8543)
0b3bf966f47bf2ba88e5d4e3ed429602008c7e63 f0c7b5edf82aa200656fd88c11ae3a805d7130bf 2024-09-23T22:23:54+02:00 Xuan Son Nguyen server : add --no-context-shift option (#9607)
acb2c32c336ce60d765bb189563cc216e57e9fc2 a6a3a5c531c73aef85750a847d21e7d4671e723d 2024-09-16T13:07:13+02:00 Daniel Bevenius llama : rename n_embed to n_embd in rwkv6_time_mix (#9504)
95ca85168b5b089b80a811b59528ce0a2f1bd1dd 441b72b91f818fe69497e5816f87969e90c73c43 2024-09-16T14:45:20+08:00 CarryFun llama : support MiniCPM3 (#9322)
1b28061400eb9832603c9f1dfbec4d339a8490a2 8db003a19d7055b5bd248ce2afff9324e5b8da95 2024-09-11T17:52:13+02:00 slaren llama : skip token bounds check when evaluating embeddings (#9437)
0996c5597f680effacc046832bb807c14900e22d 5bb2c5dbd26b246d334f0087b3cbd800f2e65c54 2024-09-11T12:59:13+02:00 Xuan Son Nguyen llava : correct args for minicpmv-cli (#9429)
6c89eb0b4749184f4d19e96ada5dcb8847129b9c 9b2c24c0993487d3b34a873980e292da571481f3 2024-09-07T09:48:54+02:00 slaren ci : disable rocm image creation (#9340)
9bc6db28d011d47a5f318dc4aebbe7927fac4629 32b2ec88bc44b086f3807c739daf28a1613abde1 2024-09-05T21:48:47-04:00 compilade ggml-quants : ternary packing for TriLMs and BitNet b1.58 (#8151)
048de848ee4baad4531fcd6239438f5d55be365c f771d064a95d212ddadea452ad0cc1e42b2c3db3 2024-09-02T18:11:13+02:00 slaren docker : fix missing binaries in full-cuda image (#9278)
6e7d133a5f9409dd257fad90d7f320721b07a1b2 b60074f1c26d8354053a952844ef3f7ebefd8803 2024-09-02T17:11:51+02:00 Xuan Son Nguyen server : refactor multitask handling (#9274)
8f1d81a0b6f50b9bad72db0b6fcd299ad9ecd48c a47667cff41f5a198eb791974e0afcc1cddd3229 2024-09-01T22:38:17+08:00 Molly Sophia llama : support RWKV v6 models (#8980)
7ea8d80d53364f2cdcd7bbc0f031106f529b1fe3 42c76d1358021ccdbe8ba89109c143dd7ae166df 2024-08-30T13:21:57+08:00 tc-mb llava : the function "clip" should be int (#9237)
9fe94ccac92693d4ae1bc283ff0574e8b3f4e765 66b039a5011522b6a61495eea2a9862601e169f7 2024-08-28T17:28:00+02:00 slaren docker : build images only once (#9225)
66b039a5011522b6a61495eea2a9862601e169f7 20f1789dfb4e535d64ba2f523c64929e7891f428 2024-08-28T13:20:36+02:00 slaren docker : update CUDA images (#9213)
3246fe84d78c8ccccd4291132809236ef477e9ea 78eb487bb0038eae95506d3d832b94c979185b09 2024-08-27T20:33:08+08:00 Xie Yanbo Fix minicpm example directory (#9111)
ad76569f8e78ab6ca921bda25cef25a157361719 7d787ed96c32be18603c158ab0276992cf0dc346 2024-08-26T22:58:50-07:00 arch-btw common : Update stb_image.h to latest version (#9161)
a1631e53f6763e17da522ba219b030d8932900bd fc54ef0d1c138133a01933296d50a36a1ab64735 2024-08-21T17:58:11-04:00 compilade llama : simplify Mamba with advanced batch splits (#8526)
f63f603c879c2232eaeded8c0aeba4244471d720 8455340b874aa90d5f70104c99ed2778d9e31c36 2024-08-21T09:45:49+02:00 fairydreaming llava : zero-initialize clip_ctx structure fields with aggregate initialization 908)
2f3c1466ff46a2413b0e363a5005c46538186ee6 50addec9a532a6518146ab837a85504850627316 2024-08-21T04:00:00+09:00 Changyeon Kim llava: Add ACC OP for GPU acceleration to the Vulkan backend in the LLAVA CLIP model. (#8984)
d565bb2fd5a2a58b9924a7a34e77a87c78c52137 ee2984bdaf10c14d440ad873a049bcc09b786d9b 2024-08-16T21:34:41+08:00 tc-mb llava : support MiniCPM-V-2.6 (#8967)
7c3f55c10051c634546247387c5c359c9d499360 911b437f228e75aa3d235acec21bfddd23ecce2f 2024-08-10T11:43:26+02:00 fairydreaming Add support for encoder-only T5 models (#8900)
3071c0a5f218f107dabd13b73f6090af683ef5ec 4305b57c80eff4f0df5f6acb60b292f03b8f0dd0 2024-08-09T18:33:53+08:00 tc-mb llava : support MiniCPM-V-2.5 (#7599)
5b2c04f4925e152c362b824f4b41eb2a081fa623 6f6496bb0999d1bce5daff0cfc55ceb0dd13c888 2024-08-09T08:33:30+02:00 Daniel Bevenius embedding : add --pooling option to README.md [no ci] (#8934)
daef3ab233fc02e4c53afd9b07366379876f00d1 345a686d8271a24db20d31789c0d4b9ed51dcb0c 2024-08-09T08:32:02+02:00 Mathieu Geli server : add one level list nesting for embeddings (#8936)
15fa07a5c564d3ed7e7eb64b73272cedb27e73ec be55695eff44784a141a863f273661a6bce63dfc 2024-08-07T18:24:05+02:00 slaren make : use C compiler to build metal embed object (#8899)
cdd1889de62a7140c8c016405ec917464bde8bd3 c21a896405de4cdf4207eb8130555ceaac0ab110 2024-08-06T02:20:54-05:00 Douglas Hanley convert : add support for XLMRoberta embedding models (#8658)
a3738b2fa7c60ef2c4592435d1aa7fb8f1f69c3e 655858ace0cf2720e56eb01f84ad05e0c94ada3c 2024-08-04T17:28:08+02:00 0cc4m vulkan : implement Stable Diffusion operators (ggml/904)
afbbcf3c04e3c6420cad3d72571478cd62ac176c ed9d2854c9de4ae1f448334294e61167b04bec2a 2024-07-31T18:59:09-05:00 Igor Okulist server : update llama-server embedding flag documentation (#8779)
c887d8b01726b11ea03dbcaa9d44fa74422d0076 75af08c475e285888f66556d0f459c533b7deb95 2024-07-30T14:56:51+08:00 zhentaoyu [SYCL] Add `TIMESTEP_EMBEDDING` OP (#8707)
4c676c85e59ef8f771f3a129e6eb217552139231 e54c35e4fb5777c76316a50671640e6e144c9538 2024-07-28T00:42:05-04:00 compilade llama : refactor session file management (#8699)
c3ebcfa148e867a68e78fd5c4f0c23e8f84c788b 8a4441ea1a2564578134404f31158c318e9c0bf3 2024-07-12T03:14:12-05:00 Douglas Hanley server : ensure batches are either all embed or all completion (#8420)
d12f781074b92589a72a36ffabb583933f7b9dc0 bcefa03bc01a41aace2e200ee8e77827d6d39b4f 2024-07-05T02:05:56-05:00 Douglas Hanley llama : streamline embeddings from "non-embedding" models (#8087)
d7fd29fff16456ce9c3a23fd2d09a66256b05aff 6f63d646c1a06a6e09f721009a2676864ae04e31 2024-07-05T05:14:21+12:00 Icecream95 llama : add OpenELM support (#7359)
807b0c49ff7071094f97ebc3a0a8e2b9e274f503 f8c4c0738d72d2162736edd72dd5db8b269adca1 2024-07-04T15:46:11+02:00 fairydreaming Inference support for T5 and FLAN-T5 model families (#5763)
26a39bbd6b0bbd66118bb68569f0276d7fe7df6c 38373cfbab5397cc2ab5c3694a3dee12a9e58f45 2024-06-28T15:11:44+02:00 Xuan Son Nguyen Add MiniCPM, Deepseek V2 chat template + clean up `llama_chat_apply_template_internal` (#8172)
9b31a40c6ddabe552875b811d7127aa039ca9703 c70d117c37cc7876e775d1e2722208a50c52edb3 2024-06-27T01:50:09+02:00 Daniel Bevenius clip : suppress unused variable warnings (#8105)
ae5d0f4b899ff2842bfca561370c945ad8d4368b 31ec3993f6e050322a249c07af79dbde66ea6ddc 2024-06-26T21:59:28+02:00 slaren ci : publish new docker images only when the files change (#8142)
3791ad219323389106dc3fd80814eb5bbb7b80de f702a90e245499283d6de0b287701c723cda2a87 2024-06-25T16:57:35+05:30 HanishKVC SimpleChat v3.1: Boolean chat request options in Settings UI, cache_prompt (#7950)
8cb508d0d5c024e12692370d85237b45469a004b 646ef4a9cfb6f40236d3b9ef07ac03700b6efcc7 2024-06-24T07:36:11+02:00 slaren disable publishing the full-rocm docker image (#8083)
646ef4a9cfb6f40236d3b9ef07ac03700b6efcc7 de0d6a68ac99f307fe889c48e21124bc3b7ca29a 2024-06-24T13:30:24+08:00 Yann Follet embedding : more cli arguments (#7458)
11318d9aa1f668aa10407a5cb9614371af32f3ce b6b9a8e606da7764bd3649c2ea574979c85abd43 2024-06-23T15:39:45+02:00 Daniel Bevenius Fix typo in llama_set_embeddings comment (#8077)
80ea089d771f0c2d97afa8bead80ded412f600d7 0e64591e8290037db6412665a56354b789a0597e 2024-06-21T00:38:22-05:00 Douglas Hanley llama : allow pooled embeddings on any model (#7477)
0c7b3595b9e5ad2355818e259f06b0dc3f0065b3 7b2f4a7d193ef2475259bbe7656fcccfab4b1217 2024-06-15T18:53:40+02:00 Xuan Son Nguyen Add `cvector-generator` example (#7514)
c2ce6c47e4f2d891bf29d8810832a3b310a8f205 b61eb9644d64e90123ac805436d95b94b3b4cc3f 2024-06-11T07:59:20+02:00 slaren fix CUDA CI by using a windows-2019 image (#7861)
a5cabd76491f07494c5b8267f921c73f5e2bbfb4 d5c938cd7716b9a2ace49a43a469dfbffcff4d28 2024-06-07T15:09:45+08:00 woodx server : do not get prompt in infill mode (#7286)
2d08b7fbb483c14bd2b173d4cd51ea3a4f862e8f d67caea0d6e6c303d31b01d0a010973e6c908dff 2024-06-06T07:19:49+02:00 slaren docker : build only main and server in their images (#7782)
6f28a333c1e3fdfdc7b4f9d0367f2b41a9b7e9d4 549279d8049d78620a2b081e26edb654f83c3bbd 2024-06-03T15:49:30+08:00 zhangkaihuo llama : MiniCPM support tied embeddings (#7664)
74b239b3d5f067470d7ef5e26e2e059720572e32 852aafb163d32d5bad63c10bc323a02c28fec59d 2024-05-28T11:48:16+09:00 Ikko Eltociear Ashimine llava : update clip.h (#7580)
152da28ae54139e3754189b9e6e1c28e11277502 d48c88cbd563b6cf0ce972e2f56796896e240736 2024-05-23T17:40:43+10:00 Brian labeler.yml: add embedding label detector [no ci] (#7482)
65c58207ece92ad213f4bfd0f91dcb2dfb664f5b 1cc0155d04918cb3017afa472acea51b77483c4a 2024-05-20T15:19:21+08:00 junchao-loongson ggml : add loongarch lsx and lasx support (#6454)
e932094d58f513d5996c3efc9f6fed8238894c57 2789baf480ba7dc9281b65f601f0918e58920f54 2024-05-20T08:56:05+03:00 Georgi Gerganov server : return error on too large embedding input (#7389)
33c8d50accd6dca73c9c4af00a05e24209c160fe d359f30921a9f62a0fd299c412ff3f270286fea6 2024-05-19T19:18:39-07:00 Srihari-mcw Add provisions for windows support for BF16 code including CMake provision for enabling AVX512_BF16 (#7258)
f030ec1f7a72aa825b2104823946551b9ec5dfc1 e4e6f67be6a8a697f5f89a28c98934e53c99c359 2024-05-19T17:19:53+02:00 0cc4m Vulkan Embedding Fix (#7360)
ea3b0590ee33d3573eb8ef76f88cc60f36d2a38d 29499bb59383c2a8c5d557a90abb08b696cef7f6 2024-05-15T20:01:12+08:00 dm4 embedding : free the batch after execution (#7297)
27f65d6267cf22a44c5ccefa7765d53a05bd1259 ee52225067622babc277371511b8124884e1c797 2024-05-14T14:20:47+09:00 Ryuei docs: Fix typo and update description for --embeddings flag (#7026)
b83cc3f5b303ff30c52874b2d5864dc6385ebf9f 9cb317f77e53067f7a138cc89ef7657148eae8e6 2024-05-11T09:46:09+02:00 Joan Fontanals llama : add Jina Embeddings architecture (#6826)
f89fe2732c5709f6e86d5f4aee2e6d2a561f2eb2 d11afd665241c1b3910ab5f040d0216403019d87 2024-05-10T15:51:58+05:30 HanishKVC Main+: optionally allow special tokens from user in interactive mode (#7097)
d11afd665241c1b3910ab5f040d0216403019d87 8c570c9496212073079476651c7517c02581101f 2024-05-10T02:41:10-04:00 Andrei llava : fix moondream support (#7163)
47345248827f426038098d016ed11975021b4919 07cd41d0965829463eff73eda3348aedbfd3a444 2024-05-09T17:34:37+08:00 Albert Jin opencl : alignment size converted from bits to bytes (#7090)
9da243b36ac0b9d609adfaaa4c8f1cc8c592f737 bd1871fa2b1bf8a081b43ba9bc85f8ffd46fac46 2024-05-08T22:14:39+03:00 Georgi Gerganov Revert "llava : add support for moondream vision language model (#6899)"
ffe666572f98a686b17a2cd1dbf4c0a982e5ac0a 24affa7db3c9db148854b0ab4fd63de8bca7d898 2024-04-29T07:34:24-07:00 cpumaxx llava-cli : multiple images (#6969)
3055a4180557c6cbe29eacc8284c9e070ac10eab 577277ffd203b190c3dc2ab3e737946dc432132c 2024-04-29T09:34:41-04:00 Christian Zhou-Zheng convert : fix conversion of some BERT embedding models (#6937)
46e12c4692a37bdd31a0432fc5153d7d22bc7f72 dba497e0c1eff27cf0e85d1d73c86fa08e1b5557 2024-04-25T12:38:31-07:00 vik llava : add support for moondream vision language model (#6899)
4ab99d8d4762869506bb675b36501fd7c2af00b2 54770413c484660d021dd51b5dbacab7880b8827 2024-04-25T14:38:14+02:00 Daniel Bevenius clip : rename lerp function to avoid conflict (#6894)
8cc91dc63c0df397d644a581b2cbeea74eb51ae0 dbceec87c0221ec952e69448df6a71f1372a7487 2024-04-16T14:55:30-04:00 Justine Tunney ggml : add llamafile sgemm (#6414)
67fac4b95fcccfda8ab965e9ba4992a9ddf3a25f 29122d32ac8075ad27b7a8be05dcad2b7e7a5f9e 2024-04-10T08:58:48+02:00 Pierrick Hymbert docs : how to add a model (#6565)
1b67731e184e27a465b8c5476061294a4af668ea c4a3a4ff47d62d2503ddf9bd91b58c21f04fe3c3 2024-04-09T13:44:08-04:00 Jared Van Bortel BERT tokenizer fixes (#6498)
5dc9dd7152dedc6046b646855585bd070c91e8c8 e11a8999b5690f810c2c99c14347f0834e68c524 2024-04-09T09:16:13+01:00 Carolinabanana llama : add Command R Plus support (#6491)
e3c337d87ca650972105a51c6ce302dd236c07ad beea6e1b16e783a0886e78dec01002a8c00db24d 2024-04-08T06:02:30-07:00 Rick G llama : support negative ith in llama_get_ API (#6519)
22a462cc1f69873f7d4c6d0201bd93478afa2ecb f6a0f5c6422200764b7929064c39dcf4bb0e9cd6 2024-03-26T16:22:07Z Someone Serge nix: package: don't introduce the dependency on python
a016026a3ac16d8c9b993a3573f19b9556d67de4 53c7ec53d5eca26b2c0c648605543a5fa6c12817 2024-03-27T20:26:49+01:00 Pierrick Hymbert server: continuous performance monitoring and PR comment (#6283)
1e13987fba5a536965ef942f2c86549d62cef50b e82f9e2b833d88cd2b30123ef57346c2cb8abd99 2024-03-27T12:15:44+01:00 howlger embedding : show full embedding for single prompt (#6342)
557410b8f06380560155ac7fcb8316d71ddc9837 55c1b2a3bbd470e9e2a3a0618b92cf64a885f806 2024-03-26T10:46:41-04:00 compilade llama : greatly reduce output buffer memory usage (#6122)
deb7240100da99555b9ab9dc635021e591fceaf5 3d032ece8e6973441273601ca2981130608e287d 2024-03-26T18:11:46+09:00 Minsoo Cheong embedding : adjust `n_ubatch` value (#6296)
1d0331c12a2f2a6296b471232bd4e66fbf06e6a1 dba1af612926cbd4ebe2d876277af1e3305177e0 2024-03-22T19:47:14+01:00 Kawrakow quantize: options for output and token embedding tensors qtype (#6239)
272935b281fee5c683e3d6d1eb580b84553cf503 ccf58aa3ec4d20b10162ba40898dc038ad4c3fad 2024-03-20T23:02:32+08:00 Ziang Wu llava : add MobileVLM_V2 backup (#6175)
f8c4e745e1e728204ab26dbadf52853545e6789c 47cc7a7bf9793f81a6dfe7c2096c499403f64dd6 2024-03-20T19:20:37+08:00 Ziang Wu llava : add a MobileVLM_V2-1.7B backup (#6152)
104f5e0fc156d48476258295457cafeec2a2af10 5e1b7f94a03e0b3b8e4578625bbdadc7bbd2b93c 2024-03-18T16:40:22+01:00 Felix clip : fix memory leak (#6138)
877b4d0c628cc70dddb5df72ed8fc14d126ca7e8 12247f4c69a173b9482f68aaa174ec37fc909ccf 2024-03-15T13:43:02-07:00 Theia Vogel llama : add support for control vectors (#5970)
12247f4c69a173b9482f68aaa174ec37fc909ccf 4e9a7f7f7fb6acbddd1462909c8d696e38edbfcc 2024-03-15T16:41:22-04:00 Andrew Canis llama : add Command-R support (#6033)
044ec4b2a567f649459ccd20af2f387c784faa51 77178eedc83d49f31bf757d8e12315d76460be78 2024-03-14T15:14:14+02:00 Georgi Gerganov embedding : add EOS token if not present (#899)
68265ebfc6a1bed022973ea0c3145be1450b7e70 381da2d9f0940d7009e3e918bed36338c8ff2fbb 2024-03-14T12:37:20+02:00 Georgi Gerganov embedding : print all resulting embeddings (#899)
381da2d9f0940d7009e3e918bed36338c8ff2fbb 0fd6c1f015f6cccf3b527f7dbd8386a434728126 2024-03-14T11:55:23+02:00 Georgi Gerganov metal : build metallib + fix embed path (#6015)
0fd6c1f015f6cccf3b527f7dbd8386a434728126 19885d205e768579ab090d1e99281cae58c21b54 2024-03-14T10:12:29+02:00 Georgi Gerganov embedding : print cosine similarity (#899)
f30ea47a87ed4446ad55adb265755dc9102956a2 d8fd0ccf6ac8b07791ffd1575eed436930854ae3 2024-03-13T18:54:21+01:00 slaren llama : add pipeline parallelism support (#6017)
99b71c068f624521ad977e08e41589e2971fa1c7 306d34be7ad19e768975409fc80791a274ea0230 2024-03-13T11:39:11+01:00 Xuan Son Nguyen Server: Use multi-task for embeddings endpoint (#6001)
828defefb66fc8a25404f5de845897145bf34061 caa106d4e05a0ab94225c220b81f9e2cd522339b 2024-03-11T14:40:42+01:00 Jakub N Update server docker image URLs (#5997)
ecab1c75de68de7c41c254e2ae170d3b07bee6d4 ee35600b9061b1ea0c4ea87fce6844297632b2a8 2024-03-11T10:00:08+02:00 Gilad S cmake : fix subdir for `LLAMA_METAL_EMBED_LIBRARY` (#5985)
bcebd7dbf62fd7b293d5ed089023e4e733269c71 2960eae847f8dbde23be6d170a61bcf44ebf32de 2024-03-10T11:56:30-04:00 DAN™ llama : add support for GritLM (#5959)
fb215c3832236fec7380c4fb618bd7154cb196ef 2c4f566c88322ebf2f9bd11b01b5ebdaa0130b89 2024-03-09T21:27:58+09:00 SeungWon Jeong server : normalize embeddings (#5956)
950ba1ab84db199f0bbdecdb2bb911f35261b321 e1fa9569ba8ce276bc7801a3cebdcf8b1aa116ea 2024-03-09T11:27:53+01:00 Xuan Son Nguyen Server: reorganize some http logic (#5939)
c2101a2e909ac7c08976d414e64e96c90ee5fa9e 515f7d0d4fce41c752fc253acf30707c3be2531e 2024-03-08T17:31:00-05:00 compilade llama : support Mamba Selective State Space Models (#5328)
e457fb3540e0aaec47cfde0abf784c213f9216ee af37fd8b30e37ccbffdd82e6f48559e2fb7ce7dd 2024-03-08T02:41:50-08:00 Don Mahurin llama : assume tied weights if lm_head/output weights is missing (#5824)
6cdabe652695167263c8b447520987b11856f7ca 89fb735fcfd21781a8194b211cf32824beb3f71f 2024-03-07T16:32:38+02:00 Georgi Gerganov llama-bench : add embeddings option (#5924)
2002bc96bf2cbf5ab981a17d7e994d817c9801f5 ceca1aef0738b57951cd12c603c3477e75312dec 2024-03-07T11:41:53+02:00 Georgi Gerganov server : refactor (#5882)
21b08674331e1ea1b599f17c5ca91f0ed173be31 6a87ac3a52668e117d97bcea07b529c93188b303 2024-03-05T16:08:35+08:00 Neo Zhang Jianyu [SYCL] fix mul_mat fault in CI/unit-test (#5862)
29ae62d2ae163e2b68aa0ad3bf2ab4636de0c957 e0843afe1b37890b631bc7d3d2da2ed36c862b91 2024-03-04T22:31:20+02:00 Georgi Gerganov llama : fix embeddings (#5796)
7d43c585dc174bb586775c22c15e5db9242b5b4b 82f3e668adafba647de703f835991e91a96b5ac4 2024-03-03T20:23:52+08:00 leejet add some new ops, fix some operators and add batch operations to certain operators. (ggml/747)
475df1d6cf817060028d3ff763cb8097d4ec40d6 87c2e8b2797860a06af3d6c06b8488a8ff1a09ab 2024-03-03T04:40:27-06:00 Douglas Hanley llama : allow for user specified embedding pooling type (#5849)
c29af7e2252d288f2ea58a7d437c1cb7c0abf160 38d16b142624bdd7c41d9955752b7f7b59c5e048 2024-03-02T01:00:46+05:30 Sourab Mangrulkar llama : add StarCoder2 support (#5795)
9e359a4f47c1b2dceb99e29706c9f7403d32ab5e 4c4cb30736582cacb1a164a9d4bc8e17b1014be7 2024-02-24T19:16:04+01:00 Pierrick Hymbert server: continue to update other slots on embedding concurrent request (#5699)
525213d2f5da1eaf4b922b6b792cb52b2c613368 fd43d66f46ee3b5345fb8a74a252d86ccd34a409 2024-02-24T12:28:55+01:00 Pierrick Hymbert server: init functional tests (#5566)
201294ae177b308fb3a99dc504dd6d27e8afa907 5a9e2f60ba3d8362ba17c77ac3092906d49b813f 2024-02-22T19:44:10Z Someone nix: init singularity and docker images (#5056)
580111d42b3b6ad0a390bfb267d6e3077506eb31 88c46cbdac05cebd936511b1d3c74112e721615f 2024-02-21T05:08:22-08:00 postmasters llama : add `gemma` model (#5631)
6560bed3f066c876682464762cad90f1e28e3f1b 06bf2cf8c406e6b70dbf9b431a02fa0ad845b9df 2024-02-20T11:07:22-08:00 CJ Pais server : support llava 1.6 (#5553)
8dbbd75754d43ec7b4bbe42fb287cc2553fdf0e9 c0a8c6db371cb3e4379900867b948879f5842201 2024-02-19T22:58:36-11:00 Haoxiang Fei metal : add build system support for embedded metal library (#5604)
890559ab28e354052e16e770155ad007fd0856e8 d0e3ce51f45bd6a646da1952d7e5d143a087db3e 2024-02-11T16:41:41+02:00 Didzis Gosko metal : option to embed MSL source into compiled binary (whisper/1842)
60ed04cf82dc91ade725dd7ad53f0ee81f76eccf 594845aab1c6775877f6d9545a51dc0f8d0b3d77 2024-02-16T10:24:39+01:00 Daniel Bevenius llava : fix clip-model-is-vision flag in README.md (#5509)
4524290e87b8e107cc2b56e1251751546f4b9051 c06e45d72983d9ace7b1535f7e7ea258d212169e 2024-02-15T11:21:49-06:00 Douglas Hanley Use correct type of pooling for embedding models (#5500)
c06e45d72983d9ace7b1535f7e7ea258d212169e 9060a1e9dfca6038906e819be5fa42217f49028c 2024-02-15T18:49:08+02:00 Georgi Gerganov clip : fix wrong loop condition
0d4177126b0556e202efb85bf3f768be81076400 7930a8a6e89a04c77c51e3ae5dc1cd8e845b6b8f 2024-02-15T09:01:57+01:00 Elbios llava : fix memory management bug (#5491)
7930a8a6e89a04c77c51e3ae5dc1cd8e845b6b8f 704359e29985a06a389337a2617b7f3fa8eff908 2024-02-15T08:59:18+01:00 John llaba : hotfix for llava-1.6 image number (#5495)
aa2341298924ac89778252015efcb792f2df1e20 f5ca054855dea83f424003162f26de376e5643f6 2024-02-14T08:38:35+01:00 John llava : support v1.6 (#5267)
ea9c8e11436ad50719987fa23a289c74b7b40d40 c4e6dd59e45ef7b14f7763fb073b517395dc176c 2024-02-13T12:03:53-05:00 Jared Van Bortel llama : add support for Nomic Embed (#5468)
03bf161eb6dea6400ee49c6dc6b69bdcfa9fd3fc ad014bba97ef6ef6c3e2f78b2fc463e91ae94579 2024-02-13T06:06:58-06:00 Douglas Hanley llama : support batched embeddings (#5466)
4a46d2b7923be83d6019251671ee63aa1fa0d6bc 3b169441dfe8e420f88d1592708cc2a871daadb9 2024-02-12T09:38:44+01:00 Daniel Bevenius llava : remove prog parameter from ArgumentParser (#5457)
3b169441dfe8e420f88d1592708cc2a871daadb9 3bdc4cd0f595a6096cca4a64aa75ffa8a3503465 2024-02-12T09:16:06+02:00 Georgi Gerganov sync : ggml (#5452)
2891c8aa9af17f4ff636ff3868bc34ff72b56e25 97a336507ed9b971d72262bec7e2b8b7016a054a 2024-02-11T10:21:38-06:00 Douglas Hanley Add support for BERT embedding models (#5423)
ff4ff05c5ff4311c05a8ce1f984c7d8def4f07a5 b7b74cef36a93ae01e0b9af8986d131761742d0e 2024-02-08T15:20:03+01:00 Daniel Bevenius llava : add missing .py, and fix paths in README.md (#5414)
4aa43fab569215a13495a7f1a0f8afc541b16d03 a6e514a85f0fda38ff78ec91782877ea3d19ed98 2024-02-08T18:36:19+08:00 runfuture llama : fix MiniCPM (#5392)
a6e514a85f0fda38ff78ec91782877ea3d19ed98 26d4efd11e48908e14e2ee9471a7fc4c57079a1d 2024-02-08T09:58:19+01:00 Daniel Bevenius llava: fix typo/formatting in README.md (#5405)
316c7faf7740fa98ea68f1445f4505810f706b9e f3e2b4fa3f81a410ecb7dec929c259ef8d8dbb7d 2024-02-07T14:15:56+08:00 runfuture llama : add MiniCPM support (#5346)
6b91b1e0a92ac2e4e269eec6361ca53a61ced6c6 e805f0fa9951081ce0a86378a7aa52b6f636b82d 2024-02-02T08:56:31+01:00 Xuan Son Nguyen docker : add build for SYCL, Vulkan + update readme (#5228)
c82d18e863fcde91b4b1109b1d0c73ea4470c405 14fef85e2d5361e6b4dd7a9ecf22bb817362997d 2024-01-29T21:48:10+08:00 Wu Jian Ping server : embeddings compatibility for OpenAI (#5190)
39baaf55a160909bb9428bd981014218761a20cb 6db2b41a76ee78d5efdd5c3cddd5d7ad3f646855 2024-01-28T01:55:31-06:00 Kyle Mistele docker : add server-first container images (#5157)
6db2b41a76ee78d5efdd5c3cddd5d7ad3f646855 753eafed0ebd07af6903771327a1786a7c02cf98 2024-01-27T16:09:18+01:00 John llava : support for Yi-VL and fix for mobileVLM (#5093)
bf63d695b804b1c995c7ae4427a8a86936ea6d25 1387ea21178f9f154944013d4dd9764b54c69deb 2024-01-22T03:17:05-07:00 Michael Hueschen nix: add cc to devShell LD_LIBRARY_PATH
57e2a7a52a819883f40dada8a2edc24ecf48186b 9b6ea4263ab45e02ff905bf7a29dc143ca1facc3 2024-01-18T23:12:15+01:00 John llama : fix falcon arch for tied output embeddings (#4978)
ee8243adaa9a9f51ff449213383874e49efe368f 15ebe59210e7fd9817ff67f51fa1a5ee2d004294 2024-01-13T14:16:11Z makomk server : fix crash with multimodal models without BOS token (#4904)
d34633d8db6c2e400355de4862cd699154ecc73f 4f56458d34cb13dcbf69aca650e9bf77d5497e6f 2024-01-10T14:37:09+01:00 John clip : support more quantization types (#4846)
36e5a08b203542dca53cca4eaf172c5dc4bbc991 4dccb38d9abab7f9f2d1f9a6977df4185d490132 2024-01-09T09:59:14-08:00 Justine Tunney llava-cli : don't crash if --image flag is invalid (#4835)
3418c03ecc149fd657527ebb06776239b60a3f3b 63ee677efd92060b14894b984597c62e3742b8da 2024-01-07T08:46:55+01:00 Alex Azarov llama.swiftui : add visionOS target (#4805)
9fbda719de18a9400a064c28759c39d55d687d3e 39d8bc71edcb8b6f99d46fa4216af7a15232e218 2023-12-30T23:24:42+02:00 Georgi Gerganov clip : refactor + bug fixes (#4696)
0235b9b571f3cc7d2b8836409a5404b41ce1379c ce18d727a47f2473ca863a6f78bf3ad480008f72 2023-12-29T18:53:34+02:00 Georgi Gerganov clip : use ggml_backend_buffer_is_host (#4205)
ce18d727a47f2473ca863a6f78bf3ad480008f72 91bb39cec7e4dfb9e2293509ef60298a67f0b1b7 2023-12-29T11:52:15-05:00 Steward Garcia clip : enable gpu backend (#4205)
b93edd22f55d3e5268263c3edcdae1818505c078 82d6eab224862a7044069fb9211dc4b29124264b 2023-12-29T06:22:10-08:00 Karthik Sethuraman server : allow to generate multimodal embeddings (#4681)
925e5584a058afb612f9c20bc472c130f5d0f891 6123979952385847d8348e295d77d6e01da8aa84 2023-12-23T11:35:55+02:00 Samuel Maynard ci(docker): fix tags in "Build and push docker image (tagged)" (#4603)
f31b98489824a86c937fa62ccf5dfd4bb0327b86 2bb98279c5a087d62949972b35cf63ff974ffe6a 2023-12-21T23:56:34-07:00 rhuddleston ci : tag docker image with build number (#4584)
33c9892af58b7b161f2a532935dcccff8c8048c6 8efa0f6ebed53c9453e6721da86fb294e5015909 2023-11-30T23:11:14+01:00 John llava : ShareGPT4V compatibility (vision encoder only loading) (#4172)
bd90eca237b498dd106d315dcb9ad3e6fae3906f 3d68f364f15778dc326f5024f2e5af1ad6dfddef 2023-11-13T18:20:52+03:00 M. Yusuf Sarıgöz llava : fix regression for square images in #3613 (#4056)
381efbf480959bb6d1e247a8b0c2328f22e350f8 2833a6f63c1b87c7f4ac574bcf7a15a2f3bf3ede 2023-11-06T22:36:23+01:00 Damian Stewart llava : expose as a shared library for downstream projects (#3613)
ca190bca8e844d171020d6147687e71472d71734 71e3718abdb2771b50c9606d3a7569623a0b0afe 2023-11-01T09:28:28Z Adrian Hesketh server : re-enable completion and embedded at the same time (#3876)
34b2a5e1ee4fe6295fb4420eb91131d743694c65 6961c4bd0b5176e10ab03b35394f1e9eab761792 2023-10-26T22:53:37+03:00 Georgi Gerganov server : do not release slot on image input (#3798)
438c2ca83045a00ef244093d27e9ed41a8cb4ea9 9e70cc03229df19ca2d28ce23cc817198f897278 2023-10-22T22:53:08+03:00 Georgi Gerganov server : parallel decoding and multimodal (#3677)
f3b25e40438b3c8383caabf4e7b89863145a9f0e 60abea9798f47b918a9f38c66edfd88c526d20f6 2023-10-19T19:40:41+03:00 M. Yusuf Sarıgöz multimodal : add BakLLaVA conversion support (#3682)
cb33f43a2a9f5a5a5f8d290dd97c625d9ba97a2f e1675d133c31e1c8de2f06be7164e12c0ba6cf2c 2023-10-17T22:24:50+02:00 slaren fix embeddings when using CUDA (#3657)
940efa95fec0b8a98c226a889d2ad839dfeeae0d 11bff290458f12f020b588792707f76ec658a27a 2023-10-16T23:58:00+03:00 Georgi Gerganov llava : fix tokenization to not add bos between image embeddings and user prompt (#3645)
370359e5baf619f3a8d461023143d1494b1e8fde 9e24cc6e2e589d405bd1720c400f5b0b9d0ca3ee 2023-10-12T18:23:18+03:00 M. Yusuf Sarıgöz examples: support LLaVA v1.5 (multimodal model) (#3436)
f5f9121de140eff558f13b5c5e78a3a3b6b94377 11ea5c7d96f2c28e1c99659e08ec0a44574056e2 2023-10-10T09:50:23+02:00 Jan Ploski llm : add MPT support (#3417)
a8777ad84e00cda0399e827cdf971e2c3fab1da2 97af49fa395df77e4c18af0e1655b2fee67c9686 2023-10-06T14:16:38+01:00 pudepiedj parallel : add option to load external prompt file (#3416)
0e76a8992c8200237bbc6471a53fb8796b3872f7 2db94d98eda56982d80238840b0652b4137a2a84 2023-09-28T20:40:11+02:00 xaedes train : finetune LORA (#2632)
f56c418ab0a635c020bcb5bf44b8f00cb3c9e514 8185710a80531e9ee0c0cb99d3a9c9af1019ab67 2023-09-21T17:57:40+09:00 yuiseki embedding : update README.md (#3224)
4fe09dfe665c58a753dc9eb638dd4dca1cd35488 80291a1d02a07f7f66666fb576c5b1e75aa48b46 2023-09-16T03:02:13+08:00 Meng Zhang llama : add support for StarCoder model architectures (#3187)
980ab41afba96106cd29cdf3aa6f948c251cb71f e394084166baac09e8ee9a08a4686f907f7e5291 2023-09-14T09:47:00-07:00 dylan docker : add gpu image CI builds (#3103)
71d6975559acfd6c8407a4ef8275a9979c737765 b532a69b2fd08067f34f32f37a2fd9b37678a34a 2023-08-30T19:14:53+03:00 Henri Vasserman [Docker] fix tools.sh argument passing. (#2884)
44c117f41ee01c5ac8fb86bba041f08d8b87b46d 43033b7bb4858da4f591715b3babdf906c9b7cbc 2023-08-28T21:51:47+02:00 xaedes train : mem usage and other improvements (#2439)
c82742ac9cd96fd34aa961978805c1d8a361d589 28b2c996ca0ab90a5669946084f13443ec98e241 2023-08-25T11:18:48-04:00 Matt Pulver llama : add llama_beam_search() (#2267)
3f460a2b723c8b936ac29ecfd02f244b3adeba55 87e3733f24a85d894cc16e1cbdfa1ea1e81a76f3 2023-08-25T11:55:59+03:00 Georgi Gerganov cuda : add RoPE kernel for mode == 2 (NeoX) (#2760)
95385241a91a616788a3bb76d12c9b7b2379ca2d 335acd2ffd7b04501c6d8773ab9fcee6e7bf8639 2023-08-23T20:33:05+01:00 Olivier Chafik examples : restore the functionality to import llama2.c models (#2685)
bac66994cf356cf488078c056831396eb4ce31d5 519c981f8b65ee6c87c2965539685ced0a17223b 2023-08-22T19:14:09+03:00 Kawrakow Quantization imrovements for k_quants (#2707)
519c981f8b65ee6c87c2965539685ced0a17223b 1123f7fbdfb8012e46f05e903e6f675922916378 2023-08-22T16:03:12+02:00 slaren embedding : evaluate prompt in batches (#2713)
bbef28218fe827265716b66977719b9ee2b21165 5656d10599bd756dc0f17284e418e704200b43f3 2023-07-11T22:01:08+08:00 LostRuins Possible solution to allow K-quants on models with n_vocab!=32000 (#2148)
7f0e9a775ecc4c6ade271c217f63d6dc93e79eaa b472f3fca558b6335adbd87210ed58cfb5da37cb 2023-07-04T18:33:33-05:00 Nigel Bosch embd-input: Fix input embedding example unsigned int seed (#2105)
7ee76e45afae7f9a7a53e93393accfb5b36684e1 acc111caf93fc6681450924df9f99679c384c59e 2023-07-04T10:05:27-04:00 Tobias Lütke Simple webchat for server (#1998)
698efad5fbbf326f01288649b123eff5f79b417e 14a2cc71f62e45803ae70890ffbdeb0a172e6210 2023-07-04T01:50:12+02:00 Erik Scholz CI: make the brew update temporarily optional. (#2092)
cfa0750bc9dbc2d957a91b8ed09ab0035d8f3d4e 9d23589d638dc74577d5ff880e6d4248b795f12e 2023-06-28T23:53:37+08:00 ningshanwutuobang llama : support input embeddings directly (#1910)
20568fe60f00155fa25e92eb3a7f6b911d557967 18b35625c3c19c64b7818a12460ba5ddb006dfdc 2023-06-20T01:12:39+03:00 Henri Vasserman [Fix] Reenable server embedding endpoint (#1937)
ca7c3f4da5d144d4cd1dd44903552e6ba49b8ec8 b97ca431db35ec96a339a721acb1219c1dd78bed 2023-06-19T18:14:09+03:00 Kawrakow cuda : faster k-quants on older GPUs (#1930)
794db3e7b982fee37e3995db9c3a216a57ff65e3 5ddf7ea1fb42bac21026de2f77e0f9c069b92234 2023-06-17T07:53:04-04:00 Randall Fitzgerald Server Example Refactor and Improvements (#1570)
e32089b2c20b1b87b22912f4a8b93fe01647d5b9 2347e45e7bdb09c9a7d74b2c0bc86c2b65f0c343 2023-06-13T21:04:40+02:00 xaedes train : improved training-from-scratch example (#1652)
0e730dd23b0fb5f93dba574e0a48d9a69dc5dbae 3b126f654fceb4f5f195a1c2e825bb18e101188c 2023-05-29T06:45:50+02:00 Jiří Podivín Adding git in container package dependencies (#1621)
6456a4eb9f9c1f4de8f6908ef100daa78802ad00 cdd5350892b1d4e521e930c77341f858fcfcd433 2023-05-13T15:24:20+08:00 Rinne embedding : remove unused code (#1426)
b6e7f9b09e9c340ec97a2fae61c1eb8db861f2f9 50cb666b8a2e35a49b08c0f6bc81138c8f6f2ac1 2023-04-22T08:21:32+02:00 xaedes llama : add api for getting/setting the complete state: rng, logits, embedding and kv_cache (#1105)
a0c05164168297c04737936ad0cad849a512547a d8d4e865cd481b18f10508ffee35db903767ef5c 2023-04-02T15:13:03-07:00 bsilvereagle Remove torch GPU dependencies from the Docker.full image (#665)
e0670260fb50a882b37074112b1881fb0820cf77 28ba975aea1dcae2f31770516f5d542ff177771e 2023-03-28T18:34:35+03:00 Georgi Gerganov gitignore : add "embedding"
4b8efff0e3945090379aa2f897ff125c8f9cdbae 7e5395575a3360598f2565c73c8a2ec0c0abbdb8 2023-03-28T08:11:09+02:00 RJ Adriaansen Add embedding example to Makefile (#540)
03f7e335604b3d68f74995aa2ccb4955833ee423 55ad42af845127bd0eb0c1f36f327ecec83f4bca 2023-03-25T20:51:14+02:00 Georgi Gerganov Cleanup STL headers + fix embedding examples + minor stuff
a316a425d04027453dc0fd45f003b647c12f66f9 ecbe466a364876927994e2f1ec14f4d82301d201 2023-03-25T20:26:40+02:00 Georgi Gerganov Overhaul the examples structure
8d4a855c241ecb0f3ddc03447fe56002ebf27a37 b6b268d4415fd3b3e53f22b6619b724d4928f713 2023-03-24T08:05:13-07:00 Luciano Add embedding mode with arg flag. Currently working (#282)
16ffc013c62f22bdaa3cdc022d7a13fd952d73fc 486ae645fd3eda8b9d7413d5ff34fb65a3e337fb 2023-03-21T09:42:25-07:00 comex Importer for GPTQ quantized LLaMA models (#301)
0f1b21cb90ac6b84a9af70cafb8e13b5389e3b32 074bea2eb1f1349a0118239c4152914aecaa1be4 2023-03-20T18:05:20+01:00 Bernat Vadell Docker - Fix publish docker image in GitHub Registry (#235)
5cb63e2493c49bc2c3b9b355696e8dc26cdd0380 da5303c1ea68aa19db829c634f1e10d08d409680 2023-03-20T08:24:11Z Stephan Walter Add tqdm to Python requirements (#293)
2af23d30434a677c6416812eea52ccc0af65119c 904d2a8d6acd667c9633138d45a361d40fbf76d0 2023-03-17T10:47:06+01:00 Bernat Vadell 🚀 Dockerize llamacpp (#132)
Can't render this file because it contains an unexpected character in line 210 and column 147.
@@ -0,0 +1,68 @@
ebce9e1a548c2329aa97f53b8b2ad50d968088dc e850ff4de25ad1221abc9bf3bb30df252ccd9c36 2026-05-27T09:38:00+08:00 Yunzhe Jia origin/runtime_replace Refactor cal-llm integration by removing runtime capacity loading and adjusting request handling
e850ff4de25ad1221abc9bf3bb30df252ccd9c36 9985688f7fa96f755882f96a2cd8a18114fdc42d 2026-05-26T10:59:45+08:00 Yunzhe Jia Enhance cal-llm integration by adding runtime checks for CALRT_LIBRARY and updating link settings for Linux and Windows
9985688f7fa96f755882f96a2cd8a18114fdc42d 38ca6895815671a87ceec86b4aa4eb976580ce76 2026-05-25T09:05:49+08:00 Yunzhe Jia Refactor CalrtEngineConfig initialization by removing redundant parameters
38ca6895815671a87ceec86b4aa4eb976580ce76 ddd60c928224b52eb4e1e60e01e8a1ecbb80ee45 2026-05-20T16:37:13+08:00 Yunzhe Jia Add support for cal-llm profile dumping to JSONL file
ddd60c928224b52eb4e1e60e01e8a1ecbb80ee45 2716130010c58f1cdd9d94f0e2f8e047bc92dc66 2026-05-20T09:22:40+08:00 Yunzhe Jia Add cal-llm backend profiling support with command-line option
c931ef3163940227c9b6291e04216245cce21429 a43741244a646d3f8fa3ff01bb9b7d059223d0a5 2026-05-18T17:34:37+08:00 wangbomeng calrt: fix prefill_by_ids.fix create_buf
2716130010c58f1cdd9d94f0e2f8e047bc92dc66 b35bda124ccd4ed581dd6088d3ffa4931c2809b6 2026-05-18T08:40:54+08:00 Yunzhe Jia fix n_ctx_slot error by adding runtime capacity loading for cal-llm
a43741244a646d3f8fa3ff01bb9b7d059223d0a5 b2003d6c90ef0fa26ab9e930ba3e22b355eb3d39 2026-05-15T14:39:53+08:00 wangbomeng run llama-passkey successfully, fix llama-bench, copy 3 times input to infer qwen2.5vl
b35bda124ccd4ed581dd6088d3ffa4931c2809b6 81a2cbd4cef5d28334ff513d6b69e593d9d1cb49 2026-05-15T09:19:31+08:00 Yunzhe Jia Implement vocab-only model initialization and enhance cal-llm backend error handling
81a2cbd4cef5d28334ff513d6b69e593d9d1cb49 3b14ed556c15529fe1f94b649f49db7156dfaf67 2026-05-14T16:06:37+08:00 Yunzhe Jia Enhance CMake configuration for cal-llm integration by updating paths and adding library properties
3b14ed556c15529fe1f94b649f49db7156dfaf67 dde8b8228081769c8d8f1e0751d47fa7875f8423 2026-05-14T14:34:25+08:00 Yunzhe Jia - Removed references to CALRT from clip.h, mtmd-helper.cpp, mtmd-helper.h, mtmd.cpp, and mtmd.h. - Updated server.cpp to conditionally include CAL-LLM support. - Introduced option LLAMA_SERVER_USE_CAL_LLM in CMakeLists.txt to enable CAL-LLM integration. - Refactored server context to handle CAL-LLM requests and responses. - Updated image processing logic to remove CALRT-specific implementations. - Ensured compatibility with existing llama functionality while integrating new CAL-LLM features.
fabcc7dac4b34d83fe430980bb364b81087c7ee9 1e9787962f20a7e82c71589ac1dd0585454e4bfe 2026-04-30T16:17:17+08:00 wangbomeng calrt: fix encode dump
f584311c716dd078c4b737eebbfda97fe12b7274 a339954cc2a145a80c5ea349e7896211916cbed9 2026-04-30T16:05:15+08:00 wangbomeng calrt: fix encode dump
1bec0db5a675ddc60fb793be2a746e8f3c8855dc 465df20c3e1f3f58d0f5531c796e0941a49c32b0 2026-04-30T16:02:59+08:00 wangbomeng origin/dev-ben bench: support 2 calbins
465df20c3e1f3f58d0f5531c796e0941a49c32b0 a339954cc2a145a80c5ea349e7896211916cbed9 2026-04-30T09:08:12+08:00 wangbomeng support one calbin
431ad6f1c787f1b47e9e7be14b2e1a7d8565485c efa1876bb8b2a449a55054a8c3745892f2c0f262 2026-04-27T16:52:15+08:00 wangbomeng update calrt_infer
4a2a3181f1cea170105c771e6ba69d851b82b937 e3ea5541259f35871c3e995331770aaca297e9ec 2026-04-26T10:56:02+08:00 wangbomeng add calrt-version
e3ea5541259f35871c3e995331770aaca297e9ec 0b8e43943846a1cd05c26c9186b9ef778ebae6e2 2026-04-26T10:55:48+08:00 wangbomeng add calrt-version
5eb46fffbd2e260c540fb112314ad67bbb8f56b6 005112c51e00d998b457337ca3dad53fc46e2d0b 2026-04-24T16:24:51+08:00 wangbomeng clip: add image_to_patches; calrt: vision copy data from bf16 to fp32
005112c51e00d998b457337ca3dad53fc46e2d0b 509670642e8090a1713f5d73590b549be827aaef 2026-04-24T16:24:31+08:00 wangbomeng clip: add image_to_patches; calrt: vision copy data from bf16 to fp32
5d219bfcef239c1e3ddd1baecc0514a9462ff6a8 6787a53ab9b4897c5a7b51a4062d7b90e6697d35 2026-04-24T09:31:32+08:00 wangbomeng calrt: recover base = batch_index * dict_len
6787a53ab9b4897c5a7b51a4062d7b90e6697d35 e1a76abf66178ea85656479a5e19aea7785c09f4 2026-04-24T09:22:02+08:00 wangbomeng calrt:input of multimodel from fp32 to bf16
e1a76abf66178ea85656479a5e19aea7785c09f4 99dd308adb8488fa869bb669e3335e646a938eff 2026-04-22T16:29:22+08:00 wangbomeng calrt:add CalcoreRT version print
99962021f2dd1994dbbf90d5712f0ca2633f20f8 9af6682ef101c6d006c743c703cf150ac25f466f 2026-04-17T14:48:33+08:00 wangbomeng origin/dev-ot calrt: add onetoken slice and untile_prefill
e24f775ee26ea5249d5ff6cd23b8a0a17fe1438d a206460e610aef995e36e50b33e8bd41fe477541 2026-04-15T10:01:09+08:00 wangbomeng calrt: add copy_data_to_ibuf for vision model
a206460e610aef995e36e50b33e8bd41fe477541 d8b2aaa00049978cebac15041f960d75b552f97b 2026-04-14T10:23:43+08:00 wangbomeng calrt: support mixture of prefill_by_ids and prefill_by_embeds
0cd44929b442860dc0e5f88976108be82350f9dc b8153b6b8f244b223c9f4c2940ae1f212634519e 2026-04-09T15:08:50+08:00 Bomeng Wang rm calculet0.txt
9626239f5a9e568c9975d67dd6745fef90279a87 da724f3e2a8af2c2537e3edcff41e9415ac66fef 2026-04-08T17:47:04+08:00 wangbomeng calrt: fix MapBuf
da724f3e2a8af2c2537e3edcff41e9415ac66fef 18814f9bf1a423ebe8f32d6043c9cbc5b21b0218 2026-04-08T16:58:32+08:00 Bomeng Wang calrt: add MapBuf
bbee06d6d851e3f84f75b578047967d7e0e4a8dc e126c21ed7b793b648d63533ea7ee30885f5a82a 2026-04-08T11:29:36+08:00 wangbomeng calrt: add test time print
5603e050af07173589f3b8850121263d86da01fd 1e8a16cd0e3ad3c9a0f8746852a0a38c6e52322e 2026-04-01T05:57:55+08:00 wangbomeng calrt: add t_incopy and t_outcopy
1e8a16cd0e3ad3c9a0f8746852a0a38c6e52322e 893e52bda0fee99bbda1521ea733a760bc4201f1 2026-04-01T10:14:22+08:00 wangbomeng calrt: fix slice and add infer/copy time
6d5e83902bdd3142a8ff0d3db19f02a8619e95a0 e4eaab700333490e80ebefc8d023f6c1adfcc312 2026-03-27T00:57:11+08:00 wangbomeng server: printf calrt commit ID
e4eaab700333490e80ebefc8d023f6c1adfcc312 aeacc23a883400db0ebffb50e23355ada054da66 2026-03-25T09:03:55+08:00 wangbomeng calrt: prefil to prefill
aeacc23a883400db0ebffb50e23355ada054da66 cbaa7492663630132adeddccd9fec5e44ffa3336 2026-03-25T08:49:22+08:00 wangbomeng calrt: add slice only on decode
3c08ebf0e442cd730ddffd959ec676f9caf31c82 613bc2b9a9d7af92efbe42d876ffcdb244f7a00e 2026-03-24T02:43:03+08:00 wangbomeng calrt: comment LOG_ERROR in untile_decode_cpy
613bc2b9a9d7af92efbe42d876ffcdb244f7a00e 4e194ecc6c4b8ebe4c72d93f6055e3605dbfcefa 2026-03-24T02:30:12+08:00 wangbomeng calrt: fix max_seq_len judgment
4e194ecc6c4b8ebe4c72d93f6055e3605dbfcefa 16cbf81a731f5839a2f6b0eb9d8539826353748b 2026-03-24T01:59:03+08:00 wangbomeng calrt: fix ubatch.embd cpy
16cbf81a731f5839a2f6b0eb9d8539826353748b 8b4e17d990c23025148c4abadefe1010a0dd0734 2026-03-23T09:38:21+08:00 wangbomeng calrt: fix model_name of untile_cpy
6dacdd2cf9574214ca272a86674e7bd7ba21c4f0 3e6ad64467771224f072e5bad90e270951ba4cdf 2026-03-23T14:42:28+08:00 wangbomeng calrt: add multimodal
3e6ad64467771224f072e5bad90e270951ba4cdf b37b7d9756feb3dac2db526eeab38b572a095d47 2026-03-23T14:36:41+08:00 wangbomeng calrt: add multimodal
d0a1b2c758440720d42fa108b3444f54593daa73 b37b7d9756feb3dac2db526eeab38b572a095d47 2026-03-12T16:10:28+08:00 Bomeng Wang calrt: comment out dump
7ddafbdcb9426ae3af016925b8b596f11e8742d0 059009eeaf20a569abfbac5eb37dad3bb9376428 2026-03-10T07:13:04+08:00 wangbomeng calrt: commented out cal_ctx->encode(batch)
059009eeaf20a569abfbac5eb37dad3bb9376428 1b073661d1311b5300173993b9f31ee7241d8606 2026-03-10T07:04:22+08:00 wangbomeng calrt: add multimodel
6295273c5866b9249bacdedbfc3a31877e6e6a85 c6ea3f0d2468e3b8eab5de80bacee7fe4c9dd3d7 2026-03-10T06:54:41+08:00 wangbomeng arg: update hf_repo url to https://download.calculet.tech:9443
f8fba66b657c51a1df1efc7267bfea9f6140cebf db4a61d2234c2f457b42ecc3f7219a1e1a35508a 2026-03-06T15:06:36+08:00 Yunzhe Jia fix calrt_install include path
e672e02ca1a582f9e3a9d011d9e1b4fea4942a25 27b82f64252779ad160a3fa76bd378c39421de36 7a3a9a0e76bb5f530beafcfe52e87e388e93117a 2026-03-06T11:47:09+08:00 Yunzhe Jia Merge branch 'dev' of http://192.168.10.26:1000/yunzhe/llama.cpp into dev
27b82f64252779ad160a3fa76bd378c39421de36 0bd95719fed2f0247c8d0199dd897d24157dfae6 2026-03-06T11:42:45+08:00 Yunzhe Jia adapt to calrt_objs target
7a3a9a0e76bb5f530beafcfe52e87e388e93117a 583c387efaf7bc030574e554088de79d09a27fbd 2026-03-05T07:24:59+08:00 wangbomeng calrt_infer: fix past_kv_len
aa0a17d719326a63e0d6fea60aa0ced44e7abc33 fa332e773da681f3e77d6ffe83a87edb557f758b 2026-02-27T01:40:11+08:00 wangbomeng calrt: add bf16_to_fp32
49fea70a20f550bfdb59d0ffe041b54919c22447 74a118df31b6a4acc8876b2a2db90d2395cc6ec3 2026-01-28T09:11:16+08:00 Yunzhe Jia adapt to new calbin test_case
74a118df31b6a4acc8876b2a2db90d2395cc6ec3 98e8f9acfe87cd93646482cb2d942b8a132f0852 2026-01-13T14:32:47+08:00 Yunzhe Jia sync with calrt update
8c8152a04036bb0d4756a4e08e54f514dae4e64d 5d2387931528fbe04aa8d66de935147efb65ca4d 2025-12-09T14:40:04+08:00 Yunzhe Jia adapt to calrt csr
e6285a748657add8d974b78ca920c5b41753ee12 6b1ecdbbe3cc72ed8888be38f9e934cfd79b9fbb 2025-11-27T16:58:35+08:00 Yunzhe Jia adapt to calrt
240d9bb75241c91896afe125f2fc74698a7395f3 7eeb241aad429a68fb8cfa3ba85d000fb2348cd2 2025-11-24T12:03:00+08:00 Yunzhe Jia adapt to calrt modification
98c8269abefdfa8fde47dfb2769ceebc8b704e86 2790ecc304e384d9075c55d0628d8bf440025dc4 2025-09-30T17:42:57+08:00 Yunzhe Jia server: adapt to calrt
2790ecc304e384d9075c55d0628d8bf440025dc4 f528e97d894b4d93934a0711a00253eea980e799 2025-09-30T17:37:58+08:00 Yunzhe Jia adapt to calrt
f528e97d894b4d93934a0711a00253eea980e799 dcbe998a6d8f13b6c9cb36bbe7b355ced2ac3842 2025-09-11T14:13:35+08:00 Yunzhe Jia add calrt mtmd support
dcbe998a6d8f13b6c9cb36bbe7b355ced2ac3842 87932ec016f0ec81e98a13ce5212851f8c12458a 2025-09-05T14:34:07+08:00 Yunzhe Jia add calrt API used in server side
3a617cb18121a85eed17ac5585788810c5d9c1e0 c42293848dd9f03eba9a6c1b85a600b398f06541 2025-08-13T10:58:59+08:00 Yunzhe Jia add calrt_decode
c42293848dd9f03eba9a6c1b85a600b398f06541 1cbf442f50a154aac0bf35d7b8b3436a2cdfd6f5 2025-08-06T15:46:06+08:00 Yunzhe Jia sync with calrt API
1cbf442f50a154aac0bf35d7b8b3436a2cdfd6f5 ba67d6c03fed3193987a4ef13050e6e2a4451df4 2025-07-24T15:50:19+08:00 Yunzhe Jia 1.sync with calrt prefill,decode,kv_update op 2.add hw pattern untile function
ba67d6c03fed3193987a4ef13050e6e2a4451df4 8f52c6f8abb2ed9ad967cc0bfb90acb073011193 2025-06-26T17:42:32+08:00 Yunzhe Jia llama-calrt: infer-op: copy data from output buffer to dst-tensor.data
8f52c6f8abb2ed9ad967cc0bfb90acb073011193 d2f325130c4ed77a3dcff2c23a926587fb08e2cc 2025-06-26T15:10:45+08:00 Yunzhe Jia Squashed commit of the following:
d2f325130c4ed77a3dcff2c23a926587fb08e2cc 6391ee7ffd97e723dfbdcc32f001e1b95a63cba6 2025-06-17T11:53:33+08:00 Yunzhe Jia calrt: add input_token in graph; input_token will be copy to calrt_in_buffer
b9850050a5b5147cb2e6720b98ed8c1e8e02eff9 933b205c32551848589b8339437d778cb4f2a46d 2025-06-06T17:25:52+08:00 Yunzhe Jia calrt: add call chain for using calrt::infer
33fea9a8592fd338abe279b89350a3af2e0ff1f7 806f05a353d322e97d97e02f910de2b408a8b4ab 2025-06-06T17:25:52+08:00 Yunzhe Jia calrt: add load calbin
806f05a353d322e97d97e02f910de2b408a8b4ab ec9e0301fef6476df83e94842c3b625501c95566 2025-05-30T09:45:37+08:00 Yunzhe Jia add calrt demo
1 ebce9e1a548c2329aa97f53b8b2ad50d968088dc e850ff4de25ad1221abc9bf3bb30df252ccd9c36 2026-05-27T09:38:00+08:00 Yunzhe Jia origin/runtime_replace Refactor cal-llm integration by removing runtime capacity loading and adjusting request handling
2 e850ff4de25ad1221abc9bf3bb30df252ccd9c36 9985688f7fa96f755882f96a2cd8a18114fdc42d 2026-05-26T10:59:45+08:00 Yunzhe Jia Enhance cal-llm integration by adding runtime checks for CALRT_LIBRARY and updating link settings for Linux and Windows
3 9985688f7fa96f755882f96a2cd8a18114fdc42d 38ca6895815671a87ceec86b4aa4eb976580ce76 2026-05-25T09:05:49+08:00 Yunzhe Jia Refactor CalrtEngineConfig initialization by removing redundant parameters
4 38ca6895815671a87ceec86b4aa4eb976580ce76 ddd60c928224b52eb4e1e60e01e8a1ecbb80ee45 2026-05-20T16:37:13+08:00 Yunzhe Jia Add support for cal-llm profile dumping to JSONL file
5 ddd60c928224b52eb4e1e60e01e8a1ecbb80ee45 2716130010c58f1cdd9d94f0e2f8e047bc92dc66 2026-05-20T09:22:40+08:00 Yunzhe Jia Add cal-llm backend profiling support with command-line option
6 c931ef3163940227c9b6291e04216245cce21429 a43741244a646d3f8fa3ff01bb9b7d059223d0a5 2026-05-18T17:34:37+08:00 wangbomeng calrt: fix prefill_by_ids.fix create_buf
7 2716130010c58f1cdd9d94f0e2f8e047bc92dc66 b35bda124ccd4ed581dd6088d3ffa4931c2809b6 2026-05-18T08:40:54+08:00 Yunzhe Jia fix n_ctx_slot error by adding runtime capacity loading for cal-llm
8 a43741244a646d3f8fa3ff01bb9b7d059223d0a5 b2003d6c90ef0fa26ab9e930ba3e22b355eb3d39 2026-05-15T14:39:53+08:00 wangbomeng run llama-passkey successfully, fix llama-bench, copy 3 times input to infer qwen2.5vl
9 b35bda124ccd4ed581dd6088d3ffa4931c2809b6 81a2cbd4cef5d28334ff513d6b69e593d9d1cb49 2026-05-15T09:19:31+08:00 Yunzhe Jia Implement vocab-only model initialization and enhance cal-llm backend error handling
10 81a2cbd4cef5d28334ff513d6b69e593d9d1cb49 3b14ed556c15529fe1f94b649f49db7156dfaf67 2026-05-14T16:06:37+08:00 Yunzhe Jia Enhance CMake configuration for cal-llm integration by updating paths and adding library properties
11 3b14ed556c15529fe1f94b649f49db7156dfaf67 dde8b8228081769c8d8f1e0751d47fa7875f8423 2026-05-14T14:34:25+08:00 Yunzhe Jia - Removed references to CALRT from clip.h, mtmd-helper.cpp, mtmd-helper.h, mtmd.cpp, and mtmd.h. - Updated server.cpp to conditionally include CAL-LLM support. - Introduced option LLAMA_SERVER_USE_CAL_LLM in CMakeLists.txt to enable CAL-LLM integration. - Refactored server context to handle CAL-LLM requests and responses. - Updated image processing logic to remove CALRT-specific implementations. - Ensured compatibility with existing llama functionality while integrating new CAL-LLM features.
12 fabcc7dac4b34d83fe430980bb364b81087c7ee9 1e9787962f20a7e82c71589ac1dd0585454e4bfe 2026-04-30T16:17:17+08:00 wangbomeng calrt: fix encode dump
13 f584311c716dd078c4b737eebbfda97fe12b7274 a339954cc2a145a80c5ea349e7896211916cbed9 2026-04-30T16:05:15+08:00 wangbomeng calrt: fix encode dump
14 1bec0db5a675ddc60fb793be2a746e8f3c8855dc 465df20c3e1f3f58d0f5531c796e0941a49c32b0 2026-04-30T16:02:59+08:00 wangbomeng origin/dev-ben bench: support 2 calbins
15 465df20c3e1f3f58d0f5531c796e0941a49c32b0 a339954cc2a145a80c5ea349e7896211916cbed9 2026-04-30T09:08:12+08:00 wangbomeng support one calbin
16 431ad6f1c787f1b47e9e7be14b2e1a7d8565485c efa1876bb8b2a449a55054a8c3745892f2c0f262 2026-04-27T16:52:15+08:00 wangbomeng update calrt_infer
17 4a2a3181f1cea170105c771e6ba69d851b82b937 e3ea5541259f35871c3e995331770aaca297e9ec 2026-04-26T10:56:02+08:00 wangbomeng add calrt-version
18 e3ea5541259f35871c3e995331770aaca297e9ec 0b8e43943846a1cd05c26c9186b9ef778ebae6e2 2026-04-26T10:55:48+08:00 wangbomeng add calrt-version
19 5eb46fffbd2e260c540fb112314ad67bbb8f56b6 005112c51e00d998b457337ca3dad53fc46e2d0b 2026-04-24T16:24:51+08:00 wangbomeng clip: add image_to_patches; calrt: vision copy data from bf16 to fp32
20 005112c51e00d998b457337ca3dad53fc46e2d0b 509670642e8090a1713f5d73590b549be827aaef 2026-04-24T16:24:31+08:00 wangbomeng clip: add image_to_patches; calrt: vision copy data from bf16 to fp32
21 5d219bfcef239c1e3ddd1baecc0514a9462ff6a8 6787a53ab9b4897c5a7b51a4062d7b90e6697d35 2026-04-24T09:31:32+08:00 wangbomeng calrt: recover base = batch_index * dict_len
22 6787a53ab9b4897c5a7b51a4062d7b90e6697d35 e1a76abf66178ea85656479a5e19aea7785c09f4 2026-04-24T09:22:02+08:00 wangbomeng calrt:input of multimodel from fp32 to bf16
23 e1a76abf66178ea85656479a5e19aea7785c09f4 99dd308adb8488fa869bb669e3335e646a938eff 2026-04-22T16:29:22+08:00 wangbomeng calrt:add CalcoreRT version print
24 99962021f2dd1994dbbf90d5712f0ca2633f20f8 9af6682ef101c6d006c743c703cf150ac25f466f 2026-04-17T14:48:33+08:00 wangbomeng origin/dev-ot calrt: add onetoken slice and untile_prefill
25 e24f775ee26ea5249d5ff6cd23b8a0a17fe1438d a206460e610aef995e36e50b33e8bd41fe477541 2026-04-15T10:01:09+08:00 wangbomeng calrt: add copy_data_to_ibuf for vision model
26 a206460e610aef995e36e50b33e8bd41fe477541 d8b2aaa00049978cebac15041f960d75b552f97b 2026-04-14T10:23:43+08:00 wangbomeng calrt: support mixture of prefill_by_ids and prefill_by_embeds
27 0cd44929b442860dc0e5f88976108be82350f9dc b8153b6b8f244b223c9f4c2940ae1f212634519e 2026-04-09T15:08:50+08:00 Bomeng Wang rm calculet0.txt
28 9626239f5a9e568c9975d67dd6745fef90279a87 da724f3e2a8af2c2537e3edcff41e9415ac66fef 2026-04-08T17:47:04+08:00 wangbomeng calrt: fix MapBuf
29 da724f3e2a8af2c2537e3edcff41e9415ac66fef 18814f9bf1a423ebe8f32d6043c9cbc5b21b0218 2026-04-08T16:58:32+08:00 Bomeng Wang calrt: add MapBuf
30 bbee06d6d851e3f84f75b578047967d7e0e4a8dc e126c21ed7b793b648d63533ea7ee30885f5a82a 2026-04-08T11:29:36+08:00 wangbomeng calrt: add test time print
31 5603e050af07173589f3b8850121263d86da01fd 1e8a16cd0e3ad3c9a0f8746852a0a38c6e52322e 2026-04-01T05:57:55+08:00 wangbomeng calrt: add t_incopy and t_outcopy
32 1e8a16cd0e3ad3c9a0f8746852a0a38c6e52322e 893e52bda0fee99bbda1521ea733a760bc4201f1 2026-04-01T10:14:22+08:00 wangbomeng calrt: fix slice and add infer/copy time
33 6d5e83902bdd3142a8ff0d3db19f02a8619e95a0 e4eaab700333490e80ebefc8d023f6c1adfcc312 2026-03-27T00:57:11+08:00 wangbomeng server: printf calrt commit ID
34 e4eaab700333490e80ebefc8d023f6c1adfcc312 aeacc23a883400db0ebffb50e23355ada054da66 2026-03-25T09:03:55+08:00 wangbomeng calrt: prefil to prefill
35 aeacc23a883400db0ebffb50e23355ada054da66 cbaa7492663630132adeddccd9fec5e44ffa3336 2026-03-25T08:49:22+08:00 wangbomeng calrt: add slice only on decode
36 3c08ebf0e442cd730ddffd959ec676f9caf31c82 613bc2b9a9d7af92efbe42d876ffcdb244f7a00e 2026-03-24T02:43:03+08:00 wangbomeng calrt: comment LOG_ERROR in untile_decode_cpy
37 613bc2b9a9d7af92efbe42d876ffcdb244f7a00e 4e194ecc6c4b8ebe4c72d93f6055e3605dbfcefa 2026-03-24T02:30:12+08:00 wangbomeng calrt: fix max_seq_len judgment
38 4e194ecc6c4b8ebe4c72d93f6055e3605dbfcefa 16cbf81a731f5839a2f6b0eb9d8539826353748b 2026-03-24T01:59:03+08:00 wangbomeng calrt: fix ubatch.embd cpy
39 16cbf81a731f5839a2f6b0eb9d8539826353748b 8b4e17d990c23025148c4abadefe1010a0dd0734 2026-03-23T09:38:21+08:00 wangbomeng calrt: fix model_name of untile_cpy
40 6dacdd2cf9574214ca272a86674e7bd7ba21c4f0 3e6ad64467771224f072e5bad90e270951ba4cdf 2026-03-23T14:42:28+08:00 wangbomeng calrt: add multimodal
41 3e6ad64467771224f072e5bad90e270951ba4cdf b37b7d9756feb3dac2db526eeab38b572a095d47 2026-03-23T14:36:41+08:00 wangbomeng calrt: add multimodal
42 d0a1b2c758440720d42fa108b3444f54593daa73 b37b7d9756feb3dac2db526eeab38b572a095d47 2026-03-12T16:10:28+08:00 Bomeng Wang calrt: comment out dump
43 7ddafbdcb9426ae3af016925b8b596f11e8742d0 059009eeaf20a569abfbac5eb37dad3bb9376428 2026-03-10T07:13:04+08:00 wangbomeng calrt: commented out cal_ctx->encode(batch)
44 059009eeaf20a569abfbac5eb37dad3bb9376428 1b073661d1311b5300173993b9f31ee7241d8606 2026-03-10T07:04:22+08:00 wangbomeng calrt: add multimodel
45 6295273c5866b9249bacdedbfc3a31877e6e6a85 c6ea3f0d2468e3b8eab5de80bacee7fe4c9dd3d7 2026-03-10T06:54:41+08:00 wangbomeng arg: update hf_repo url to https://download.calculet.tech:9443
46 f8fba66b657c51a1df1efc7267bfea9f6140cebf db4a61d2234c2f457b42ecc3f7219a1e1a35508a 2026-03-06T15:06:36+08:00 Yunzhe Jia fix calrt_install include path
47 e672e02ca1a582f9e3a9d011d9e1b4fea4942a25 27b82f64252779ad160a3fa76bd378c39421de36 7a3a9a0e76bb5f530beafcfe52e87e388e93117a 2026-03-06T11:47:09+08:00 Yunzhe Jia Merge branch 'dev' of http://192.168.10.26:1000/yunzhe/llama.cpp into dev
48 27b82f64252779ad160a3fa76bd378c39421de36 0bd95719fed2f0247c8d0199dd897d24157dfae6 2026-03-06T11:42:45+08:00 Yunzhe Jia adapt to calrt_objs target
49 7a3a9a0e76bb5f530beafcfe52e87e388e93117a 583c387efaf7bc030574e554088de79d09a27fbd 2026-03-05T07:24:59+08:00 wangbomeng calrt_infer: fix past_kv_len
50 aa0a17d719326a63e0d6fea60aa0ced44e7abc33 fa332e773da681f3e77d6ffe83a87edb557f758b 2026-02-27T01:40:11+08:00 wangbomeng calrt: add bf16_to_fp32
51 49fea70a20f550bfdb59d0ffe041b54919c22447 74a118df31b6a4acc8876b2a2db90d2395cc6ec3 2026-01-28T09:11:16+08:00 Yunzhe Jia adapt to new calbin test_case
52 74a118df31b6a4acc8876b2a2db90d2395cc6ec3 98e8f9acfe87cd93646482cb2d942b8a132f0852 2026-01-13T14:32:47+08:00 Yunzhe Jia sync with calrt update
53 8c8152a04036bb0d4756a4e08e54f514dae4e64d 5d2387931528fbe04aa8d66de935147efb65ca4d 2025-12-09T14:40:04+08:00 Yunzhe Jia adapt to calrt csr
54 e6285a748657add8d974b78ca920c5b41753ee12 6b1ecdbbe3cc72ed8888be38f9e934cfd79b9fbb 2025-11-27T16:58:35+08:00 Yunzhe Jia adapt to calrt
55 240d9bb75241c91896afe125f2fc74698a7395f3 7eeb241aad429a68fb8cfa3ba85d000fb2348cd2 2025-11-24T12:03:00+08:00 Yunzhe Jia adapt to calrt modification
56 98c8269abefdfa8fde47dfb2769ceebc8b704e86 2790ecc304e384d9075c55d0628d8bf440025dc4 2025-09-30T17:42:57+08:00 Yunzhe Jia server: adapt to calrt
57 2790ecc304e384d9075c55d0628d8bf440025dc4 f528e97d894b4d93934a0711a00253eea980e799 2025-09-30T17:37:58+08:00 Yunzhe Jia adapt to calrt
58 f528e97d894b4d93934a0711a00253eea980e799 dcbe998a6d8f13b6c9cb36bbe7b355ced2ac3842 2025-09-11T14:13:35+08:00 Yunzhe Jia add calrt mtmd support
59 dcbe998a6d8f13b6c9cb36bbe7b355ced2ac3842 87932ec016f0ec81e98a13ce5212851f8c12458a 2025-09-05T14:34:07+08:00 Yunzhe Jia add calrt API used in server side
60 3a617cb18121a85eed17ac5585788810c5d9c1e0 c42293848dd9f03eba9a6c1b85a600b398f06541 2025-08-13T10:58:59+08:00 Yunzhe Jia add calrt_decode
61 c42293848dd9f03eba9a6c1b85a600b398f06541 1cbf442f50a154aac0bf35d7b8b3436a2cdfd6f5 2025-08-06T15:46:06+08:00 Yunzhe Jia sync with calrt API
62 1cbf442f50a154aac0bf35d7b8b3436a2cdfd6f5 ba67d6c03fed3193987a4ef13050e6e2a4451df4 2025-07-24T15:50:19+08:00 Yunzhe Jia 1.sync with calrt prefill,decode,kv_update op 2.add hw pattern untile function
63 ba67d6c03fed3193987a4ef13050e6e2a4451df4 8f52c6f8abb2ed9ad967cc0bfb90acb073011193 2025-06-26T17:42:32+08:00 Yunzhe Jia llama-calrt: infer-op: copy data from output buffer to dst-tensor.data
64 8f52c6f8abb2ed9ad967cc0bfb90acb073011193 d2f325130c4ed77a3dcff2c23a926587fb08e2cc 2025-06-26T15:10:45+08:00 Yunzhe Jia Squashed commit of the following:
65 d2f325130c4ed77a3dcff2c23a926587fb08e2cc 6391ee7ffd97e723dfbdcc32f001e1b95a63cba6 2025-06-17T11:53:33+08:00 Yunzhe Jia calrt: add input_token in graph; input_token will be copy to calrt_in_buffer
66 b9850050a5b5147cb2e6720b98ed8c1e8e02eff9 933b205c32551848589b8339437d778cb4f2a46d 2025-06-06T17:25:52+08:00 Yunzhe Jia calrt: add call chain for using calrt::infer
67 33fea9a8592fd338abe279b89350a3af2e0ff1f7 806f05a353d322e97d97e02f910de2b408a8b4ab 2025-06-06T17:25:52+08:00 Yunzhe Jia calrt: add load calbin
68 806f05a353d322e97d97e02f910de2b408a8b4ab ec9e0301fef6476df83e94842c3b625501c95566 2025-05-30T09:45:37+08:00 Yunzhe Jia add calrt demo
@@ -0,0 +1,24 @@
f131bf1908b8c5dd1f49d7ae7f616506fc471666 33d96dae28e17208ef61a71dba40cda3c04f135a 2026-05-27T09:38:51+08:00 wangbomeng fix patch of qwen2.5vl,n_patch of minicpm = 64,fix n_ctx_slot,comment out M-ROPE
38ca6895815671a87ceec86b4aa4eb976580ce76 ddd60c928224b52eb4e1e60e01e8a1ecbb80ee45 2026-05-20T16:37:13+08:00 Yunzhe Jia Add support for cal-llm profile dumping to JSONL file
2716130010c58f1cdd9d94f0e2f8e047bc92dc66 b35bda124ccd4ed581dd6088d3ffa4931c2809b6 2026-05-18T08:40:54+08:00 Yunzhe Jia fix n_ctx_slot error by adding runtime capacity loading for cal-llm
3b14ed556c15529fe1f94b649f49db7156dfaf67 dde8b8228081769c8d8f1e0751d47fa7875f8423 2026-05-14T14:34:25+08:00 Yunzhe Jia - Removed references to CALRT from clip.h, mtmd-helper.cpp, mtmd-helper.h, mtmd.cpp, and mtmd.h. - Updated server.cpp to conditionally include CAL-LLM support. - Introduced option LLAMA_SERVER_USE_CAL_LLM in CMakeLists.txt to enable CAL-LLM integration. - Refactored server context to handle CAL-LLM requests and responses. - Updated image processing logic to remove CALRT-specific implementations. - Ensured compatibility with existing llama functionality while integrating new CAL-LLM features.
99dd308adb8488fa869bb669e3335e646a938eff 06c7852e99e34c71e24e3ef6001cb54c72970e4d 2026-04-21T15:50:01+08:00 wangbomeng tag: v0.2.1 server: fix max_seq_len
ed62eb33447f993d578e156a3c7e38c91b420ece 015e988a271573a7c11e2a4b45084e1219d69d50 2026-04-21T15:05:22+08:00 wangbomeng try server-test:not success
d8b2aaa00049978cebac15041f960d75b552f97b b6f29ec8140028619efaa50aa6e73146cecf631d 2026-04-13T11:23:44+08:00 wangbomeng server: fix context-shift
b6f29ec8140028619efaa50aa6e73146cecf631d 6d55eae7e76b768acfcec045b8e84cded8ae3b55 2026-04-13T11:23:31+08:00 wangbomeng server: fix context-shift
a2d5bf362d6c9a546f9deadf4f8975605a915d33 bd3a57a11aa008e0b5dc2a30f82fcd3a02587208 2026-04-09T21:01:46+08:00 Bomeng Wang server: comment fixed time
b8153b6b8f244b223c9f4c2940ae1f212634519e 82842cfc3fa3d5c004c4540aeff8a81f38509bee 2026-04-09T15:07:02+08:00 wangbomeng server: fix limit tokens to max_seq_len
82842cfc3fa3d5c004c4540aeff8a81f38509bee 622a22991089c6debd5f4b57738f3df3a0bda8b5 2026-04-09T15:06:26+08:00 wangbomeng server: fix limit tokens to max_seq_len
622a22991089c6debd5f4b57738f3df3a0bda8b5 5f47a738ba56a37d0ff281a16212f41979568e35 2026-04-09T10:36:31+08:00 wangbomeng server: comment circle print
ecf01a17651cd7b1e8b85fd6075e83831463ee23 99d2078e89305035d87d966cee7987c7d50b3925 2026-04-09T09:47:55+08:00 Yunzhe Jia fix n_parallel problem
18814f9bf1a423ebe8f32d6043c9cbc5b21b0218 bbee06d6d851e3f84f75b578047967d7e0e4a8dc 2026-04-08T13:55:52+08:00 wangbomeng server : reset inference time
398ecf71f5f574037ce33f84dd1576fa164909ad 6d5e83902bdd3142a8ff0d3db19f02a8619e95a0 2026-03-27T02:01:23+08:00 wangbomeng rm llama-server_old.cpp
6d5e83902bdd3142a8ff0d3db19f02a8619e95a0 e4eaab700333490e80ebefc8d023f6c1adfcc312 2026-03-27T00:57:11+08:00 wangbomeng server: printf calrt commit ID
41e6636ea1fb3884e41fb2023f92b0e7262ef09b d0a1b2c758440720d42fa108b3444f54593daa73 2026-03-12T16:36:07+08:00 Bomeng Wang tag: v0.0.1 server: correct the max_seq_len judgment
583c387efaf7bc030574e554088de79d09a27fbd 0edc14a60a2d5596f71d728c655e3523da924d89 2026-02-27T02:24:56+08:00 wangbomeng caserver: lim generated tokens to n_ctx_per_seq
0edc14a60a2d5596f71d728c655e3523da924d89 aa0a17d719326a63e0d6fea60aa0ced44e7abc33 2026-02-27T01:57:39+08:00 wangbomeng caserver: limit generated tokens to n_ctx_per_seq
d81d7b190ff5f21325167936496dfe5ab48b922e e492f5dc8cec17529f53ef2bbdf7b502107f8148 1f5accb8d0056e6099cd5b772b1cb787dd590a13 2025-11-04T14:43:32+08:00 Yunzhe Jia Merge branch 'master' into dev
98c8269abefdfa8fde47dfb2769ceebc8b704e86 2790ecc304e384d9075c55d0628d8bf440025dc4 2025-09-30T17:42:57+08:00 Yunzhe Jia server: adapt to calrt
dcbe998a6d8f13b6c9cb36bbe7b355ced2ac3842 87932ec016f0ec81e98a13ce5212851f8c12458a 2025-09-05T14:34:07+08:00 Yunzhe Jia add calrt API used in server side
0115cfb7c1dec0753aecb34f3af4338bf9de8eeb 3a617cb18121a85eed17ac5585788810c5d9c1e0 0d5a470223fc90b6b6807921d68011ff06ae7f9e 2025-08-26T15:19:56+08:00 Yunzhe Jia Merge branch 'master' into dev
8f52c6f8abb2ed9ad967cc0bfb90acb073011193 d2f325130c4ed77a3dcff2c23a926587fb08e2cc 2025-06-26T15:10:45+08:00 Yunzhe Jia Squashed commit of the following:
1 f131bf1908b8c5dd1f49d7ae7f616506fc471666 33d96dae28e17208ef61a71dba40cda3c04f135a 2026-05-27T09:38:51+08:00 wangbomeng fix patch of qwen2.5vl,n_patch of minicpm = 64,fix n_ctx_slot,comment out M-ROPE
2 38ca6895815671a87ceec86b4aa4eb976580ce76 ddd60c928224b52eb4e1e60e01e8a1ecbb80ee45 2026-05-20T16:37:13+08:00 Yunzhe Jia Add support for cal-llm profile dumping to JSONL file
3 2716130010c58f1cdd9d94f0e2f8e047bc92dc66 b35bda124ccd4ed581dd6088d3ffa4931c2809b6 2026-05-18T08:40:54+08:00 Yunzhe Jia fix n_ctx_slot error by adding runtime capacity loading for cal-llm
4 3b14ed556c15529fe1f94b649f49db7156dfaf67 dde8b8228081769c8d8f1e0751d47fa7875f8423 2026-05-14T14:34:25+08:00 Yunzhe Jia - Removed references to CALRT from clip.h, mtmd-helper.cpp, mtmd-helper.h, mtmd.cpp, and mtmd.h. - Updated server.cpp to conditionally include CAL-LLM support. - Introduced option LLAMA_SERVER_USE_CAL_LLM in CMakeLists.txt to enable CAL-LLM integration. - Refactored server context to handle CAL-LLM requests and responses. - Updated image processing logic to remove CALRT-specific implementations. - Ensured compatibility with existing llama functionality while integrating new CAL-LLM features.
5 99dd308adb8488fa869bb669e3335e646a938eff 06c7852e99e34c71e24e3ef6001cb54c72970e4d 2026-04-21T15:50:01+08:00 wangbomeng tag: v0.2.1 server: fix max_seq_len
6 ed62eb33447f993d578e156a3c7e38c91b420ece 015e988a271573a7c11e2a4b45084e1219d69d50 2026-04-21T15:05:22+08:00 wangbomeng try server-test:not success
7 d8b2aaa00049978cebac15041f960d75b552f97b b6f29ec8140028619efaa50aa6e73146cecf631d 2026-04-13T11:23:44+08:00 wangbomeng server: fix context-shift
8 b6f29ec8140028619efaa50aa6e73146cecf631d 6d55eae7e76b768acfcec045b8e84cded8ae3b55 2026-04-13T11:23:31+08:00 wangbomeng server: fix context-shift
9 a2d5bf362d6c9a546f9deadf4f8975605a915d33 bd3a57a11aa008e0b5dc2a30f82fcd3a02587208 2026-04-09T21:01:46+08:00 Bomeng Wang server: comment fixed time
10 b8153b6b8f244b223c9f4c2940ae1f212634519e 82842cfc3fa3d5c004c4540aeff8a81f38509bee 2026-04-09T15:07:02+08:00 wangbomeng server: fix limit tokens to max_seq_len
11 82842cfc3fa3d5c004c4540aeff8a81f38509bee 622a22991089c6debd5f4b57738f3df3a0bda8b5 2026-04-09T15:06:26+08:00 wangbomeng server: fix limit tokens to max_seq_len
12 622a22991089c6debd5f4b57738f3df3a0bda8b5 5f47a738ba56a37d0ff281a16212f41979568e35 2026-04-09T10:36:31+08:00 wangbomeng server: comment circle print
13 ecf01a17651cd7b1e8b85fd6075e83831463ee23 99d2078e89305035d87d966cee7987c7d50b3925 2026-04-09T09:47:55+08:00 Yunzhe Jia fix n_parallel problem
14 18814f9bf1a423ebe8f32d6043c9cbc5b21b0218 bbee06d6d851e3f84f75b578047967d7e0e4a8dc 2026-04-08T13:55:52+08:00 wangbomeng server : reset inference time
15 398ecf71f5f574037ce33f84dd1576fa164909ad 6d5e83902bdd3142a8ff0d3db19f02a8619e95a0 2026-03-27T02:01:23+08:00 wangbomeng rm llama-server_old.cpp
16 6d5e83902bdd3142a8ff0d3db19f02a8619e95a0 e4eaab700333490e80ebefc8d023f6c1adfcc312 2026-03-27T00:57:11+08:00 wangbomeng server: printf calrt commit ID
17 41e6636ea1fb3884e41fb2023f92b0e7262ef09b d0a1b2c758440720d42fa108b3444f54593daa73 2026-03-12T16:36:07+08:00 Bomeng Wang tag: v0.0.1 server: correct the max_seq_len judgment
18 583c387efaf7bc030574e554088de79d09a27fbd 0edc14a60a2d5596f71d728c655e3523da924d89 2026-02-27T02:24:56+08:00 wangbomeng caserver: lim generated tokens to n_ctx_per_seq
19 0edc14a60a2d5596f71d728c655e3523da924d89 aa0a17d719326a63e0d6fea60aa0ced44e7abc33 2026-02-27T01:57:39+08:00 wangbomeng caserver: limit generated tokens to n_ctx_per_seq
20 d81d7b190ff5f21325167936496dfe5ab48b922e e492f5dc8cec17529f53ef2bbdf7b502107f8148 1f5accb8d0056e6099cd5b772b1cb787dd590a13 2025-11-04T14:43:32+08:00 Yunzhe Jia Merge branch 'master' into dev
21 98c8269abefdfa8fde47dfb2769ceebc8b704e86 2790ecc304e384d9075c55d0628d8bf440025dc4 2025-09-30T17:42:57+08:00 Yunzhe Jia server: adapt to calrt
22 dcbe998a6d8f13b6c9cb36bbe7b355ced2ac3842 87932ec016f0ec81e98a13ce5212851f8c12458a 2025-09-05T14:34:07+08:00 Yunzhe Jia add calrt API used in server side
23 0115cfb7c1dec0753aecb34f3af4338bf9de8eeb 3a617cb18121a85eed17ac5585788810c5d9c1e0 0d5a470223fc90b6b6807921d68011ff06ae7f9e 2025-08-26T15:19:56+08:00 Yunzhe Jia Merge branch 'master' into dev
24 8f52c6f8abb2ed9ad967cc0bfb90acb073011193 d2f325130c4ed77a3dcff2c23a926587fb08e2cc 2025-06-26T15:10:45+08:00 Yunzhe Jia Squashed commit of the following:
@@ -0,0 +1,17 @@
fd9bd632f346085920d523dd307a3e4c11cc0a05 e08e473cf292ba73789769b993bb35bcdfc31689 2026-06-01T14:15:35+08:00 wangbomeng HEAD -> dev, origin/dev llama-bench: fix device-info
e08e473cf292ba73789769b993bb35bcdfc31689 f86112d6758298241ab2fa84ad4f0f7b1ace35c6 2026-06-01T11:47:01+08:00 wangbomeng llama-bench:add device-info
ebce9e1a548c2329aa97f53b8b2ad50d968088dc e850ff4de25ad1221abc9bf3bb30df252ccd9c36 2026-05-27T09:38:00+08:00 Yunzhe Jia origin/runtime_replace Refactor cal-llm integration by removing runtime capacity loading and adjusting request handling
e850ff4de25ad1221abc9bf3bb30df252ccd9c36 9985688f7fa96f755882f96a2cd8a18114fdc42d 2026-05-26T10:59:45+08:00 Yunzhe Jia Enhance cal-llm integration by adding runtime checks for CALRT_LIBRARY and updating link settings for Linux and Windows
38ca6895815671a87ceec86b4aa4eb976580ce76 ddd60c928224b52eb4e1e60e01e8a1ecbb80ee45 2026-05-20T16:37:13+08:00 Yunzhe Jia Add support for cal-llm profile dumping to JSONL file
2716130010c58f1cdd9d94f0e2f8e047bc92dc66 b35bda124ccd4ed581dd6088d3ffa4931c2809b6 2026-05-18T08:40:54+08:00 Yunzhe Jia fix n_ctx_slot error by adding runtime capacity loading for cal-llm
a43741244a646d3f8fa3ff01bb9b7d059223d0a5 b2003d6c90ef0fa26ab9e930ba3e22b355eb3d39 2026-05-15T14:39:53+08:00 wangbomeng run llama-passkey successfully, fix llama-bench, copy 3 times input to infer qwen2.5vl
1bec0db5a675ddc60fb793be2a746e8f3c8855dc 465df20c3e1f3f58d0f5531c796e0941a49c32b0 2026-04-30T16:02:59+08:00 wangbomeng origin/dev-ben bench: support 2 calbins
eeeef3f6d6a5aad9296323ca15d9d929745b8932 431ad6f1c787f1b47e9e7be14b2e1a7d8565485c 2026-04-28T16:16:19+08:00 wangbomeng add unknown time info: prefill and decode
a2d5bf362d6c9a546f9deadf4f8975605a915d33 bd3a57a11aa008e0b5dc2a30f82fcd3a02587208 2026-04-09T21:01:46+08:00 Bomeng Wang server: comment fixed time
18814f9bf1a423ebe8f32d6043c9cbc5b21b0218 bbee06d6d851e3f84f75b578047967d7e0e4a8dc 2026-04-08T13:55:52+08:00 wangbomeng server : reset inference time
bbee06d6d851e3f84f75b578047967d7e0e4a8dc e126c21ed7b793b648d63533ea7ee30885f5a82a 2026-04-08T11:29:36+08:00 wangbomeng calrt: add test time print
1e8a16cd0e3ad3c9a0f8746852a0a38c6e52322e 893e52bda0fee99bbda1521ea733a760bc4201f1 2026-04-01T10:14:22+08:00 wangbomeng calrt: fix slice and add infer/copy time
98e8f9acfe87cd93646482cb2d942b8a132f0852 8c8152a04036bb0d4756a4e08e54f514dae4e64d 2025-12-10T00:20:57+08:00 Yunzhe Jia add timestamp
5d2387931528fbe04aa8d66de935147efb65ca4d e6285a748657add8d974b78ca920c5b41753ee12 2025-12-08T16:40:34+08:00 Yunzhe Jia add timestamp for one decode process
0115cfb7c1dec0753aecb34f3af4338bf9de8eeb 3a617cb18121a85eed17ac5585788810c5d9c1e0 0d5a470223fc90b6b6807921d68011ff06ae7f9e 2025-08-26T15:19:56+08:00 Yunzhe Jia Merge branch 'master' into dev
8f52c6f8abb2ed9ad967cc0bfb90acb073011193 d2f325130c4ed77a3dcff2c23a926587fb08e2cc 2025-06-26T15:10:45+08:00 Yunzhe Jia Squashed commit of the following:
1 fd9bd632f346085920d523dd307a3e4c11cc0a05 e08e473cf292ba73789769b993bb35bcdfc31689 2026-06-01T14:15:35+08:00 wangbomeng HEAD -> dev, origin/dev llama-bench: fix device-info
2 e08e473cf292ba73789769b993bb35bcdfc31689 f86112d6758298241ab2fa84ad4f0f7b1ace35c6 2026-06-01T11:47:01+08:00 wangbomeng llama-bench:add device-info
3 ebce9e1a548c2329aa97f53b8b2ad50d968088dc e850ff4de25ad1221abc9bf3bb30df252ccd9c36 2026-05-27T09:38:00+08:00 Yunzhe Jia origin/runtime_replace Refactor cal-llm integration by removing runtime capacity loading and adjusting request handling
4 e850ff4de25ad1221abc9bf3bb30df252ccd9c36 9985688f7fa96f755882f96a2cd8a18114fdc42d 2026-05-26T10:59:45+08:00 Yunzhe Jia Enhance cal-llm integration by adding runtime checks for CALRT_LIBRARY and updating link settings for Linux and Windows
5 38ca6895815671a87ceec86b4aa4eb976580ce76 ddd60c928224b52eb4e1e60e01e8a1ecbb80ee45 2026-05-20T16:37:13+08:00 Yunzhe Jia Add support for cal-llm profile dumping to JSONL file
6 2716130010c58f1cdd9d94f0e2f8e047bc92dc66 b35bda124ccd4ed581dd6088d3ffa4931c2809b6 2026-05-18T08:40:54+08:00 Yunzhe Jia fix n_ctx_slot error by adding runtime capacity loading for cal-llm
7 a43741244a646d3f8fa3ff01bb9b7d059223d0a5 b2003d6c90ef0fa26ab9e930ba3e22b355eb3d39 2026-05-15T14:39:53+08:00 wangbomeng run llama-passkey successfully, fix llama-bench, copy 3 times input to infer qwen2.5vl
8 1bec0db5a675ddc60fb793be2a746e8f3c8855dc 465df20c3e1f3f58d0f5531c796e0941a49c32b0 2026-04-30T16:02:59+08:00 wangbomeng origin/dev-ben bench: support 2 calbins
9 eeeef3f6d6a5aad9296323ca15d9d929745b8932 431ad6f1c787f1b47e9e7be14b2e1a7d8565485c 2026-04-28T16:16:19+08:00 wangbomeng add unknown time info: prefill and decode
10 a2d5bf362d6c9a546f9deadf4f8975605a915d33 bd3a57a11aa008e0b5dc2a30f82fcd3a02587208 2026-04-09T21:01:46+08:00 Bomeng Wang server: comment fixed time
11 18814f9bf1a423ebe8f32d6043c9cbc5b21b0218 bbee06d6d851e3f84f75b578047967d7e0e4a8dc 2026-04-08T13:55:52+08:00 wangbomeng server : reset inference time
12 bbee06d6d851e3f84f75b578047967d7e0e4a8dc e126c21ed7b793b648d63533ea7ee30885f5a82a 2026-04-08T11:29:36+08:00 wangbomeng calrt: add test time print
13 1e8a16cd0e3ad3c9a0f8746852a0a38c6e52322e 893e52bda0fee99bbda1521ea733a760bc4201f1 2026-04-01T10:14:22+08:00 wangbomeng calrt: fix slice and add infer/copy time
14 98e8f9acfe87cd93646482cb2d942b8a132f0852 8c8152a04036bb0d4756a4e08e54f514dae4e64d 2025-12-10T00:20:57+08:00 Yunzhe Jia add timestamp
15 5d2387931528fbe04aa8d66de935147efb65ca4d e6285a748657add8d974b78ca920c5b41753ee12 2025-12-08T16:40:34+08:00 Yunzhe Jia add timestamp for one decode process
16 0115cfb7c1dec0753aecb34f3af4338bf9de8eeb 3a617cb18121a85eed17ac5585788810c5d9c1e0 0d5a470223fc90b6b6807921d68011ff06ae7f9e 2025-08-26T15:19:56+08:00 Yunzhe Jia Merge branch 'master' into dev
17 8f52c6f8abb2ed9ad967cc0bfb90acb073011193 d2f325130c4ed77a3dcff2c23a926587fb08e2cc 2025-06-26T15:10:45+08:00 Yunzhe Jia Squashed commit of the following:
@@ -0,0 +1,5 @@
ebce9e1a548c2329aa97f53b8b2ad50d968088dc e850ff4de25ad1221abc9bf3bb30df252ccd9c36 2026-05-27T09:38:00+08:00 Yunzhe Jia origin/runtime_replace Refactor cal-llm integration by removing runtime capacity loading and adjusting request handling
2716130010c58f1cdd9d94f0e2f8e047bc92dc66 b35bda124ccd4ed581dd6088d3ffa4931c2809b6 2026-05-18T08:40:54+08:00 Yunzhe Jia fix n_ctx_slot error by adding runtime capacity loading for cal-llm
1bec0db5a675ddc60fb793be2a746e8f3c8855dc 465df20c3e1f3f58d0f5531c796e0941a49c32b0 2026-04-30T16:02:59+08:00 wangbomeng origin/dev-ben bench: support 2 calbins
6787a53ab9b4897c5a7b51a4062d7b90e6697d35 e1a76abf66178ea85656479a5e19aea7785c09f4 2026-04-24T09:22:02+08:00 wangbomeng calrt:input of multimodel from fp32 to bf16
059009eeaf20a569abfbac5eb37dad3bb9376428 1b073661d1311b5300173993b9f31ee7241d8606 2026-03-10T07:04:22+08:00 wangbomeng calrt: add multimodel
1 ebce9e1a548c2329aa97f53b8b2ad50d968088dc e850ff4de25ad1221abc9bf3bb30df252ccd9c36 2026-05-27T09:38:00+08:00 Yunzhe Jia origin/runtime_replace Refactor cal-llm integration by removing runtime capacity loading and adjusting request handling
2 2716130010c58f1cdd9d94f0e2f8e047bc92dc66 b35bda124ccd4ed581dd6088d3ffa4931c2809b6 2026-05-18T08:40:54+08:00 Yunzhe Jia fix n_ctx_slot error by adding runtime capacity loading for cal-llm
3 1bec0db5a675ddc60fb793be2a746e8f3c8855dc 465df20c3e1f3f58d0f5531c796e0941a49c32b0 2026-04-30T16:02:59+08:00 wangbomeng origin/dev-ben bench: support 2 calbins
4 6787a53ab9b4897c5a7b51a4062d7b90e6697d35 e1a76abf66178ea85656479a5e19aea7785c09f4 2026-04-24T09:22:02+08:00 wangbomeng calrt:input of multimodel from fp32 to bf16
5 059009eeaf20a569abfbac5eb37dad3bb9376428 1b073661d1311b5300173993b9f31ee7241d8606 2026-03-10T07:04:22+08:00 wangbomeng calrt: add multimodel
@@ -0,0 +1,31 @@
d1bc743c10080fed1253686ce01749b42611ded4 2f201160b1960fd7be18b70d5770599d7082dd2f 2026-05-28T14:23:06+08:00 wangbomeng set u_batch = max_seq_len
f131bf1908b8c5dd1f49d7ae7f616506fc471666 33d96dae28e17208ef61a71dba40cda3c04f135a 2026-05-27T09:38:51+08:00 wangbomeng fix patch of qwen2.5vl,n_patch of minicpm = 64,fix n_ctx_slot,comment out M-ROPE
1921024604db640f09ade83c8a437ebf15bde360 d028722a12c5a463cc97207787cfd03d7a2590b0 5af229fe518ee2d761ab8ae2a69f7a9aaa9057f4 2026-05-21T14:08:14+08:00 Bomeng Wang refs/stash WIP on dev: d028722a replace cparam.n_ubatch with n_ubatch()
5af229fe518ee2d761ab8ae2a69f7a9aaa9057f4 d028722a12c5a463cc97207787cfd03d7a2590b0 2026-05-21T14:08:14+08:00 Bomeng Wang index on dev: d028722a replace cparam.n_ubatch with n_ubatch()
d028722a12c5a463cc97207787cfd03d7a2590b0 63442fde8dc285817f725bd6c5fae80f478a3813 2026-05-20T14:41:05+08:00 wangbomeng replace cparam.n_ubatch with n_ubatch()
63442fde8dc285817f725bd6c5fae80f478a3813 fc3f4a9fab88e98eff8eeca8cbc6617333edba2c 2026-05-20T11:47:42+08:00 wangbomeng fix ubatch and cmakelist
2716130010c58f1cdd9d94f0e2f8e047bc92dc66 b35bda124ccd4ed581dd6088d3ffa4931c2809b6 2026-05-18T08:40:54+08:00 Yunzhe Jia fix n_ctx_slot error by adding runtime capacity loading for cal-llm
3b14ed556c15529fe1f94b649f49db7156dfaf67 dde8b8228081769c8d8f1e0751d47fa7875f8423 2026-05-14T14:34:25+08:00 Yunzhe Jia - Removed references to CALRT from clip.h, mtmd-helper.cpp, mtmd-helper.h, mtmd.cpp, and mtmd.h. - Updated server.cpp to conditionally include CAL-LLM support. - Introduced option LLAMA_SERVER_USE_CAL_LLM in CMakeLists.txt to enable CAL-LLM integration. - Refactored server context to handle CAL-LLM requests and responses. - Updated image processing logic to remove CALRT-specific implementations. - Ensured compatibility with existing llama functionality while integrating new CAL-LLM features.
5d219bfcef239c1e3ddd1baecc0514a9462ff6a8 6787a53ab9b4897c5a7b51a4062d7b90e6697d35 2026-04-24T09:31:32+08:00 wangbomeng calrt: recover base = batch_index * dict_len
d8b2aaa00049978cebac15041f960d75b552f97b b6f29ec8140028619efaa50aa6e73146cecf631d 2026-04-13T11:23:44+08:00 wangbomeng server: fix context-shift
b6f29ec8140028619efaa50aa6e73146cecf631d 6d55eae7e76b768acfcec045b8e84cded8ae3b55 2026-04-13T11:23:31+08:00 wangbomeng server: fix context-shift
42a181674565411efa5c8b318bc77d6fd084df8a bd3a57a11aa008e0b5dc2a30f82fcd3a02587208 2026-04-10T09:06:55+08:00 Yunzhe Jia fix prompt_cache issue
99d2078e89305035d87d966cee7987c7d50b3925 9626239f5a9e568c9975d67dd6745fef90279a87 2026-04-08T19:01:16+08:00 Yunzhe Jia fix buffer resize problem
4e194ecc6c4b8ebe4c72d93f6055e3605dbfcefa 16cbf81a731f5839a2f6b0eb9d8539826353748b 2026-03-24T01:59:03+08:00 wangbomeng calrt: fix ubatch.embd cpy
07817cefc14fa359dcecad0630defd3610f8f5c8 b2c45d8ddefb7ec09435231c8ec5b736fabf9c91 2026-03-10T16:32:07+08:00 Yunzhe Jia fix kv issue
7ddafbdcb9426ae3af016925b8b596f11e8742d0 059009eeaf20a569abfbac5eb37dad3bb9376428 2026-03-10T07:13:04+08:00 wangbomeng calrt: commented out cal_ctx->encode(batch)
b2c45d8ddefb7ec09435231c8ec5b736fabf9c91 c6ea3f0d2468e3b8eab5de80bacee7fe4c9dd3d7 2026-03-09T15:03:26+08:00 Bomeng Wang clart: past_kv_len = n_tokens
7a3a9a0e76bb5f530beafcfe52e87e388e93117a 583c387efaf7bc030574e554088de79d09a27fbd 2026-03-05T07:24:59+08:00 wangbomeng calrt_infer: fix past_kv_len
583c387efaf7bc030574e554088de79d09a27fbd 0edc14a60a2d5596f71d728c655e3523da924d89 2026-02-27T02:24:56+08:00 wangbomeng caserver: lim generated tokens to n_ctx_per_seq
0edc14a60a2d5596f71d728c655e3523da924d89 aa0a17d719326a63e0d6fea60aa0ced44e7abc33 2026-02-27T01:57:39+08:00 wangbomeng caserver: limit generated tokens to n_ctx_per_seq
365eb0b719e30b0f9e348d854f11c9c3f954a96e 886cd1fb3b217efcf51c46209fcb694022346797 2026-02-07T09:05:17+08:00 Yunzhe Jia comment out pos buffer file
6b1ecdbbe3cc72ed8888be38f9e934cfd79b9fbb 240d9bb75241c91896afe125f2fc74698a7395f3 2025-11-25T17:06:14+08:00 Yunzhe Jia add kv_tensor for pld test
d81d7b190ff5f21325167936496dfe5ab48b922e e492f5dc8cec17529f53ef2bbdf7b502107f8148 1f5accb8d0056e6099cd5b772b1cb787dd590a13 2025-11-04T14:43:32+08:00 Yunzhe Jia Merge branch 'master' into dev
c20c0a5c0c44179f5267a262546624854b1203d1 62425b3a7e8b169a3bbe6ce8c7324513a7fcee8c 2025-10-20T14:41:08+08:00 Yunzhe Jia kv: turn on common-prefix mtmd: fix output size bug
62425b3a7e8b169a3bbe6ce8c7324513a7fcee8c 76a63a2998286c1649de2496bccb7d8a46549895 2025-10-16T17:34:39+08:00 Yunzhe Jia kv: let seq_rm free whole seq since current hw-op cannot support common-prefix
76a63a2998286c1649de2496bccb7d8a46549895 b67217078aa748b06e1b2269d88dd18c0aca2c26 2025-10-16T16:31:15+08:00 Yunzhe Jia kv: fix common-prefix bug by implementing llama_memory_seq_rm
0115cfb7c1dec0753aecb34f3af4338bf9de8eeb 3a617cb18121a85eed17ac5585788810c5d9c1e0 0d5a470223fc90b6b6807921d68011ff06ae7f9e 2025-08-26T15:19:56+08:00 Yunzhe Jia Merge branch 'master' into dev
1cbf442f50a154aac0bf35d7b8b3436a2cdfd6f5 ba67d6c03fed3193987a4ef13050e6e2a4451df4 2025-07-24T15:50:19+08:00 Yunzhe Jia 1.sync with calrt prefill,decode,kv_update op 2.add hw pattern untile function
ba67d6c03fed3193987a4ef13050e6e2a4451df4 8f52c6f8abb2ed9ad967cc0bfb90acb073011193 2025-06-26T17:42:32+08:00 Yunzhe Jia llama-calrt: infer-op: copy data from output buffer to dst-tensor.data
8f52c6f8abb2ed9ad967cc0bfb90acb073011193 d2f325130c4ed77a3dcff2c23a926587fb08e2cc 2025-06-26T15:10:45+08:00 Yunzhe Jia Squashed commit of the following:
d2f325130c4ed77a3dcff2c23a926587fb08e2cc 6391ee7ffd97e723dfbdcc32f001e1b95a63cba6 2025-06-17T11:53:33+08:00 Yunzhe Jia calrt: add input_token in graph; input_token will be copy to calrt_in_buffer
1 d1bc743c10080fed1253686ce01749b42611ded4 2f201160b1960fd7be18b70d5770599d7082dd2f 2026-05-28T14:23:06+08:00 wangbomeng set u_batch = max_seq_len
2 f131bf1908b8c5dd1f49d7ae7f616506fc471666 33d96dae28e17208ef61a71dba40cda3c04f135a 2026-05-27T09:38:51+08:00 wangbomeng fix patch of qwen2.5vl,n_patch of minicpm = 64,fix n_ctx_slot,comment out M-ROPE
3 1921024604db640f09ade83c8a437ebf15bde360 d028722a12c5a463cc97207787cfd03d7a2590b0 5af229fe518ee2d761ab8ae2a69f7a9aaa9057f4 2026-05-21T14:08:14+08:00 Bomeng Wang refs/stash WIP on dev: d028722a replace cparam.n_ubatch with n_ubatch()
4 5af229fe518ee2d761ab8ae2a69f7a9aaa9057f4 d028722a12c5a463cc97207787cfd03d7a2590b0 2026-05-21T14:08:14+08:00 Bomeng Wang index on dev: d028722a replace cparam.n_ubatch with n_ubatch()
5 d028722a12c5a463cc97207787cfd03d7a2590b0 63442fde8dc285817f725bd6c5fae80f478a3813 2026-05-20T14:41:05+08:00 wangbomeng replace cparam.n_ubatch with n_ubatch()
6 63442fde8dc285817f725bd6c5fae80f478a3813 fc3f4a9fab88e98eff8eeca8cbc6617333edba2c 2026-05-20T11:47:42+08:00 wangbomeng fix ubatch and cmakelist
7 2716130010c58f1cdd9d94f0e2f8e047bc92dc66 b35bda124ccd4ed581dd6088d3ffa4931c2809b6 2026-05-18T08:40:54+08:00 Yunzhe Jia fix n_ctx_slot error by adding runtime capacity loading for cal-llm
8 3b14ed556c15529fe1f94b649f49db7156dfaf67 dde8b8228081769c8d8f1e0751d47fa7875f8423 2026-05-14T14:34:25+08:00 Yunzhe Jia - Removed references to CALRT from clip.h, mtmd-helper.cpp, mtmd-helper.h, mtmd.cpp, and mtmd.h. - Updated server.cpp to conditionally include CAL-LLM support. - Introduced option LLAMA_SERVER_USE_CAL_LLM in CMakeLists.txt to enable CAL-LLM integration. - Refactored server context to handle CAL-LLM requests and responses. - Updated image processing logic to remove CALRT-specific implementations. - Ensured compatibility with existing llama functionality while integrating new CAL-LLM features.
9 5d219bfcef239c1e3ddd1baecc0514a9462ff6a8 6787a53ab9b4897c5a7b51a4062d7b90e6697d35 2026-04-24T09:31:32+08:00 wangbomeng calrt: recover base = batch_index * dict_len
10 d8b2aaa00049978cebac15041f960d75b552f97b b6f29ec8140028619efaa50aa6e73146cecf631d 2026-04-13T11:23:44+08:00 wangbomeng server: fix context-shift
11 b6f29ec8140028619efaa50aa6e73146cecf631d 6d55eae7e76b768acfcec045b8e84cded8ae3b55 2026-04-13T11:23:31+08:00 wangbomeng server: fix context-shift
12 42a181674565411efa5c8b318bc77d6fd084df8a bd3a57a11aa008e0b5dc2a30f82fcd3a02587208 2026-04-10T09:06:55+08:00 Yunzhe Jia fix prompt_cache issue
13 99d2078e89305035d87d966cee7987c7d50b3925 9626239f5a9e568c9975d67dd6745fef90279a87 2026-04-08T19:01:16+08:00 Yunzhe Jia fix buffer resize problem
14 4e194ecc6c4b8ebe4c72d93f6055e3605dbfcefa 16cbf81a731f5839a2f6b0eb9d8539826353748b 2026-03-24T01:59:03+08:00 wangbomeng calrt: fix ubatch.embd cpy
15 07817cefc14fa359dcecad0630defd3610f8f5c8 b2c45d8ddefb7ec09435231c8ec5b736fabf9c91 2026-03-10T16:32:07+08:00 Yunzhe Jia fix kv issue
16 7ddafbdcb9426ae3af016925b8b596f11e8742d0 059009eeaf20a569abfbac5eb37dad3bb9376428 2026-03-10T07:13:04+08:00 wangbomeng calrt: commented out cal_ctx->encode(batch)
17 b2c45d8ddefb7ec09435231c8ec5b736fabf9c91 c6ea3f0d2468e3b8eab5de80bacee7fe4c9dd3d7 2026-03-09T15:03:26+08:00 Bomeng Wang clart: past_kv_len = n_tokens
18 7a3a9a0e76bb5f530beafcfe52e87e388e93117a 583c387efaf7bc030574e554088de79d09a27fbd 2026-03-05T07:24:59+08:00 wangbomeng calrt_infer: fix past_kv_len
19 583c387efaf7bc030574e554088de79d09a27fbd 0edc14a60a2d5596f71d728c655e3523da924d89 2026-02-27T02:24:56+08:00 wangbomeng caserver: lim generated tokens to n_ctx_per_seq
20 0edc14a60a2d5596f71d728c655e3523da924d89 aa0a17d719326a63e0d6fea60aa0ced44e7abc33 2026-02-27T01:57:39+08:00 wangbomeng caserver: limit generated tokens to n_ctx_per_seq
21 365eb0b719e30b0f9e348d854f11c9c3f954a96e 886cd1fb3b217efcf51c46209fcb694022346797 2026-02-07T09:05:17+08:00 Yunzhe Jia comment out pos buffer file
22 6b1ecdbbe3cc72ed8888be38f9e934cfd79b9fbb 240d9bb75241c91896afe125f2fc74698a7395f3 2025-11-25T17:06:14+08:00 Yunzhe Jia add kv_tensor for pld test
23 d81d7b190ff5f21325167936496dfe5ab48b922e e492f5dc8cec17529f53ef2bbdf7b502107f8148 1f5accb8d0056e6099cd5b772b1cb787dd590a13 2025-11-04T14:43:32+08:00 Yunzhe Jia Merge branch 'master' into dev
24 c20c0a5c0c44179f5267a262546624854b1203d1 62425b3a7e8b169a3bbe6ce8c7324513a7fcee8c 2025-10-20T14:41:08+08:00 Yunzhe Jia kv: turn on common-prefix mtmd: fix output size bug
25 62425b3a7e8b169a3bbe6ce8c7324513a7fcee8c 76a63a2998286c1649de2496bccb7d8a46549895 2025-10-16T17:34:39+08:00 Yunzhe Jia kv: let seq_rm free whole seq since current hw-op cannot support common-prefix
26 76a63a2998286c1649de2496bccb7d8a46549895 b67217078aa748b06e1b2269d88dd18c0aca2c26 2025-10-16T16:31:15+08:00 Yunzhe Jia kv: fix common-prefix bug by implementing llama_memory_seq_rm
27 0115cfb7c1dec0753aecb34f3af4338bf9de8eeb 3a617cb18121a85eed17ac5585788810c5d9c1e0 0d5a470223fc90b6b6807921d68011ff06ae7f9e 2025-08-26T15:19:56+08:00 Yunzhe Jia Merge branch 'master' into dev
28 1cbf442f50a154aac0bf35d7b8b3436a2cdfd6f5 ba67d6c03fed3193987a4ef13050e6e2a4451df4 2025-07-24T15:50:19+08:00 Yunzhe Jia 1.sync with calrt prefill,decode,kv_update op 2.add hw pattern untile function
29 ba67d6c03fed3193987a4ef13050e6e2a4451df4 8f52c6f8abb2ed9ad967cc0bfb90acb073011193 2025-06-26T17:42:32+08:00 Yunzhe Jia llama-calrt: infer-op: copy data from output buffer to dst-tensor.data
30 8f52c6f8abb2ed9ad967cc0bfb90acb073011193 d2f325130c4ed77a3dcff2c23a926587fb08e2cc 2025-06-26T15:10:45+08:00 Yunzhe Jia Squashed commit of the following:
31 d2f325130c4ed77a3dcff2c23a926587fb08e2cc 6391ee7ffd97e723dfbdcc32f001e1b95a63cba6 2025-06-17T11:53:33+08:00 Yunzhe Jia calrt: add input_token in graph; input_token will be copy to calrt_in_buffer
@@ -0,0 +1,23 @@
c931ef3163940227c9b6291e04216245cce21429 a43741244a646d3f8fa3ff01bb9b7d059223d0a5 2026-05-18T17:34:37+08:00 wangbomeng calrt: fix prefill_by_ids.fix create_buf
eeeef3f6d6a5aad9296323ca15d9d929745b8932 431ad6f1c787f1b47e9e7be14b2e1a7d8565485c 2026-04-28T16:16:19+08:00 wangbomeng add unknown time info: prefill and decode
99962021f2dd1994dbbf90d5712f0ca2633f20f8 9af6682ef101c6d006c743c703cf150ac25f466f 2026-04-17T14:48:33+08:00 wangbomeng origin/dev-ot calrt: add onetoken slice and untile_prefill
a206460e610aef995e36e50b33e8bd41fe477541 d8b2aaa00049978cebac15041f960d75b552f97b 2026-04-14T10:23:43+08:00 wangbomeng calrt: support mixture of prefill_by_ids and prefill_by_embeds
b8153b6b8f244b223c9f4c2940ae1f212634519e 82842cfc3fa3d5c004c4540aeff8a81f38509bee 2026-04-09T15:07:02+08:00 wangbomeng server: fix limit tokens to max_seq_len
82842cfc3fa3d5c004c4540aeff8a81f38509bee 622a22991089c6debd5f4b57738f3df3a0bda8b5 2026-04-09T15:06:26+08:00 wangbomeng server: fix limit tokens to max_seq_len
1e8a16cd0e3ad3c9a0f8746852a0a38c6e52322e 893e52bda0fee99bbda1521ea733a760bc4201f1 2026-04-01T10:14:22+08:00 wangbomeng calrt: fix slice and add infer/copy time
e4eaab700333490e80ebefc8d023f6c1adfcc312 aeacc23a883400db0ebffb50e23355ada054da66 2026-03-25T09:03:55+08:00 wangbomeng calrt: prefil to prefill
aeacc23a883400db0ebffb50e23355ada054da66 cbaa7492663630132adeddccd9fec5e44ffa3336 2026-03-25T08:49:22+08:00 wangbomeng calrt: add slice only on decode
3c08ebf0e442cd730ddffd959ec676f9caf31c82 613bc2b9a9d7af92efbe42d876ffcdb244f7a00e 2026-03-24T02:43:03+08:00 wangbomeng calrt: comment LOG_ERROR in untile_decode_cpy
16cbf81a731f5839a2f6b0eb9d8539826353748b 8b4e17d990c23025148c4abadefe1010a0dd0734 2026-03-23T09:38:21+08:00 wangbomeng calrt: fix model_name of untile_cpy
b2c45d8ddefb7ec09435231c8ec5b736fabf9c91 c6ea3f0d2468e3b8eab5de80bacee7fe4c9dd3d7 2026-03-09T15:03:26+08:00 Bomeng Wang clart: past_kv_len = n_tokens
583c387efaf7bc030574e554088de79d09a27fbd 0edc14a60a2d5596f71d728c655e3523da924d89 2026-02-27T02:24:56+08:00 wangbomeng caserver: lim generated tokens to n_ctx_per_seq
0edc14a60a2d5596f71d728c655e3523da924d89 aa0a17d719326a63e0d6fea60aa0ced44e7abc33 2026-02-27T01:57:39+08:00 wangbomeng caserver: limit generated tokens to n_ctx_per_seq
84f2c0b5f334a7ab77347c6779b6027a951d0ff0 0bd95719fed2f0247c8d0199dd897d24157dfae6 2026-02-09T01:46:36+08:00 wangbomeng add bf16_to_fp32 in untile_decode/prefill_cpy
9328f21378275f2354a19c3af907332b216ab492 49fea70a20f550bfdb59d0ffe041b54919c22447 2026-01-28T15:32:36+08:00 Yunzhe Jia add prefill-only mode
5d2387931528fbe04aa8d66de935147efb65ca4d e6285a748657add8d974b78ca920c5b41753ee12 2025-12-08T16:40:34+08:00 Yunzhe Jia add timestamp for one decode process
e492f5dc8cec17529f53ef2bbdf7b502107f8148 2e05afd22b3d77c7013b11eee88e88b17188f21a 2025-11-04T14:09:59+08:00 Yunzhe Jia redo untile logic
0115cfb7c1dec0753aecb34f3af4338bf9de8eeb 3a617cb18121a85eed17ac5585788810c5d9c1e0 0d5a470223fc90b6b6807921d68011ff06ae7f9e 2025-08-26T15:19:56+08:00 Yunzhe Jia Merge branch 'master' into dev
3a617cb18121a85eed17ac5585788810c5d9c1e0 c42293848dd9f03eba9a6c1b85a600b398f06541 2025-08-13T10:58:59+08:00 Yunzhe Jia add calrt_decode
1cbf442f50a154aac0bf35d7b8b3436a2cdfd6f5 ba67d6c03fed3193987a4ef13050e6e2a4451df4 2025-07-24T15:50:19+08:00 Yunzhe Jia 1.sync with calrt prefill,decode,kv_update op 2.add hw pattern untile function
8f52c6f8abb2ed9ad967cc0bfb90acb073011193 d2f325130c4ed77a3dcff2c23a926587fb08e2cc 2025-06-26T15:10:45+08:00 Yunzhe Jia Squashed commit of the following:
d2f325130c4ed77a3dcff2c23a926587fb08e2cc 6391ee7ffd97e723dfbdcc32f001e1b95a63cba6 2025-06-17T11:53:33+08:00 Yunzhe Jia calrt: add input_token in graph; input_token will be copy to calrt_in_buffer
1 c931ef3163940227c9b6291e04216245cce21429 a43741244a646d3f8fa3ff01bb9b7d059223d0a5 2026-05-18T17:34:37+08:00 wangbomeng calrt: fix prefill_by_ids.fix create_buf
2 eeeef3f6d6a5aad9296323ca15d9d929745b8932 431ad6f1c787f1b47e9e7be14b2e1a7d8565485c 2026-04-28T16:16:19+08:00 wangbomeng add unknown time info: prefill and decode
3 99962021f2dd1994dbbf90d5712f0ca2633f20f8 9af6682ef101c6d006c743c703cf150ac25f466f 2026-04-17T14:48:33+08:00 wangbomeng origin/dev-ot calrt: add onetoken slice and untile_prefill
4 a206460e610aef995e36e50b33e8bd41fe477541 d8b2aaa00049978cebac15041f960d75b552f97b 2026-04-14T10:23:43+08:00 wangbomeng calrt: support mixture of prefill_by_ids and prefill_by_embeds
5 b8153b6b8f244b223c9f4c2940ae1f212634519e 82842cfc3fa3d5c004c4540aeff8a81f38509bee 2026-04-09T15:07:02+08:00 wangbomeng server: fix limit tokens to max_seq_len
6 82842cfc3fa3d5c004c4540aeff8a81f38509bee 622a22991089c6debd5f4b57738f3df3a0bda8b5 2026-04-09T15:06:26+08:00 wangbomeng server: fix limit tokens to max_seq_len
7 1e8a16cd0e3ad3c9a0f8746852a0a38c6e52322e 893e52bda0fee99bbda1521ea733a760bc4201f1 2026-04-01T10:14:22+08:00 wangbomeng calrt: fix slice and add infer/copy time
8 e4eaab700333490e80ebefc8d023f6c1adfcc312 aeacc23a883400db0ebffb50e23355ada054da66 2026-03-25T09:03:55+08:00 wangbomeng calrt: prefil to prefill
9 aeacc23a883400db0ebffb50e23355ada054da66 cbaa7492663630132adeddccd9fec5e44ffa3336 2026-03-25T08:49:22+08:00 wangbomeng calrt: add slice only on decode
10 3c08ebf0e442cd730ddffd959ec676f9caf31c82 613bc2b9a9d7af92efbe42d876ffcdb244f7a00e 2026-03-24T02:43:03+08:00 wangbomeng calrt: comment LOG_ERROR in untile_decode_cpy
11 16cbf81a731f5839a2f6b0eb9d8539826353748b 8b4e17d990c23025148c4abadefe1010a0dd0734 2026-03-23T09:38:21+08:00 wangbomeng calrt: fix model_name of untile_cpy
12 b2c45d8ddefb7ec09435231c8ec5b736fabf9c91 c6ea3f0d2468e3b8eab5de80bacee7fe4c9dd3d7 2026-03-09T15:03:26+08:00 Bomeng Wang clart: past_kv_len = n_tokens
13 583c387efaf7bc030574e554088de79d09a27fbd 0edc14a60a2d5596f71d728c655e3523da924d89 2026-02-27T02:24:56+08:00 wangbomeng caserver: lim generated tokens to n_ctx_per_seq
14 0edc14a60a2d5596f71d728c655e3523da924d89 aa0a17d719326a63e0d6fea60aa0ced44e7abc33 2026-02-27T01:57:39+08:00 wangbomeng caserver: limit generated tokens to n_ctx_per_seq
15 84f2c0b5f334a7ab77347c6779b6027a951d0ff0 0bd95719fed2f0247c8d0199dd897d24157dfae6 2026-02-09T01:46:36+08:00 wangbomeng add bf16_to_fp32 in untile_decode/prefill_cpy
16 9328f21378275f2354a19c3af907332b216ab492 49fea70a20f550bfdb59d0ffe041b54919c22447 2026-01-28T15:32:36+08:00 Yunzhe Jia add prefill-only mode
17 5d2387931528fbe04aa8d66de935147efb65ca4d e6285a748657add8d974b78ca920c5b41753ee12 2025-12-08T16:40:34+08:00 Yunzhe Jia add timestamp for one decode process
18 e492f5dc8cec17529f53ef2bbdf7b502107f8148 2e05afd22b3d77c7013b11eee88e88b17188f21a 2025-11-04T14:09:59+08:00 Yunzhe Jia redo untile logic
19 0115cfb7c1dec0753aecb34f3af4338bf9de8eeb 3a617cb18121a85eed17ac5585788810c5d9c1e0 0d5a470223fc90b6b6807921d68011ff06ae7f9e 2025-08-26T15:19:56+08:00 Yunzhe Jia Merge branch 'master' into dev
20 3a617cb18121a85eed17ac5585788810c5d9c1e0 c42293848dd9f03eba9a6c1b85a600b398f06541 2025-08-13T10:58:59+08:00 Yunzhe Jia add calrt_decode
21 1cbf442f50a154aac0bf35d7b8b3436a2cdfd6f5 ba67d6c03fed3193987a4ef13050e6e2a4451df4 2025-07-24T15:50:19+08:00 Yunzhe Jia 1.sync with calrt prefill,decode,kv_update op 2.add hw pattern untile function
22 8f52c6f8abb2ed9ad967cc0bfb90acb073011193 d2f325130c4ed77a3dcff2c23a926587fb08e2cc 2025-06-26T15:10:45+08:00 Yunzhe Jia Squashed commit of the following:
23 d2f325130c4ed77a3dcff2c23a926587fb08e2cc 6391ee7ffd97e723dfbdcc32f001e1b95a63cba6 2025-06-17T11:53:33+08:00 Yunzhe Jia calrt: add input_token in graph; input_token will be copy to calrt_in_buffer
@@ -0,0 +1,42 @@
fd9bd632f346085920d523dd307a3e4c11cc0a05 e08e473cf292ba73789769b993bb35bcdfc31689 2026-06-01T14:15:35+08:00 wangbomeng HEAD -> dev, origin/dev llama-bench: fix device-info
f86112d6758298241ab2fa84ad4f0f7b1ace35c6 d1bc743c10080fed1253686ce01749b42611ded4 2026-05-29T16:40:38+08:00 wangbomeng add dump_pos,fix pos_tensor of pre_by_embeds
f131bf1908b8c5dd1f49d7ae7f616506fc471666 33d96dae28e17208ef61a71dba40cda3c04f135a 2026-05-27T09:38:51+08:00 wangbomeng fix patch of qwen2.5vl,n_patch of minicpm = 64,fix n_ctx_slot,comment out M-ROPE
63442fde8dc285817f725bd6c5fae80f478a3813 fc3f4a9fab88e98eff8eeca8cbc6617333edba2c 2026-05-20T11:47:42+08:00 wangbomeng fix ubatch and cmakelist
c931ef3163940227c9b6291e04216245cce21429 a43741244a646d3f8fa3ff01bb9b7d059223d0a5 2026-05-18T17:34:37+08:00 wangbomeng calrt: fix prefill_by_ids.fix create_buf
2716130010c58f1cdd9d94f0e2f8e047bc92dc66 b35bda124ccd4ed581dd6088d3ffa4931c2809b6 2026-05-18T08:40:54+08:00 Yunzhe Jia fix n_ctx_slot error by adding runtime capacity loading for cal-llm
a43741244a646d3f8fa3ff01bb9b7d059223d0a5 b2003d6c90ef0fa26ab9e930ba3e22b355eb3d39 2026-05-15T14:39:53+08:00 wangbomeng run llama-passkey successfully, fix llama-bench, copy 3 times input to infer qwen2.5vl
b35bda124ccd4ed581dd6088d3ffa4931c2809b6 81a2cbd4cef5d28334ff513d6b69e593d9d1cb49 2026-05-15T09:19:31+08:00 Yunzhe Jia Implement vocab-only model initialization and enhance cal-llm backend error handling
fabcc7dac4b34d83fe430980bb364b81087c7ee9 1e9787962f20a7e82c71589ac1dd0585454e4bfe 2026-04-30T16:17:17+08:00 wangbomeng calrt: fix encode dump
f584311c716dd078c4b737eebbfda97fe12b7274 a339954cc2a145a80c5ea349e7896211916cbed9 2026-04-30T16:05:15+08:00 wangbomeng calrt: fix encode dump
0b8e43943846a1cd05c26c9186b9ef778ebae6e2 5eb46fffbd2e260c540fb112314ad67bbb8f56b6 2026-04-26T08:43:43+08:00 wangbomeng to debug
509670642e8090a1713f5d73590b549be827aaef 5d219bfcef239c1e3ddd1baecc0514a9462ff6a8 2026-04-24T09:40:34+08:00 wangbomeng rm debug code
99dd308adb8488fa869bb669e3335e646a938eff 06c7852e99e34c71e24e3ef6001cb54c72970e4d 2026-04-21T15:50:01+08:00 wangbomeng tag: v0.2.1 server: fix max_seq_len
ed62eb33447f993d578e156a3c7e38c91b420ece 015e988a271573a7c11e2a4b45084e1219d69d50 2026-04-21T15:05:22+08:00 wangbomeng try server-test:not success
015e988a271573a7c11e2a4b45084e1219d69d50 99962021f2dd1994dbbf90d5712f0ca2633f20f8 2026-04-17T16:56:08+08:00 wangbomeng little change
d8b2aaa00049978cebac15041f960d75b552f97b b6f29ec8140028619efaa50aa6e73146cecf631d 2026-04-13T11:23:44+08:00 wangbomeng server: fix context-shift
b6f29ec8140028619efaa50aa6e73146cecf631d 6d55eae7e76b768acfcec045b8e84cded8ae3b55 2026-04-13T11:23:31+08:00 wangbomeng server: fix context-shift
42a181674565411efa5c8b318bc77d6fd084df8a bd3a57a11aa008e0b5dc2a30f82fcd3a02587208 2026-04-10T09:06:55+08:00 Yunzhe Jia fix prompt_cache issue
a2d5bf362d6c9a546f9deadf4f8975605a915d33 bd3a57a11aa008e0b5dc2a30f82fcd3a02587208 2026-04-09T21:01:46+08:00 Bomeng Wang server: comment fixed time
fcfcdf80b01664a08fb12df879a05df3cc0eba70 0cd44929b442860dc0e5f88976108be82350f9dc 2026-04-09T19:41:52+08:00 Yunzhe Jia tmp fix one run >4K problem
b8153b6b8f244b223c9f4c2940ae1f212634519e 82842cfc3fa3d5c004c4540aeff8a81f38509bee 2026-04-09T15:07:02+08:00 wangbomeng server: fix limit tokens to max_seq_len
82842cfc3fa3d5c004c4540aeff8a81f38509bee 622a22991089c6debd5f4b57738f3df3a0bda8b5 2026-04-09T15:06:26+08:00 wangbomeng server: fix limit tokens to max_seq_len
ecf01a17651cd7b1e8b85fd6075e83831463ee23 99d2078e89305035d87d966cee7987c7d50b3925 2026-04-09T09:47:55+08:00 Yunzhe Jia fix n_parallel problem
99d2078e89305035d87d966cee7987c7d50b3925 9626239f5a9e568c9975d67dd6745fef90279a87 2026-04-08T19:01:16+08:00 Yunzhe Jia fix buffer resize problem
9626239f5a9e568c9975d67dd6745fef90279a87 da724f3e2a8af2c2537e3edcff41e9415ac66fef 2026-04-08T17:47:04+08:00 wangbomeng calrt: fix MapBuf
e126c21ed7b793b648d63533ea7ee30885f5a82a 5603e050af07173589f3b8850121263d86da01fd 2026-04-01T10:07:12+08:00 wangbomeng sever: fix commit id
1e8a16cd0e3ad3c9a0f8746852a0a38c6e52322e 893e52bda0fee99bbda1521ea733a760bc4201f1 2026-04-01T10:14:22+08:00 wangbomeng calrt: fix slice and add infer/copy time
3c08ebf0e442cd730ddffd959ec676f9caf31c82 613bc2b9a9d7af92efbe42d876ffcdb244f7a00e 2026-03-24T02:43:03+08:00 wangbomeng calrt: comment LOG_ERROR in untile_decode_cpy
613bc2b9a9d7af92efbe42d876ffcdb244f7a00e 4e194ecc6c4b8ebe4c72d93f6055e3605dbfcefa 2026-03-24T02:30:12+08:00 wangbomeng calrt: fix max_seq_len judgment
4e194ecc6c4b8ebe4c72d93f6055e3605dbfcefa 16cbf81a731f5839a2f6b0eb9d8539826353748b 2026-03-24T01:59:03+08:00 wangbomeng calrt: fix ubatch.embd cpy
16cbf81a731f5839a2f6b0eb9d8539826353748b 8b4e17d990c23025148c4abadefe1010a0dd0734 2026-03-23T09:38:21+08:00 wangbomeng calrt: fix model_name of untile_cpy
07817cefc14fa359dcecad0630defd3610f8f5c8 b2c45d8ddefb7ec09435231c8ec5b736fabf9c91 2026-03-10T16:32:07+08:00 Yunzhe Jia fix kv issue
f8fba66b657c51a1df1efc7267bfea9f6140cebf db4a61d2234c2f457b42ecc3f7219a1e1a35508a 2026-03-06T15:06:36+08:00 Yunzhe Jia fix calrt_install include path
7a3a9a0e76bb5f530beafcfe52e87e388e93117a 583c387efaf7bc030574e554088de79d09a27fbd 2026-03-05T07:24:59+08:00 wangbomeng calrt_infer: fix past_kv_len
0bd95719fed2f0247c8d0199dd897d24157dfae6 365eb0b719e30b0f9e348d854f11c9c3f954a96e 2026-02-07T10:25:06+08:00 Yunzhe Jia fix get_model_by_name
886cd1fb3b217efcf51c46209fcb694022346797 9328f21378275f2354a19c3af907332b216ab492 2026-02-06T17:36:54+08:00 Yunzhe Jia fix compile problem
7eeb241aad429a68fb8cfa3ba85d000fb2348cd2 dfb6250031a25058dbc3757e8a7ec75d90dcb48a 2025-11-21T09:20:01+08:00 Yunzhe Jia fix byte_size error
c20c0a5c0c44179f5267a262546624854b1203d1 62425b3a7e8b169a3bbe6ce8c7324513a7fcee8c 2025-10-20T14:41:08+08:00 Yunzhe Jia kv: turn on common-prefix mtmd: fix output size bug
62425b3a7e8b169a3bbe6ce8c7324513a7fcee8c 76a63a2998286c1649de2496bccb7d8a46549895 2025-10-16T17:34:39+08:00 Yunzhe Jia kv: let seq_rm free whole seq since current hw-op cannot support common-prefix
76a63a2998286c1649de2496bccb7d8a46549895 b67217078aa748b06e1b2269d88dd18c0aca2c26 2025-10-16T16:31:15+08:00 Yunzhe Jia kv: fix common-prefix bug by implementing llama_memory_seq_rm
87932ec016f0ec81e98a13ce5212851f8c12458a 0115cfb7c1dec0753aecb34f3af4338bf9de8eeb 2025-08-27T14:29:18+08:00 Yunzhe Jia fix merge problem
8f52c6f8abb2ed9ad967cc0bfb90acb073011193 d2f325130c4ed77a3dcff2c23a926587fb08e2cc 2025-06-26T15:10:45+08:00 Yunzhe Jia Squashed commit of the following:
1 fd9bd632f346085920d523dd307a3e4c11cc0a05 e08e473cf292ba73789769b993bb35bcdfc31689 2026-06-01T14:15:35+08:00 wangbomeng HEAD -> dev, origin/dev llama-bench: fix device-info
2 f86112d6758298241ab2fa84ad4f0f7b1ace35c6 d1bc743c10080fed1253686ce01749b42611ded4 2026-05-29T16:40:38+08:00 wangbomeng add dump_pos,fix pos_tensor of pre_by_embeds
3 f131bf1908b8c5dd1f49d7ae7f616506fc471666 33d96dae28e17208ef61a71dba40cda3c04f135a 2026-05-27T09:38:51+08:00 wangbomeng fix patch of qwen2.5vl,n_patch of minicpm = 64,fix n_ctx_slot,comment out M-ROPE
4 63442fde8dc285817f725bd6c5fae80f478a3813 fc3f4a9fab88e98eff8eeca8cbc6617333edba2c 2026-05-20T11:47:42+08:00 wangbomeng fix ubatch and cmakelist
5 c931ef3163940227c9b6291e04216245cce21429 a43741244a646d3f8fa3ff01bb9b7d059223d0a5 2026-05-18T17:34:37+08:00 wangbomeng calrt: fix prefill_by_ids.fix create_buf
6 2716130010c58f1cdd9d94f0e2f8e047bc92dc66 b35bda124ccd4ed581dd6088d3ffa4931c2809b6 2026-05-18T08:40:54+08:00 Yunzhe Jia fix n_ctx_slot error by adding runtime capacity loading for cal-llm
7 a43741244a646d3f8fa3ff01bb9b7d059223d0a5 b2003d6c90ef0fa26ab9e930ba3e22b355eb3d39 2026-05-15T14:39:53+08:00 wangbomeng run llama-passkey successfully, fix llama-bench, copy 3 times input to infer qwen2.5vl
8 b35bda124ccd4ed581dd6088d3ffa4931c2809b6 81a2cbd4cef5d28334ff513d6b69e593d9d1cb49 2026-05-15T09:19:31+08:00 Yunzhe Jia Implement vocab-only model initialization and enhance cal-llm backend error handling
9 fabcc7dac4b34d83fe430980bb364b81087c7ee9 1e9787962f20a7e82c71589ac1dd0585454e4bfe 2026-04-30T16:17:17+08:00 wangbomeng calrt: fix encode dump
10 f584311c716dd078c4b737eebbfda97fe12b7274 a339954cc2a145a80c5ea349e7896211916cbed9 2026-04-30T16:05:15+08:00 wangbomeng calrt: fix encode dump
11 0b8e43943846a1cd05c26c9186b9ef778ebae6e2 5eb46fffbd2e260c540fb112314ad67bbb8f56b6 2026-04-26T08:43:43+08:00 wangbomeng to debug
12 509670642e8090a1713f5d73590b549be827aaef 5d219bfcef239c1e3ddd1baecc0514a9462ff6a8 2026-04-24T09:40:34+08:00 wangbomeng rm debug code
13 99dd308adb8488fa869bb669e3335e646a938eff 06c7852e99e34c71e24e3ef6001cb54c72970e4d 2026-04-21T15:50:01+08:00 wangbomeng tag: v0.2.1 server: fix max_seq_len
14 ed62eb33447f993d578e156a3c7e38c91b420ece 015e988a271573a7c11e2a4b45084e1219d69d50 2026-04-21T15:05:22+08:00 wangbomeng try server-test:not success
15 015e988a271573a7c11e2a4b45084e1219d69d50 99962021f2dd1994dbbf90d5712f0ca2633f20f8 2026-04-17T16:56:08+08:00 wangbomeng little change
16 d8b2aaa00049978cebac15041f960d75b552f97b b6f29ec8140028619efaa50aa6e73146cecf631d 2026-04-13T11:23:44+08:00 wangbomeng server: fix context-shift
17 b6f29ec8140028619efaa50aa6e73146cecf631d 6d55eae7e76b768acfcec045b8e84cded8ae3b55 2026-04-13T11:23:31+08:00 wangbomeng server: fix context-shift
18 42a181674565411efa5c8b318bc77d6fd084df8a bd3a57a11aa008e0b5dc2a30f82fcd3a02587208 2026-04-10T09:06:55+08:00 Yunzhe Jia fix prompt_cache issue
19 a2d5bf362d6c9a546f9deadf4f8975605a915d33 bd3a57a11aa008e0b5dc2a30f82fcd3a02587208 2026-04-09T21:01:46+08:00 Bomeng Wang server: comment fixed time
20 fcfcdf80b01664a08fb12df879a05df3cc0eba70 0cd44929b442860dc0e5f88976108be82350f9dc 2026-04-09T19:41:52+08:00 Yunzhe Jia tmp fix one run >4K problem
21 b8153b6b8f244b223c9f4c2940ae1f212634519e 82842cfc3fa3d5c004c4540aeff8a81f38509bee 2026-04-09T15:07:02+08:00 wangbomeng server: fix limit tokens to max_seq_len
22 82842cfc3fa3d5c004c4540aeff8a81f38509bee 622a22991089c6debd5f4b57738f3df3a0bda8b5 2026-04-09T15:06:26+08:00 wangbomeng server: fix limit tokens to max_seq_len
23 ecf01a17651cd7b1e8b85fd6075e83831463ee23 99d2078e89305035d87d966cee7987c7d50b3925 2026-04-09T09:47:55+08:00 Yunzhe Jia fix n_parallel problem
24 99d2078e89305035d87d966cee7987c7d50b3925 9626239f5a9e568c9975d67dd6745fef90279a87 2026-04-08T19:01:16+08:00 Yunzhe Jia fix buffer resize problem
25 9626239f5a9e568c9975d67dd6745fef90279a87 da724f3e2a8af2c2537e3edcff41e9415ac66fef 2026-04-08T17:47:04+08:00 wangbomeng calrt: fix MapBuf
26 e126c21ed7b793b648d63533ea7ee30885f5a82a 5603e050af07173589f3b8850121263d86da01fd 2026-04-01T10:07:12+08:00 wangbomeng sever: fix commit id
27 1e8a16cd0e3ad3c9a0f8746852a0a38c6e52322e 893e52bda0fee99bbda1521ea733a760bc4201f1 2026-04-01T10:14:22+08:00 wangbomeng calrt: fix slice and add infer/copy time
28 3c08ebf0e442cd730ddffd959ec676f9caf31c82 613bc2b9a9d7af92efbe42d876ffcdb244f7a00e 2026-03-24T02:43:03+08:00 wangbomeng calrt: comment LOG_ERROR in untile_decode_cpy
29 613bc2b9a9d7af92efbe42d876ffcdb244f7a00e 4e194ecc6c4b8ebe4c72d93f6055e3605dbfcefa 2026-03-24T02:30:12+08:00 wangbomeng calrt: fix max_seq_len judgment
30 4e194ecc6c4b8ebe4c72d93f6055e3605dbfcefa 16cbf81a731f5839a2f6b0eb9d8539826353748b 2026-03-24T01:59:03+08:00 wangbomeng calrt: fix ubatch.embd cpy
31 16cbf81a731f5839a2f6b0eb9d8539826353748b 8b4e17d990c23025148c4abadefe1010a0dd0734 2026-03-23T09:38:21+08:00 wangbomeng calrt: fix model_name of untile_cpy
32 07817cefc14fa359dcecad0630defd3610f8f5c8 b2c45d8ddefb7ec09435231c8ec5b736fabf9c91 2026-03-10T16:32:07+08:00 Yunzhe Jia fix kv issue
33 f8fba66b657c51a1df1efc7267bfea9f6140cebf db4a61d2234c2f457b42ecc3f7219a1e1a35508a 2026-03-06T15:06:36+08:00 Yunzhe Jia fix calrt_install include path
34 7a3a9a0e76bb5f530beafcfe52e87e388e93117a 583c387efaf7bc030574e554088de79d09a27fbd 2026-03-05T07:24:59+08:00 wangbomeng calrt_infer: fix past_kv_len
35 0bd95719fed2f0247c8d0199dd897d24157dfae6 365eb0b719e30b0f9e348d854f11c9c3f954a96e 2026-02-07T10:25:06+08:00 Yunzhe Jia fix get_model_by_name
36 886cd1fb3b217efcf51c46209fcb694022346797 9328f21378275f2354a19c3af907332b216ab492 2026-02-06T17:36:54+08:00 Yunzhe Jia fix compile problem
37 7eeb241aad429a68fb8cfa3ba85d000fb2348cd2 dfb6250031a25058dbc3757e8a7ec75d90dcb48a 2025-11-21T09:20:01+08:00 Yunzhe Jia fix byte_size error
38 c20c0a5c0c44179f5267a262546624854b1203d1 62425b3a7e8b169a3bbe6ce8c7324513a7fcee8c 2025-10-20T14:41:08+08:00 Yunzhe Jia kv: turn on common-prefix mtmd: fix output size bug
39 62425b3a7e8b169a3bbe6ce8c7324513a7fcee8c 76a63a2998286c1649de2496bccb7d8a46549895 2025-10-16T17:34:39+08:00 Yunzhe Jia kv: let seq_rm free whole seq since current hw-op cannot support common-prefix
40 76a63a2998286c1649de2496bccb7d8a46549895 b67217078aa748b06e1b2269d88dd18c0aca2c26 2025-10-16T16:31:15+08:00 Yunzhe Jia kv: fix common-prefix bug by implementing llama_memory_seq_rm
41 87932ec016f0ec81e98a13ce5212851f8c12458a 0115cfb7c1dec0753aecb34f3af4338bf9de8eeb 2025-08-27T14:29:18+08:00 Yunzhe Jia fix merge problem
42 8f52c6f8abb2ed9ad967cc0bfb90acb073011193 d2f325130c4ed77a3dcff2c23a926587fb08e2cc 2025-06-26T15:10:45+08:00 Yunzhe Jia Squashed commit of the following:
@@ -0,0 +1,15 @@
f86112d6758298241ab2fa84ad4f0f7b1ace35c6 d1bc743c10080fed1253686ce01749b42611ded4 2026-05-29T16:40:38+08:00 wangbomeng add dump_pos,fix pos_tensor of pre_by_embeds
f131bf1908b8c5dd1f49d7ae7f616506fc471666 33d96dae28e17208ef61a71dba40cda3c04f135a 2026-05-27T09:38:51+08:00 wangbomeng fix patch of qwen2.5vl,n_patch of minicpm = 64,fix n_ctx_slot,comment out M-ROPE
a43741244a646d3f8fa3ff01bb9b7d059223d0a5 b2003d6c90ef0fa26ab9e930ba3e22b355eb3d39 2026-05-15T14:39:53+08:00 wangbomeng run llama-passkey successfully, fix llama-bench, copy 3 times input to infer qwen2.5vl
3b14ed556c15529fe1f94b649f49db7156dfaf67 dde8b8228081769c8d8f1e0751d47fa7875f8423 2026-05-14T14:34:25+08:00 Yunzhe Jia - Removed references to CALRT from clip.h, mtmd-helper.cpp, mtmd-helper.h, mtmd.cpp, and mtmd.h. - Updated server.cpp to conditionally include CAL-LLM support. - Introduced option LLAMA_SERVER_USE_CAL_LLM in CMakeLists.txt to enable CAL-LLM integration. - Refactored server context to handle CAL-LLM requests and responses. - Updated image processing logic to remove CALRT-specific implementations. - Ensured compatibility with existing llama functionality while integrating new CAL-LLM features.
b2003d6c90ef0fa26ab9e930ba3e22b355eb3d39 7800c772d44a7415640ec1669a691232939927cf 2026-05-13T15:24:24+08:00 wangbomeng try passkey and embedding
7800c772d44a7415640ec1669a691232939927cf dde8b8228081769c8d8f1e0751d47fa7875f8423 2026-05-13T15:23:54+08:00 wangbomeng try passkey and embedding
dde8b8228081769c8d8f1e0751d47fa7875f8423 fabcc7dac4b34d83fe430980bb364b81087c7ee9 2026-05-12T10:46:08+08:00 wangbomeng clip:add minicpm patch;
5eb46fffbd2e260c540fb112314ad67bbb8f56b6 005112c51e00d998b457337ca3dad53fc46e2d0b 2026-04-24T16:24:51+08:00 wangbomeng clip: add image_to_patches; calrt: vision copy data from bf16 to fp32
005112c51e00d998b457337ca3dad53fc46e2d0b 509670642e8090a1713f5d73590b549be827aaef 2026-04-24T16:24:31+08:00 wangbomeng clip: add image_to_patches; calrt: vision copy data from bf16 to fp32
e24f775ee26ea5249d5ff6cd23b8a0a17fe1438d a206460e610aef995e36e50b33e8bd41fe477541 2026-04-15T10:01:09+08:00 wangbomeng calrt: add copy_data_to_ibuf for vision model
a206460e610aef995e36e50b33e8bd41fe477541 d8b2aaa00049978cebac15041f960d75b552f97b 2026-04-14T10:23:43+08:00 wangbomeng calrt: support mixture of prefill_by_ids and prefill_by_embeds
6dacdd2cf9574214ca272a86674e7bd7ba21c4f0 3e6ad64467771224f072e5bad90e270951ba4cdf 2026-03-23T14:42:28+08:00 wangbomeng calrt: add multimodal
3e6ad64467771224f072e5bad90e270951ba4cdf b37b7d9756feb3dac2db526eeab38b572a095d47 2026-03-23T14:36:41+08:00 wangbomeng calrt: add multimodal
d81d7b190ff5f21325167936496dfe5ab48b922e e492f5dc8cec17529f53ef2bbdf7b502107f8148 1f5accb8d0056e6099cd5b772b1cb787dd590a13 2025-11-04T14:43:32+08:00 Yunzhe Jia Merge branch 'master' into dev
8f52c6f8abb2ed9ad967cc0bfb90acb073011193 d2f325130c4ed77a3dcff2c23a926587fb08e2cc 2025-06-26T15:10:45+08:00 Yunzhe Jia Squashed commit of the following:
1 f86112d6758298241ab2fa84ad4f0f7b1ace35c6 d1bc743c10080fed1253686ce01749b42611ded4 2026-05-29T16:40:38+08:00 wangbomeng add dump_pos,fix pos_tensor of pre_by_embeds
2 f131bf1908b8c5dd1f49d7ae7f616506fc471666 33d96dae28e17208ef61a71dba40cda3c04f135a 2026-05-27T09:38:51+08:00 wangbomeng fix patch of qwen2.5vl,n_patch of minicpm = 64,fix n_ctx_slot,comment out M-ROPE
3 a43741244a646d3f8fa3ff01bb9b7d059223d0a5 b2003d6c90ef0fa26ab9e930ba3e22b355eb3d39 2026-05-15T14:39:53+08:00 wangbomeng run llama-passkey successfully, fix llama-bench, copy 3 times input to infer qwen2.5vl
4 3b14ed556c15529fe1f94b649f49db7156dfaf67 dde8b8228081769c8d8f1e0751d47fa7875f8423 2026-05-14T14:34:25+08:00 Yunzhe Jia - Removed references to CALRT from clip.h, mtmd-helper.cpp, mtmd-helper.h, mtmd.cpp, and mtmd.h. - Updated server.cpp to conditionally include CAL-LLM support. - Introduced option LLAMA_SERVER_USE_CAL_LLM in CMakeLists.txt to enable CAL-LLM integration. - Refactored server context to handle CAL-LLM requests and responses. - Updated image processing logic to remove CALRT-specific implementations. - Ensured compatibility with existing llama functionality while integrating new CAL-LLM features.
5 b2003d6c90ef0fa26ab9e930ba3e22b355eb3d39 7800c772d44a7415640ec1669a691232939927cf 2026-05-13T15:24:24+08:00 wangbomeng try passkey and embedding
6 7800c772d44a7415640ec1669a691232939927cf dde8b8228081769c8d8f1e0751d47fa7875f8423 2026-05-13T15:23:54+08:00 wangbomeng try passkey and embedding
7 dde8b8228081769c8d8f1e0751d47fa7875f8423 fabcc7dac4b34d83fe430980bb364b81087c7ee9 2026-05-12T10:46:08+08:00 wangbomeng clip:add minicpm patch;
8 5eb46fffbd2e260c540fb112314ad67bbb8f56b6 005112c51e00d998b457337ca3dad53fc46e2d0b 2026-04-24T16:24:51+08:00 wangbomeng clip: add image_to_patches; calrt: vision copy data from bf16 to fp32
9 005112c51e00d998b457337ca3dad53fc46e2d0b 509670642e8090a1713f5d73590b549be827aaef 2026-04-24T16:24:31+08:00 wangbomeng clip: add image_to_patches; calrt: vision copy data from bf16 to fp32
10 e24f775ee26ea5249d5ff6cd23b8a0a17fe1438d a206460e610aef995e36e50b33e8bd41fe477541 2026-04-15T10:01:09+08:00 wangbomeng calrt: add copy_data_to_ibuf for vision model
11 a206460e610aef995e36e50b33e8bd41fe477541 d8b2aaa00049978cebac15041f960d75b552f97b 2026-04-14T10:23:43+08:00 wangbomeng calrt: support mixture of prefill_by_ids and prefill_by_embeds
12 6dacdd2cf9574214ca272a86674e7bd7ba21c4f0 3e6ad64467771224f072e5bad90e270951ba4cdf 2026-03-23T14:42:28+08:00 wangbomeng calrt: add multimodal
13 3e6ad64467771224f072e5bad90e270951ba4cdf b37b7d9756feb3dac2db526eeab38b572a095d47 2026-03-23T14:36:41+08:00 wangbomeng calrt: add multimodal
14 d81d7b190ff5f21325167936496dfe5ab48b922e e492f5dc8cec17529f53ef2bbdf7b502107f8148 1f5accb8d0056e6099cd5b772b1cb787dd590a13 2025-11-04T14:43:32+08:00 Yunzhe Jia Merge branch 'master' into dev
15 8f52c6f8abb2ed9ad967cc0bfb90acb073011193 d2f325130c4ed77a3dcff2c23a926587fb08e2cc 2025-06-26T15:10:45+08:00 Yunzhe Jia Squashed commit of the following:
@@ -0,0 +1,21 @@
# llama.cpp unreachable-object recovery
This directory preserves every commit and annotated tag reported as unreachable by
`git fsck --full --unreachable --no-reflogs` in the recovered repository.
The seven commits consist of one ordinary experimental commit and three expired
stash pairs. In each stash pair, the `index on ...` commit stores the staged/index
tree and the two-parent `WIP on ...` commit stores the complete worktree snapshot.
`patches/*-vs-first-parent.patch` reproduces each commit relative to its base.
For two-parent WIP commits, `*-vs-index-parent.patch` additionally isolates the
worktree snapshot relative to the stash index parent. Zero-byte patch files are
intentional: those index commits contain no tree changes from their base.
`llama.cpp-all-refs-plus-recovered-unreachable-20260802.bundle` is the preferred
self-contained recovery asset. It names the recovered objects under
`refs/recovered/unreachable/*` and `refs/recovered/tags/*`; clone it with
`git clone --mirror` to retain those ref names.
The exact original repository archive remains the forensic source of truth because
it also preserves original reflogs, config, worktree state, and object storage.
@@ -0,0 +1,8 @@
commit kind parent_1 parent_2 author_date author subject
1d248d956f6cbcf5fdd4169d5467678ead035fe2 ordinary-experiment 41e6636ea1fb3884e41fb2023f92b0e7262ef09b 2026-03-24T02:17:22+08:00 wangbomeng <wangbomeng@calculet.tech> calrt: add slice
f06f10a592284d02a0e68019abab18f637cb738f expired-stash-index 207ca38c751f7e6c251833eb11e89a2a0bb0fd07 2026-04-09T10:37:03+08:00 Bomeng Wang <wangbomeng@calculet.tech> index on dev: 207ca38c delet extra printf
c44438579a1cc573cbdb2519dda46ccd04ddc817 expired-stash-wip 207ca38c751f7e6c251833eb11e89a2a0bb0fd07 f06f10a592284d02a0e68019abab18f637cb738f 2026-04-09T10:37:03+08:00 Bomeng Wang <wangbomeng@calculet.tech> WIP on dev: 207ca38c delet extra printf
294f5e41db9f2ee14fa7e511b1774c6271c7c7ec expired-stash-index 99dd308adb8488fa869bb669e3335e646a938eff 2026-04-27T11:41:25+08:00 Bomeng Wang <wangbomeng@calculet.tech> index on (no branch): 99dd308a server: fix max_seq_len
2a67be2e31c4b7b28fa3937893ec9e86bf5d9f4d expired-stash-wip 99dd308adb8488fa869bb669e3335e646a938eff 294f5e41db9f2ee14fa7e511b1774c6271c7c7ec 2026-04-27T11:41:25+08:00 Bomeng Wang <wangbomeng@calculet.tech> WIP on (no branch): 99dd308a server: fix max_seq_len
499f6ff441d26b9a720c3d3403bde14695257b9d expired-stash-index efa1876bb8b2a449a55054a8c3745892f2c0f262 2026-04-30T16:18:01+08:00 Bomeng Wang <wangbomeng@calculet.tech> index on (no branch): efa1876b update version print
81d4fd2c584e6df9199181e44b77fc3d939c0a67 expired-stash-wip efa1876bb8b2a449a55054a8c3745892f2c0f262 499f6ff441d26b9a720c3d3403bde14695257b9d 2026-04-30T16:18:01+08:00 Bomeng Wang <wangbomeng@calculet.tech> WIP on (no branch): efa1876b update version print
1 commit kind parent_1 parent_2 author_date author subject
2 1d248d956f6cbcf5fdd4169d5467678ead035fe2 ordinary-experiment 41e6636ea1fb3884e41fb2023f92b0e7262ef09b 2026-03-24T02:17:22+08:00 wangbomeng <wangbomeng@calculet.tech> calrt: add slice
3 f06f10a592284d02a0e68019abab18f637cb738f expired-stash-index 207ca38c751f7e6c251833eb11e89a2a0bb0fd07 2026-04-09T10:37:03+08:00 Bomeng Wang <wangbomeng@calculet.tech> index on dev: 207ca38c delet extra printf
4 c44438579a1cc573cbdb2519dda46ccd04ddc817 expired-stash-wip 207ca38c751f7e6c251833eb11e89a2a0bb0fd07 f06f10a592284d02a0e68019abab18f637cb738f 2026-04-09T10:37:03+08:00 Bomeng Wang <wangbomeng@calculet.tech> WIP on dev: 207ca38c delet extra printf
5 294f5e41db9f2ee14fa7e511b1774c6271c7c7ec expired-stash-index 99dd308adb8488fa869bb669e3335e646a938eff 2026-04-27T11:41:25+08:00 Bomeng Wang <wangbomeng@calculet.tech> index on (no branch): 99dd308a server: fix max_seq_len
6 2a67be2e31c4b7b28fa3937893ec9e86bf5d9f4d expired-stash-wip 99dd308adb8488fa869bb669e3335e646a938eff 294f5e41db9f2ee14fa7e511b1774c6271c7c7ec 2026-04-27T11:41:25+08:00 Bomeng Wang <wangbomeng@calculet.tech> WIP on (no branch): 99dd308a server: fix max_seq_len
7 499f6ff441d26b9a720c3d3403bde14695257b9d expired-stash-index efa1876bb8b2a449a55054a8c3745892f2c0f262 2026-04-30T16:18:01+08:00 Bomeng Wang <wangbomeng@calculet.tech> index on (no branch): efa1876b update version print
8 81d4fd2c584e6df9199181e44b77fc3d939c0a67 expired-stash-wip efa1876bb8b2a449a55054a8c3745892f2c0f262 499f6ff441d26b9a720c3d3403bde14695257b9d 2026-04-30T16:18:01+08:00 Bomeng Wang <wangbomeng@calculet.tech> WIP on (no branch): efa1876b update version print
@@ -0,0 +1,7 @@
commit 1d248d956f6cbcf5fdd4169d5467678ead035fe2
Author: wangbomeng <wangbomeng@calculet.tech>
AuthorDate: Tue Mar 24 02:17:22 2026 +0800
Commit: wangbomeng <wangbomeng@calculet.tech>
CommitDate: Tue Mar 24 02:17:22 2026 +0800
calrt: add slice
@@ -0,0 +1,15 @@
diff --git a/src/llama-calrt.cpp b/src/llama-calrt.cpp
index 5bbdd52e1f7adc96ac72945ed52eabd9e075d990..e038a4c25d5589550680bf5bb556145f1524ae17 100644
--- a/src/llama-calrt.cpp
+++ b/src/llama-calrt.cpp
@@ -564,6 +564,10 @@ void calrt_context::calrt_infer(calrt_seqs_info & seqs) {
// makeup_ubatch(ubatch);
copy_data_to_ibuf(*pIbuf, ubatch, model_name);
+ //only copy promt tokens
+ //pObuf->SliceTensorByName(pObuf->GetTensorByName("outputs[0]")->GetDataPtr(),"outputs[0]", 0, cur_seq_len * sizeof(ggml_bf16_t));
+ pObuf->GetTensorByName("outputs[0]")->SliceTensor(0, cur_seq_len * sizeof(ggml_bf16_t));
+
calrt::infer(vdev, model, pIbuf.get(), pObuf.get());
pObuf->Wait();
@@ -0,0 +1,7 @@
commit 294f5e41db9f2ee14fa7e511b1774c6271c7c7ec
Author: Bomeng Wang <wangbomeng@calculet.tech>
AuthorDate: Mon Apr 27 11:41:25 2026 +0800
Commit: Bomeng Wang <wangbomeng@calculet.tech>
CommitDate: Mon Apr 27 11:41:25 2026 +0800
index on (no branch): 99dd308a server: fix max_seq_len
@@ -0,0 +1,8 @@
commit 2a67be2e31c4b7b28fa3937893ec9e86bf5d9f4d
Merge: 99dd308a 294f5e41
Author: Bomeng Wang <wangbomeng@calculet.tech>
AuthorDate: Mon Apr 27 11:41:25 2026 +0800
Commit: Bomeng Wang <wangbomeng@calculet.tech>
CommitDate: Mon Apr 27 11:41:25 2026 +0800
WIP on (no branch): 99dd308a server: fix max_seq_len
@@ -0,0 +1,140 @@
diff --git a/common/common.cpp b/common/common.cpp
index 625b369b26a5981cc19eda5181226d916acc28ad..898d445293a51a4d1e0037f05bc83b5f773cc430 100644
--- a/common/common.cpp
+++ b/common/common.cpp
@@ -1058,51 +1058,51 @@ struct common_init_result common_init_from_params(common_params & params) {
params.sampling.dry_penalty_last_n = llama_n_ctx(lctx);
}
- if (params.warmup) {
- LOG_WRN("%s: warming up the model with an empty run - please wait ... (--no-warmup to disable)\n", __func__);
-
- llama_set_warmup(lctx, true);
-
- std::vector<llama_token> tmp;
- llama_token bos = llama_vocab_bos(vocab);
- llama_token eos = llama_vocab_eos(vocab);
-
- // some models (e.g. T5) don't have a BOS token
- if (bos != LLAMA_TOKEN_NULL) {
- tmp.push_back(bos);
- }
- if (eos != LLAMA_TOKEN_NULL) {
- tmp.push_back(eos);
- }
- if (tmp.empty()) {
- tmp.push_back(0);
- }
-
- if (llama_model_has_encoder(model)) {
- #ifdef USE_CALRT
- //calrt_encode(cal_ctx, llama_batch_get_one(tmp.data(), tmp.size()));
- #else
- llama_encode(lctx, llama_batch_get_one(tmp.data(), tmp.size()));
- #endif
- llama_token decoder_start_token_id = llama_model_decoder_start_token(model);
- if (decoder_start_token_id == LLAMA_TOKEN_NULL) {
- decoder_start_token_id = bos;
- }
- tmp.clear();
- tmp.push_back(decoder_start_token_id);
- }
- if (llama_model_has_decoder(model)) {
- #ifdef USE_CALRT
- calrt_decode(cal_ctx, llama_batch_get_one(tmp.data(), std::min(tmp.size(), (size_t) params.n_batch)));
- #else
- llama_decode(lctx, llama_batch_get_one(tmp.data(), std::min(tmp.size(), (size_t) params.n_batch)));
- #endif
- }
- llama_memory_clear(llama_get_memory(lctx), true);
- llama_synchronize(lctx);
- llama_perf_context_reset(lctx);
- llama_set_warmup(lctx, false);
- }
+ // if (params.warmup) {
+ // LOG_WRN("%s: warming up the model with an empty run - please wait ... (--no-warmup to disable)\n", __func__);
+
+ // llama_set_warmup(lctx, true);
+
+ // std::vector<llama_token> tmp;
+ // llama_token bos = llama_vocab_bos(vocab);
+ // llama_token eos = llama_vocab_eos(vocab);
+
+ // // some models (e.g. T5) don't have a BOS token
+ // if (bos != LLAMA_TOKEN_NULL) {
+ // tmp.push_back(bos);
+ // }
+ // if (eos != LLAMA_TOKEN_NULL) {
+ // tmp.push_back(eos);
+ // }
+ // if (tmp.empty()) {
+ // tmp.push_back(0);
+ // }
+
+ // if (llama_model_has_encoder(model)) {
+ // #ifdef USE_CALRT
+ // //calrt_encode(cal_ctx, llama_batch_get_one(tmp.data(), tmp.size()));
+ // #else
+ // llama_encode(lctx, llama_batch_get_one(tmp.data(), tmp.size()));
+ // #endif
+ // llama_token decoder_start_token_id = llama_model_decoder_start_token(model);
+ // if (decoder_start_token_id == LLAMA_TOKEN_NULL) {
+ // decoder_start_token_id = bos;
+ // }
+ // tmp.clear();
+ // tmp.push_back(decoder_start_token_id);
+ // }
+ // if (llama_model_has_decoder(model)) {
+ // #ifdef USE_CALRT
+ // calrt_decode(cal_ctx, llama_batch_get_one(tmp.data(), std::min(tmp.size(), (size_t) params.n_batch)));
+ // #else
+ // llama_decode(lctx, llama_batch_get_one(tmp.data(), std::min(tmp.size(), (size_t) params.n_batch)));
+ // #endif
+ // }
+ // llama_memory_clear(llama_get_memory(lctx), true);
+ // llama_synchronize(lctx);
+ // llama_perf_context_reset(lctx);
+ // llama_set_warmup(lctx, false);
+ // }
iparams.model.reset(model);
iparams.context.reset(lctx);
diff --git a/src/llama-calrt.cpp b/src/llama-calrt.cpp
index 9f41c955b7bb36cdc4dfc0d50c5fdd76667a2373..e8dc07c6fe6282ff3d7d4e43210b3491982d10f0 100644
--- a/src/llama-calrt.cpp
+++ b/src/llama-calrt.cpp
@@ -43,6 +43,16 @@ std::unique_ptr<calrt::VirtualDevice> init_calrt_vdev() {
throw std::runtime_error("failed to create vdevice");
}
+ uint64_t commitId = 0;
+ uint32_t rdata = 0;
+ vDev->GetDevice()->ReadReg(0x0a238254, rdata);
+ commitId |=(((uint64_t)rdata) << 32);
+ vDev->GetDevice()->ReadReg(0x0a238258, rdata);
+ commitId |=((uint64_t)rdata);
+
+ LLAMA_LOG_INFO("CalcoreRT: =================== CalcoreRT Version: %016llx ====================\n", commitId);
+ LLAMA_LOG_INFO("CalRT: =================== CalRT Version %s ====================\n", calrt::calrt_version());
+
return vDev;
}
@@ -664,7 +674,7 @@ calrt::CalbinModel * calrt_context::get_model_by_name(std::string & name) {
}
if (smodelName.empty()) {
- LLAMA_LOG_ERROR("submodel who's name contains %s not found", name.c_str());
+ //LLAMA_LOG_ERROR("submodel who's name contains %s not found", name.c_str());
return nullptr;
}
@@ -681,7 +691,7 @@ calrt::CalbinModel * calrt_context::get_model_by_names(std::string & name1, std:
}
if (smodelName.empty()) {
- LLAMA_LOG_ERROR("submodel who's name contains %s not found", name1.c_str(), name2.c_str());
+ //LLAMA_LOG_ERROR("submodel who's name contains %s not found", name1.c_str(), name2.c_str());
return nullptr;
}
@@ -0,0 +1,140 @@
diff --git a/common/common.cpp b/common/common.cpp
index 625b369b26a5981cc19eda5181226d916acc28ad..898d445293a51a4d1e0037f05bc83b5f773cc430 100644
--- a/common/common.cpp
+++ b/common/common.cpp
@@ -1058,51 +1058,51 @@ struct common_init_result common_init_from_params(common_params & params) {
params.sampling.dry_penalty_last_n = llama_n_ctx(lctx);
}
- if (params.warmup) {
- LOG_WRN("%s: warming up the model with an empty run - please wait ... (--no-warmup to disable)\n", __func__);
-
- llama_set_warmup(lctx, true);
-
- std::vector<llama_token> tmp;
- llama_token bos = llama_vocab_bos(vocab);
- llama_token eos = llama_vocab_eos(vocab);
-
- // some models (e.g. T5) don't have a BOS token
- if (bos != LLAMA_TOKEN_NULL) {
- tmp.push_back(bos);
- }
- if (eos != LLAMA_TOKEN_NULL) {
- tmp.push_back(eos);
- }
- if (tmp.empty()) {
- tmp.push_back(0);
- }
-
- if (llama_model_has_encoder(model)) {
- #ifdef USE_CALRT
- //calrt_encode(cal_ctx, llama_batch_get_one(tmp.data(), tmp.size()));
- #else
- llama_encode(lctx, llama_batch_get_one(tmp.data(), tmp.size()));
- #endif
- llama_token decoder_start_token_id = llama_model_decoder_start_token(model);
- if (decoder_start_token_id == LLAMA_TOKEN_NULL) {
- decoder_start_token_id = bos;
- }
- tmp.clear();
- tmp.push_back(decoder_start_token_id);
- }
- if (llama_model_has_decoder(model)) {
- #ifdef USE_CALRT
- calrt_decode(cal_ctx, llama_batch_get_one(tmp.data(), std::min(tmp.size(), (size_t) params.n_batch)));
- #else
- llama_decode(lctx, llama_batch_get_one(tmp.data(), std::min(tmp.size(), (size_t) params.n_batch)));
- #endif
- }
- llama_memory_clear(llama_get_memory(lctx), true);
- llama_synchronize(lctx);
- llama_perf_context_reset(lctx);
- llama_set_warmup(lctx, false);
- }
+ // if (params.warmup) {
+ // LOG_WRN("%s: warming up the model with an empty run - please wait ... (--no-warmup to disable)\n", __func__);
+
+ // llama_set_warmup(lctx, true);
+
+ // std::vector<llama_token> tmp;
+ // llama_token bos = llama_vocab_bos(vocab);
+ // llama_token eos = llama_vocab_eos(vocab);
+
+ // // some models (e.g. T5) don't have a BOS token
+ // if (bos != LLAMA_TOKEN_NULL) {
+ // tmp.push_back(bos);
+ // }
+ // if (eos != LLAMA_TOKEN_NULL) {
+ // tmp.push_back(eos);
+ // }
+ // if (tmp.empty()) {
+ // tmp.push_back(0);
+ // }
+
+ // if (llama_model_has_encoder(model)) {
+ // #ifdef USE_CALRT
+ // //calrt_encode(cal_ctx, llama_batch_get_one(tmp.data(), tmp.size()));
+ // #else
+ // llama_encode(lctx, llama_batch_get_one(tmp.data(), tmp.size()));
+ // #endif
+ // llama_token decoder_start_token_id = llama_model_decoder_start_token(model);
+ // if (decoder_start_token_id == LLAMA_TOKEN_NULL) {
+ // decoder_start_token_id = bos;
+ // }
+ // tmp.clear();
+ // tmp.push_back(decoder_start_token_id);
+ // }
+ // if (llama_model_has_decoder(model)) {
+ // #ifdef USE_CALRT
+ // calrt_decode(cal_ctx, llama_batch_get_one(tmp.data(), std::min(tmp.size(), (size_t) params.n_batch)));
+ // #else
+ // llama_decode(lctx, llama_batch_get_one(tmp.data(), std::min(tmp.size(), (size_t) params.n_batch)));
+ // #endif
+ // }
+ // llama_memory_clear(llama_get_memory(lctx), true);
+ // llama_synchronize(lctx);
+ // llama_perf_context_reset(lctx);
+ // llama_set_warmup(lctx, false);
+ // }
iparams.model.reset(model);
iparams.context.reset(lctx);
diff --git a/src/llama-calrt.cpp b/src/llama-calrt.cpp
index 9f41c955b7bb36cdc4dfc0d50c5fdd76667a2373..e8dc07c6fe6282ff3d7d4e43210b3491982d10f0 100644
--- a/src/llama-calrt.cpp
+++ b/src/llama-calrt.cpp
@@ -43,6 +43,16 @@ std::unique_ptr<calrt::VirtualDevice> init_calrt_vdev() {
throw std::runtime_error("failed to create vdevice");
}
+ uint64_t commitId = 0;
+ uint32_t rdata = 0;
+ vDev->GetDevice()->ReadReg(0x0a238254, rdata);
+ commitId |=(((uint64_t)rdata) << 32);
+ vDev->GetDevice()->ReadReg(0x0a238258, rdata);
+ commitId |=((uint64_t)rdata);
+
+ LLAMA_LOG_INFO("CalcoreRT: =================== CalcoreRT Version: %016llx ====================\n", commitId);
+ LLAMA_LOG_INFO("CalRT: =================== CalRT Version %s ====================\n", calrt::calrt_version());
+
return vDev;
}
@@ -664,7 +674,7 @@ calrt::CalbinModel * calrt_context::get_model_by_name(std::string & name) {
}
if (smodelName.empty()) {
- LLAMA_LOG_ERROR("submodel who's name contains %s not found", name.c_str());
+ //LLAMA_LOG_ERROR("submodel who's name contains %s not found", name.c_str());
return nullptr;
}
@@ -681,7 +691,7 @@ calrt::CalbinModel * calrt_context::get_model_by_names(std::string & name1, std:
}
if (smodelName.empty()) {
- LLAMA_LOG_ERROR("submodel who's name contains %s not found", name1.c_str(), name2.c_str());
+ //LLAMA_LOG_ERROR("submodel who's name contains %s not found", name1.c_str(), name2.c_str());
return nullptr;
}
@@ -0,0 +1,7 @@
commit 499f6ff441d26b9a720c3d3403bde14695257b9d
Author: Bomeng Wang <wangbomeng@calculet.tech>
AuthorDate: Thu Apr 30 16:18:01 2026 +0800
Commit: Bomeng Wang <wangbomeng@calculet.tech>
CommitDate: Thu Apr 30 16:18:01 2026 +0800
index on (no branch): efa1876b update version print
@@ -0,0 +1,8 @@
commit 81d4fd2c584e6df9199181e44b77fc3d939c0a67
Merge: efa1876b 499f6ff4
Author: Bomeng Wang <wangbomeng@calculet.tech>
AuthorDate: Thu Apr 30 16:18:01 2026 +0800
Commit: Bomeng Wang <wangbomeng@calculet.tech>
CommitDate: Thu Apr 30 16:18:01 2026 +0800
WIP on (no branch): efa1876b update version print
@@ -0,0 +1,13 @@
diff --git a/src/llama-calrt.cpp b/src/llama-calrt.cpp
index 0dd65366a7390fc29423281f515f29406003de51..845d1df3b3e3ac5df45404b08909c5941ea49e54 100644
--- a/src/llama-calrt.cpp
+++ b/src/llama-calrt.cpp
@@ -133,7 +133,7 @@ int calrt_context::decode(const llama_batch & batch_inp) {
// require that all tokens are output
if (n_outputs_all != n_tokens_all) {
LLAMA_LOG_ERROR(
- "%s: pooled embedding requires that all tokens are output (n_outputs_all = %d, n_tokens_all = %d)\n",
+ "%s: pooled embedding requires that all tokens are eoutput (n_outputs_all = %d, n_tokens_all = %d)\n",
__func__, n_outputs_all, n_tokens_all);
return -1;
}
@@ -0,0 +1,13 @@
diff --git a/src/llama-calrt.cpp b/src/llama-calrt.cpp
index 0dd65366a7390fc29423281f515f29406003de51..845d1df3b3e3ac5df45404b08909c5941ea49e54 100644
--- a/src/llama-calrt.cpp
+++ b/src/llama-calrt.cpp
@@ -133,7 +133,7 @@ int calrt_context::decode(const llama_batch & batch_inp) {
// require that all tokens are output
if (n_outputs_all != n_tokens_all) {
LLAMA_LOG_ERROR(
- "%s: pooled embedding requires that all tokens are output (n_outputs_all = %d, n_tokens_all = %d)\n",
+ "%s: pooled embedding requires that all tokens are eoutput (n_outputs_all = %d, n_tokens_all = %d)\n",
__func__, n_outputs_all, n_tokens_all);
return -1;
}
@@ -0,0 +1,8 @@
commit c44438579a1cc573cbdb2519dda46ccd04ddc817
Merge: 207ca38c f06f10a5
Author: Bomeng Wang <wangbomeng@calculet.tech>
AuthorDate: Thu Apr 9 10:37:03 2026 +0800
Commit: Bomeng Wang <wangbomeng@calculet.tech>
CommitDate: Thu Apr 9 10:37:03 2026 +0800
WIP on dev: 207ca38c delet extra printf
@@ -0,0 +1,49 @@
diff --git a/tools/server/server.cpp b/tools/server/server.cpp
index 868d17b418312a2d7898f4b355eef76f509195c5..d2a035baeb46f868c72592d48a64c5ede41efee9 100644
--- a/tools/server/server.cpp
+++ b/tools/server/server.cpp
@@ -1875,7 +1875,7 @@ struct server_slot {
GGML_ASSERT(task);
auto previous_msg = chat_msg;
- SRV_DBG("Parsing chat message: %s\n", generated_text.c_str());
+ //SRV_DBG("Parsing chat message: %s\n", generated_text.c_str());
auto new_msg = common_chat_parse(
generated_text,
/* is_partial= */ stop != STOP_TYPE_EOS,
@@ -1920,13 +1920,17 @@ struct server_slot {
}
void print_timings() const {
- const double t_prompt = t_prompt_processing / n_prompt_tokens_processed;
- const double n_prompt_second = 1e3 / t_prompt_processing * n_prompt_tokens_processed;
+ const double t_copyout_total = t_inference_outcopy / 32 * 31;
+ const double t_copyout_decode = (t_inference_outcopy - t_prefill_inference_outcopy) / 32 * 31;
+ const double t_copyout_prefill = t_prefill_inference_outcopy / 32 * 31;
- const double t_gen = t_token_generation / n_decoded;
- const double n_gen_second = 1e3 / t_token_generation * n_decoded;
+ const double t_prompt = (t_prompt_processing - t_copyout_prefill) / n_prompt_tokens_processed;
+ const double n_prompt_second = 1e3 / (t_prompt_processing - t_copyout_prefill) * n_prompt_tokens_processed;
- const double t_total = t_prompt_processing + t_token_generation;
+ const double t_gen = (t_token_generation - t_copyout_decode) / n_decoded;
+ const double n_gen_second = 1e3 / (t_token_generation - t_copyout_decode) * n_decoded;
+
+ const double t_total = t_prompt_processing + t_token_generation -t_copyout_total ;
const double t_framework_other = t_total - t_inference_accumulated - t_inference_incopy - t_inference_outcopy - t_sampling_accumulated - t_unknown;
const double t_prompt_inference = t_prefill_inference_accumulated / n_prompt_tokens_processed;
@@ -1950,9 +1954,9 @@ struct server_slot {
" [Device] Unknown : %10.2f ms \n"
" [CPU] Sampling: %10.2f ms \n"
" [CPU] Fw Ovhd : %10.2f ms (Batch Prep, Logic, etc.)\n",
- t_prompt_processing, n_prompt_tokens_processed, t_prompt, n_prompt_second,
- t_token_generation, n_decoded, t_gen, n_gen_second,
- t_prompt_processing + t_token_generation, n_prompt_tokens_processed + n_decoded,
+ t_prompt_processing - t_copyout_prefill , n_prompt_tokens_processed, t_prompt, n_prompt_second,
+ t_token_generation - t_copyout_decode , n_decoded, t_gen, n_gen_second,
+ t_prompt_processing + t_token_generation - t_copyout_total, n_prompt_tokens_processed + n_decoded,
t_inference_accumulated, t_prefill_inference_accumulated, t_prompt_inference, t_inference_accumulated - t_prefill_inference_accumulated, t_gen_inference,
t_inference_incopy, t_prefill_inference_incopy, t_prompt_incopy, t_inference_incopy - t_prefill_inference_incopy, t_gen_incopy,
t_inference_outcopy, t_prefill_inference_outcopy, t_prompt_outcopy, t_inference_outcopy - t_prefill_inference_outcopy, t_gen_outcopy,
@@ -0,0 +1,49 @@
diff --git a/tools/server/server.cpp b/tools/server/server.cpp
index 868d17b418312a2d7898f4b355eef76f509195c5..d2a035baeb46f868c72592d48a64c5ede41efee9 100644
--- a/tools/server/server.cpp
+++ b/tools/server/server.cpp
@@ -1875,7 +1875,7 @@ struct server_slot {
GGML_ASSERT(task);
auto previous_msg = chat_msg;
- SRV_DBG("Parsing chat message: %s\n", generated_text.c_str());
+ //SRV_DBG("Parsing chat message: %s\n", generated_text.c_str());
auto new_msg = common_chat_parse(
generated_text,
/* is_partial= */ stop != STOP_TYPE_EOS,
@@ -1920,13 +1920,17 @@ struct server_slot {
}
void print_timings() const {
- const double t_prompt = t_prompt_processing / n_prompt_tokens_processed;
- const double n_prompt_second = 1e3 / t_prompt_processing * n_prompt_tokens_processed;
+ const double t_copyout_total = t_inference_outcopy / 32 * 31;
+ const double t_copyout_decode = (t_inference_outcopy - t_prefill_inference_outcopy) / 32 * 31;
+ const double t_copyout_prefill = t_prefill_inference_outcopy / 32 * 31;
- const double t_gen = t_token_generation / n_decoded;
- const double n_gen_second = 1e3 / t_token_generation * n_decoded;
+ const double t_prompt = (t_prompt_processing - t_copyout_prefill) / n_prompt_tokens_processed;
+ const double n_prompt_second = 1e3 / (t_prompt_processing - t_copyout_prefill) * n_prompt_tokens_processed;
- const double t_total = t_prompt_processing + t_token_generation;
+ const double t_gen = (t_token_generation - t_copyout_decode) / n_decoded;
+ const double n_gen_second = 1e3 / (t_token_generation - t_copyout_decode) * n_decoded;
+
+ const double t_total = t_prompt_processing + t_token_generation -t_copyout_total ;
const double t_framework_other = t_total - t_inference_accumulated - t_inference_incopy - t_inference_outcopy - t_sampling_accumulated - t_unknown;
const double t_prompt_inference = t_prefill_inference_accumulated / n_prompt_tokens_processed;
@@ -1950,9 +1954,9 @@ struct server_slot {
" [Device] Unknown : %10.2f ms \n"
" [CPU] Sampling: %10.2f ms \n"
" [CPU] Fw Ovhd : %10.2f ms (Batch Prep, Logic, etc.)\n",
- t_prompt_processing, n_prompt_tokens_processed, t_prompt, n_prompt_second,
- t_token_generation, n_decoded, t_gen, n_gen_second,
- t_prompt_processing + t_token_generation, n_prompt_tokens_processed + n_decoded,
+ t_prompt_processing - t_copyout_prefill , n_prompt_tokens_processed, t_prompt, n_prompt_second,
+ t_token_generation - t_copyout_decode , n_decoded, t_gen, n_gen_second,
+ t_prompt_processing + t_token_generation - t_copyout_total, n_prompt_tokens_processed + n_decoded,
t_inference_accumulated, t_prefill_inference_accumulated, t_prompt_inference, t_inference_accumulated - t_prefill_inference_accumulated, t_gen_inference,
t_inference_incopy, t_prefill_inference_incopy, t_prompt_incopy, t_inference_incopy - t_prefill_inference_incopy, t_gen_incopy,
t_inference_outcopy, t_prefill_inference_outcopy, t_prompt_outcopy, t_inference_outcopy - t_prefill_inference_outcopy, t_gen_outcopy,
@@ -0,0 +1,7 @@
commit f06f10a592284d02a0e68019abab18f637cb738f
Author: Bomeng Wang <wangbomeng@calculet.tech>
AuthorDate: Thu Apr 9 10:37:03 2026 +0800
Commit: Bomeng Wang <wangbomeng@calculet.tech>
CommitDate: Thu Apr 9 10:37:03 2026 +0800
index on dev: 207ca38c delet extra printf
@@ -0,0 +1,6 @@
object 41e6636ea1fb3884e41fb2023f92b0e7262ef09b
type commit
tag v0.1.0
tagger wangbomeng <wangbomeng@calculet.tech> 1775010837 +0800
add slice and infer/copy time