Files
calculet-npu-research-archive/history/llama.cpp/llama.cpp-dev-vs-master-commits.tsv
T

823 lines
140 KiB
Plaintext
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
fd9bd632f346085920d523dd307a3e4c11cc0a05 e08e473cf292ba73789769b993bb35bcdfc31689 2026-06-01T14:15:35+08:00 wangbomeng llama-bench: fix device-info
e08e473cf292ba73789769b993bb35bcdfc31689 f86112d6758298241ab2fa84ad4f0f7b1ace35c6 2026-06-01T11:47:01+08:00 wangbomeng llama-bench:add device-info
f86112d6758298241ab2fa84ad4f0f7b1ace35c6 d1bc743c10080fed1253686ce01749b42611ded4 2026-05-29T16:40:38+08:00 wangbomeng add dump_pos,fix pos_tensor of pre_by_embeds
d1bc743c10080fed1253686ce01749b42611ded4 2f201160b1960fd7be18b70d5770599d7082dd2f 2026-05-28T14:23:06+08:00 wangbomeng set u_batch = max_seq_len
2f201160b1960fd7be18b70d5770599d7082dd2f f131bf1908b8c5dd1f49d7ae7f616506fc471666 2026-05-27T09:58:31+08:00 wangbomeng delete useless code
f131bf1908b8c5dd1f49d7ae7f616506fc471666 33d96dae28e17208ef61a71dba40cda3c04f135a 2026-05-27T09:38:51+08:00 wangbomeng fix patch of qwen2.5vl,n_patch of minicpm = 64,fix n_ctx_slot,comment out M-ROPE
33d96dae28e17208ef61a71dba40cda3c04f135a 37f068d87cc2d0a0b40ce978031fc9932fc89077 2026-05-22T14:33:45+08:00 wangbomeng add llama-build.sh
37f068d87cc2d0a0b40ce978031fc9932fc89077 13508e5e18bbb1202ae60c2ee5ecbdda1cca817b 2026-05-21T14:07:00+08:00 wangbomeng release
13508e5e18bbb1202ae60c2ee5ecbdda1cca817b b6b7919468126d5ba30a10941825154789e9082f 2026-05-21T11:43:59+08:00 wangbomeng reduce cmake log
b6b7919468126d5ba30a10941825154789e9082f 46847c24fc5c52dd57bb4fb17fc4d684149bb4fa 2026-05-20T16:40:33+08:00 wangbomeng reduce cmake log
46847c24fc5c52dd57bb4fb17fc4d684149bb4fa d028722a12c5a463cc97207787cfd03d7a2590b0 2026-05-20T16:02:12+08:00 wangbomeng Simplify CMakeLists.txt
d028722a12c5a463cc97207787cfd03d7a2590b0 63442fde8dc285817f725bd6c5fae80f478a3813 2026-05-20T14:41:05+08:00 wangbomeng replace cparam.n_ubatch with n_ubatch()
63442fde8dc285817f725bd6c5fae80f478a3813 fc3f4a9fab88e98eff8eeca8cbc6617333edba2c 2026-05-20T11:47:42+08:00 wangbomeng fix ubatch and cmakelist
fc3f4a9fab88e98eff8eeca8cbc6617333edba2c c931ef3163940227c9b6291e04216245cce21429 2026-05-19T16:54:16+08:00 wangbomeng add dump and rt case generation
c931ef3163940227c9b6291e04216245cce21429 a43741244a646d3f8fa3ff01bb9b7d059223d0a5 2026-05-18T17:34:37+08:00 wangbomeng calrt: fix prefill_by_ids.fix create_buf
a43741244a646d3f8fa3ff01bb9b7d059223d0a5 b2003d6c90ef0fa26ab9e930ba3e22b355eb3d39 2026-05-15T14:39:53+08:00 wangbomeng run llama-passkey successfully, fix llama-bench, copy 3 times input to infer qwen2.5vl
b2003d6c90ef0fa26ab9e930ba3e22b355eb3d39 7800c772d44a7415640ec1669a691232939927cf 2026-05-13T15:24:24+08:00 wangbomeng try passkey and embedding
7800c772d44a7415640ec1669a691232939927cf dde8b8228081769c8d8f1e0751d47fa7875f8423 2026-05-13T15:23:54+08:00 wangbomeng try passkey and embedding
dde8b8228081769c8d8f1e0751d47fa7875f8423 fabcc7dac4b34d83fe430980bb364b81087c7ee9 2026-05-12T10:46:08+08:00 wangbomeng clip:add minicpm patch;
fabcc7dac4b34d83fe430980bb364b81087c7ee9 1e9787962f20a7e82c71589ac1dd0585454e4bfe 2026-04-30T16:17:17+08:00 wangbomeng calrt: fix encode dump
1e9787962f20a7e82c71589ac1dd0585454e4bfe f584311c716dd078c4b737eebbfda97fe12b7274 1bec0db5a675ddc60fb793be2a746e8f3c8855dc 2026-04-30T16:06:23+08:00 wangbomeng Merge remote-tracking branch 'origin/dev-ben' into dev
f584311c716dd078c4b737eebbfda97fe12b7274 a339954cc2a145a80c5ea349e7896211916cbed9 2026-04-30T16:05:15+08:00 wangbomeng calrt: fix encode dump
1bec0db5a675ddc60fb793be2a746e8f3c8855dc 465df20c3e1f3f58d0f5531c796e0941a49c32b0 2026-04-30T16:02:59+08:00 wangbomeng bench: support 2 calbins
465df20c3e1f3f58d0f5531c796e0941a49c32b0 a339954cc2a145a80c5ea349e7896211916cbed9 2026-04-30T09:08:12+08:00 wangbomeng support one calbin
a339954cc2a145a80c5ea349e7896211916cbed9 8e76fc330ad624d1768b412d7894e272dbe696f4 eeeef3f6d6a5aad9296323ca15d9d929745b8932 2026-04-29T14:57:55+08:00 wangbomeng Merge branch 'dev' into dev-cli
8e76fc330ad624d1768b412d7894e272dbe696f4 431ad6f1c787f1b47e9e7be14b2e1a7d8565485c 2026-04-29T14:56:59+08:00 wangbomeng finish dev of llama-cli
eeeef3f6d6a5aad9296323ca15d9d929745b8932 431ad6f1c787f1b47e9e7be14b2e1a7d8565485c 2026-04-28T16:16:19+08:00 wangbomeng add unknown time info: prefill and decode
431ad6f1c787f1b47e9e7be14b2e1a7d8565485c efa1876bb8b2a449a55054a8c3745892f2c0f262 2026-04-27T16:52:15+08:00 wangbomeng update calrt_infer
efa1876bb8b2a449a55054a8c3745892f2c0f262 4a2a3181f1cea170105c771e6ba69d851b82b937 2026-04-27T11:35:58+08:00 wangbomeng update version print
4a2a3181f1cea170105c771e6ba69d851b82b937 e3ea5541259f35871c3e995331770aaca297e9ec 2026-04-26T10:56:02+08:00 wangbomeng add calrt-version
e3ea5541259f35871c3e995331770aaca297e9ec 0b8e43943846a1cd05c26c9186b9ef778ebae6e2 2026-04-26T10:55:48+08:00 wangbomeng add calrt-version
0b8e43943846a1cd05c26c9186b9ef778ebae6e2 5eb46fffbd2e260c540fb112314ad67bbb8f56b6 2026-04-26T08:43:43+08:00 wangbomeng to debug
5eb46fffbd2e260c540fb112314ad67bbb8f56b6 005112c51e00d998b457337ca3dad53fc46e2d0b 2026-04-24T16:24:51+08:00 wangbomeng clip: add image_to_patches; calrt: vision copy data from bf16 to fp32
005112c51e00d998b457337ca3dad53fc46e2d0b 509670642e8090a1713f5d73590b549be827aaef 2026-04-24T16:24:31+08:00 wangbomeng clip: add image_to_patches; calrt: vision copy data from bf16 to fp32
509670642e8090a1713f5d73590b549be827aaef 5d219bfcef239c1e3ddd1baecc0514a9462ff6a8 2026-04-24T09:40:34+08:00 wangbomeng rm debug code
5d219bfcef239c1e3ddd1baecc0514a9462ff6a8 6787a53ab9b4897c5a7b51a4062d7b90e6697d35 2026-04-24T09:31:32+08:00 wangbomeng calrt: recover base = batch_index * dict_len
6787a53ab9b4897c5a7b51a4062d7b90e6697d35 e1a76abf66178ea85656479a5e19aea7785c09f4 2026-04-24T09:22:02+08:00 wangbomeng calrt:input of multimodel from fp32 to bf16
e1a76abf66178ea85656479a5e19aea7785c09f4 99dd308adb8488fa869bb669e3335e646a938eff 2026-04-22T16:29:22+08:00 wangbomeng calrt:add CalcoreRT version print
99dd308adb8488fa869bb669e3335e646a938eff 06c7852e99e34c71e24e3ef6001cb54c72970e4d 2026-04-21T15:50:01+08:00 wangbomeng server: fix max_seq_len
06c7852e99e34c71e24e3ef6001cb54c72970e4d 96b4e267e562f44e76ec6c965ee0fa361f0439bf ed62eb33447f993d578e156a3c7e38c91b420ece 2026-04-21T15:06:01+08:00 wangbomeng Merge branch 'dev-ot' into dev
ed62eb33447f993d578e156a3c7e38c91b420ece 015e988a271573a7c11e2a4b45084e1219d69d50 2026-04-21T15:05:22+08:00 wangbomeng try server-test:not success
015e988a271573a7c11e2a4b45084e1219d69d50 99962021f2dd1994dbbf90d5712f0ca2633f20f8 2026-04-17T16:56:08+08:00 wangbomeng little change
96b4e267e562f44e76ec6c965ee0fa361f0439bf 99962021f2dd1994dbbf90d5712f0ca2633f20f8 2026-04-17T15:33:01+08:00 wangbomeng merge dev-ot
99962021f2dd1994dbbf90d5712f0ca2633f20f8 9af6682ef101c6d006c743c703cf150ac25f466f 2026-04-17T14:48:33+08:00 wangbomeng calrt: add onetoken slice and untile_prefill
9af6682ef101c6d006c743c703cf150ac25f466f e24f775ee26ea5249d5ff6cd23b8a0a17fe1438d 2026-04-16T10:09:44+08:00 wangbomeng args: add -ca
e24f775ee26ea5249d5ff6cd23b8a0a17fe1438d a206460e610aef995e36e50b33e8bd41fe477541 2026-04-15T10:01:09+08:00 wangbomeng calrt: add copy_data_to_ibuf for vision model
a206460e610aef995e36e50b33e8bd41fe477541 d8b2aaa00049978cebac15041f960d75b552f97b 2026-04-14T10:23:43+08:00 wangbomeng calrt: support mixture of prefill_by_ids and prefill_by_embeds
d8b2aaa00049978cebac15041f960d75b552f97b b6f29ec8140028619efaa50aa6e73146cecf631d 2026-04-13T11:23:44+08:00 wangbomeng server: fix context-shift
b6f29ec8140028619efaa50aa6e73146cecf631d 6d55eae7e76b768acfcec045b8e84cded8ae3b55 2026-04-13T11:23:31+08:00 wangbomeng server: fix context-shift
6d55eae7e76b768acfcec045b8e84cded8ae3b55 af8055f5f033a730e7e1fe80185b18b7e9473966 2026-04-10T14:58:56+08:00 wangbomeng add annotations
af8055f5f033a730e7e1fe80185b18b7e9473966 6f54682df62b8ec6bb4154b99c47b5becda3291f 2026-04-10T14:58:19+08:00 wangbomeng add annotations
6f54682df62b8ec6bb4154b99c47b5becda3291f 42a181674565411efa5c8b318bc77d6fd084df8a a2d5bf362d6c9a546f9deadf4f8975605a915d33 2026-04-10T09:07:20+08:00 Yunzhe Jia Merge branch 'dev' of http://192.168.10.26:1000/yunzhe/llama.cpp into dev
42a181674565411efa5c8b318bc77d6fd084df8a bd3a57a11aa008e0b5dc2a30f82fcd3a02587208 2026-04-10T09:06:55+08:00 Yunzhe Jia fix prompt_cache issue
a2d5bf362d6c9a546f9deadf4f8975605a915d33 bd3a57a11aa008e0b5dc2a30f82fcd3a02587208 2026-04-09T21:01:46+08:00 Bomeng Wang server: comment fixed time
bd3a57a11aa008e0b5dc2a30f82fcd3a02587208 fcfcdf80b01664a08fb12df879a05df3cc0eba70 74d437ab1456831573def7ca385a74d0ca460c37 2026-04-09T19:42:57+08:00 Yunzhe Jia Merge branch 'dev' of http://192.168.10.26:1000/yunzhe/llama.cpp into dev
fcfcdf80b01664a08fb12df879a05df3cc0eba70 0cd44929b442860dc0e5f88976108be82350f9dc 2026-04-09T19:41:52+08:00 Yunzhe Jia tmp fix one run >4K problem
74d437ab1456831573def7ca385a74d0ca460c37 5813c943005d1ede551e67ee98e35aefd210ff22 0cd44929b442860dc0e5f88976108be82350f9dc 2026-04-09T17:44:26+08:00 wangbomeng Merge branch 'dev' of http://192.168.10.26:1000/yunzhe/llama.cpp into dev
5813c943005d1ede551e67ee98e35aefd210ff22 1f0d5bb0453f93ffa51faf68237c89251c2e0c40 2026-04-09T17:38:57+08:00 wangbomeng add --device-info
1f0d5bb0453f93ffa51faf68237c89251c2e0c40 b8153b6b8f244b223c9f4c2940ae1f212634519e 2026-04-09T17:38:37+08:00 wangbomeng add --device-info
0cd44929b442860dc0e5f88976108be82350f9dc b8153b6b8f244b223c9f4c2940ae1f212634519e 2026-04-09T15:08:50+08:00 Bomeng Wang rm calculet0.txt
b8153b6b8f244b223c9f4c2940ae1f212634519e 82842cfc3fa3d5c004c4540aeff8a81f38509bee 2026-04-09T15:07:02+08:00 wangbomeng server: fix limit tokens to max_seq_len
82842cfc3fa3d5c004c4540aeff8a81f38509bee 622a22991089c6debd5f4b57738f3df3a0bda8b5 2026-04-09T15:06:26+08:00 wangbomeng server: fix limit tokens to max_seq_len
622a22991089c6debd5f4b57738f3df3a0bda8b5 5f47a738ba56a37d0ff281a16212f41979568e35 2026-04-09T10:36:31+08:00 wangbomeng server: comment circle print
5f47a738ba56a37d0ff281a16212f41979568e35 ecf01a17651cd7b1e8b85fd6075e83831463ee23 207ca38c751f7e6c251833eb11e89a2a0bb0fd07 2026-04-09T09:48:20+08:00 Yunzhe Jia Merge branch 'dev' of http://192.168.10.26:1000/yunzhe/llama.cpp into dev
ecf01a17651cd7b1e8b85fd6075e83831463ee23 99d2078e89305035d87d966cee7987c7d50b3925 2026-04-09T09:47:55+08:00 Yunzhe Jia fix n_parallel problem
207ca38c751f7e6c251833eb11e89a2a0bb0fd07 99d2078e89305035d87d966cee7987c7d50b3925 2026-04-08T19:14:37+08:00 wangbomeng delet extra printf
99d2078e89305035d87d966cee7987c7d50b3925 9626239f5a9e568c9975d67dd6745fef90279a87 2026-04-08T19:01:16+08:00 Yunzhe Jia fix buffer resize problem
9626239f5a9e568c9975d67dd6745fef90279a87 da724f3e2a8af2c2537e3edcff41e9415ac66fef 2026-04-08T17:47:04+08:00 wangbomeng calrt: fix MapBuf
da724f3e2a8af2c2537e3edcff41e9415ac66fef 18814f9bf1a423ebe8f32d6043c9cbc5b21b0218 2026-04-08T16:58:32+08:00 Bomeng Wang calrt: add MapBuf
18814f9bf1a423ebe8f32d6043c9cbc5b21b0218 bbee06d6d851e3f84f75b578047967d7e0e4a8dc 2026-04-08T13:55:52+08:00 wangbomeng server : reset inference time
bbee06d6d851e3f84f75b578047967d7e0e4a8dc e126c21ed7b793b648d63533ea7ee30885f5a82a 2026-04-08T11:29:36+08:00 wangbomeng calrt: add test time print
e126c21ed7b793b648d63533ea7ee30885f5a82a 5603e050af07173589f3b8850121263d86da01fd 2026-04-01T10:07:12+08:00 wangbomeng sever: fix commit id
5603e050af07173589f3b8850121263d86da01fd 1e8a16cd0e3ad3c9a0f8746852a0a38c6e52322e 2026-04-01T05:57:55+08:00 wangbomeng calrt: add t_incopy and t_outcopy
1e8a16cd0e3ad3c9a0f8746852a0a38c6e52322e 893e52bda0fee99bbda1521ea733a760bc4201f1 2026-04-01T10:14:22+08:00 wangbomeng calrt: fix slice and add infer/copy time
893e52bda0fee99bbda1521ea733a760bc4201f1 398ecf71f5f574037ce33f84dd1576fa164909ad 2026-03-30T11:35:40+08:00 Bomeng Wang delete unnecessary commit id
398ecf71f5f574037ce33f84dd1576fa164909ad 6d5e83902bdd3142a8ff0d3db19f02a8619e95a0 2026-03-27T02:01:23+08:00 wangbomeng rm llama-server_old.cpp
6d5e83902bdd3142a8ff0d3db19f02a8619e95a0 e4eaab700333490e80ebefc8d023f6c1adfcc312 2026-03-27T00:57:11+08:00 wangbomeng server: printf calrt commit ID
e4eaab700333490e80ebefc8d023f6c1adfcc312 aeacc23a883400db0ebffb50e23355ada054da66 2026-03-25T09:03:55+08:00 wangbomeng calrt: prefil to prefill
aeacc23a883400db0ebffb50e23355ada054da66 cbaa7492663630132adeddccd9fec5e44ffa3336 2026-03-25T08:49:22+08:00 wangbomeng calrt: add slice only on decode
cbaa7492663630132adeddccd9fec5e44ffa3336 3c08ebf0e442cd730ddffd959ec676f9caf31c82 2026-03-25T03:21:02+08:00 wangbomeng reduce warning
3c08ebf0e442cd730ddffd959ec676f9caf31c82 613bc2b9a9d7af92efbe42d876ffcdb244f7a00e 2026-03-24T02:43:03+08:00 wangbomeng calrt: comment LOG_ERROR in untile_decode_cpy
613bc2b9a9d7af92efbe42d876ffcdb244f7a00e 4e194ecc6c4b8ebe4c72d93f6055e3605dbfcefa 2026-03-24T02:30:12+08:00 wangbomeng calrt: fix max_seq_len judgment
4e194ecc6c4b8ebe4c72d93f6055e3605dbfcefa 16cbf81a731f5839a2f6b0eb9d8539826353748b 2026-03-24T01:59:03+08:00 wangbomeng calrt: fix ubatch.embd cpy
16cbf81a731f5839a2f6b0eb9d8539826353748b 8b4e17d990c23025148c4abadefe1010a0dd0734 2026-03-23T09:38:21+08:00 wangbomeng calrt: fix model_name of untile_cpy
8b4e17d990c23025148c4abadefe1010a0dd0734 6dacdd2cf9574214ca272a86674e7bd7ba21c4f0 41e6636ea1fb3884e41fb2023f92b0e7262ef09b 2026-03-23T14:50:27+08:00 wangbomeng merge origin dev
6dacdd2cf9574214ca272a86674e7bd7ba21c4f0 3e6ad64467771224f072e5bad90e270951ba4cdf 2026-03-23T14:42:28+08:00 wangbomeng calrt: add multimodal
3e6ad64467771224f072e5bad90e270951ba4cdf b37b7d9756feb3dac2db526eeab38b572a095d47 2026-03-23T14:36:41+08:00 wangbomeng calrt: add multimodal
41e6636ea1fb3884e41fb2023f92b0e7262ef09b d0a1b2c758440720d42fa108b3444f54593daa73 2026-03-12T16:36:07+08:00 Bomeng Wang server: correct the max_seq_len judgment
d0a1b2c758440720d42fa108b3444f54593daa73 b37b7d9756feb3dac2db526eeab38b572a095d47 2026-03-12T16:10:28+08:00 Bomeng Wang calrt: comment out dump
b37b7d9756feb3dac2db526eeab38b572a095d47 07817cefc14fa359dcecad0630defd3610f8f5c8 7ddafbdcb9426ae3af016925b8b596f11e8742d0 2026-03-10T16:32:31+08:00 Yunzhe Jia Merge branch 'dev' of http://192.168.10.26:1000/yunzhe/llama.cpp into dev
07817cefc14fa359dcecad0630defd3610f8f5c8 b2c45d8ddefb7ec09435231c8ec5b736fabf9c91 2026-03-10T16:32:07+08:00 Yunzhe Jia fix kv issue
7ddafbdcb9426ae3af016925b8b596f11e8742d0 059009eeaf20a569abfbac5eb37dad3bb9376428 2026-03-10T07:13:04+08:00 wangbomeng calrt: commented out cal_ctx->encode(batch)
059009eeaf20a569abfbac5eb37dad3bb9376428 1b073661d1311b5300173993b9f31ee7241d8606 2026-03-10T07:04:22+08:00 wangbomeng calrt: add multimodel
1b073661d1311b5300173993b9f31ee7241d8606 6295273c5866b9249bacdedbfc3a31877e6e6a85 b2c45d8ddefb7ec09435231c8ec5b736fabf9c91 2026-03-10T06:58:35+08:00 wangbomeng Merge branch 'dev' of http://192.168.20.229:1000/yunzhe/llama.cpp into dev
6295273c5866b9249bacdedbfc3a31877e6e6a85 c6ea3f0d2468e3b8eab5de80bacee7fe4c9dd3d7 2026-03-10T06:54:41+08:00 wangbomeng arg: update hf_repo url to https://download.calculet.tech:9443
b2c45d8ddefb7ec09435231c8ec5b736fabf9c91 c6ea3f0d2468e3b8eab5de80bacee7fe4c9dd3d7 2026-03-09T15:03:26+08:00 Bomeng Wang clart: past_kv_len = n_tokens
c6ea3f0d2468e3b8eab5de80bacee7fe4c9dd3d7 f8fba66b657c51a1df1efc7267bfea9f6140cebf 2026-03-09T03:26:47+08:00 wangbomeng CMakeLists: STATIC to SHARED
f8fba66b657c51a1df1efc7267bfea9f6140cebf db4a61d2234c2f457b42ecc3f7219a1e1a35508a 2026-03-06T15:06:36+08:00 Yunzhe Jia fix calrt_install include path
db4a61d2234c2f457b42ecc3f7219a1e1a35508a e672e02ca1a582f9e3a9d011d9e1b4fea4942a25 2026-03-06T06:59:58+08:00 Yunzhe Jia adapt to host-rt install structure
e672e02ca1a582f9e3a9d011d9e1b4fea4942a25 27b82f64252779ad160a3fa76bd378c39421de36 7a3a9a0e76bb5f530beafcfe52e87e388e93117a 2026-03-06T11:47:09+08:00 Yunzhe Jia Merge branch 'dev' of http://192.168.10.26:1000/yunzhe/llama.cpp into dev
27b82f64252779ad160a3fa76bd378c39421de36 0bd95719fed2f0247c8d0199dd897d24157dfae6 2026-03-06T11:42:45+08:00 Yunzhe Jia adapt to calrt_objs target
7a3a9a0e76bb5f530beafcfe52e87e388e93117a 583c387efaf7bc030574e554088de79d09a27fbd 2026-03-05T07:24:59+08:00 wangbomeng calrt_infer: fix past_kv_len
583c387efaf7bc030574e554088de79d09a27fbd 0edc14a60a2d5596f71d728c655e3523da924d89 2026-02-27T02:24:56+08:00 wangbomeng caserver: lim generated tokens to n_ctx_per_seq
0edc14a60a2d5596f71d728c655e3523da924d89 aa0a17d719326a63e0d6fea60aa0ced44e7abc33 2026-02-27T01:57:39+08:00 wangbomeng caserver: limit generated tokens to n_ctx_per_seq
aa0a17d719326a63e0d6fea60aa0ced44e7abc33 fa332e773da681f3e77d6ffe83a87edb557f758b 2026-02-27T01:40:11+08:00 wangbomeng calrt: add bf16_to_fp32
fa332e773da681f3e77d6ffe83a87edb557f758b aa54a7c637f2c92d924a5f35386975b1c27de898 2026-02-27T01:31:42+08:00 wangbomeng Add bf16_to_fp32
aa54a7c637f2c92d924a5f35386975b1c27de898 84f2c0b5f334a7ab77347c6779b6027a951d0ff0 2026-02-27T01:30:36+08:00 wangbomeng Add bf16_to_fp32
84f2c0b5f334a7ab77347c6779b6027a951d0ff0 0bd95719fed2f0247c8d0199dd897d24157dfae6 2026-02-09T01:46:36+08:00 wangbomeng add bf16_to_fp32 in untile_decode/prefill_cpy
0bd95719fed2f0247c8d0199dd897d24157dfae6 365eb0b719e30b0f9e348d854f11c9c3f954a96e 2026-02-07T10:25:06+08:00 Yunzhe Jia fix get_model_by_name
365eb0b719e30b0f9e348d854f11c9c3f954a96e 886cd1fb3b217efcf51c46209fcb694022346797 2026-02-07T09:05:17+08:00 Yunzhe Jia comment out pos buffer file
886cd1fb3b217efcf51c46209fcb694022346797 9328f21378275f2354a19c3af907332b216ab492 2026-02-06T17:36:54+08:00 Yunzhe Jia fix compile problem
9328f21378275f2354a19c3af907332b216ab492 49fea70a20f550bfdb59d0ffe041b54919c22447 2026-01-28T15:32:36+08:00 Yunzhe Jia add prefill-only mode
49fea70a20f550bfdb59d0ffe041b54919c22447 74a118df31b6a4acc8876b2a2db90d2395cc6ec3 2026-01-28T09:11:16+08:00 Yunzhe Jia adapt to new calbin test_case
74a118df31b6a4acc8876b2a2db90d2395cc6ec3 98e8f9acfe87cd93646482cb2d942b8a132f0852 2026-01-13T14:32:47+08:00 Yunzhe Jia sync with calrt update
98e8f9acfe87cd93646482cb2d942b8a132f0852 8c8152a04036bb0d4756a4e08e54f514dae4e64d 2025-12-10T00:20:57+08:00 Yunzhe Jia add timestamp
8c8152a04036bb0d4756a4e08e54f514dae4e64d 5d2387931528fbe04aa8d66de935147efb65ca4d 2025-12-09T14:40:04+08:00 Yunzhe Jia adapt to calrt csr
5d2387931528fbe04aa8d66de935147efb65ca4d e6285a748657add8d974b78ca920c5b41753ee12 2025-12-08T16:40:34+08:00 Yunzhe Jia add timestamp for one decode process
e6285a748657add8d974b78ca920c5b41753ee12 6b1ecdbbe3cc72ed8888be38f9e934cfd79b9fbb 2025-11-27T16:58:35+08:00 Yunzhe Jia adapt to calrt
6b1ecdbbe3cc72ed8888be38f9e934cfd79b9fbb 240d9bb75241c91896afe125f2fc74698a7395f3 2025-11-25T17:06:14+08:00 Yunzhe Jia add kv_tensor for pld test
240d9bb75241c91896afe125f2fc74698a7395f3 7eeb241aad429a68fb8cfa3ba85d000fb2348cd2 2025-11-24T12:03:00+08:00 Yunzhe Jia adapt to calrt modification
7eeb241aad429a68fb8cfa3ba85d000fb2348cd2 dfb6250031a25058dbc3757e8a7ec75d90dcb48a 2025-11-21T09:20:01+08:00 Yunzhe Jia fix byte_size error
dfb6250031a25058dbc3757e8a7ec75d90dcb48a e31bce25e85dc7fdf0a0e69fd0e58ba4a2ffaf3e 2025-11-18T10:28:00+08:00 Yunzhe Jia add elf in CMakelist
e31bce25e85dc7fdf0a0e69fd0e58ba4a2ffaf3e 6444e227c36df16199c40d8cead2244fe014f377 2025-11-07T11:52:17+08:00 Yunzhe Jia dump src tensor
6444e227c36df16199c40d8cead2244fe014f377 d81d7b190ff5f21325167936496dfe5ab48b922e 2025-11-07T09:19:11+08:00 Yunzhe Jia test golden case
d81d7b190ff5f21325167936496dfe5ab48b922e e492f5dc8cec17529f53ef2bbdf7b502107f8148 1f5accb8d0056e6099cd5b772b1cb787dd590a13 2025-11-04T14:43:32+08:00 Yunzhe Jia Merge branch 'master' into dev
e492f5dc8cec17529f53ef2bbdf7b502107f8148 2e05afd22b3d77c7013b11eee88e88b17188f21a 2025-11-04T14:09:59+08:00 Yunzhe Jia redo untile logic
1f5accb8d0056e6099cd5b772b1cb787dd590a13 2759ccdb4adc8568add4316780d5e675519b0775 2025-11-04T05:04:59Z Noah Fix garbled output with REPACK at high thread counts (#16956)
2759ccdb4adc8568add4316780d5e675519b0775 c5023daf607c578d6344c628eb7da18ac3d92d32 2025-11-04T10:53:48+08:00 Aman Gupta CUDA: avoid mul + bias fusion when doing fusion (#16935)
c5023daf607c578d6344c628eb7da18ac3d92d32 e7da30b584dc1f2ee0414c4a1298ce64eef97e8d 2025-11-03T11:47:57-08:00 lhez opencl: support imrope (#16914)
e7da30b584dc1f2ee0414c4a1298ce64eef97e8d ed8aa63320393512bdcfe4b05b5ae01ba91888e1 2025-11-03T18:53:26+01:00 Aleksander Grygier fix: Viewing multiple PDF attachments (#16974)
ed8aa63320393512bdcfe4b05b5ae01ba91888e1 48bd26501b08a3f0bff1249db47f313641f7bebb 2025-11-03T18:01:59+01:00 Daniel Bevenius model-conversion : pass config to from_pretrained (#16963)
48bd26501b08a3f0bff1249db47f313641f7bebb 622cd010ff4a65bef67edbf2f9bf4707c01f98f7 2025-11-03T15:38:23+02:00 Georgi Gerganov server : add props.model_alias (#16943)
622cd010ff4a65bef67edbf2f9bf4707c01f98f7 070ff4d5356083d60b807bb34d36b31c3653a29e 2025-11-03T14:29:11+01:00 theo77186 ggml: CUDA: add head size 72 for flash-attn (#16962)
070ff4d5356083d60b807bb34d36b31c3653a29e bf7b0c9725ed0c406c5debaea022ec7258430634 2025-11-03T11:11:18+01:00 Xuan-Son Nguyen mtmd: add --image-min/max-tokens (#16921)
bf7b0c9725ed0c406c5debaea022ec7258430634 fcfce040e816c542f374ad51461b3561d73c4bc9 2025-11-03T10:25:55+01:00 Xuan-Son Nguyen mtmd: pad mask for qwen2.5vl (#16954)
fcfce040e816c542f374ad51461b3561d73c4bc9 ee3a5a10adf9e83722d1914dddc56a0623ececaf 2025-11-03T14:40:02+08:00 Jinyang He ggml : LoongArch fixes (#16958)
ee3a5a10adf9e83722d1914dddc56a0623ececaf 7e994168b1ccc12337ba8de939c4fd466107c1fb 2025-11-03T05:33:56Z Olivier Chafik sync: minja (glm 4.6 & minmax m2 templates) (#16949)
7e994168b1ccc12337ba8de939c4fd466107c1fb bcfa87622ae46be6345a8e3dfdbdc5ba5414042b 2025-11-03T03:35:33+02:00 shani-f SYCL: optimized repeat_back kernel (3× fewer asm instructions, 2× faster)Feature/sycl repeat back opt (#16869)
bcfa87622ae46be6345a8e3dfdbdc5ba5414042b a2054e3a8ff0da3978a4acc18c349ff58554d336 2025-11-03T00:41:08+01:00 Sascha Rogmann feat(webui): improve LaTeX rendering with currency detection (#16508)
a2054e3a8ff0da3978a4acc18c349ff58554d336 dd5286805004db1f9ac3176a1cbbfe373bdda0f8 2025-11-03T04:40:30+05:30 Shagun Bera test-backend-ops : fix segfault in moe-expert-reduce test in support mode and coverage (#16936)
dd5286805004db1f9ac3176a1cbbfe373bdda0f8 6b9a52422bac0f50dd8f1f8386744fa3ce9783bf 2025-11-02T23:11:21+01:00 Sigbjørn Skjæret ci : disable failing riscv cross build (#16952)
6b9a52422bac0f50dd8f1f8386744fa3ce9783bf 2f966b8ed87514e74bb96592217226cb6a6974dd 2025-11-02T13:08:04-08:00 Zhiyong Wang model: add Janus Pro for image understanding (#16906)
2f966b8ed87514e74bb96592217226cb6a6974dd cd5e3b57541ecc52421130742f4d89acbcf77cd4 2025-11-02T22:21:48+02:00 Georgi Gerganov clip : use FA (#16837)
cd5e3b57541ecc52421130742f4d89acbcf77cd4 87c9efc3b297b8a498716b1db3d061842e6fc85b 2025-11-02T18:14:04+02:00 Georgi Gerganov server : support unified cache across slots (#16736)
87c9efc3b297b8a498716b1db3d061842e6fc85b 76af40aaaad78c42faecd8016a88362c788b84b0 2025-11-02T08:56:28-06:00 Aldehir Rojas common : move gpt-oss reasoning processing to init params (#16937)
76af40aaaad78c42faecd8016a88362c788b84b0 7db35a7958a943be1693879f42d166f152613979 2025-11-02T10:28:37+01:00 Adrian Lundberg docs: remove llama_sampler_accept reference in sampling sample usage (#16920)
7db35a7958a943be1693879f42d166f152613979 a864132ba546b6385922226480ee4e392aaa065c 2025-11-02T08:42:57+05:30 mnehete32 CUDA: add FLOOR, CEIL, ROUND, TRUNC unary ops (#16917)
a864132ba546b6385922226480ee4e392aaa065c d38d9f0877a5872daa3c5f06fb9a86376bf15d50 2025-11-02T08:48:46+08:00 Aaron Teo devops: fix failing s390x docker build (#16918)
d38d9f0877a5872daa3c5f06fb9a86376bf15d50 7fd205a8e8832ead273f62c5fd81d2b8aa910535 2025-11-02T08:48:23+08:00 Aaron Teo ggml: add s390x cpu-feats (#16774)
7fd205a8e8832ead273f62c5fd81d2b8aa910535 2f68ce7cfd20e9e7098514bf730e5389b7bba908 2025-11-02T00:15:31+02:00 Georgi Gerganov scripts : add script to bench models (#16894)
2f68ce7cfd20e9e7098514bf730e5389b7bba908 e4a71599e5846110159955dec0008eb4aa24222b 2025-11-01T19:49:51+01:00 Pascal webui: auto-refresh /props on inference start to resync model metadata (#16784)
e4a71599e5846110159955dec0008eb4aa24222b dd5e8cab512c7752392b6e51a6f118f348fb3f16 2025-11-01T17:14:54+01:00 Pascal webui: add HTML/JS preview support to MarkdownContent with sandboxed iframe (#16757)
dd5e8cab512c7752392b6e51a6f118f348fb3f16 cf659bbb8ef9eb048e5153a27cf787fd83c05560 2025-11-01T16:52:17+01:00 Adrien Gallouët vendor : update cpp-httplib to 0.27.0 (#16846)
cf659bbb8ef9eb048e5153a27cf787fd83c05560 d8b860a219c2415faac8cc0e50b48b4aa11e3b64 2025-11-01T15:51:36+01:00 Xuan-Son Nguyen mtmd: refactor preprocessing + support max/min pixels (#16878)
d8b860a219c2415faac8cc0e50b48b4aa11e3b64 1ae74882f8f6755e44dff8f23f3abdc5b53ab7c1 2025-11-01T15:35:57+01:00 Aleksander Grygier Add a setting to display message generation statistics (#16901)
1ae74882f8f6755e44dff8f23f3abdc5b53ab7c1 961660b8c395afb8903f61ace69396a158ea0cb4 2025-11-01T15:02:57+01:00 Jaromír Hradílek webui: recognize AsciiDoc files as valid text files (#16850)
961660b8c395afb8903f61ace69396a158ea0cb4 74fef4129fa58f6277c243777a4894371479dbad 2025-11-01T11:01:42+01:00 Sigbjørn Skjæret common : allow --system-prompt-file for diffusion-cli (#16903)
74fef4129fa58f6277c243777a4894371479dbad 5d8bb900bc7daa84bfa7bb1d25ab7e32394919f3 2025-11-01T08:55:25+01:00 Sigbjørn Skjæret codeowners : update after refactor (#16905)
5d8bb900bc7daa84bfa7bb1d25ab7e32394919f3 2e76e013600cb0d51ccf158571ca1d0502952a07 2025-11-01T00:52:14-05:00 Jeff Bolz vulkan: Fix multi_add invalid descriptor usage (#16899)
2e76e013600cb0d51ccf158571ca1d0502952a07 d3dc9dd898be805c23a408cc36daed5b3bf29221 2025-11-01T00:45:28-05:00 Jeff Bolz vulkan: fuse mul_mat+add and mul_mat_id+add_id (#16868)
d3dc9dd898be805c23a408cc36daed5b3bf29221 bea04522ff1a0d8559ccfd353aa018dcfbb608cc 2025-11-01T06:13:26+01:00 Oliver Simons CUDA: Remove unneded bias/gate dims in fused mmvq (#16858)
bea04522ff1a0d8559ccfd353aa018dcfbb608cc 0de0a01576772032008a689afc4d7c80685074c4 2025-10-31T23:40:23+01:00 Piotr Wilkin (ilintar) refactor : llama-model.cpp (#16252)
0de0a01576772032008a689afc4d7c80685074c4 e58d585604bbbbbc24f8149effe444621b5191c6 2025-10-31T21:20:47+01:00 Piotr Wilkin (ilintar) model : Minimax M2 (#16831)
e58d585604bbbbbc24f8149effe444621b5191c6 31c511a968348281e11d590446bb815048a1e912 2025-10-31T21:20:07+01:00 Giuseppe Scrivano model : add Granite Hybrid nano types (#16896)
31c511a968348281e11d590446bb815048a1e912 6d39015a744b47bb7643ea73f412e6d64677f305 2025-10-31T15:57:19+01:00 Johannes Gäßler CUDA: Volta tensor core support for MMF (#16843)
6d39015a744b47bb7643ea73f412e6d64677f305 4146d6a1a6228711a487a1e3e9ddd120f8d027d7 2025-10-31T16:25:50+02:00 Georgi Gerganov sync : ggml
4146d6a1a6228711a487a1e3e9ddd120f8d027d7 8da3c0e200a586f768ada6f38745acb01380174c 2025-10-31T20:05:07+08:00 Aman Gupta CUDA: add expert reduce kernel (#16857)
8da3c0e200a586f768ada6f38745acb01380174c c22473b580807929fd9e3a3344a48e8cfbe6c88f 2025-10-31T13:50:33+02:00 Georgi Gerganov batch : fix consistency checks for the input positions (#16890)
c22473b580807929fd9e3a3344a48e8cfbe6c88f 0f715b4e759acceccb9f437cfd2a988fff85514a 2025-10-31T10:54:19+02:00 Georgi Gerganov server : don't print user inputs to console (#16871)
0f715b4e759acceccb9f437cfd2a988fff85514a d2d931f173b8a736b08999436e9259aafddec718 2025-10-31T09:51:26+01:00 Daniel Bevenius server : fix typos in server.cpp comments [no ci] (#16883)
d2d931f173b8a736b08999436e9259aafddec718 2976b0374d36609b0429dd6ce48807e2ad39a7c2 2025-10-31T02:34:47-05:00 Jeff Bolz vulkan: disable spirv-opt for rope shaders (#16872)
2976b0374d36609b0429dd6ce48807e2ad39a7c2 d2a2673dd1c86a01ab010e18b13b8bb959968c48 2025-10-31T16:18:59+09:00 Masato Nakasaka vulkan: Fix crash when FP16 mul_mat accumulation is not supported (#16796)
d2a2673dd1c86a01ab010e18b13b8bb959968c48 13002a08960e51a76c4d696165b5d7638d2f2b99 2025-10-31T08:14:49+01:00 Ruben Ortlam vulkan: fix shmem overrun in mmq id shader (#16873)
2e05afd22b3d77c7013b11eee88e88b17188f21a c20c0a5c0c44179f5267a262546624854b1203d1 2025-10-31T14:06:06+08:00 Yunzhe Jia add pcie support
13002a08960e51a76c4d696165b5d7638d2f2b99 6eb208d17ea29bb60295d9a2b5e7122dfb8f4b55 2025-10-31T12:46:31+08:00 l3utterfly ggml-hexagon: respect input size when getting/setting tensor data (#16836)
6eb208d17ea29bb60295d9a2b5e7122dfb8f4b55 9984cbb61d12491d604484fb38b678fa15064061 2025-10-31T00:34:27+01:00 Sigbjørn Skjæret ci : enable free-disk-space on cuda docker build (#16877)
9984cbb61d12491d604484fb38b678fa15064061 ce18efeaf1234bd08f25bc08f88ef95cf5d9e51f 2025-10-30T16:00:20-07:00 lhez opencl: fix boundary handling for mul_mm (#16875)
ce18efeaf1234bd08f25bc08f88ef95cf5d9e51f 16724b5b6836a2d4b8936a5824d2ff27c52b4517 2025-10-30T23:15:03+01:00 RodriMora convert : update transformers requirements (#16866)
16724b5b6836a2d4b8936a5824d2ff27c52b4517 b52edd25586fabb70f0c21b274473b307cf14499 2025-10-30T14:22:23-04:00 chansikpark server : bump request URI max length to 32768 (#16862)
b52edd25586fabb70f0c21b274473b307cf14499 517b7170e1a4d733583c4b07c5b7a49acc05911c 2025-10-30T18:42:57+02:00 Georgi Gerganov server : remove n_past (#16818)
517b7170e1a4d733583c4b07c5b7a49acc05911c 835e918d8428f5119927d7150bf5a26176dedda0 2025-10-30T09:06:13-07:00 Max Krasnyansky cpu: introduce chunking for repack matmuls and enable matmul-id chunking on ARM64 (#16833)
835e918d8428f5119927d7150bf5a26176dedda0 d261223d24e97f2df50220e4a5b7f0adb69bba81 2025-10-30T21:17:31+05:30 Shagun Bera common: fix typo in cli help text (#16864)
d261223d24e97f2df50220e4a5b7f0adb69bba81 dcca0d3ab840ebe9b2ccd4719033d408eeb758d7 2025-10-30T23:19:14+08:00 JJJYmmm model: add support for qwen3vl series (#16780)
dcca0d3ab840ebe9b2ccd4719033d408eeb758d7 bacddc049a00786df44e682262f6e298742bfbc3 2025-10-30T05:26:05-07:00 Max Krasnyansky cpu: introduce chunking for flash attention (#16829)
bacddc049a00786df44e682262f6e298742bfbc3 229bf686287d18f82c44e89888cc662145ecfdb4 2025-10-30T07:18:50-04:00 Tianyue-Zhao model: Add support for CogVLM model (#15002)
229bf686287d18f82c44e89888cc662145ecfdb4 d7395115baf395b75a73a17b0b796e746e468da9 2025-10-30T08:56:28+01:00 Sigbjørn Skjæret cuda : fix argsort with 64k+ rows (#16849)
d7395115baf395b75a73a17b0b796e746e468da9 052df28b0e3ca0398e5928c61c7de40254317894 2025-10-30T14:30:58+08:00 Jan Boon llama : use std::abs instead of abs (#16853)
052df28b0e3ca0398e5928c61c7de40254317894 8b11deea4663f29d3e042ce1056ba643264cd5f1 2025-10-30T01:27:41-05:00 Jeff Bolz vulkan: Handle argsort with a large number of rows (#16851)
8b11deea4663f29d3e042ce1056ba643264cd5f1 b9ce94017729465895402cbcfffb51fa926c15e3 2025-10-30T04:34:15+01:00 Oliver Simons Hide latency of bias and gate-loading (#16847)
b9ce94017729465895402cbcfffb51fa926c15e3 3464bdac37027c5e9661621fc75ffcef3c19c6ef 2025-10-29T15:13:10-05:00 Jeff Bolz vulkan: Fuse rope+set_rows (#16769)
3464bdac37027c5e9661621fc75ffcef3c19c6ef e3af5563bd049141e036b50f843196db33d23e97 2025-10-29T20:11:39+01:00 Xuan-Son Nguyen llama: fix ASAN error with M-RoPE (#16848)
e3af5563bd049141e036b50f843196db33d23e97 10fcc41290e233788f5a4215314156e8e023eb92 2025-10-29T18:09:18+01:00 Xuan-Son Nguyen llama: store mrope data in KV cell (#16825)
10fcc41290e233788f5a4215314156e8e023eb92 bcf5bda6f5df559565d11d7c8e8295c1159a85ec 2025-10-29T08:44:29-05:00 Jeff Bolz vulkan: Update topk_moe fusion to handle gpt's late softmax (#16656)
bcf5bda6f5df559565d11d7c8e8295c1159a85ec 3eb2be1ca5f37480aeb16102970d9e65f43347fe 2025-10-29T14:39:03+01:00 Ruben Ortlam Vulkan MMQ Integer Dot Refactor and K-Quant support (#16536)
3eb2be1ca5f37480aeb16102970d9e65f43347fe e41bcce8f0b53032a1fed275cd253e931c041cf6 2025-10-29T06:29:12-07:00 Max Krasnyansky Hexagon Op queue & dispatch optimizations (#16820)
e41bcce8f0b53032a1fed275cd253e931c041cf6 144a4ce824b6bd0e48d62009d10cae1daf5308db 2025-10-29T21:11:53+08:00 Aman Gupta CUDA: use fastdiv in set-rows (#16834)
144a4ce824b6bd0e48d62009d10cae1daf5308db f549b0007dbdd683215820f7229ce180a12b191d 2025-10-29T14:09:50+01:00 Sigbjørn Skjæret vendor : sync minja (#16500)
f549b0007dbdd683215820f7229ce180a12b191d 9a3ea685b937c0f0cbfda2e50004ea54bf187512 2025-10-29T03:53:04-05:00 Jeff Bolz vulkan: Call ggml_vk_buffer_write_2d from ggml_vk_buffer_copy (#16793)
9a3ea685b937c0f0cbfda2e50004ea54bf187512 338074c383c81366320d176d83b94b0a567ee0c2 2025-10-29T15:55:06+08:00 Aman Gupta CUDA: Fix bug in topk-moe for gpt-oss (#16821)
338074c383c81366320d176d83b94b0a567ee0c2 851553ea6b24cb39fd5fd188b437d777cb411de8 2025-10-29T08:14:39+02:00 YaelLogic sycl: add RMS_NORM_BACK operation support (#16808)
851553ea6b24cb39fd5fd188b437d777cb411de8 85a7d8677bf2200981e52f744a21d5267964ffcf 2025-10-28T21:10:28+02:00 YaelGitAccount cuda: add SET operation support (#16804)
85a7d8677bf2200981e52f744a21d5267964ffcf a8ca18b4b815a2abdbecb958ee5f4c542d69aac7 2025-10-28T20:19:44+02:00 Georgi Gerganov memory : remove KV cache size padding (#16812)
a8ca18b4b815a2abdbecb958ee5f4c542d69aac7 8284efc35c909217ee1b9a06903245d808ac2283 2025-10-28T19:41:43+02:00 Georgi Gerganov llama-bench : clarify benchmarked parts of the computation (#16823)
8284efc35c909217ee1b9a06903245d808ac2283 1c1409e13169d0ced4b1b4d39fb5b268b7525091 2025-10-28T23:16:20+08:00 l3utterfly initialise buffer.device in ggml_hexagon_session (#16816)
1c1409e13169d0ced4b1b4d39fb5b268b7525091 7a0e900e3615fa46c074a7fdf900b47d3c0a1c7e 2025-10-28T03:51:41-07:00 Sam Malayek embedding: add raw option for --embd-output-format (#16541)
7a0e900e3615fa46c074a7fdf900b47d3c0a1c7e 280d97be9660e7a5feaa28a6e7a299bc73dd83fc 2025-10-28T11:23:54+01:00 Johannes Gäßler llama: consistent ctx <-> buf order for KV cache (#16746)
280d97be9660e7a5feaa28a6e7a299bc73dd83fc 3479efd112b3910d2d008ad08fe4cb4895605903 2025-10-28T03:37:52-05:00 Aldehir Rojas grammar : support array references in json schema (#16792)
3479efd112b3910d2d008ad08fe4cb4895605903 463bbf20bfbe0da10ac58984d4d62bed5a49362a 2025-10-28T10:54:53+08:00 Chenguang Li CANN: Improve device ID handling and aclnnArange checks (#16752)
463bbf20bfbe0da10ac58984d4d62bed5a49362a ad8d36beffd791db10c94eb9e964afb891e3ca55 2025-10-28T10:31:21+08:00 Aman Gupta CUDA: add unused vars to mmvf and mmvq (#16807)
ad8d36beffd791db10c94eb9e964afb891e3ca55 c053e18a66dd95dc340aa61317877c2a41d4e3cf 2025-10-28T03:50:33+02:00 tamarPal sycl: add SSM_CONV operation support (#16800)
c053e18a66dd95dc340aa61317877c2a41d4e3cf e1ab0848037c9f9bfe68b3e1cee9ee375e1018a3 2025-10-27T18:54:01-04:00 Yuri Khrustalev chat: Add LFM2 tool handling (#16763)
e1ab0848037c9f9bfe68b3e1cee9ee375e1018a3 5a4ff43e7dd049e35942bc3d12361dab2f155544 2025-10-27T23:12:16+01:00 Xuan-Son Nguyen mtmd : fix idefics3 preprocessing (#16806)
5a4ff43e7dd049e35942bc3d12361dab2f155544 10640e31aab0819f31c1e1f2d008b019ee737232 2025-10-27T13:51:28-07:00 Diego Devesa llama : disable pipeline parallelism if compute buffer allocation fails (#16748)
10640e31aab0819f31c1e1f2d008b019ee737232 80d28f104c0c3e61c11d6af073642b246a9fc19c 2025-10-27T21:50:22+01:00 Acly ggml : fix interpolate with align-corners and ne=1 (#16700)
80d28f104c0c3e61c11d6af073642b246a9fc19c c55d53acec864f64afa1ba92972203dce1bf88f5 2025-10-27T21:39:49+01:00 Johannes Gäßler HIP: fix AMDGPU_TARGETS, update documentation (#16803)
c55d53acec864f64afa1ba92972203dce1bf88f5 945501f5ea4b8ca56b181ecb035e9ee3fb31f432 2025-10-27T16:02:58+01:00 Xuan-Son Nguyen model : add LightOnOCR-1B model (#16764)
945501f5ea4b8ca56b181ecb035e9ee3fb31f432 75cbdd3fce38ea12d50cd19e73a069aa5dbbd5fa 2025-10-27T09:17:31+01:00 Johannes Gäßler llama: fix leaked buffers for mmap + split files (#16765)
75cbdd3fce38ea12d50cd19e73a069aa5dbbd5fa 2b9bd9bf4e759c05db629ec1c391dc8aeaa71887 2025-10-27T09:25:10+08:00 Aman Gupta test-backend-ops: print failed tests at the end (#16785)
2b9bd9bf4e759c05db629ec1c391dc8aeaa71887 59fc1ec8e83b14354c1a3a8acf8c5c2cbf9af42f 2025-10-27T03:20:24+02:00 tamarPal sycl: add ROLL operation support (#16665)
59fc1ec8e83b14354c1a3a8acf8c5c2cbf9af42f 75d33b9302f84a5b89f82205d2bcd8def5a64e0a 2025-10-27T03:19:50+02:00 shani-f sycl: add REPEAT_BACK operation support (#16734)
75d33b9302f84a5b89f82205d2bcd8def5a64e0a 3470a5c891dcc94363e492a3760af92b6b07241c 2025-10-27T09:06:16+08:00 Aman Gupta CUDA: support for weight clamp in top-k norm (#16702)
3470a5c891dcc94363e492a3760af92b6b07241c bd562fe4f7bd55625511d5f9d639c4fb1db1d440 2025-10-26T23:19:03+01:00 Acly ggml-alloc : make gallocr prefer chunks that allow memory reuse (#16788)
bd562fe4f7bd55625511d5f9d639c4fb1db1d440 bbac6a26b2bd7f7c1f0831cb1e7b52734c66673b 2025-10-26T21:31:41+01:00 Sigbjørn Skjæret cuda : use fast copy when src and dst are of different type and contiguous (#16789)
bbac6a26b2bd7f7c1f0831cb1e7b52734c66673b 73a48c9790d320476b3e5ef75bda09f2f8269e6e 2025-10-27T02:13:31+08:00 leejet ggml: fix cuda kernel launch configuration for k_compute_batched_ptrs to support large batch (#16744)
73a48c9790d320476b3e5ef75bda09f2f8269e6e f696428ce8e4d16c17acbffeaa7feac3b0fb9061 2025-10-26T17:21:23+01:00 Sigbjørn Skjæret convert : enable expert group selection for all models with it (#16691)
f696428ce8e4d16c17acbffeaa7feac3b0fb9061 7cce4f8158f0c4c88d8dadd4c23d33938127b897 2025-10-26T17:20:32+01:00 Sigbjørn Skjæret graph : add clamping to ffn_moe_weights_sum to avoid div-by-zero (#16655)
7cce4f8158f0c4c88d8dadd4c23d33938127b897 8d8862829cd770fc9c0c7a726ed162de824ff5ea 2025-10-26T16:08:52+01:00 Sigbjørn Skjæret model : set res->t_embd in SmallThinker models (#16782)
8d8862829cd770fc9c0c7a726ed162de824ff5ea f77c13b91f4d25754b6a0b857f98a6bc922a0aa7 2025-10-26T14:01:20+02:00 amirai21 docs : add Jamba to Text-only models list (#16778)
f77c13b91f4d25754b6a0b857f98a6bc922a0aa7 3cfa9c3f125763305b4226bc032f1954f08990dc 2025-10-26T19:28:04+08:00 Aman Gupta CUDA: General GEMV fusion (#16715)
3cfa9c3f125763305b4226bc032f1954f08990dc 5d195f17bc60eacc15cfb929f9403cf29ccdf419 2025-10-26T06:37:38+02:00 Gilad S. vulkan: deduplicate Microsoft Direct3D12 devices (#16689)
5d195f17bc60eacc15cfb929f9403cf29ccdf419 226f295f4dd92ad714533adc5497afed5fa88bb8 2025-10-25T20:41:36+02:00 Galunid convert : handle mmproj filename/path properly (#16760)
226f295f4dd92ad714533adc5497afed5fa88bb8 f90b4a8efe4466215c51155a5c22c1ae6207da23 2025-10-25T19:26:27+09:00 Shunta Saito model : set res->t_embd in PLaMo2 models (#16766)
f90b4a8efe4466215c51155a5c22c1ae6207da23 8423d019318b446640bb620e4ce80066d8530f05 2025-10-25T10:59:54+02:00 Giuseppe Scrivano vulkan: delete dead code (#16732)
8423d019318b446640bb620e4ce80066d8530f05 5cca2542ac3f3f86831d32bce744d08fc2b353b0 2025-10-25T00:04:12-05:00 Jeff Bolz vulkan: Optimize SSM_SCAN (#16645)
5cca2542ac3f3f86831d32bce744d08fc2b353b0 55945d2ef51b93821d4b6f4a9b994393344a90db 2025-10-24T20:52:00-04:00 compilade convert : avoid dequantizing mxfp4 for GPT-OSS (#16756)
55945d2ef51b93821d4b6f4a9b994393344a90db 0bcb40b48c6fc6f17ba9672625e526ab2574344b 2025-10-25T03:39:37+08:00 leejet ggml: fix CUDA grid launch condition for large block_nums.y in binbcast (#16742)
0bcb40b48c6fc6f17ba9672625e526ab2574344b 69e9ff010309a1155d704cf9320bdb3aaf4160ca 2025-10-24T20:46:19+08:00 Aman Gupta CUDA: use CUB for arbitary size argsort (#16754)
69e9ff010309a1155d704cf9320bdb3aaf4160ca 5a91109a5d7dab5d7adc40bedb397ede99a705b1 2025-10-24T14:10:29+02:00 Florian Badie webui: support q URL parameter (#16728)
5a91109a5d7dab5d7adc40bedb397ede99a705b1 f8f071faddf32ea09f4234edb6e809b380a9ee26 2025-10-24T12:02:02+02:00 Daniel Bevenius model-conversion : add trust_remote_code for orig model run [no ci] (#16751)
f8f071faddf32ea09f4234edb6e809b380a9ee26 0bf47a1dbba4d36f2aff4e8c34b06210ba34e688 2025-10-23T16:31:41-04:00 compilade convert : handle pre-quantized models (#14810)
0bf47a1dbba4d36f2aff4e8c34b06210ba34e688 dd62dcfab97e420949519fd0eac9fca7bf97e635 2025-10-23T21:30:17+02:00 Johannes Gäßler server: add memory breakdown print (#16740)
dd62dcfab97e420949519fd0eac9fca7bf97e635 d0660f237a5c31771a3d6d1030ebe3e0c409ba92 2025-10-23T15:54:46+02:00 Julien Denize convert : Make mistral-common dependency optional (#16738)
d0660f237a5c31771a3d6d1030ebe3e0c409ba92 fe6a9882acf5c02f96624ed8f80144100d7006cb 2025-10-23T15:00:49+02:00 Xuan-Son Nguyen mtmd-cli : allow using --jinja (#16718)
fe6a9882acf5c02f96624ed8f80144100d7006cb 061f0eff02dc9a82f7bd850db3bd70b8a0b5e87a 2025-10-23T17:07:31+05:30 Prajwal B Mehendarkar Manually link -lbsd to resolve flock symbol on AIX (#16610)
061f0eff02dc9a82f7bd850db3bd70b8a0b5e87a 8cf6b42d467d05fa7d9776d2bcc69974ecce6900 2025-10-23T19:14:06+08:00 Aman Gupta ggml-cuda: use passed ops instead of hardcoded ops (#16712)
8cf6b42d467d05fa7d9776d2bcc69974ecce6900 9de9672adb0f4ca4e39483ac3ffed52b3f70a55d 2025-10-23T11:32:24+02:00 matteo server : send partial stop string when <EOG> is reached (#15007)
9de9672adb0f4ca4e39483ac3ffed52b3f70a55d 63d2fc46e17a06be5b4b5823a5ada088317f1f0a 2025-10-22T20:05:15-05:00 Matthew Michel sycl: use async memory allocation to fix crashes during graph recording (#16644)
63d2fc46e17a06be5b4b5823a5ada088317f1f0a a2e0088d9242bd9e57f8b852b05a6e47843b5a45 2025-10-22T13:47:09-07:00 Max Krasnyansky Add experimental ggml-hexagon backend for the Hexagon NPU (#16547)
a2e0088d9242bd9e57f8b852b05a6e47843b5a45 9b9201f65a22c02cee8e300f58f480a588591227 2025-10-22T11:20:55-07:00 Diego Devesa Revert "ggml : Leverage the existing GGML_F32_VEC helpers to vectorize ggml_v…" (#16723)
9b9201f65a22c02cee8e300f58f480a588591227 19a5a3edfd306516cc419679d69d6435943b6816 2025-10-22T16:58:23+02:00 Pascal webui: introduce OpenAI-compatible model selector in JSON payload (#16562)
19a5a3edfd306516cc419679d69d6435943b6816 d8eaa26e4d9228df3aa46a930db60c8eaab67c1b 2025-10-22T05:14:14-05:00 sirus20x6 ggml : Leverage the existing GGML_F32_VEC helpers to vectorize ggml_vec_set_f32 for faster fills (#16522)
d8eaa26e4d9228df3aa46a930db60c8eaab67c1b 9285325ce0174631c3cd6121d56084adc4ef2d8f 2025-10-22T12:01:22+02:00 Acly tests : fix test-thread-safety when compiling with multiple backends (#16699)
9285325ce0174631c3cd6121d56084adc4ef2d8f 03792ad93609fc67e41041c6347d9aa14e5e0d74 2025-10-22T12:33:08+08:00 Aman Gupta CUDA: fix bug in topk-moe softmax (#16711)
03792ad93609fc67e41041c6347d9aa14e5e0d74 51d1a8c997bd2629ef211a30208058ea87a30982 2025-10-21T22:40:38+08:00 Aman Gupta CUDA: topk-moe: add optional parameter for gpt-oss (#16649)
51d1a8c997bd2629ef211a30208058ea87a30982 4926419c4d74a1cf724e7163d937eb72f36e7b26 2025-10-21T15:27:53+02:00 Johannes Gäßler CUDA: better error for FA kernel with 0 occupancy (#16643)
4926419c4d74a1cf724e7163d937eb72f36e7b26 6ea37f57391d27736c35cd3c20c1f990b7952b74 2025-10-21T16:43:14+08:00 Aman Gupta ggml: add ggml_can_fuse_subgraph (#16662)
6ea37f57391d27736c35cd3c20c1f990b7952b74 fb349848f387f355450c3187556e71e6d32c145f 2025-10-20T22:26:17-07:00 lhez opencl: fix warnings and clean up profiling (#16688)
fb349848f387f355450c3187556e71e6d32c145f 6de8ed75196c7cd98c1f34bbf3a7452451ba8ac2 2025-10-20T22:16:08-05:00 Jeff Bolz vulkan: Handle FA with all -inf mask values (#16447)
6de8ed75196c7cd98c1f34bbf3a7452451ba8ac2 84bf3c677857279037adf67cdcfd89eaa4ca9281 2025-10-21T01:21:12+03:00 YehuditE sycl : add PAD_REFLECT_D1 operator support (#16145)
84bf3c677857279037adf67cdcfd89eaa4ca9281 c9c1972e2c2cc6a771fcc145bfa138700179f961 2025-10-20T21:38:20+02:00 Sigbjørn Skjæret model : add BailingMoeV2 support (#16063)
c9c1972e2c2cc6a771fcc145bfa138700179f961 b617cfd2896edd592a36ebbc041817eb030a1005 2025-10-20T19:49:02+02:00 Aleksander Grygier Handle legacy 'context' attachments (#16687)
b617cfd2896edd592a36ebbc041817eb030a1005 79068501fac9a74cca7129a8e5a8281b410a853e 2025-10-20T05:53:50-07:00 Diego Devesa ggml-alloc : fix leak when reusing a tensor with a larger size (#16679)
79068501fac9a74cca7129a8e5a8281b410a853e 0e4a0cf2fae667d3efcf52f2f52398779d986b1d 2025-10-20T14:21:12+02:00 Aleksander Grygier Prevent premature submission on IME input (#16673)
0e4a0cf2fae667d3efcf52f2f52398779d986b1d 13f2cfad4170c096c51a02c24a6a158cb47f1480 2025-10-20T13:29:14+02:00 Aleksander Grygier Import/Export UX improvements (#16619)
13f2cfad4170c096c51a02c24a6a158cb47f1480 06332e28672356b964d6dfc2ba4657e20581cd43 2025-10-20T12:41:13+02:00 Aleksander Grygier Enable per-conversation loading states to allow having parallel conversations (#16327)
06332e28672356b964d6dfc2ba4657e20581cd43 72d53e6c4decee8b339e49aed8cc0e234b9639dc 2025-10-20T16:27:09+08:00 takuya kodama llama-batch: fix build fails with `-Werror=missing-braces` (#16614)
72d53e6c4decee8b339e49aed8cc0e234b9639dc 2330de7b847ca84eac766df372c604c26db72747 2025-10-20T10:20:04+02:00 Ron Evans readme: update bindings (#16651)
2330de7b847ca84eac766df372c604c26db72747 7062dd8460685d6700ed7621e50a22c6f3400ca3 2025-10-20T11:08:32+03:00 safranowith SYCL: Add support for FLOOR,CEIL,ROUND and TRUNC unary operators (#16613)
7062dd8460685d6700ed7621e50a22c6f3400ca3 0398752dd450dfabdd1b9e289f6364c2600f6ab5 2025-10-20T15:44:21+08:00 takuya kodama llama-context: only warn on pooling_type when user specified (#16674)
c20c0a5c0c44179f5267a262546624854b1203d1 62425b3a7e8b169a3bbe6ce8c7324513a7fcee8c 2025-10-20T14:41:08+08:00 Yunzhe Jia kv: turn on common-prefix mtmd: fix output size bug
0398752dd450dfabdd1b9e289f6364c2600f6ab5 4f73d0a95120687e2c527739f771330a5271259a 2025-10-19T23:54:31+02:00 Giuseppe Scrivano model : add Granite Hybrid types (#16635)
4f73d0a95120687e2c527739f771330a5271259a cec5edbcaec69bbf6d5851cabce4ac148be41701 2025-10-20T05:06:39+08:00 Aaron Teo ci : fix binaries release failure for s390x (binaries may not work yet) (#16664)
cec5edbcaec69bbf6d5851cabce4ac148be41701 fcb235b46618921cbd826acd49b553b5302233aa 2025-10-19T14:03:25+02:00 Sigbjørn Skjæret ci : avoid manual updates of docs/ops.md (#16663)
fcb235b46618921cbd826acd49b553b5302233aa 55754bebd5d570960cde9c0ba991a0b2991f6b1e 2025-10-19T18:37:47+08:00 Aaron Teo ci: include s390x release binaries (#16648)
55754bebd5d570960cde9c0ba991a0b2991f6b1e ee09828cb057460b369576410601a3a09279e23c 2025-10-19T15:37:12+08:00 Aman Gupta CODEOWNERS: update for ggml-cuda/mmf (#16660)
ee09828cb057460b369576410601a3a09279e23c e56abd2098dd2e2b0804691b93c13b48ae421627 2025-10-18T14:47:32+02:00 Johannes Gäßler HIP: fix GPU_TARGETS (#16642)
e56abd2098dd2e2b0804691b93c13b48ae421627 38355c6c8e43204e11a22daa7483082c0ff01e71 2025-10-18T05:22:57-05:00 Jeff Bolz vulkan: Implement topk_moe fused shader, ported from CUDA (#16641)
38355c6c8e43204e11a22daa7483082c0ff01e71 81387858f1fbcc1acedbd308486e1016618ca8f8 2025-10-18T17:52:53+08:00 Aman Gupta CUDA: use registers instead of smem in topk-moe (#16647)
81387858f1fbcc1acedbd308486e1016618ca8f8 66b0dbcb2d462e7b70ba5a69ee8c3899ac2efb1c 2025-10-17T17:55:32-07:00 Shawn Gu opencl: transposed gemm/gemv moe kernel with mxfp4,f32 (#16602)
66b0dbcb2d462e7b70ba5a69ee8c3899ac2efb1c 41386cf365d894134ee0813d15e2f5d76f6a4d8e 2025-10-17T17:41:09+02:00 Johannes Gäßler llama-model: fix insonsistent ctxs <-> bufs order (#16581)
41386cf365d894134ee0813d15e2f5d76f6a4d8e 3d4e86bbeb15f487d6da6174ba6191b7c212cc25 2025-10-17T18:02:52+03:00 Radoslav Gerganov rpc : report actual free memory (#16616)
3d4e86bbeb15f487d6da6174ba6191b7c212cc25 342c728d031d50673feded797520a44127d73379 2025-10-17T14:23:47+02:00 Giuseppe Scrivano vulkan: Add State Space Model (SSM) Operations Support (#16463)
342c728d031d50673feded797520a44127d73379 ababae7e1ec3e9cfdab0322ee55ea3389e82a4d5 2025-10-17T18:01:23+08:00 muggle-stack ggml : fix SpaceMit IME array out-of-bounds in task assignment (#16629)
ababae7e1ec3e9cfdab0322ee55ea3389e82a4d5 b19491599d4d42c606601d75e95c1d1de3291f8e 2025-10-17T10:35:03+02:00 Pascal webui: reorganize settings layout (#16607)
b19491599d4d42c606601d75e95c1d1de3291f8e 9ad4f1931ee0f3b41d9355245ef744786aaae0aa 2025-10-17T02:31:04-05:00 Jeff Bolz vulkan: fix debug build (add_rms_len/data not found) (#16624)
9ad4f1931ee0f3b41d9355245ef744786aaae0aa 79967ec596c0dacfd2251b085a57e79df292b1cc 2025-10-17T02:33:58-04:00 Ilia Ilmer metal : add `CONV_TRANSPOSE_2D` (#16542)
79967ec596c0dacfd2251b085a57e79df292b1cc ceff6bb253dd306f5404d7ccb3f11fadafe71b52 2025-10-17T06:59:31+01:00 Olivier Chafik grammar : use int64_t to avoid int overflows in int schema to grammar conversion logic (#16626)
ceff6bb253dd306f5404d7ccb3f11fadafe71b52 1bb4f43380944e94c9a86e305789ba103f5e62bd 2025-10-17T05:36:40+03:00 GittyBurstein SYCL SET operator optimized for F32 tensors (#16350)
1bb4f43380944e94c9a86e305789ba103f5e62bd 683fa6ba4ed3a23b939d3e11e6dc860bd47a0ccf 2025-10-16T19:00:31+02:00 Xuan-Son Nguyen mtmd : support home-cooked Mistral Small Omni (#14928)
683fa6ba4ed3a23b939d3e11e6dc860bd47a0ccf b22572e97dc51757d3ebe917a5a283385010ec68 2025-10-16T16:28:41+02:00 Pascal fix: added a normalization step for MathJax-style \[\] and \(\) delimiters (#16599)
b22572e97dc51757d3ebe917a5a283385010ec68 7a50cf388a530127cbbdd2a507ef81a451c9d819 2025-10-16T16:26:21+03:00 GittyBurstein sycl : add ARANGE operator (#16362)
62425b3a7e8b169a3bbe6ce8c7324513a7fcee8c 76a63a2998286c1649de2496bccb7d8a46549895 2025-10-16T17:34:39+08:00 Yunzhe Jia kv: let seq_rm free whole seq since current hw-op cannot support common-prefix
7a50cf388a530127cbbdd2a507ef81a451c9d819 6f5d924637a15abedb111cbbffd7da5f31c81855 2025-10-16T16:41:11+08:00 Chenguang Li CANN: format code using .clang-format (#15863)
76a63a2998286c1649de2496bccb7d8a46549895 b67217078aa748b06e1b2269d88dd18c0aca2c26 2025-10-16T16:31:15+08:00 Yunzhe Jia kv: fix common-prefix bug by implementing llama_memory_seq_rm
6f5d924637a15abedb111cbbffd7da5f31c81855 adc9b60f190c1016a09f439862fa1cbb302262ac 2025-10-16T01:11:33-04:00 takasurazeem common : Update the docs on -t --threads (#16236)
adc9b60f190c1016a09f439862fa1cbb302262ac ee50ee1eadff58777ae746827b04de7ba0befc55 2025-10-16T13:10:32+08:00 takuya kodama ggml-cpu: replace putenv with setenv for const-correctness (#16573)
ee50ee1eadff58777ae746827b04de7ba0befc55 7adc79c03234de9a20661fd6dbf2d02c32ca7acb 2025-10-16T07:21:28+03:00 yael-works SYCL: Add GGML_OP_MEAN operator support (#16009)
7adc79c03234de9a20661fd6dbf2d02c32ca7acb 466c1911ab736f0b7366127edee99f8ee5687417 2025-10-15T22:43:08+02:00 Aleksei Nikiforov gguf-py : add support for endian conversion of BF16 data (#16594)
466c1911ab736f0b7366127edee99f8ee5687417 0cb7a0683b0529172472d74d21f05470a607f297 2025-10-15T22:24:51+03:00 safranowith cpu : add FLOOR, CEIL, ROUND and TRUNC unary operators (#16083)
0cb7a0683b0529172472d74d21f05470a607f297 d93f8439b08c4f35e13a41a7366901fdbe770fc8 2025-10-15T10:51:04-07:00 lhez opencl: add q8_0 mm support (#16469)
d93f8439b08c4f35e13a41a7366901fdbe770fc8 f9fb33f2630b4b4ba9081ce9c0c921f8cd8ba4eb 2025-10-15T10:48:28-07:00 lhez opencl: fix FA for f32 (#16584)
f9fb33f2630b4b4ba9081ce9c0c921f8cd8ba4eb f4ce81c45e7bd910e36bf44c253fc5255c49b1e4 2025-10-15T16:22:20+02:00 Aleksander Grygier Add server-driven parameter defaults and syncing (#16515)
f4ce81c45e7bd910e36bf44c253fc5255c49b1e4 17304cbcc1dd24de7741cbe57925d58e90a98ac1 2025-10-15T23:05:56+09:00 Sam/Samuel metal: optimise `GGML_OP_SUM` (#16559)
17304cbcc1dd24de7741cbe57925d58e90a98ac1 3e3cb19f6449f9168a128eaeae01f8f41b049acc 2025-10-15T16:53:12+03:00 Georgi Gerganov server : fix img token logs (#16595)
3e3cb19f6449f9168a128eaeae01f8f41b049acc 5acd455460f457942d8dd02e3dd9b1eebfce99fe 2025-10-15T14:48:08+02:00 Xuan-Son Nguyen llama-quant: add support for mmproj (#16592)
5acd455460f457942d8dd02e3dd9b1eebfce99fe 554fd578a5ed78a10f371f5850c6a69aa83df15a 2025-10-15T13:54:15+02:00 Julius Tischbein CUDA: Changing the CUDA scheduling strategy to spin (#16585)
554fd578a5ed78a10f371f5850c6a69aa83df15a fa882fd2b1bcb663de23af06fdc391489d05b007 2025-10-15T12:51:27+03:00 Georgi Gerganov server : fix mtmd checkpoints (#16591)
fa882fd2b1bcb663de23af06fdc391489d05b007 ffa059034c1e41f3e58363ef3c46d2fcf854bc4d 2025-10-14T20:33:05+03:00 Georgi Gerganov metal : avoid using Metal's gpuAddress property (#16576)
ffa059034c1e41f3e58363ef3c46d2fcf854bc4d 120bf7046d85a893f064c12abe58bfeebd735f84 2025-10-14T19:18:05+02:00 SavicStefan vulkan: Add ACC_TYPE_VEC2 implementation (#16203)
120bf7046d85a893f064c12abe58bfeebd735f84 4258e0cfe72c72ad2787be1e9f93253e89219455 2025-10-14T22:48:08+08:00 Aman Gupta CUDA + openCL: fix bug in accessing rms_norm->src while doing fusion (#16577)
4258e0cfe72c72ad2787be1e9f93253e89219455 7ea15bb64c81e3813eb0babf9a57e1bc5697f569 2025-10-14T08:53:37-05:00 Jeff Bolz vulkan: Support FA with K/V in F32 (#16543)
7ea15bb64c81e3813eb0babf9a57e1bc5697f569 9c7185dd28416cf67f5e3b268381f311b5e3da56 2025-10-14T07:51:36-05:00 Jeff Bolz vulkan: Improve build time for MSVC (#16545)
9c7185dd28416cf67f5e3b268381f311b5e3da56 1ee9d0b415cdf5240418c110a18b419f4002b154 2025-10-14T14:22:47+02:00 Johannes Gäßler CUDA: enable FA for FP32 KV cache (#16546)
1ee9d0b415cdf5240418c110a18b419f4002b154 48e2fa9fb7c2de1e53808fdb65ec33f916020fc4 2025-10-14T19:16:21+08:00 Aman Gupta CUDA: use fastdiv + ggml_cuda_mad for mmvf (#16557)
48e2fa9fb7c2de1e53808fdb65ec33f916020fc4 5b6913c47b6bc71a6f927805a45387d5657d8b89 2025-10-14T19:15:15+08:00 Aman Gupta CUDA: add fp kernel for larger batch size MoE (#16512)
5b6913c47b6bc71a6f927805a45387d5657d8b89 bc07349a7f87ba6eb31ed4b0ea9d9a7352185213 2025-10-14T09:53:49Z Anav Prasad cuda : remove legacy copy-op pointer indirection code (#16485)
bc07349a7f87ba6eb31ed4b0ea9d9a7352185213 e60f241eacec42d3bd7c9edd37d236ebf35132a8 2025-10-14T08:48:50+03:00 Georgi Gerganov server : dynamic token limit for prompt cache (#16560)
e60f241eacec42d3bd7c9edd37d236ebf35132a8 e38b7c6e9e4453e3b3e96d76e38bc2ccb6bce458 2025-10-13T23:07:57+03:00 Georgi Gerganov metal : FA support F32 K and V and head size = 32 (#16531)
e38b7c6e9e4453e3b3e96d76e38bc2ccb6bce458 5016b7286240d29f8f640039989b84ea3a854344 2025-10-13T22:42:37+03:00 Georgi Gerganov graph : support cacheless embeddings with FA and iSWA (#16528)
5016b7286240d29f8f640039989b84ea3a854344 7049736b2dd9011bf819e298b844ebbc4b5afdc9 2025-10-13T11:50:37-07:00 lhez opencl: fix build targeting CL 2 (#16554)
7049736b2dd9011bf819e298b844ebbc4b5afdc9 01d2bdc2bc61b676706830305b286b08b9885a41 2025-10-13T16:29:45+02:00 Johannes Gäßler CUDA: fix numerical issues in tile FA kernel (#16540)
01d2bdc2bc61b676706830305b286b08b9885a41 56fc38b9655fbe1869d8bd6cfb269418196cea69 2025-10-13T20:48:47+08:00 Jie Fu (傅杰) ggml : fix build broken with -march=armv9-a on MacOS (#16520)
56fc38b9655fbe1869d8bd6cfb269418196cea69 1fb9504eb744969a990bfe4cfcf1d3d7a479541c 2025-10-13T17:01:24+08:00 Chenguang Li CANN: fix CPU memory leak in CANN backend (#16549)
1fb9504eb744969a990bfe4cfcf1d3d7a479541c 3f750f8d760ab5a61491e6a9409072dfeee4b4d7 2025-10-13T10:55:32+02:00 Pascal fix: add remark plugin to render raw HTML as literal text (#16505)
b67217078aa748b06e1b2269d88dd18c0aca2c26 98c8269abefdfa8fde47dfb2769ceebc8b704e86 2025-10-13T11:48:14+08:00 Yunzhe Jia add different path for unified and seperate compilation
3f750f8d760ab5a61491e6a9409072dfeee4b4d7 c515fc577166042234241c6bd0da9b08dcbe2bb9 2025-10-13T16:25:02+08:00 Sam/Samuel metal: add support for opt_step_sgd (#16539)
c515fc577166042234241c6bd0da9b08dcbe2bb9 f9bc66c3ebcfddb5f09e4b21253623caeb8e414a 2025-10-13T11:22:27+03:00 Georgi Gerganov ggml : fix scalar path for computing norm (#16558)
f9bc66c3ebcfddb5f09e4b21253623caeb8e414a a31cf36ad946a13b3a646bf0dadf2a481e89f944 2025-10-13T08:52:22+08:00 hipudding CANN: Update several operators to support FP16 data format (#16251)
a31cf36ad946a13b3a646bf0dadf2a481e89f944 81d54bbfd599811b354c39f04550888168be7780 2025-10-13T02:43:14+08:00 Sam/Samuel metal : add opt_step_adamw and op_sum (#16529)
81d54bbfd599811b354c39f04550888168be7780 c7be9febcbafa9af7d1b9443f86475c59c9c5f87 2025-10-12T18:06:41+02:00 Pascal webui: remove client-side context pre-check and rely on backend for limits (#16506)
c7be9febcbafa9af7d1b9443f86475c59c9c5f87 8415f61e23d04427cd0d912fbb9d33b85f849456 2025-10-12T21:53:35+08:00 Neo Zhang Jianyu [SYCL] fix UT fault cases: count-equal, argsort, pad OPs (#16521)
8415f61e23d04427cd0d912fbb9d33b85f849456 2c301e91abb92d03c1a682b4b540ba835562a74b 2025-10-12T15:48:03+02:00 Mathieu Baudier ci : add Vulkan on Ubuntu with default packages build (#16532)
2c301e91abb92d03c1a682b4b540ba835562a74b 4b2dae383df708e2afc49c4859a81cd074f5ac10 2025-10-12T08:18:47-05:00 Aldehir Rojas common : handle unicode during partial json parsing (#16526)
4b2dae383df708e2afc49c4859a81cd074f5ac10 41aac5c69b5fb281bc1f486afb053f78101bb39e 2025-10-12T09:29:13+03:00 Georgi Gerganov common : update presets (#16504)
41aac5c69b5fb281bc1f486afb053f78101bb39e a2fba89a426ff8005d303c73f0436e7e67368b70 2025-10-12T00:25:37-05:00 sirus20x6 ggml : Fix FP16 ELU positive branch (#16519)
a2fba89a426ff8005d303c73f0436e7e67368b70 20cc625edc2264aae2779e71bef1593e6a4e8c43 2025-10-12T07:19:06+02:00 Daniel Bevenius hparams : add check for layer index in is_recurrent (#16511)
20cc625edc2264aae2779e71bef1593e6a4e8c43 11f0af5504252e453d57406a935480c909e3ff37 2025-10-12T00:15:00-05:00 sirus20x6 ggml: Correct SVE implementation in ggml_vec_dot_f16_unroll (#16518)
11f0af5504252e453d57406a935480c909e3ff37 a3cb04744fb5c591985f53b749fef5407d07a145 2025-10-11T20:54:32+02:00 Johannes Gäßler CUDA: faster tile FA, add oob checks, more HSs (#16492)
a3cb04744fb5c591985f53b749fef5407d07a145 4a8fbe0a5eb75f339782ebcf29c17848122184d3 2025-10-11T16:54:10+03:00 Georgi Gerganov metal : fix mul-mm condition + fix mul-mv permuted kernels (#16494)
4a8fbe0a5eb75f339782ebcf29c17848122184d3 31d0ff1869aa2ea31f4e96d5877d0343e9a2171b 2025-10-11T15:50:49+02:00 Pascal feat: render user content as markdown option (#16358)
31d0ff1869aa2ea31f4e96d5877d0343e9a2171b 97870e64975b26c5e06a3540a8dc0ff601351e86 2025-10-11T21:39:04+08:00 Yann Follet server / ranking : add sorting and management of top_n (#16403)
97870e64975b26c5e06a3540a8dc0ff601351e86 477a66b03501cf3bd067f8968b77ca4d053ff1bd 2025-10-11T04:02:26-07:00 Diego Devesa cuda : avoid initializing unused devices (#16510)
477a66b03501cf3bd067f8968b77ca4d053ff1bd e60f01d941bc5b7fae62dd57fee4cec76ec0ea6e 2025-10-11T11:33:41+03:00 amirai21 convert : correctly handle LLaMA tokenizer for Jamba (#16470)
e60f01d941bc5b7fae62dd57fee4cec76ec0ea6e 81086cd6a3ca1252f0dc0f938171648399179c53 2025-10-10T22:15:05+03:00 Georgi Gerganov server : fix division by zero when reporting stats (#16501)
81086cd6a3ca1252f0dc0f938171648399179c53 68ee98ae181a5c83a5cc6261daeee69a1f588c15 2025-10-10T17:17:31+03:00 Georgi Gerganov vocab : mark EOT token for Granite models (#16499)
68ee98ae181a5c83a5cc6261daeee69a1f588c15 cdb6da468cc33323955a523738d2e1675aeb5e9a 2025-10-10T17:11:07+03:00 Radoslav Gerganov server : return HTTP 400 if prompt exceeds context length (#16486)
cdb6da468cc33323955a523738d2e1675aeb5e9a 6d69ab3f262eca3f0c6ad0ce075d2c80b9924d0e 2025-10-10T13:22:27+03:00 Radoslav Gerganov server : log requests to /v1/completions (#16495)
6d69ab3f262eca3f0c6ad0ce075d2c80b9924d0e 1faa13a1187051af66b0fd9f0d6effe4c77f0b3e 2025-10-10T13:45:46+05:30 Prajwal B Mehendarkar cmake : Dont define XOPENSOURCE on AIX (#16481)
1faa13a1187051af66b0fd9f0d6effe4c77f0b3e 1deee0f8d494981c32597dca8b5f8696d399b0f2 2025-10-09T22:54:57+02:00 Pascal webui: updated the chat service to only include max_tokens in the req… (#16489)
1deee0f8d494981c32597dca8b5f8696d399b0f2 d00cbea63c671cd85a57adaa50abf60b3b87d86f 2025-10-09T22:11:15+03:00 duduta cpu : optimize the ggml NORM operation (#15953)
d00cbea63c671cd85a57adaa50abf60b3b87d86f 8328fd4bae76fc027f8ca0e9a05acd3788dabe3f 2025-10-09T18:54:51+03:00 Georgi Gerganov server : host-memory prompt caching (#16391)
8328fd4bae76fc027f8ca0e9a05acd3788dabe3f 56b4795842d852152222ca7a2d4304008facf1b9 2025-10-09T17:36:29+02:00 Pascal No markdown in cot (#16483)
56b4795842d852152222ca7a2d4304008facf1b9 2c0d875ae6c6043fbbafd2831e160955e9ca6af1 2025-10-09T14:35:22+02:00 Daniel Bevenius model-conversion : add support for SentenceTransformers (#16387)
2c0d875ae6c6043fbbafd2831e160955e9ca6af1 aa4711d369b0d4adb6802b98ad6ea362f838710e 2025-10-09T09:13:18+01:00 sudhiarm ci: add ARM64 Kleidiai build and test support (#16462)
aa4711d369b0d4adb6802b98ad6ea362f838710e d80d6d2400b8faa80654c723cb5bdf9fc8f4db06 2025-10-09T15:50:25+08:00 Chenguang Li CANN: Improve ACL graph matching (#16166)
d80d6d2400b8faa80654c723cb5bdf9fc8f4db06 b2602137557b2b28a39e03612717d85ead9a6f5a 2025-10-09T09:29:17+02:00 Charles Xu kleidiai: kernel interface refactoring (#16460)
b2602137557b2b28a39e03612717d85ead9a6f5a e08db4259521de493b7aeb49dadf29ebd1ee966a 2025-10-09T15:25:11+08:00 Neo Zhang Jianyu [SYCL] refactor soft_max, add soft_max_back (#16472)
e08db4259521de493b7aeb49dadf29ebd1ee966a 12bbc3fa50b6df03318a4451c9a2210200a0b28d 2025-10-09T08:39:18+02:00 Saba Fallah model: EmbeddingGemma Adding Support for SentenceTransformers Dense Modules (#16367)
12bbc3fa50b6df03318a4451c9a2210200a0b28d 9d0882840e6c3fb62965d03af0e22880ea90e012 2025-10-08T22:18:41+02:00 Pascal refactor: centralize CoT parsing in backend for streaming mode (#16394)
9d0882840e6c3fb62965d03af0e22880ea90e012 d2ee056e1df0fdf646270fb5621e9f92084b59a7 2025-10-08T20:21:46+02:00 ai-fonsi Disable CUDA host buffers on integrated GPUs (#16308)
d2ee056e1df0fdf646270fb5621e9f92084b59a7 b2c08c9ec4cd59ed88c1ebdd94f109af5ccc978e 2025-10-08T17:20:18+09:00 issixx server : fix cancel pending task (#16467)
b2c08c9ec4cd59ed88c1ebdd94f109af5ccc978e 7fdd16b432d247121fe5fe7b21f8805f85266c85 2025-10-08T10:57:53+03:00 Georgi Gerganov metal : mark FA blocks (#16372)
7fdd16b432d247121fe5fe7b21f8805f85266c85 74b8fc17f92ada295a648e3c5eb28f46bca7d892 2025-10-08T10:57:29+03:00 Georgi Gerganov server : improve context checkpoint logic (#16440)
74b8fc17f92ada295a648e3c5eb28f46bca7d892 aeaf8a36f06b5810f5ae4bbefe26edb33925cf5e 2025-10-07T13:48:56-07:00 Reese Levine ggml webgpu: profiling, CI updates, reworking of command submission (#16452)
aeaf8a36f06b5810f5ae4bbefe26edb33925cf5e df1b612e29ba97a2e67db339b1e8c7465702b7e8 2025-10-07T20:03:35+02:00 Tarek Dakhran llama : support LiquidAI LFM2-MoE hybrid model (#16464)
df1b612e29ba97a2e67db339b1e8c7465702b7e8 4e0388aa8a1f4ef1065701dc9c3947aea0a1b9a5 2025-10-07T15:57:14+03:00 Georgi Gerganov server : add `/v1/health` endpoint (#16461)
4e0388aa8a1f4ef1065701dc9c3947aea0a1b9a5 ef4c5b87ea2556ff8ca99cca3abdf48bdbca22f2 2025-10-07T11:11:08+02:00 Sascha Rogmann webui : added download action (#13552) (#16282)
ef4c5b87ea2556ff8ca99cca3abdf48bdbca22f2 c61ae20d05bd4fdd8551311325a2845336449426 2025-10-07T10:32:32+03:00 Georgi Gerganov presets : fix pooling param for embedding models (#16455)
c61ae20d05bd4fdd8551311325a2845336449426 0123ff38f53d34752f29239a29d0e40a6dc4110f 2025-10-07T09:59:13+03:00 Radoslav Gerganov rpc : update documentation (#16441)
0123ff38f53d34752f29239a29d0e40a6dc4110f 0a319bb75ed29d968e2a9b544011b09ccb932915 2025-10-07T08:24:17+03:00 Georgi Gerganov memory : use sequential equal splits for recurrent modules (#16442)
0a319bb75ed29d968e2a9b544011b09ccb932915 1d6092fc72f4d10f4486ac95edfd414bc08b62b8 2025-10-07T08:23:30+03:00 Georgi Gerganov metal : add support for non-padded FA KV (#16148)
1d6092fc72f4d10f4486ac95edfd414bc08b62b8 8ae32dc9ecd7aeebf3a5b43557e0552a0a04cd4f 2025-10-07T08:22:35+03:00 Georgi Gerganov tests : add -INF blocks to the KQ mask in the FA tests (#16380)
8ae32dc9ecd7aeebf3a5b43557e0552a0a04cd4f 3df2244df40c67dfd6ad548b40ccc507a066af2b 2025-10-07T08:21:40+03:00 Georgi Gerganov metal : various optimizations + refactoring (#16446)
3df2244df40c67dfd6ad548b40ccc507a066af2b c08002a1988348403a5fd59b1fa3de3a10a6f92f 2025-10-06T12:55:53-05:00 Gadflyii llama : add --no-host to disable host buffers (#16310)
c08002a1988348403a5fd59b1fa3de3a10a6f92f 3a002afafa8e06555f11aed88b02d055d8a166f3 2025-10-06T10:59:40-06:00 Gabe Goodhart chat : Granite Docling stopping (#16438)
3a002afafa8e06555f11aed88b02d055d8a166f3 a23b9bdbd3b64ce172f9962249f432d01aea7437 2025-10-06T17:40:21+02:00 Sigbjørn Skjæret ci : refactor sdk caching to minimize storage (#16414)
a23b9bdbd3b64ce172f9962249f432d01aea7437 04e632a4aab8e6bfff0f8bc216b36ceb1e199ff9 2025-10-06T16:05:27+03:00 Georgi Gerganov ggml : fix unaligned access in AMX code (#16315)
04e632a4aab8e6bfff0f8bc216b36ceb1e199ff9 a80ff183abe4e5a76316257ffa597da41b3b6fa0 2025-10-06T14:56:59+02:00 Daniel Bevenius ci : remove missing reranker model files (#16444)
a80ff183abe4e5a76316257ffa597da41b3b6fa0 1d49ca37594fb49db6aa9518ba7c512e5ccd0108 2025-10-06T14:17:12+02:00 Daniel Bevenius ggml-cpu : fix leftover handling in ggml_vec_scale_f32 for SVE (#16443)
1d49ca37594fb49db6aa9518ba7c512e5ccd0108 c5fef0fcea3b978a2318b1af170209ecec7c37b4 2025-10-06T09:29:56Z Yuannan nix : removed metal for nix (#16118)
c5fef0fcea3b978a2318b1af170209ecec7c37b4 ca71fb9b368e3db96e028f80c4c9df6b6b370edd 2025-10-06T03:53:31-04:00 Oleksandr Kuvshynov server: update readme to mention n_past_max metric (#16436)
ca71fb9b368e3db96e028f80c4c9df6b6b370edd 35266573b968e1c947b367782fb4b3eddbb4f3c0 2025-10-05T06:57:47-06:00 Gabe Goodhart model : Granite docling + Idefics3 preprocessing (SmolVLM) (#16206)
35266573b968e1c947b367782fb4b3eddbb4f3c0 86df2c9ae4f2f1ee63d2558a9dc797b98524639b 2025-10-04T20:59:31-07:00 Reese Levine ggml webgpu: actually add softmax, fix rms_norm offset (#16400)
86df2c9ae4f2f1ee63d2558a9dc797b98524639b f39283960b58a92ecc0c72567711318b20e22b55 2025-10-04T20:04:27Z Eve vulkan: use a more appropriate amount of threads when generating shaders (#16418)
f39283960b58a92ecc0c72567711318b20e22b55 898acba6816ad23b6a9491347d30e7570bffadfd 2025-10-04T16:22:45+03:00 Radoslav Gerganov rpc : check src buffer when copying tensor (#16421)
898acba6816ad23b6a9491347d30e7570bffadfd e29acf74fea996014380d59d31aa504ae8964258 2025-10-04T12:49:16+03:00 Radoslav Gerganov rpc : add support for multiple devices (#16276)
e29acf74fea996014380d59d31aa504ae8964258 128d522c04286e019666bd6ee4d18e3fbf8772e2 2025-10-04T11:42:56+02:00 Acly vulkan : incremental shader builds (#16341)
128d522c04286e019666bd6ee4d18e3fbf8772e2 f6dcda390004b627ef30af378d0c01ad2519289e 2025-10-03T20:51:48+02:00 Pascal chat : support Magistral thinking (#16413)
f6dcda390004b627ef30af378d0c01ad2519289e 606a73f53175077429484b23dcf799f69a31d0bd 2025-10-03T13:34:51-05:00 ddh0 server : context checkpointing for hybrid and recurrent models (#16382)
606a73f53175077429484b23dcf799f69a31d0bd 946f71ed9ade07e319859b5ce656144140e066fb 2025-10-03T19:18:56+03:00 Georgi Gerganov metal : fix loop bound in ggml_mem_ranges (#16412)
946f71ed9ade07e319859b5ce656144140e066fb 638d330246954e88dffc22ce01fec15e6894e544 2025-10-03T14:40:25+02:00 Sigbjørn Skjæret llama : fix shapes for bert/mpt q/k norm (#16409)
638d330246954e88dffc22ce01fec15e6894e544 84c8e305e8010a1a3d43bdd0a25f737ac67809a4 2025-10-03T13:49:08+02:00 Acly ggml : fix graph reallocation with multiple chunks (#16396)
84c8e305e8010a1a3d43bdd0a25f737ac67809a4 2aaf0a2a2056d75d0dd53ab8a181473760e6ab22 2025-10-03T12:51:40+02:00 Aleksander Grygier Fix missing messages on sibling navigation (#16408)
2aaf0a2a2056d75d0dd53ab8a181473760e6ab22 0e1f83855609d73beaf05d818640b6cfd39d287b 2025-10-03T05:50:46-05:00 Jeff Bolz vulkan: Replace uses of maxMemoryAllocationSize and VK_WHOLE_SIZE (#16354)
0e1f83855609d73beaf05d818640b6cfd39d287b ad126479c25cf983a0f994a08ba0911cf49ed62b 2025-10-03T04:52:46-05:00 Jeff Bolz vulkan: Fix FA coopmat1 invalid array indexing (#16365)
ad126479c25cf983a0f994a08ba0911cf49ed62b 77233277c912d495d1069543ca540c21a2f9e5b4 2025-10-03T11:45:16+02:00 Daniel Bevenius ci : change macos-13 to macos-15-intel (#16401)
77233277c912d495d1069543ca540c21a2f9e5b4 e308efda8e54e3f07578937a45a5d83624eb7970 2025-10-03T11:30:39+02:00 Aleksander Grygier Capture model name only after first token (streaming) or completed request (#16405)
e308efda8e54e3f07578937a45a5d83624eb7970 136bda78c5679b266362b39c58338fff46fd2592 2025-10-03T03:33:08-05:00 Jeff Bolz vulkan: in flash attention, bounds check against nem1 (don't rely on GGML_KQ_MASK_PAD) (#16316)
136bda78c5679b266362b39c58338fff46fd2592 5113efd34ceda709292de26c72716c49e024fb32 2025-10-03T09:11:34+02:00 Aleksander Grygier webui : Fix messages payload sent to chat completions (#16402)
5113efd34ceda709292de26c72716c49e024fb32 d64c8104f090b27b1f99e8da5995ffcfa6b726e2 2025-10-03T08:01:31+02:00 Pascal fix: track viewportHeight via window.innerHeight to avoid unwanted scrolling (#16356)
d64c8104f090b27b1f99e8da5995ffcfa6b726e2 ef07a4090672a3438d7f64f197795d7dc1c18957 2025-10-02T20:10:12+02:00 Sigbjørn Skjæret test-barrier : do not use more threads than physically available (#16389)
ef07a4090672a3438d7f64f197795d7dc1c18957 34fcc5a4ace8c69476ef2ea3857f39a60334acc4 2025-10-02T11:00:31-07:00 Reese Levine ggml webgpu: add support for soft_max, optimize rms_norm (#16357)
34fcc5a4ace8c69476ef2ea3857f39a60334acc4 91a2a5655658bb9ab77894716b82fae7ecb4b4d1 2025-10-02T19:43:22+02:00 Piotr Wilkin (ilintar) model : Apertus model implementation (#15852)
91a2a5655658bb9ab77894716b82fae7ecb4b4d1 72ee736c447be4ededb51ab97904b4d33c90c261 2025-10-02T21:29:56+08:00 R0CKSTAR musa: update compile flags (#16265)
72ee736c447be4ededb51ab97904b4d33c90c261 f09aefaa84d7f4d5df3f400f67944b94fef5b795 2025-10-02T13:51:36+02:00 Sigbjørn Skjæret ci : fix ubuntu-latest-cmake-rpc (disable ccache) (#16388)
f09aefaa84d7f4d5df3f400f67944b94fef5b795 bbd32bc0384fbfcf07369617de58856b1e0e95a3 2025-10-02T08:10:07Z Eve ci: update vulkan ci (#16294)
bbd32bc0384fbfcf07369617de58856b1e0e95a3 2be72c2b121ee99f33927149265ce6073ade9e59 2025-10-02T10:35:43+03:00 Georgi Gerganov ci : fix clean-up of old logs (#16381)
2be72c2b121ee99f33927149265ce6073ade9e59 95ce0985449c52fb9d6849b95563f7cf933ea0e3 2025-10-02T15:16:25+08:00 Neo Zhang Jianyu SYCL: Update to oneAPI 2025.2 (#16371)
95ce0985449c52fb9d6849b95563f7cf933ea0e3 c8dedc9999eccf7821a9fe5b29f10e8d075e2217 2025-10-02T05:52:59+02:00 uvos HIP: add IMbackK to codeowner (#16375)
c8dedc9999eccf7821a9fe5b29f10e8d075e2217 e95fec640f43623911a2cd5bda8b19b1898c530c 2025-10-01T23:32:39+02:00 uvos CI: reenable cdna in rocm docker builds (#16376)
e95fec640f43623911a2cd5bda8b19b1898c530c ded67b94446ef4f7fd988dbde7a12deef9870c13 2025-10-01T23:09:25+02:00 uvos HIP: Disable ROCWMMA fattn on CDNA when compiled against ROCWMMA 2.0.0 (#16221)
ded67b94446ef4f7fd988dbde7a12deef9870c13 1fe4e38cc20af058ed320bd46cac934991190056 2025-10-02T06:08:15+09:00 Shunta Saito llama : parameter conversion and loading fixes for PLaMo2 variants (#16075)
1fe4e38cc20af058ed320bd46cac934991190056 4201deae9c2ae4732db8957b6ce0808d02ec597c 2025-10-01T20:18:03+02:00 uvos ci: Properly install rocwmma for hip builds (#16305)
4201deae9c2ae4732db8957b6ce0808d02ec597c 764799279f801c696503bacca490b4358587d94c 2025-10-01T19:22:18+02:00 Adrien Gallouët common: introduce http.h for httplib-based client (#16373)
764799279f801c696503bacca490b4358587d94c 2a9b63383a448ec18c754dfdc6e95cb853940a52 2025-10-01T18:18:10+02:00 Aleksander Grygier Conversation action dialogs as singletons from Chat Sidebar + apply conditional rendering for Actions Dropdown for Chat Conversation Items (#16369)
2a9b63383a448ec18c754dfdc6e95cb853940a52 1104ca1a1c926b832274694a2773a17066982ad0 2025-10-01T15:54:42+02:00 Aleksander Grygier Improve code block color theming (#16325)
1104ca1a1c926b832274694a2773a17066982ad0 4f1575921cac9b489fe8f8bbf20aff985e7da45e 2025-10-01T14:09:52+02:00 Sigbjørn Skjæret ci : use registry cache for docker builds (#16366)
4f1575921cac9b489fe8f8bbf20aff985e7da45e 132d673554e65282e92505f4f77401ab971528bb 2025-10-01T12:08:16+02:00 Aleksander Grygier Add optional setting for showing "Model used:" information (#16337)
132d673554e65282e92505f4f77401ab971528bb aa9538a63aef35f0224b2502f13b19d650a8ce04 2025-10-01T07:56:36Z Eve vulkan: make ggml_vk_default_dispatcher support older vulkan headers (#16345)
aa9538a63aef35f0224b2502f13b19d650a8ce04 e74c92e84236b2bab3f3c77bee4ead94928be360 2025-10-01T07:40:26+02:00 Aleksander Grygier webui: Remove running `llama-server` within WebUI `dev.sh` script (#16363)
e74c92e84236b2bab3f3c77bee4ead94928be360 b2ba81dbe07b6dbea9c96b13346c66973dede32c 2025-09-30T16:24:36-04:00 Bartowski model : support GLM 4.6 (make a few NextN/MTP tensors not required) (#16359)
b2ba81dbe07b6dbea9c96b13346c66973dede32c bf6f3b3a1965d70e07ca94aab7b01268fe483e96 2025-09-30T21:41:42+02:00 Sigbjørn Skjæret ci : fix ccache key for ubuntu-cpu-cmake (#16355)
bf6f3b3a1965d70e07ca94aab7b01268fe483e96 7c156df4148eb524b22f7f363bfd2df00f264e0b 2025-09-30T19:52:41+02:00 Adrien Gallouët common : disable progress bar without a tty (#16352)
7c156df4148eb524b22f7f363bfd2df00f264e0b 16b0ca0d2e63fc1a0a43795f8552f9cb61d9f7a5 2025-09-30T10:45:45-07:00 lhez opencl: support pad_ext (#15888)
16b0ca0d2e63fc1a0a43795f8552f9cb61d9f7a5 8d78cd2613ccdeb3cc86f59bc8f9ddd31cfbd3ed 2025-09-30T19:18:54+02:00 Pascal Chatapi ignore empty sampling (#16330)
8d78cd2613ccdeb3cc86f59bc8f9ddd31cfbd3ed d1c84a662daa91be975863913a59975b11458141 2025-09-30T09:57:51-07:00 Reese Levine ggml webgpu: support for rope,div,sub,glu,scale,cont operators (#16187)
d1c84a662daa91be975863913a59975b11458141 364a7a6d4a786e98947c8a90430ea581213c0ba9 2025-09-30T09:55:13-07:00 lhez opencl: support ne3 in get_rows (#15866)
364a7a6d4a786e98947c8a90430ea581213c0ba9 2df5bcf357dba0c49b4df1d684b2ffc9e88b7054 2025-09-30T16:39:44+02:00 Adrien Gallouët common : remove common_has_curl() (#16351)
2df5bcf357dba0c49b4df1d684b2ffc9e88b7054 075c01567bb7e93965ae60b7e119182c3e68f3e9 2025-09-30T15:38:01+02:00 Sigbjørn Skjæret ci : disable ccache for android (#16348)
075c01567bb7e93965ae60b7e119182c3e68f3e9 a014310374a16f9204f2bcc1b458fc1eda67e469 2025-09-30T13:42:39+03:00 Georgi Gerganov ggml : bump version to 0.9.4 (ggml/1363)
98c8269abefdfa8fde47dfb2769ceebc8b704e86 2790ecc304e384d9075c55d0628d8bf440025dc4 2025-09-30T17:42:57+08:00 Yunzhe Jia server: adapt to calrt
2790ecc304e384d9075c55d0628d8bf440025dc4 f528e97d894b4d93934a0711a00253eea980e799 2025-09-30T17:37:58+08:00 Yunzhe Jia adapt to calrt
f528e97d894b4d93934a0711a00253eea980e799 dcbe998a6d8f13b6c9cb36bbe7b355ced2ac3842 2025-09-11T14:13:35+08:00 Yunzhe Jia add calrt mtmd support
a014310374a16f9204f2bcc1b458fc1eda67e469 35fb82497ec6c5904b0adb7e1c881a76c1c692db 2025-09-30T08:13:22Z anavp-nvidia cuda : Enable CUDA Graph usage for Nemotron Nano v2 (NemotronH) (#16328)
35fb82497ec6c5904b0adb7e1c881a76c1c692db 3c62aed89fbe3e15f6f82035e805a0a1add26306 2025-09-30T11:03:23+03:00 Georgi Gerganov metal : dynamic simdgroups for MV kernels (#16340)
3c62aed89fbe3e15f6f82035e805a0a1add26306 f1eb1cb1eba042b2d583234e80f65e2e225d8995 2025-09-30T09:36:33+02:00 Adrien Gallouët common : simplify etag tracking by removing json (#16342)
f1eb1cb1eba042b2d583234e80f65e2e225d8995 de41f2b7bffab7582944b213ce12b605f8cf6e0f 2025-09-30T09:07:20+02:00 Charles Xu kleidiai : fix work size and threads sync for fp16 (#16246)
de41f2b7bffab7582944b213ce12b605f8cf6e0f a74a0d69f34f52fa10d4f0a7ce749fb3490d0774 2025-09-29T22:30:16-07:00 lhez codeowners: add codeowners for opencl backend (#16344)
a74a0d69f34f52fa10d4f0a7ce749fb3490d0774 5f7e166cbf7b9ca928c7fad990098ef32358ac75 2025-09-29T19:26:34-05:00 Jeff Bolz tests: override test_set_rows::max_nmse_err to allow for occasional rounding differences (#16295)
5f7e166cbf7b9ca928c7fad990098ef32358ac75 d72f5f7ba260b546190338b0b76f2f152581424f 2025-09-29T18:49:47+02:00 Pascal Fix thinking blocks with quotes + add handling `[THINK]...[/THINK]` blocks (#16326)
d72f5f7ba260b546190338b0b76f2f152581424f b77e6c18e1a6fac5705ed95f03af5436d67484c1 2025-09-29T17:51:48+03:00 Georgi Gerganov ci : add AMD runners and workflows (#16249)
b77e6c18e1a6fac5705ed95f03af5436d67484c1 2ddd3f2356c313385fafc19a9f0ce678c8fe03ee 2025-09-29T22:50:44+08:00 alex-spacemit ggml: riscv: add riscv spacemit backend (#15288)
2ddd3f2356c313385fafc19a9f0ce678c8fe03ee 4d3d455d3c8719eb8f206de328d1b9ba191efd7c 2025-09-29T16:50:52+03:00 Georgi Gerganov sync : ggml
4d3d455d3c8719eb8f206de328d1b9ba191efd7c c9b1c06467aca8d30fafcab51292bcb285df5b0d 2025-09-29T16:49:11+03:00 Georgi Gerganov sync : whisper.cpp (ggml/1359)
c9b1c06467aca8d30fafcab51292bcb285df5b0d b6ae75afb49b23db3dfbc2b01e8aabfb047e6880 2025-09-26T17:34:42+02:00 Daniel Bevenius ggml : remove -dev suffix from release version (ggml/1355)
b6ae75afb49b23db3dfbc2b01e8aabfb047e6880 b6dff20e2fe352093039e2359370c6bb2b505e0b 2025-09-25T14:39:05+02:00 Daniel Bevenius ggml : bump version to 0.9.3 (ggml/1353)
b6dff20e2fe352093039e2359370c6bb2b505e0b 2db78c75e4ef7497313fda6dbbb3fcaf9ca0752d 2025-09-20T16:44:23+03:00 Georgi Gerganov ggml : prepare for development of 0.9.2-dev
2db78c75e4ef7497313fda6dbbb3fcaf9ca0752d 02463ab27b1379ff5e3d936ce8b3bfd356872ea6 2025-09-20T16:44:23+03:00 Georgi Gerganov ggml : bump version to 0.9.1
02463ab27b1379ff5e3d936ce8b3bfd356872ea6 adc76347d73b3d915e946efa5de8d0ad9f3904c2 2025-09-29T13:17:09+02:00 Rafal Lewczuk ggml-backend : add root cause in error message if loading backend library fails (#16172)
adc76347d73b3d915e946efa5de8d0ad9f3904c2 3a2bdcda0b31e51db954551e0cd49424133a84f3 2025-09-29T11:09:00+02:00 Sigbjørn Skjæret ggml : check cuda and metal argsort limits and add test (#16323)
3a2bdcda0b31e51db954551e0cd49424133a84f3 66bb7985c3fcefda7a74aae9f8321f70eb1646c4 2025-09-29T10:37:20+02:00 Aleksander Grygier Improve Mobile UI for dialogs and action dropdowns (#16222)
66bb7985c3fcefda7a74aae9f8321f70eb1646c4 2f61c0f5bf8a620ca4c3872408803ab38cfb9613 2025-09-29T09:08:41+02:00 Pascal fix: preserved zero values in chat settings inputs and textareas by switching to nullish coalescing for field values and default placeholders (#16312)
2f61c0f5bf8a620ca4c3872408803ab38cfb9613 3ffd0fae473c954bb3e67526b31262048fb508d4 2025-09-29T12:33:12+05:30 Vinkal llama-cli: prevent spurious assistant token (#16202)
3ffd0fae473c954bb3e67526b31262048fb508d4 a4a0aa5ea2a88e4858996199fefd5439f17b481c 2025-09-29T01:30:45-05:00 ddh0 perplexity : show more kl-divergence data (#16321)
a4a0aa5ea2a88e4858996199fefd5439f17b481c 92cd103f627015a95f2107f1c27dc218c7b8ec64 2025-09-29T08:41:28+03:00 Georgi Gerganov ggml : fix dependencies for ggml_set_rows (#16318)
92cd103f627015a95f2107f1c27dc218c7b8ec64 b887d2f3413ac231e3cb5925260c39902af4a70c 2025-09-28T23:50:37-05:00 Jeff Bolz vulkan: Fix validation failure in quantized flash attention (#16292)
b887d2f3413ac231e3cb5925260c39902af4a70c bd0af02fc96c2057726f33c0f0daf7bb8f3e462a 2025-09-28T23:15:03+02:00 Sigbjørn Skjæret ggml : fix GGML_F32_VEC_FMA argument order in ggml_vec_mad1_f32 (#16307)
bd0af02fc96c2057726f33c0f0daf7bb8f3e462a d9e0e7c8194dfd7d23bf3a86608c9ece68d77c93 2025-09-28T14:13:50-04:00 crat0z common : fix reasoning before forced tool call via tool_choice = required (#16264)
d9e0e7c8194dfd7d23bf3a86608c9ece68d77c93 0124ac989f7e7bf08803788f66dbe4106bdcdd58 2025-09-28T22:38:15+08:00 R0CKSTAR ci : fix musa docker build (#16306)
0124ac989f7e7bf08803788f66dbe4106bdcdd58 2811c65286ae954bec87049f75b86dc022006dcc 2025-09-28T19:25:58+08:00 Aaron Teo devops: switch to using ubuntu-22.04-s390x image (#16302)
2811c65286ae954bec87049f75b86dc022006dcc d8359f5fde480da030bf75c7711573c7c4d993ba 2025-09-28T12:04:46+01:00 Imad Saddik Fixed a few typos in the README of the LLaMA.cpp HTTP Server [no ci] (#16297)
d8359f5fde480da030bf75c7711573c7c4d993ba 6a2c6145a0b91b40eb3c3dba7b20ccc4b270490f 2025-09-28T01:38:37-05:00 Jeff Bolz vulkan: 64-bit im2col (#16135)
6a2c6145a0b91b40eb3c3dba7b20ccc4b270490f 3b53634fe35771e2e318227aa81585726bae7234 2025-09-28T09:34:44+03:00 Georgi Gerganov metal : extend mat-mat multiplication support (#16225)
3b53634fe35771e2e318227aa81585726bae7234 1384abf8b8d5894d32fada453ccf4d196ffba7de 2025-09-28T09:34:05+03:00 Georgi Gerganov metal : fuse non-sequential nodes (#16102)
1384abf8b8d5894d32fada453ccf4d196ffba7de e6d65fb02d553bd79cad94e517cdca18b687788d 2025-09-27T20:36:34-05:00 Jeff Bolz vulkan: handle mat_mul with A matrix > 4GB (#16176)
e6d65fb02d553bd79cad94e517cdca18b687788d 8656f5de688cddcaea1d6174535eb60ee23ef6a0 2025-09-27T16:43:39-04:00 Jeff Bolz vulkan: support arbitrary KV dimension in flash attention (#16160)
8656f5de688cddcaea1d6174535eb60ee23ef6a0 4807e8f96a61b2adccebd5e57444c94d18de7264 2025-09-27T22:41:03+02:00 Acly vulkan : make the vulkan.hpp dynamic dispatcher instance private (#16224)
4807e8f96a61b2adccebd5e57444c94d18de7264 c0bfc57af421f8fd63c946c13b7666aed82560e2 2025-09-27T19:56:40+02:00 Aleksander Grygier Show message actions by default (#16289)
c0bfc57af421f8fd63c946c13b7666aed82560e2 75a3a6c2cd0002ba40e2dcc92007bc9fdbc69f1a 2025-09-28T00:49:32+08:00 Aman Gupta CUDA: mul_mat_id for mmf for bs <= 64 for f16 and bs <= 32 for f32 (#16277)
75a3a6c2cd0002ba40e2dcc92007bc9fdbc69f1a 0499b29c6f64c705faaf5860dc4600fca23671f4 2025-09-27T18:45:07+02:00 Johannes Gäßler CUDA: refactor and deduplicate vector FA kernels (#16208)
0499b29c6f64c705faaf5860dc4600fca23671f4 234e2ff8ed09716fb553437596779399bee31b11 2025-09-27T19:26:46+03:00 Dmytro Minochkin vulkan: throw system error instead of SIGABRT during init on older devices (#16156)
234e2ff8ed09716fb553437596779399bee31b11 3f81b4e91c1d5f098148af117e3f13cf4b077f52 2025-09-27T18:17:08+02:00 Adrien Gallouët server : remove old LLAMA_SERVER_SSL (#16290)
3f81b4e91c1d5f098148af117e3f13cf4b077f52 ace6a54565444b6377bee8e7ac693238e7766279 2025-09-27T06:36:11-04:00 Jeff Bolz vulkan: support GET_ROWS for k-quants (#16235)
ace6a54565444b6377bee8e7ac693238e7766279 72b24d96c6888c609d562779a23787304ae4609c 2025-09-27T11:12:46+02:00 Adrien Gallouët build : add LLAMA_OPENSSL option (#16287)
72b24d96c6888c609d562779a23787304ae4609c 624207e676ab5eb3ce7af631902bb45fb73a8359 2025-09-27T02:58:29+05:30 Vinkal model : make minicpm embedding_scale, residual_scale and logit_scale optional with legacy defaults (#16273)
624207e676ab5eb3ce7af631902bb45fb73a8359 807e8c6d310952f2f5656afc63dab9d7083dcb5c 2025-09-27T02:03:33+08:00 Aaron Teo devops: add s390x & ppc64le CI (#15925)
807e8c6d310952f2f5656afc63dab9d7083dcb5c 1a189278944d030211f336e103e96b65f976c361 2025-09-26T19:25:29+02:00 Aleksander Grygier Enhance text file detection logic for file attachments (#16199)
1a189278944d030211f336e103e96b65f976c361 e0539eb6aed346d4b25a6ea019044e88771e7690 2025-09-26T18:35:42+02:00 Aleksander Grygier Allow viewing conversations even when llama server is down (#16255)
e0539eb6aed346d4b25a6ea019044e88771e7690 5d0a40f390732cbf85d8a3b7b0fc3cbebffe780a 2025-09-26T11:36:48-04:00 Isaac McFadyen webui: switch to hash-based routing (alternative of #16079) (#16157)
5d0a40f390732cbf85d8a3b7b0fc3cbebffe780a d12a9836597b1ae4440d64d5a6ed727d27ac0702 2025-09-26T15:59:07+02:00 Aleksander Grygier Always show message actions for mobile UI + improvements for user message sizing (#16076)
d12a9836597b1ae4440d64d5a6ed727d27ac0702 cc1cfa277b3aae1f6cc9180472072336597a78d4 2025-09-26T16:09:34+03:00 Radoslav Gerganov codeowners : add rgerganov as owner of RPC [no ci] (#16279)
cc1cfa277b3aae1f6cc9180472072336597a78d4 54dbc37053f7d75ea5b0631d5ee88f19391e4314 2025-09-26T15:00:44+02:00 Aleksei Nikiforov mtmd : fix uninitialized variable in bicubic_resize (#16275)
54dbc37053f7d75ea5b0631d5ee88f19391e4314 b995a10760cb93d23d617d76ecb82a5f95b5e0d3 2025-09-26T14:14:28+03:00 Georgi Gerganov metal : report OOM errors (#16274)
b995a10760cb93d23d617d76ecb82a5f95b5e0d3 4710dd31bbcef79d04f85a3a6a8c7d9439c5c79a 2025-09-26T13:12:19+02:00 Adrien Gallouët common : use cpp-httplib as a cURL alternative for downloads (#16185)
4710dd31bbcef79d04f85a3a6a8c7d9439c5c79a 9b26511857ac09ae69ab485168fe2d3ee5fb1d6e 2025-09-26T12:39:35+02:00 Adrien Gallouët build : fix build-ios-device (#16257)
9b26511857ac09ae69ab485168fe2d3ee5fb1d6e 00217cd41388328c93e9e9644921c4319bb03bcc 2025-09-26T18:27:25+08:00 Aaron Teo ggml-cpu: implement MXFP4 SIMD for s390x (#16193)
00217cd41388328c93e9e9644921c4319bb03bcc 3b337b01a1a85c2f5b49376e8c0bbdb3f521528e 2025-09-26T13:19:23+03:00 Radoslav Gerganov ci : create git tags for released docker images (#16008)
3b337b01a1a85c2f5b49376e8c0bbdb3f521528e a86a580a6692edd1da076d5422f944c344b4fe5e 2025-09-26T07:53:36+02:00 Daniel Bevenius codeowners : add danbev as owner of build-xcframework.sh [no ci] (#16268)
a86a580a6692edd1da076d5422f944c344b4fe5e 0f7c69689f4e681948a6005adea9bee9c08ff903 2025-09-26T08:56:38+08:00 R0CKSTAR musa: upgrade musa sdk to 4.3.0 (#16240)
0f7c69689f4e681948a6005adea9bee9c08ff903 835b2b915c52bcabcd688d025eacff9a07b65f52 2025-09-26T08:56:10+08:00 R0CKSTAR musa: fix build warnings (#15611)
835b2b915c52bcabcd688d025eacff9a07b65f52 b05a9d650f4da1e70e7e2cbe8fe44e61b39656db 2025-09-25T19:50:28+02:00 Sigbjørn Skjæret model : add GroveMoE support (#15510)
b05a9d650f4da1e70e7e2cbe8fe44e61b39656db 27052978e487957b3d39e3bd8fc8ee4aa304bff9 2025-09-25T23:38:10+08:00 Aaron Teo vendors: update miniaudio version (#16212)
27052978e487957b3d39e3bd8fc8ee4aa304bff9 077c94d0caf87fbd3cf3288dbb5c0fd9670294cf 2025-09-25T18:20:34+03:00 rtaluyev readme : update bindings (#16144)
077c94d0caf87fbd3cf3288dbb5c0fd9670294cf aa3ee0eb0b80efca126cedf9bcb4fb5864b46ce3 2025-09-25T22:35:05+08:00 Aman Gupta CUDA: add a fused top-K MoE kernel (#16130)
aa3ee0eb0b80efca126cedf9bcb4fb5864b46ce3 d0991da39d3c39b3980c24cdfccb9a4c95a46870 2025-09-25T12:02:36+02:00 Daniel Bevenius model-conversion : add embedding prompt file support (#15871)
d0991da39d3c39b3980c24cdfccb9a4c95a46870 aa719c2f886c445b78113bf1e5849f1fce4124a7 2025-09-25T11:36:47+02:00 Daniel Bevenius server : add support for external server for tests (#16243)
aa719c2f886c445b78113bf1e5849f1fce4124a7 4cdd0bb4537f9617e9efcfef6b9454fcefe2ff08 2025-09-25T17:22:55+08:00 junchao-zhao ggml : fix loongarch lsx compilation error (#15864)
4cdd0bb4537f9617e9efcfef6b9454fcefe2ff08 b5bd037832bcb8ed3086dfe26ce9090bea989af1 2025-09-25T11:12:27+02:00 Johannes Gäßler docs: fix typo [no ci] (#16244)
b5bd037832bcb8ed3086dfe26ce9090bea989af1 dfcd53f7ecb9bb897a9d752d09c59d10be47237a 2025-09-25T03:53:09-05:00 Douglas Hanley llama : add support for qwen3 reranker (#15824)
dfcd53f7ecb9bb897a9d752d09c59d10be47237a 4ea00794b8c995b6deaf4bac159c1778dc27419a 2025-09-25T11:30:16+03:00 Georgi Gerganov metal : fuse NORM + MUL + ADD, support non-multiples of 4 (#16220)
4ea00794b8c995b6deaf4bac159c1778dc27419a 02a6a82ae7c7ddd1819ae26b0cc36675879aecee 2025-09-25T11:29:42+03:00 Georgi Gerganov metal : relax reorder conditions (#16216)
02a6a82ae7c7ddd1819ae26b0cc36675879aecee c498fc82fe5b83fc8c6e1627286bdc1f93caddbf 2025-09-25T11:29:08+03:00 Georgi Gerganov metal : restore im2col perf (#16219)
c498fc82fe5b83fc8c6e1627286bdc1f93caddbf e7a5130a20cf45a3358308356c249734ca982143 2025-09-25T10:20:02+03:00 Radoslav Gerganov rpc : use ggml logging facilities
e7a5130a20cf45a3358308356c249734ca982143 bee378e0988b44bbe93b0768208080951b312363 2025-09-25T13:06:30+08:00 Aaron Teo codeowners: add ownership of zdnn backend [no ci] (#16232)
bee378e0988b44bbe93b0768208080951b312363 5fb557653b8756ac2b6c6a102b1e44abcadf552f 2025-09-25T05:06:06Z Eve ci: run the x64 and arm ci on the github machines instead (#16183)
5fb557653b8756ac2b6c6a102b1e44abcadf552f 4ae88d07d026e66b41e85afece74e88af54f4e66 2025-09-25T11:36:30+08:00 Aaron Teo devops: fix s390x docker release failure (#16231)
4ae88d07d026e66b41e85afece74e88af54f4e66 e789095502b337690c7616db32d7c679a5bd2533 2025-09-25T00:25:04+08:00 Aaron Teo codeowners: add ownership of zdnn backend [no ci] (#16229)
e789095502b337690c7616db32d7c679a5bd2533 f2a789e33490deb483a2694b066b37e45524bb79 2025-09-24T16:53:48+02:00 Johannes Gäßler llama: print memory breakdown on exit (#15860)
f2a789e33490deb483a2694b066b37e45524bb79 3a599719673c850647e3bb911ed6d91109bb91d2 2025-09-24T16:17:49+02:00 Acly ggml : split graph allocations according to backend max buffer size (#15815)
3a599719673c850647e3bb911ed6d91109bb91d2 63b54c81a620981be020184ab99e63a8e50e47cb 2025-09-24T13:42:26+02:00 Tarek Dakhran model : add label for LiquidAI LFM2-2.6B model (#16204)
63b54c81a620981be020184ab99e63a8e50e47cb 152729f8848b692e1ae53c197ccca92ef10a523b 2025-09-24T16:25:26+08:00 Jie Fu (傅杰) model-conversion : make causal-verify-logits fails with model names containing "." (#16215)
152729f8848b692e1ae53c197ccca92ef10a523b c0c59c1157b5aeded285a3b25d2463c866f583d3 2025-09-24T08:53:47+02:00 Uilian Ries common : add missing chrono header for common.cpp (#16211)
c0c59c1157b5aeded285a3b25d2463c866f583d3 7735706b939847df2c6c00b44c36f95a20137c61 2025-09-24T08:53:20+02:00 Sigbjørn Skjæret codeowners : match all requirements files (#16214)
7735706b939847df2c6c00b44c36f95a20137c61 4d9ea03d170cf504a40bf3a85788af84cccaee80 2025-09-24T14:46:52+08:00 Jie Fu (傅杰) model-conversion : run-org-model.py fails to run on mac m1 (#16213)
4d9ea03d170cf504a40bf3a85788af84cccaee80 8ba548dae251f8f2e3834ed5226b76b6e4f4a485 2025-09-24T08:10:09+02:00 Daniel Bevenius codeowners : use slash prefix for root files [no ci] (#16210)
8ba548dae251f8f2e3834ed5226b76b6e4f4a485 f505bd83ca7a43c4585ff3d59135e77eae9c793b 2025-09-24T12:19:23+08:00 Jie Fu (傅杰) model-conversion : fix the make targets in the README.md (#16209)
f505bd83ca7a43c4585ff3d59135e77eae9c793b 0889589dbe8c67dd518c58a57afbb02dde2dccbe 2025-09-23T20:41:40+03:00 Georgi Gerganov ci : disable AMD workflows + update NVIDIA workflows (#16200)
0889589dbe8c67dd518c58a57afbb02dde2dccbe 4e29084ba4104c4ea529fd3163bb6e76f64383df 2025-09-23T13:44:25+03:00 Georgi Gerganov ci : enable Vulkan workflow on Mac (#16194)
4e29084ba4104c4ea529fd3163bb6e76f64383df f6b4af3d04763b1e0130f5b5fce19c4bc6f83f1c 2025-09-23T01:58:12-07:00 Xiangyan Sun ggml-cpu: Respect cpumask settings (#16164)
f6b4af3d04763b1e0130f5b5fce19c4bc6f83f1c 264f1b51872c125e23fa0ac1da5e2a1170de9a08 2025-09-23T10:25:20+02:00 Sigbjørn Skjæret ggml : fix uninitialized is_on_grid in quantize_row_iq3_xxs_impl (#15928)
264f1b51872c125e23fa0ac1da5e2a1170de9a08 0bc7cc715472fe28822e57f036f0746592ed2c04 2025-09-23T14:53:05+08:00 Aaron Teo zdnn: refactor codebase + add docs (#16178)
0bc7cc715472fe28822e57f036f0746592ed2c04 4b9f4cb0f89a88de4bdf97727d0457b0c648804c 2025-09-23T08:13:22+02:00 Daniel Bevenius codeowners : add @danbev to model-conversion example [no ci] (#16190)
4b9f4cb0f89a88de4bdf97727d0457b0c648804c 85e72271ba1ce78adf34fd8997803c991e617ca6 2025-09-23T13:59:34+08:00 Aaron Teo devops: add s390x containers (#15915)
85e72271ba1ce78adf34fd8997803c991e617ca6 1d0125bcf1cbd7195ad0faf826a20bc7cec7d3f4 2025-09-23T05:59:03+02:00 Daniel Bevenius ggml-cpu : fix typo in gemm comments [no ci] (#16189)
1d0125bcf1cbd7195ad0faf826a20bc7cec7d3f4 351f3da39c85f59d581fc184f09283da7f099a3b 2025-09-22T12:40:10-06:00 Gabe Goodhart feat: Add conversion support in GraniteHybrid for non-hybrid (all attn) (#16177)
351f3da39c85f59d581fc184f09283da7f099a3b 3ecb2f671a2f49d56357f99d135a94e841759178 2025-09-23T01:57:46+08:00 Haiyue Wang clang-tidy : disable warning about performance enum size (#16127)
3ecb2f671a2f49d56357f99d135a94e841759178 432cf4304c5379bfbd1f3feed65ec205955b2f4b 2025-09-22T19:13:00+02:00 Sigbjørn Skjæret ggml : implement set_rows with i32 index (#16159)
432cf4304c5379bfbd1f3feed65ec205955b2f4b 37a23c17bdc9c99c9c6ad41168e4ced3724b72cd 2025-09-22T18:20:21+03:00 Georgi Gerganov codeowners : update + cleanup (#16174)
37a23c17bdc9c99c9c6ad41168e4ced3724b72cd 138c87ce8bd558b2cc134ada7316a3dad8eb67ac 2025-09-22T14:13:51+02:00 Adrien Gallouët common : enable `--offline` mode without curl support (#16137)
138c87ce8bd558b2cc134ada7316a3dad8eb67ac c6db9a10278f40b4b8d3f6931728f2cce2356daa 2025-09-22T10:53:13+02:00 Quentin Bramas webui : fix handling incomplete chunks (#16107)
c6db9a10278f40b4b8d3f6931728f2cce2356daa d05affbab7d1364fa7ac06c03cd33f03235ae840 2025-09-22T10:49:58+02:00 GideonSerf embedding : fix typos in README (#16171)
d05affbab7d1364fa7ac06c03cd33f03235ae840 4f324a556caa5be0be2261604ef4aab0faf36eb8 2025-09-22T16:48:42+08:00 Haiyue Wang common : remove unused local variables (#16140)
4f324a556caa5be0be2261604ef4aab0faf36eb8 a71ae3ba7a857394103f12e30b387c48242c84f2 2025-09-22T11:12:37+03:00 Georgi Gerganov ggml : extend ggml_can_fuse to work with non-sequential nodes (#16123)
a71ae3ba7a857394103f12e30b387c48242c84f2 05a2458121f9cdcc98ea6ffeeab6f23023136266 2025-09-22T11:12:09+03:00 Georgi Gerganov ggml : add ggml_op_is_empty (#16122)
05a2458121f9cdcc98ea6ffeeab6f23023136266 96fdca043be8fa733bbd59868a75517f92633376 2025-09-22T15:10:58+07:00 Xuan-Son Nguyen codeowners : update ownership for @ngxson and @allozuar (#16128)
96fdca043be8fa733bbd59868a75517f92633376 b2d980fce063fa3591c59ad50b946c8da66c294f 2025-09-22T17:04:01+09:00 Shin-myoung-serp Vulkan: add conv_transpose_2d operation (#16022)
b2d980fce063fa3591c59ad50b946c8da66c294f 5c6106a696af2b00ce01d14ba525979d5a32b199 2025-09-22T09:59:05+02:00 Sigbjørn Skjæret codeowners : claim responsibility for ci, models, gguf-py and convert (#16124)
5c6106a696af2b00ce01d14ba525979d5a32b199 ec65fb52f0cc890e5085a6c5995ab08a156265fb 2025-09-22T10:58:02+03:00 Georgi Gerganov contrib : update roles (#16113)
ec65fb52f0cc890e5085a6c5995ab08a156265fb 1d660d2fae42ea2e1d3569638e722bf7a37b6b19 2025-09-22T10:16:05+03:00 Georgi Gerganov ci : remove vulkaninfo calls (#16169)
1d660d2fae42ea2e1d3569638e722bf7a37b6b19 a20d810d79adfbf82e0eb703af6f27a0e2d1a539 2025-09-22T09:11:39+03:00 Georgi Gerganov ci : use smaller model (#16168)
a20d810d79adfbf82e0eb703af6f27a0e2d1a539 4d0a7cbc617e384fc355077a304c883b5c7d4fb6 2025-09-22T00:37:17-05:00 Jeff Bolz vulkan: add RTE variants of exp shader (#16165)
4d0a7cbc617e384fc355077a304c883b5c7d4fb6 9073a73d82a916cea0809de225ef5175c3a86e91 2025-09-22T08:31:40+03:00 Georgi Gerganov ci : adjust params for less runtime (#16167)
9073a73d82a916cea0809de225ef5175c3a86e91 51f5a45fbe575dcd54bdd2a339ef8e8424d1c12a 2025-09-22T07:22:43+02:00 Ruben Ortlam vulkan: vec dot matrix multiplication fix (#16151)
51f5a45fbe575dcd54bdd2a339ef8e8424d1c12a c4510dc9374e17dcb8726902ab5216067a92b3d3 2025-09-21T16:42:10-07:00 lhez opencl: fix concat crash on win arm64 with Adreno (#15944)
c4510dc9374e17dcb8726902ab5216067a92b3d3 da30ab5f8696cabb2d4620cdc0aa41a298c54fd6 2025-09-21T14:48:44-07:00 lhez opencl: initial `q8_0` mv support (#15732)
da30ab5f8696cabb2d4620cdc0aa41a298c54fd6 28baac9c9f491c872e2c37762d3bd90446b005e9 2025-09-21T19:00:27+03:00 Georgi Gerganov ci : add label for the RISC-V runner (#16150)
28baac9c9f491c872e2c37762d3bd90446b005e9 1eeb523c3e0c7ffbd59469f5463dcbdecba3535e 2025-09-21T16:50:45+03:00 Georgi Gerganov ci : migrate ggml ci to self-hosted runners (#16116)
1eeb523c3e0c7ffbd59469f5463dcbdecba3535e 5bb4a3edec297e74b0f7bd4ed5d0fdd12e28d858 2025-09-21T08:31:55+02:00 Giuseppe Scrivano vulkan: optimize UMA buffer operations and fix driver hangs (#16059)
5bb4a3edec297e74b0f7bd4ed5d0fdd12e28d858 7f766929ca8e8e01dcceb1c526ee584f7e5e1408 2025-09-21T01:23:37-05:00 Jeff Bolz vulkan: fix validation error about VK_PIPELINE_CREATE_CAPTURE_STATISTICS_BIT_KHR (#16086)
7f766929ca8e8e01dcceb1c526ee584f7e5e1408 405921dcefdd4e90ed948a4bf179007c2fa92b2d 2025-09-20T12:55:47+03:00 Georgi Gerganov sync : ggml
405921dcefdd4e90ed948a4bf179007c2fa92b2d fa6383ca7e7ccb8ca3bdfeb37e348ddc4113aa26 2025-09-16T06:16:52+02:00 Daniel Bevenius ggml : introduce semantic versioning (ggml/1336)
fa6383ca7e7ccb8ca3bdfeb37e348ddc4113aa26 803dac2e48ef3ba26a504eb27c4e77ec2d21f7d0 2025-09-10T17:21:11+02:00 Gregor Jasny CUDA : conditionally add cuda architectures (ggml/1341)
803dac2e48ef3ba26a504eb27c4e77ec2d21f7d0 459c0c2c1a400f960d7b8e8d94d31a8426f80986 2025-09-20T10:42:56+02:00 Ruben Ortlam vulkan: use vec dot for matrix matrix multiplications (#16056)
459c0c2c1a400f960d7b8e8d94d31a8426f80986 be79d9fdd95ab8955527c4aaa67b90e8b9516718 2025-09-20T07:56:30+02:00 Benni server: fix SSE and OpenAI compatibility for error messages when streaming (#16109)
be79d9fdd95ab8955527c4aaa67b90e8b9516718 f432d8d83e7407073634c5e4fd81a3d23a10827f 2025-09-19T15:15:21-07:00 ssweens llama-bench: add --devices and --list-devices support (#16039)
f432d8d83e7407073634c5e4fd81a3d23a10827f 4067f07fc5aa5722b87db303b561597004696f6c 2025-09-20T00:57:30+09:00 shun095 chat: Fix streaming parser for granite models (#15682)
4067f07fc5aa5722b87db303b561597004696f6c 4b8560ab56fdd9819358b47c338bbc8ec357c57e 2025-09-19T09:52:27+02:00 Aleksander Grygier feat: Improve mobile UI for Settings Dialog (#16084)
4b8560ab56fdd9819358b47c338bbc8ec357c57e 0dd58b6877f3dc106593d6bc68d98305f553c566 2025-09-19T13:02:51+07:00 Xuan-Son Nguyen chat : fix build on arm64 (#16101)
0dd58b6877f3dc106593d6bc68d98305f553c566 69ffd891631befa9e6b485fd646a16dab4f2c007 2025-09-19T11:31:56+07:00 Xuan-Son Nguyen ggml : refactor forward_dup for cpu backend (#16062)
69ffd891631befa9e6b485fd646a16dab4f2c007 246c0d9c795fb25da8268625d597580155a3672f 2025-09-18T23:07:26+02:00 Adrien Gallouët ggml-amx : fix ggml_amx_init() on generic Linux (#16049)
246c0d9c795fb25da8268625d597580155a3672f 3edd87cd055a45d885fa914d879d36d33ecfc3e1 2025-09-18T23:07:18+02:00 Adrien Gallouët cmake : fix static linking for OpenMP on Unix-like systems (#16031)
3edd87cd055a45d885fa914d879d36d33ecfc3e1 c0b45097c33e2667a94444f08cc9e36bec0a5e2e 2025-09-18T12:03:34-07:00 Shawn Gu opencl: optimize mxfp4 kernels (#16037)
c0b45097c33e2667a94444f08cc9e36bec0a5e2e 38dbdf4c057515ccea9bec0ca2518f86d5e4d28e 2025-09-18T13:46:17-05:00 Jeff Bolz rename optimize_graph to graph_optimize (#16082)
38dbdf4c057515ccea9bec0ca2518f86d5e4d28e 368560a1e3b9a3bc83af741b0b2bc9e46fb420d2 2025-09-18T11:26:03-07:00 Bowen Han CUDA: Optimize PAD_REFLECT_1D (#15957)
368560a1e3b9a3bc83af741b0b2bc9e46fb420d2 4ca088b036313c2d8e682f4cfeb7c29edd85d0b9 2025-09-18T19:28:32+02:00 Johannes Gäßler CUDA: fix compilation on CC 6.0 (#16091)
4ca088b036313c2d8e682f4cfeb7c29edd85d0b9 703f9e32c4eb3166f8d63007c26e31a1466c21af 2025-09-18T16:22:50+01:00 Eric Curtin Add resumable downloads for llama-server model loading (#15963)
703f9e32c4eb3166f8d63007c26e31a1466c21af ad6bd9083bc346afd4ecd2fbb83e0306c0141c99 2025-09-18T16:28:41+03:00 Georgi Gerganov metal : use function constants for mul_mv_ext kernels (#16074)
ad6bd9083bc346afd4ecd2fbb83e0306c0141c99 2b6b55a59f590a1e1eb2dcd09d5b8b6feb9cc748 2025-09-18T13:28:22+02:00 Sigbjørn Skjæret cuda : add missing F32<->I32 entries in ggml_cuda_cpy_fn (#16060)
2b6b55a59f590a1e1eb2dcd09d5b8b6feb9cc748 e58174cecbc45bf79bf653cd2c984395940c6ef4 2025-09-18T13:36:57+03:00 Radoslav Gerganov server : include usage statistics only when user request them (#16052)
e58174cecbc45bf79bf653cd2c984395940c6ef4 b213fce89bee8cb56b587b91e15a4278f8ed0180 2025-09-18T12:47:56+03:00 Georgi Gerganov llama : bump max seq limit from 64 to 256 (#15916)
b213fce89bee8cb56b587b91e15a4278f8ed0180 e00f3fd8fff2cf5a8c8c9f475034bd089c8bcce4 2025-09-18T12:33:45+03:00 Georgi Gerganov metal : improve F32, F16 and BF16 mat-vec multiplication (#16057)
e00f3fd8fff2cf5a8c8c9f475034bd089c8bcce4 f2f28380ea68939c0481df3e4216b698824a59df 2025-09-18T15:06:48+08:00 Jhen-Jie Hong metal : avoid call free for non-owned buffer (#16067)
f2f28380ea68939c0481df3e4216b698824a59df 62c3b645c56ad5288aa401901f043b050edac5a2 2025-09-18T10:03:24+03:00 Georgi Gerganov metal : handle nil cv during pipeline creation (#16065)
62c3b645c56ad5288aa401901f043b050edac5a2 d304f459d8619399eb232b1e3689379306f439d3 2025-09-18T09:26:33+08:00 Chenguang Li CANN: Remove print (#16044)
d304f459d8619399eb232b1e3689379306f439d3 0320ac5264279d74f8ee91bafa6c90e9ab9bbb91 2025-09-17T13:09:40-07:00 Reese Levine GGML WebGPU: Support for ADD, MUL, RMS_NORM, GET_ROWS operators (#16018)
0320ac5264279d74f8ee91bafa6c90e9ab9bbb91 a7a98e0fffed794396b3fbad4dcdbbc184963645 2025-09-17T20:38:12+03:00 Georgi Gerganov metal : refactor + optimize v2 (#15995)
a7a98e0fffed794396b3fbad4dcdbbc184963645 8f8f2274ee3601fecf6e2d57b52f701c81bede21 2025-09-17T19:29:13+02:00 Aleksander Grygier SvelteKit-based WebUI (#14839)
8f8f2274ee3601fecf6e2d57b52f701c81bede21 c959b676be29e93f8dbc3bd6056ceba812a9eb72 2025-09-18T00:18:21+07:00 Xuan-Son Nguyen convert : add Llama4ForCausalLM (#16042)
c959b676be29e93f8dbc3bd6056ceba812a9eb72 cd08fc3ecc0264b4414b68af3874a6c689ed60c1 2025-09-17T15:32:42+02:00 Johannes Gäßler CUDA: fix FA occupancy, optimize tile kernel (#15982)
cd08fc3ecc0264b4414b68af3874a6c689ed60c1 cb5bb6cc05119c24e7711ca2956cd0e6d409d396 2025-09-17T01:08:02-07:00 David Ribeiro Alves common : Fix corrupted memory error on json grammar initialization (#16038)
cb5bb6cc05119c24e7711ca2956cd0e6d409d396 a91d035b901e8a9edf810f63d130ee49adf27be2 2025-09-17T07:35:37Z Eve vulkan: automatically remove unsupported devices (#15976)
a91d035b901e8a9edf810f63d130ee49adf27be2 745cbcf2fe1eb88f8db615ac622f0b944d924ad6 2025-09-17T09:34:09+02:00 Daniel Bevenius ci : revert back to macos-13 for macOS-latest-cmake-x64 (#16040)
745cbcf2fe1eb88f8db615ac622f0b944d924ad6 1cbd80f8cf80a817715b1ccc5680fe2a3c5172c8 2025-09-17T15:30:55+08:00 Jie Fu (傅杰) llama-quant : fix the verification of attention layers for encoder-decoder models (#16023)
1cbd80f8cf80a817715b1ccc5680fe2a3c5172c8 85286f354813056f6c835046c0acfa3bf6ba9432 2025-09-17T15:29:00+08:00 Jie Fu (傅杰) examples : support encoder-decoder models in the simple example (#16002)
85286f354813056f6c835046c0acfa3bf6ba9432 d5fabe3682de515fd09d6c981f7a0d1b75614455 2025-09-17T00:01:58-07:00 Shane A model : add OLMo3 support (#16015)
d5fabe3682de515fd09d6c981f7a0d1b75614455 8ff206097c2bf3ca1c7aa95f9d6db779fc7bdd68 2025-09-17T14:33:08+08:00 Chenguang Li CANN: Optimize ggml_cann_set_device (#15935)
8ff206097c2bf3ca1c7aa95f9d6db779fc7bdd68 77475530b8bbea3bf578632507e1284cdfe2c8c0 2025-09-16T16:17:08+02:00 jacekpoplawski llama-bench: add --n-cpu-moe support (#15952)
77475530b8bbea3bf578632507e1284cdfe2c8c0 3913f8730ec6d6245480affc30ae3049107956f4 2025-09-16T15:27:52+02:00 Daniel Bevenius ci : use macos-latest for arm64 webgpu build (#16029)
3913f8730ec6d6245480affc30ae3049107956f4 76888d202ed2b835ae19ea9f9db6baf39e419297 2025-09-16T15:25:57+02:00 Daniel Bevenius ggml : fix padding in timestep embedding kernels (#15932)
76888d202ed2b835ae19ea9f9db6baf39e419297 f1fbffb5c0b34b2a68febb7da3fd0f8333f1ed4c 2025-09-16T13:41:38+02:00 Daniel Bevenius ci : upload xcframework artifact from ios-xcode-build job (#16010)
f1fbffb5c0b34b2a68febb7da3fd0f8333f1ed4c 51abc96bdc52ba8cd6ad78dcf12ed9a041d7b442 2025-09-15T23:59:19-07:00 Bowen Han fix: apply clang-format to CUDA macros (#16017)
51abc96bdc52ba8cd6ad78dcf12ed9a041d7b442 07808ebb07e2b1aa19032705e332679ddf967614 2025-09-16T05:57:16+02:00 Daniel Bevenius ci : update macos-latest* jobs to use macos-latest (#15938)
07808ebb07e2b1aa19032705e332679ddf967614 6d758839ff741d4966ca92b7f801b7a8b5b96364 2025-09-15T22:54:44-04:00 Yuri Khrustalev cmake : Do not install tools on iOS targets (#15903)
6d758839ff741d4966ca92b7f801b7a8b5b96364 3d4053f77f0f78ee2b791088c02af653ebee42dd 2025-09-16T10:38:28+08:00 Aman Gupta Add LLaDA-7b-MoE diffusion model (#16003)
3d4053f77f0f78ee2b791088c02af653ebee42dd dc381aa9a6dc45f00673471d34b8bddd30e77570 2025-09-15T16:28:31-06:00 Jake Karnes CUDA: fix im2col_3d to respect non-contiguous inputs (views) (#15956)
dc381aa9a6dc45f00673471d34b8bddd30e77570 10d197409bd9537ff302ad09966fe406882fef9d 2025-09-15T14:38:52-07:00 Diego Devesa docker : enable rocWMMA in ROCm images, add gfx1151 (#15997)
10d197409bd9537ff302ad09966fe406882fef9d b907255f4bd169b0dc7dca9553b4c54af5170865 2025-09-15T14:38:42-07:00 Diego Devesa releases : switch to rocWMMA develop branch, add gfx1151 (#15992)
b907255f4bd169b0dc7dca9553b4c54af5170865 28c39da7c645185ade5436767929d7ec33006033 2025-09-15T19:51:35+03:00 yael-works SYCL: Add COUNT_EQUAL operator support (#15991)
28c39da7c645185ade5436767929d7ec33006033 106220562aca42b6738b8f51acfce0db1b8a2fb6 2025-09-15T13:08:30+03:00 Nikolay Popov llama-run: Fix model download on Windows (#15988)
106220562aca42b6738b8f51acfce0db1b8a2fb6 a68f31edd71cc39141113f05f7133a3e9ece8c61 2025-09-15T17:35:11+08:00 Aman Gupta CUDA: some micro-optimizations in mmf.cuh for mul_mat_id (#15926)
a68f31edd71cc39141113f05f7133a3e9ece8c61 b8e09f08b9a91c0401bc67d17a17c90756420346 2025-09-15T02:54:57-05:00 ddh0 fix KLD percentile output (#15999)
b8e09f08b9a91c0401bc67d17a17c90756420346 6c019cb04e86e2dacfe62ce7666c64e9717dde1f 2025-09-14T23:00:59+02:00 Sigbjørn Skjæret model : add grok-2 support (#15539)
6c019cb04e86e2dacfe62ce7666c64e9717dde1f 9dcd200d57bc6f05a59a6a8df361d5d183af4124 2025-09-14T21:17:04+02:00 Sigbjørn Skjæret server : only attempt to enable thinking if using jinja (#15967)
9dcd200d57bc6f05a59a6a8df361d5d183af4124 0fa154e3502e940df914f03b41475a2b80b985b0 2025-09-14T22:02:32+03:00 Georgi Gerganov metal : remove memory pools (#15966)
0fa154e3502e940df914f03b41475a2b80b985b0 261e6a20ffdb79c4875e674b4f6b514bc73cff8f 2025-09-15T04:43:54+10:00 Adam rocm.Dockerfile: added gfx1200,gfx1201 architectures to support AMD Radeon RX 9000 series (#15994)
261e6a20ffdb79c4875e674b4f6b514bc73cff8f a0e13dcbe5bae7025660349ef3e4ead060e507f2 2025-09-14T16:56:28+02:00 Ruben Ortlam Vulkan: Clean up mul_mm shader (#15987)
a0e13dcbe5bae7025660349ef3e4ead060e507f2 a14bd350141fb42b8bf2dd2342cebc27bfdce399 2025-09-14T22:20:35+08:00 lcy build: fix the build failures of Windows HIP release job (#15984)
a14bd350141fb42b8bf2dd2342cebc27bfdce399 918b26f197f55d5d562446dfc876d0e637929d07 2025-09-14T15:33:22+03:00 Georgi Gerganov metal : fix kernel requirements (#15983)
918b26f197f55d5d562446dfc876d0e637929d07 9ecb88434644c865232bb665d2f6f05049fc6456 2025-09-14T12:28:18+03:00 Radoslav Gerganov rpc : fix regression when --device is used (#15981)
9ecb88434644c865232bb665d2f6f05049fc6456 d1c6f11f47bae063a68a6be8e4830c060a11b7bd 2025-09-14T02:21:59-07:00 Diego Devesa releases : update ROCM, add gfx1200, gfx1201, gfx1151 (#15972)
d1c6f11f47bae063a68a6be8e4830c060a11b7bd 6380d6a3e709cb02a8695afdd96b40e674477332 2025-09-14T12:10:07+03:00 Radoslav Gerganov doc : update documentation for --tensor-split (#15980)
6380d6a3e709cb02a8695afdd96b40e674477332 aa0c461efe3603639af1a1defed2438d9c16ca0f 2025-09-14T13:37:03+08:00 Aaron Teo ggml-zdnn: rm user mapped buffers (#15965)
aa0c461efe3603639af1a1defed2438d9c16ca0f b9c9c9f789cd57fb0b28b25223305613cd90fa10 2025-09-13T16:29:43+01:00 Jeff Bolz vulkan: fix failing dequant shaders (#15862)
b9c9c9f789cd57fb0b28b25223305613cd90fa10 50f4281a6f5c3a5d68bdeb12f904fa01e0e2ba91 2025-09-13T16:23:30+01:00 Jeff Bolz vulkan: initialize vulkan-hpp to allow using extension function pointers (#15705)
50f4281a6f5c3a5d68bdeb12f904fa01e0e2ba91 55758b00cae1451a0d789c50a5eb8c9bee42b9a0 2025-09-13T07:49:49-07:00 Diego Devesa llama : allow using iGPUs with --device (#15951)
55758b00cae1451a0d789c50a5eb8c9bee42b9a0 f161463a54d9f93d41246286aa4a9569a91d804d 2025-09-13T16:24:22+03:00 Georgi Gerganov metal : refactor kernel loading (#15964)
f161463a54d9f93d41246286aa4a9569a91d804d 84d7b2fca11d1be118ce776f6d72a486c4883b74 2025-09-13T13:54:28+03:00 Georgi Gerganov metal : allow ops to run concurrently (#15929)
84d7b2fca11d1be118ce776f6d72a486c4883b74 40be51152d4dc2d47444a4ed378285139859895b 2025-09-13T12:45:04+03:00 Georgi Gerganov metal : fix memory leaks (#15962)
40be51152d4dc2d47444a4ed378285139859895b 4bf5549269d99bac936a65892da2312cc71b2421 2025-09-13T02:39:52+08:00 Aaron Teo ggml-zdnn: fix #15414, activate FP16 and BF16 acceleration and incorrect zTensor free (#15839)
4bf5549269d99bac936a65892da2312cc71b2421 f4e664f838cc65d89fa845c48c372e43852112e4 2025-09-12T16:31:50+01:00 Eric Curtin Add docker protocol support for llama-server model loading (#15790)
f4e664f838cc65d89fa845c48c372e43852112e4 f088b6a84f6aed0abb619dbb9d375e726fc888a6 2025-09-12T23:16:32+08:00 Haiyue Wang context : remove redundant explicit casting to the same type (#15948)
f088b6a84f6aed0abb619dbb9d375e726fc888a6 304ac5693d1e2124f83e0584bc5eea6311d3d3b4 2025-09-12T17:02:55+03:00 Georgi Gerganov server : adjust prompt similarity thold + add logs (#15913)
304ac5693d1e2124f83e0584bc5eea6311d3d3b4 6c88ad8fa741a2182a2dcf8c5353ae4b5c66e656 2025-09-12T13:24:21+02:00 Ruben Ortlam Vulkan iGPU device selection overhaul and PCI ID API support (#15947)
6c88ad8fa741a2182a2dcf8c5353ae4b5c66e656 704d90c987cdf00751567b2088c4e54742aa2d3f 2025-09-12T09:06:20+02:00 Mathieu Baudier vulkan: Make device memory check more portable (#15939)
704d90c987cdf00751567b2088c4e54742aa2d3f 360d6533db39e11577afe9b0aece20c6b5ddaf1f 2025-09-12T09:15:12+08:00 Neo Zhang Jianyu Revert "sycl: add usage of enqueue_functions extension (#14244)" (#15910)
360d6533db39e11577afe9b0aece20c6b5ddaf1f 0e6ff0046f4a2983b2c77950aa75960fe4b4f0e2 2025-09-11T13:47:38-07:00 Diego Devesa ggml-backend : add GGML_BACKEND_DEVICE_TYPE_IGPU device type (#15797)
0e6ff0046f4a2983b2c77950aa75960fe4b4f0e2 df082f56309073ecf885eceaa21b86e8a487e61b 2025-09-11T21:19:58+02:00 Johannes Gäßler CUDA: larger SRAM reads for tile FA, AMD FP16 dot (#15927)
df082f56309073ecf885eceaa21b86e8a487e61b 24a6734daf6932ff29ba8c1ff0245c51d76f783e 2025-09-11T12:12:34-05:00 ddh0 nitpick : correct MB to MiB (#15934)
24a6734daf6932ff29ba8c1ff0245c51d76f783e 2b3efea9a4d91216850856fbb77075db26f6a6eb 2025-09-11T15:39:12+02:00 Daniel Bevenius ggml-cpu : add check for ARM MATMUL_INT8/i8mm support (#15922)
2b3efea9a4d91216850856fbb77075db26f6a6eb c0389dba43d50695f9d3f57dd1f1a14cbefc100c 2025-09-11T12:45:40+02:00 Charles Xu kleidiai: fix GGML_ASSERT(*cur_backend_id != -1) failed (#15614)
c0389dba43d50695f9d3f57dd1f1a14cbefc100c 00681dfc16ba4cebb9c7fbd2cf2656e06a0692a4 2025-09-11T15:59:37+08:00 hipudding CANN: Disable acl_graph for prefill stage (#15933)
00681dfc16ba4cebb9c7fbd2cf2656e06a0692a4 4f658855fa8f2e42b7ed9a5b298fa39a2e39b096 2025-09-10T22:04:03+02:00 Oliver Simons CUDA: Add `fastdiv` to `k_bin_bcast*`, giving 1-3% E2E performance (#15872)
4f658855fa8f2e42b7ed9a5b298fa39a2e39b096 6ab397e12ba8e9f776341cdae68f7ffb2f8d2cde 2025-09-11T02:51:51+08:00 Jie Fu (傅杰) llama : support T5 models with unequal number of encoder-decoder layers (#15909)
6ab397e12ba8e9f776341cdae68f7ffb2f8d2cde 9de447d94e1ae9d1a36e5a2e5bf47483352c0d9c 2025-09-10T19:08:59+02:00 Sigbjørn Skjæret graph : support non-contiguous Q in build_attn_mha (#15908)
9de447d94e1ae9d1a36e5a2e5bf47483352c0d9c 0f0a3c2851134d49955f3c85afbb0b1bb47c3e07 2025-09-10T17:31:40+02:00 Daniel Bevenius ggml-cpu : fix padding in ggml_timestep_embedding (#15917)
0f0a3c2851134d49955f3c85afbb0b1bb47c3e07 33daece86b65607451d0d4378d2d04ba6a20ad55 2025-09-10T17:52:35+03:00 Georgi Gerganov metal : make the backend async (#15906)
33daece86b65607451d0d4378d2d04ba6a20ad55 e7b6d83b524bbc24a1343d862de6dba8e8eddbd6 2025-09-10T15:39:57+02:00 Daniel Bevenius ci : add caching for ROCm installation in release workflow (#15924)
e7b6d83b524bbc24a1343d862de6dba8e8eddbd6 2cfef4d117d67ab1dec002915b48a15d11ee1973 2025-09-10T14:17:09+02:00 Daniel Bevenius tests : filter out no-ops from coverage report (#15900)
2cfef4d117d67ab1dec002915b48a15d11ee1973 09e72a037c77b6823fde9e1e4cf28e815b9c41ab 2025-09-10T12:51:28+01:00 j-k media : add transparent icon svg and png [no ci] (#15891)
09e72a037c77b6823fde9e1e4cf28e815b9c41ab 10d8b2b6b0ac2cae252a80b4daea5da55ab63c2f 2025-09-10T07:28:47-04:00 Jesse gitignore : Ignore vim swap files in tests (#15901)
10d8b2b6b0ac2cae252a80b4daea5da55ab63c2f 28b5f190ef1dbea5edf82dbc8b4407b721fadd13 2025-09-10T18:42:00+08:00 Chenguang Li CANN: Add ROPE sin/cos cache for reuse (#15912)
28b5f190ef1dbea5edf82dbc8b4407b721fadd13 86587da03bd78df8f4e7d8b111a0c1d2494d6ed0 2025-09-10T15:29:12+08:00 Chenguang Li CANN: implement LRU cache for ACL graphs (#15814)
86587da03bd78df8f4e7d8b111a0c1d2494d6ed0 ff02caf9eed261423289d1531a56536fbf57bfc2 2025-09-10T05:33:58+02:00 Daniel Bevenius llama : check returned fn ptrs from ggml_backend_reg_get_proc_address (#15893)
ff02caf9eed261423289d1531a56536fbf57bfc2 ae355f6f7108540297d8b7f7ae71d20fe610a0b7 2025-09-10T05:23:19+02:00 Daniel Bevenius ci : cache ROCm installation in windows-latest-cmake-hip (#15887)
ae355f6f7108540297d8b7f7ae71d20fe610a0b7 4f63cd705c7b6f457f36c63fdc053e07f6f3cc6b 2025-09-09T22:26:03+02:00 Ruben Ortlam vulkan: throw the oom error instead of no memory type found (#15905)
4f63cd705c7b6f457f36c63fdc053e07f6f3cc6b 17bc5a815f0bebc1844c99796760cd7df5e9b8d9 2025-09-09T07:41:15-05:00 Jeff Bolz vulkan: Fix OOB accesses in soft_max_back (#15861)
17bc5a815f0bebc1844c99796760cd7df5e9b8d9 ed54e32558ffe0f2c3b1d31f3227211fae05bd49 2025-09-09T14:04:43+02:00 Johannes Gäßler HIP: use v_dot2_f32_f16 instruction for FA (#15884)
ed54e32558ffe0f2c3b1d31f3227211fae05bd49 a972faebed5fdc4a3d2a844d92d476058c02e02d 2025-09-09T15:01:15+03:00 lksj92hs Workaround for subgroup arithmetic failing on MoltenVK with AMD GPUs (issue 15846) (#15886)
a972faebed5fdc4a3d2a844d92d476058c02e02d 550cf726e133fd0a069d991287fd3a2a3e3e1cbd 2025-09-09T14:38:02+08:00 Aman Gupta CUDA: Add mul_mat_id support for the mmf kernel (#15767)
550cf726e133fd0a069d991287fd3a2a3e3e1cbd c252ce67c4b99f056eeb18d42a289e28fee03475 2025-09-09T08:11:01+02:00 Johannes Gäßler CUDA: fix GET_ROWS for large tensors (#15882)
c252ce67c4b99f056eeb18d42a289e28fee03475 70cd37dbbebdb7a2f84f08207f18eabb0b291a55 2025-09-09T08:42:10+03:00 Georgi Gerganov contrib : add notes about merging PRs (#15881)
70cd37dbbebdb7a2f84f08207f18eabb0b291a55 acc1b008cfd95e63d5f99a370dbffb98e5a99d2c 2025-09-09T06:06:52+02:00 Daniel Bevenius requirements : update transformers/torch for Embedding Gemma (#15828)
acc1b008cfd95e63d5f99a370dbffb98e5a99d2c 7057faf64b514e991e2f70147f82bb13d544b1c0 2025-09-09T06:05:55+02:00 Piotr Wilkin (ilintar) model-conversion : add extra debugging support for model conversion (#15877)
7057faf64b514e991e2f70147f82bb13d544b1c0 fe1c92cd7bb491e9c5767c9de413f2b7dc1e832b 2025-09-08T16:14:32-05:00 Aldehir Rojas json : support `enum` values within `allOf` (#15830)
fe1c92cd7bb491e9c5767c9de413f2b7dc1e832b e68aa10d8f3d26fdad5b912540362d79de5460e3 2025-09-08T19:57:01+01:00 j-k media : add llama1 icon (#15878)
e68aa10d8f3d26fdad5b912540362d79de5460e3 0a16bf52e6874369cb4fd2bdc4863ef984b688e7 2025-09-08T13:10:07-05:00 Jeff Bolz vulkan: sort graph to allow more parallel execution (#15850)
0a16bf52e6874369cb4fd2bdc4863ef984b688e7 88021565f08e0b7c4e07ac089a15ec16fae9166c 2025-09-09T01:23:46+08:00 Aman Gupta CUDA: generate_cu_files.py - add missing mxfp4 (#15880)
88021565f08e0b7c4e07ac089a15ec16fae9166c 56920f56651908d5cce7a310dabf54ac4f6fbb7f 2025-09-08T10:59:48-04:00 Jesse chat : Deepseek V3.1 reasoning and tool calling support (OpenAI Style) (#15533)
56920f56651908d5cce7a310dabf54ac4f6fbb7f b0d52998b962bd2681c34bf52af993af79f178b8 2025-09-08T21:50:05+07:00 Xuan-Son Nguyen server : bring back timings_per_token (#15879)
b0d52998b962bd2681c34bf52af993af79f178b8 f28d4f4ac963f182ea9d0fe9e269f3f5f3782aaf 2025-09-08T13:56:51+03:00 Georgi Gerganov cuda : fix supports_op condition for get_rows when number of blocks is too large (#15868)
f28d4f4ac963f182ea9d0fe9e269f3f5f3782aaf 9fcb29f22f5c33c04c7f0daebb24057899d67a1a 2025-09-08T13:34:56+03:00 Georgi Gerganov metal : refactor + optimize (#15857)
9fcb29f22f5c33c04c7f0daebb24057899d67a1a 5ef22d281de9c5eaaf616874bc490b89241128cb 2025-09-08T17:33:01+07:00 Xuan-Son Nguyen ggml: allow casting between f32 and i32 (#15783)
5ef22d281de9c5eaaf616874bc490b89241128cb 233d773d02c37982badddf3994e9953a175f34da 2025-09-08T11:55:44+02:00 Sigbjørn Skjæret CUDA: non-contiguous src0 not supported for PAD (#15869)
233d773d02c37982badddf3994e9953a175f34da a885dcff11a7b73f9377812d6151f6b15d307de0 2025-09-08T09:44:34+02:00 Daniel Bevenius convert : force setting sliding_window from original config (#15867)
a885dcff11a7b73f9377812d6151f6b15d307de0 663027fd5490438ce9c27ea866a560e1e268d11f 2025-09-08T10:27:07+03:00 Georgi Gerganov batched-bench : fix llama_synchronize usage during prompt processing (#15835)
663027fd5490438ce9c27ea866a560e1e268d11f cf0e3ba1500bd23635b444f64ba23cbdb56c92ef 2025-09-08T10:26:36+03:00 Georgi Gerganov context : fix n_outputs during reserve (#15858)
cf0e3ba1500bd23635b444f64ba23cbdb56c92ef d413dca00360a7e4cb71441dacecfa32556fcc31 2025-09-08T10:25:33+03:00 Georgi Gerganov model : avoid ggml_cont_3d for fused QKV weights (#15662)
d413dca00360a7e4cb71441dacecfa32556fcc31 85ca66a74676e6d5df4433016488e039a4b464ae 2025-09-07T23:23:41-05:00 Jeff Bolz tests: large sizes for get_rows (#15687)
85ca66a74676e6d5df4433016488e039a4b464ae 3976dfbe00f02a62c0deca32c46138e4f0ca81d8 2025-09-08T10:03:29+08:00 Chenguang Li CANN: Stream sync between devices for acl_graph (#15809)
3976dfbe00f02a62c0deca32c46138e4f0ca81d8 d36e61c580bf7fc7879c443c542312a42b718e11 2025-09-07T13:50:26-05:00 Jeff Bolz vulkan: support im2col_3d (#15795)
d36e61c580bf7fc7879c443c542312a42b718e11 c97b5e5854b47b18a248d77edb693c63018a0865 2025-09-08T02:18:28+08:00 Aaron Teo ggml-cpu: clean up s390x SIMD (#15855)
c97b5e5854b47b18a248d77edb693c63018a0865 267e99867f09bec8bcc2e424ad9bcddd6cccf9d0 2025-09-07T12:00:49-05:00 Jeff Bolz vulkan: Support pad_ext (#15794)
267e99867f09bec8bcc2e424ad9bcddd6cccf9d0 3b15924d71237a43bb5ad71f5b885ee66a821342 2025-09-07T11:53:07-05:00 Jeff Bolz vulkan: Use larger loads in scalar/coopmat1 matmul (#15729)
3b15924d71237a43bb5ad71f5b885ee66a821342 79bc429262268ad2ac8a364cfe6c2d6b9c5f008a 2025-09-07T10:19:45+02:00 Daniel Bevenius ggml WebGPU: remove userdata from request adapter callback (#15527)
79bc429262268ad2ac8a364cfe6c2d6b9c5f008a c4df49a42d396bdf7344501813e7de53bc9e7bb3 2025-09-07T00:26:28+02:00 Johannes Gäßler CUDA: faster tile FA (Pascal/AMD), headsize 256 (#15769)
c4df49a42d396bdf7344501813e7de53bc9e7bb3 3c3635d2f20424d557b5b0605a2a356214ffe048 2025-09-06T16:08:43+02:00 Charles Xu kleidiai: generalize compute_forward_kv_cache to compute_forward_fp16 (#15817)
3c3635d2f20424d557b5b0605a2a356214ffe048 61bdfd5298a78593be649a1035ee2a120b13c4f0 2025-09-06T19:45:24+07:00 Xuan-Son Nguyen server : speed up tests (#15836)
61bdfd5298a78593be649a1035ee2a120b13c4f0 01806e77714ae8a78130d432945b959a0956c56f 2025-09-06T18:35:04+07:00 Xuan-Son Nguyen server : implement prompt processing progress report in stream mode (#15827)
01806e77714ae8a78130d432945b959a0956c56f 186415d59552bd5c90549cd8e9be3cc287621fd9 2025-09-06T13:28:44+02:00 Johannes Gäßler ggml-cpu: document use of "free" memory [no ci] (#15834)
186415d59552bd5c90549cd8e9be3cc287621fd9 fd621880f3fd908424e675a41715a2dc760247a2 2025-09-06T11:27:28+08:00 Aaron Teo ggml-cpu: drop support for nnpa intrinsics (#15821)
fd621880f3fd908424e675a41715a2dc760247a2 4281c7b315f8a904549fe527039b976e08098d1a 2025-09-05T17:32:39-06:00 Gabe Goodhart aLoRA Support (#15327)
4281c7b315f8a904549fe527039b976e08098d1a 5fac79cbc77b6d12c9feb5f34fc63586b35fd561 2025-09-06T01:21:15+02:00 Sigbjørn Skjæret ci : exempt correct research label (#15825)
5fac79cbc77b6d12c9feb5f34fc63586b35fd561 408ff524b40baf4f51a81d42a9828200dd4fcb6b 2025-09-05T14:31:24-06:00 Gabe Goodhart Thinking model disabled assistant prefill (#15404)
408ff524b40baf4f51a81d42a9828200dd4fcb6b 5143fa895e7725c5bd2135daf7d8f793d98fa91c 2025-09-05T19:43:59+01:00 Eric Curtin Implement --log-colors with always/never/auto (#15792)
5143fa895e7725c5bd2135daf7d8f793d98fa91c 3a550b5ca4565c9e28f63880d47840feb27d0ff6 2025-09-05T16:07:02+02:00 Johannes Gäßler CUDA: fastdiv, launch bounds for mmvq + q8_1 quant (#15802)
3a550b5ca4565c9e28f63880d47840feb27d0ff6 a81283820a466f2ace06ce4d4bc9512761f9365f 2025-09-05T14:49:21+02:00 Daniel Bevenius tests : add --list-ops and --show-coverage options (#15745)
a81283820a466f2ace06ce4d4bc9512761f9365f c610b6c11b1ef7d678671dcf15acd7187a7ad8f3 2025-09-05T11:34:28+02:00 Erik Scholz gguf: gguf_writer refactor (#15691)
c610b6c11b1ef7d678671dcf15acd7187a7ad8f3 5d6688de08e73acc2532d668380801ed79d704eb 2025-09-05T10:39:22+03:00 Georgi Gerganov kv-cache : fix SWA checks + disable cacheless iSWA (#15811)
dcbe998a6d8f13b6c9cb36bbe7b355ced2ac3842 87932ec016f0ec81e98a13ce5212851f8c12458a 2025-09-05T14:34:07+08:00 Yunzhe Jia add calrt API used in server side
5d6688de08e73acc2532d668380801ed79d704eb 4fd1242bef6cb2325b4ff1c1a80f3b54b64508a6 2025-09-05T04:36:23+02:00 Daniel Bevenius model-conversion : add --embeddings flag to modelcard.template [no ci] (#15801)
4fd1242bef6cb2325b4ff1c1a80f3b54b64508a6 b2426e469e2fdb6c44216d56baa4cfff4f39ae00 2025-09-05T01:24:08+02:00 ExtReMLapin chat : fixed crash when Hermes 2 <tool_call> had a newline before it (#15639)
b2426e469e2fdb6c44216d56baa4cfff4f39ae00 9e2b1e83c68a38ea0c64f726dd979439bd02189b 2025-09-05T01:22:22+02:00 Piotr Wilkin (ilintar) chat : nemotron thinking & toolcalling support (#15676)
9e2b1e83c68a38ea0c64f726dd979439bd02189b fb15d649ed14ab447eeab911e0c9d21e35fb243e 2025-09-05T01:05:12+02:00 Piotr Wilkin (ilintar) scripts : add Jinja tester PySide6 simple app (#15756)
fb15d649ed14ab447eeab911e0c9d21e35fb243e 856ed0947f27b4ec3ad269fceda0402fbab263d3 2025-09-04T18:10:29+02:00 Daniel Bevenius llama : add support for EmbeddingGemma 300m (#15798)
856ed0947f27b4ec3ad269fceda0402fbab263d3 d1e2adba65208d6de3d7f6f23b00c562ff5bb777 2025-09-04T09:53:22-06:00 Gabe Goodhart metal : Add template specialization for mul_mm_id w/ ne20 == 10 (#15799)
d1e2adba65208d6de3d7f6f23b00c562ff5bb777 c1c354e44c06d259679bb5bb7a8fa9f0b28480e4 2025-09-04T15:40:44+02:00 Daniel Bevenius llama : set n_outputs to 1 to avoid 0 outputs mean-pooling (#15791)
c1c354e44c06d259679bb5bb7a8fa9f0b28480e4 a68d9144262f1d0ef4f6ba7ad4a7e73e977ba78c 2025-09-04T20:20:14+08:00 Chenguang Li CANN: Refactor ND to NZ workspace to be per-device (#15763)
a68d9144262f1d0ef4f6ba7ad4a7e73e977ba78c badb80cadbc40e047b30c43611aba575fc8d6845 2025-09-04T11:50:23+02:00 Xuan-Son Nguyen server: add exceed_context_size_error type (#15780)
badb80cadbc40e047b30c43611aba575fc8d6845 0a1b3982cd0bd18730d50a693053b88c13fd04a6 2025-09-04T10:49:44+01:00 Eric Curtin Document the new max GPU layers default in help (#15771)
0a1b3982cd0bd18730d50a693053b88c13fd04a6 5421f63ab08ca1e1a093662a5ccd0117e461185f 2025-09-04T16:38:49+08:00 leejet ggml: add ops for WAN video model (cuda && cpu) (#15669)
5421f63ab08ca1e1a093662a5ccd0117e461185f 820bc9853100708011036e10f40b923968dd9b66 2025-09-04T15:12:30+08:00 hipudding CANN: Fix precision issue on 310I DUO multi-devices (#15784)
820bc9853100708011036e10f40b923968dd9b66 239b60e8986bbcb944f57311a02ac994431bf652 2025-09-04T08:30:28+02:00 rmatif opencl: add hs=40 to FA (#15758)
239b60e8986bbcb944f57311a02ac994431bf652 dff7551bfdbdd6e57c13e523d7dcca317640e907 2025-09-04T11:03:02+08:00 Chenguang Li CANN: fix acl_rstd allocation size in ggml_cann_rms_norm (#15760)
dff7551bfdbdd6e57c13e523d7dcca317640e907 0fce7a1248b74148c1eb0d368b7e18e8bcb96809 2025-09-03T22:55:10+02:00 Ruben Ortlam vulkan: fix mmv subgroup16 selection (#15775)
0fce7a1248b74148c1eb0d368b7e18e8bcb96809 8227695d7a3e5b357cb37fad263f00a8ca6db710 2025-09-03T13:33:15-05:00 Jeff Bolz vulkan: don't use std::string in load_shaders, to improve compile time (#15724)
8227695d7a3e5b357cb37fad263f00a8ca6db710 0014fb4add3a7d000c14b763538045c6170f57d9 2025-09-03T20:24:50+02:00 Daniel Bevenius vulkan : update ggml_vk_instance_validation_ext_available (#15666)
0014fb4add3a7d000c14b763538045c6170f57d9 661ae31c9c68201577e70278285b349a5a662caf 2025-09-04T03:22:55+09:00 Shin-myoung-serp ggml vulkan: add hardsigmoid and hardswish operations (#15762)
661ae31c9c68201577e70278285b349a5a662caf 407c23786dd0d3a503e9429eead96e611d3950c9 2025-09-03T19:59:16+02:00 Oliver Simons CUDA: Optimize `rms_norm_f32` kernel and its fused variants, giving 1-6% perf E2E (#15715)
407c23786dd0d3a503e9429eead96e611d3950c9 cdedb70a998cea7052560fe0b0615a839443564d 2025-09-03T18:28:36+02:00 Daniel Bevenius model-conversion : fix pyright errors (#15770)
cdedb70a998cea7052560fe0b0615a839443564d 2c8dac72eb6acd4e20c0da251535dfc46d35178b 2025-09-03T18:16:26+03:00 Georgi Gerganov sampling : optimize dist sampler (#15704)
2c8dac72eb6acd4e20c0da251535dfc46d35178b 40a751ea9a94364da73537b86502a808ebe1fc3a 2025-09-03T13:35:49+02:00 Daniel Bevenius llama : fix incorrect model type for Gemma 270M (#15764)
40a751ea9a94364da73537b86502a808ebe1fc3a 5eae9348835037046f33fafd852df7c952c95209 2025-09-03T12:50:47+02:00 Daniel Bevenius model-conversion : remove hardcoded /bin/bash shebangs [no ci] (#15765)
5eae9348835037046f33fafd852df7c952c95209 05c0380f2ae5c7193445e03ebc7b6de9ce49f1a6 2025-09-03T16:46:01+08:00 hipudding CANN: Add RoPE contiguous check for 310I DUP device (#15735)
05c0380f2ae5c7193445e03ebc7b6de9ce49f1a6 8c3fdf44ecf08335942f2ba558955f55e88c7991 2025-09-03T16:16:21+08:00 xctan ggml-cpu : optimize RVV kernels (#15720)
8c3fdf44ecf08335942f2ba558955f55e88c7991 f6da8cb86a28f0319b40d9d2a957a26a7d875f8c 2025-09-03T09:48:35+02:00 Daniel Bevenius model-conversion : add missing curl script [no ci] (#15761)
f6da8cb86a28f0319b40d9d2a957a26a7d875f8c 8a2234ea0c89f212190c176d741b7742f0082582 2025-09-03T14:08:22+08:00 hipudding CANN: Mask unsupported TRANSPOSE_1D operator (#15733)
8a2234ea0c89f212190c176d741b7742f0082582 3de008208b9b8a33f49f979097a99b4d59e6e521 2025-09-03T10:43:53+08:00 Chenguang Li CANN: Fix type float_t to float (#15736)
3de008208b9b8a33f49f979097a99b4d59e6e521 69db8a52e6dd0db81ec05c581150cc1e43b8ac46 2025-09-03T03:27:30+08:00 SnA1lGo fix: resolve unsigned int initialization warning for n_dims/size in gguf.cpp (#15754)
69db8a52e6dd0db81ec05c581150cc1e43b8ac46 c466abe1587bde458c806e2134e37750f2edf8fb 2025-09-02T19:40:37+02:00 Oliver Simons chore: Update `.clang-format` to use `BinPackArguments=true` (#15744)
c466abe1587bde458c806e2134e37750f2edf8fb 0a2a3841e8ebc570da343e8cf58a21c1010b41e7 2025-09-02T18:17:26+02:00 Johannes Gäßler llama: -fa 1/0/-1 aliases for -fa on/off/auto (#15746)
0a2a3841e8ebc570da343e8cf58a21c1010b41e7 9961d244f2df6baf40af2f1ddc0927f8d91578c8 2025-09-02T16:02:26+02:00 Ruben Ortlam vulkan: fix shaders gen when no integer dot is available (#15740)
9961d244f2df6baf40af2f1ddc0927f8d91578c8 25f1045f07cf0daf667d63e35618842e3174a8c7 2025-09-02T17:12:37+08:00 hipudding CANN: Resolve soft_max precision issue (#15730)
25f1045f07cf0daf667d63e35618842e3174a8c7 97669e40735d08db65ef094a8faae8e8411a97db 2025-09-02T01:37:01-05:00 Jeff Bolz vulkan: Fix macro parameter order for f32 matmul shaders (#15716)
97669e40735d08db65ef094a8faae8e8411a97db 2f853687b3bce15e143a22f678d1715060fd606c 2025-09-02T08:26:53+02:00 rmatif opencl: add attn sinks support for FA kernels (#15706)
2f853687b3bce15e143a22f678d1715060fd606c ef2af57ddf04ab367f6ba6e8ed100fc56785e4b7 2025-09-02T14:07:48+08:00 Chenguang Li CANN: Support eager execution mode under ACL graph compilation (#15712)
ef2af57ddf04ab367f6ba6e8ed100fc56785e4b7 5d804a4938d896f9089687a8b99911cdb43b0b94 2025-09-02T14:05:23+08:00 hipudding CANN: Support ext_factor in rope (#15710)
5d804a4938d896f9089687a8b99911cdb43b0b94 d4d8dbe383e8b9600cbe8b42016e3a4529b51219 2025-09-02T01:14:55+02:00 Johannes Gäßler ggml-backend: raise GGML_MAX_SPLIT_INPUTS (#15722)
d4d8dbe383e8b9600cbe8b42016e3a4529b51219 35a42edac84690990a75726898d975cd08d220c0 2025-09-01T22:17:42+03:00 Gilad S. vulkan: use memory budget extension to read memory usage (#15545)
35a42edac84690990a75726898d975cd08d220c0 fec7911f8febb22c27ce1acb12441800da24cc06 2025-09-01T14:01:10-05:00 Jeff Bolz vulkan: add missing clamps in new mul_mat_id paths (#15702)
fec7911f8febb22c27ce1acb12441800da24cc06 078ce23ea77988f2fe1a42afb18d58bc084d55fa 2025-09-01T20:58:35+02:00 Ruben Ortlam vulkan: disable large mmv subgroups on older Nvidia GPUs (#15717)
078ce23ea77988f2fe1a42afb18d58bc084d55fa a0c2b207c596d1092a08615de61ab56a7d63515f 2025-09-02T03:13:49+09:00 s-goto-11 ggml: SVE support for exponential functions (#15145)
a0c2b207c596d1092a08615de61ab56a7d63515f 4b20d8b7e31718d3fe8b4f12d220a9d19e4f1997 2025-09-01T23:43:16+05:30 Prashant Vithule ggml: aarch64: Implement SVE F16 kernels for vector functions (#15115)
4b20d8b7e31718d3fe8b4f12d220a9d19e4f1997 02c1813517412f3e00aa6ca7c0273fea64edb492 2025-09-01T23:53:31+08:00 Jie Fu (傅杰) convert : remove redundant code (#15708)
02c1813517412f3e00aa6ca7c0273fea64edb492 77dee9de97be75b7143a213bc48893e0c0b29af7 2025-09-01T16:19:07+02:00 Ruben Ortlam Vulkan: Add Integer Dot Product mul_mat_vec shader for legacy quants (#14903)
77dee9de97be75b7143a213bc48893e0c0b29af7 4795c91c32fec7165a1364763d4d4f0c93abf933 2025-09-01T14:28:49+02:00 Daniel Bevenius ggml : WebGPU add TRANSPOSE and RESHAPE to supported ops (#15695)
4795c91c32fec7165a1364763d4d4f0c93abf933 b66df9d9c942254d03209186ef24ed7c994a576e 2025-09-01T15:34:59+08:00 Jie Fu (傅杰) docs : add Hunyuan to models section (#15707)
b66df9d9c942254d03209186ef24ed7c994a576e b9382c3877c6067feccf182efe9449a2d1cb24c7 2025-09-01T06:55:06+05:30 Akarshan Biswas CUDA: fix build error from ambiguous __half conversions in conv2d (#15690)
b9382c3877c6067feccf182efe9449a2d1cb24c7 3dc7397a2799bdc07bccf637ab7ae5a1e786d1a4 2025-09-01T08:57:23+08:00 hipudding CANN: Optimize MUL_MAT_ID (#15658)
3dc7397a2799bdc07bccf637ab7ae5a1e786d1a4 e92d53b29e393fc4c0f9f1f7c3fe651be8d36faa 2025-09-01T08:57:00+08:00 hipudding CANN: fix RoPE cache issue on multi-device (#15629)
e92d53b29e393fc4c0f9f1f7c3fe651be8d36faa 0d161f021aa33ec0e90cce96f5d1a88925557327 2025-08-31T20:41:02+03:00 Georgi Gerganov sampling : optimize samplers by reusing bucket sort (#15665)
0d161f021aa33ec0e90cce96f5d1a88925557327 4efd5a83163ff383285b3a4c2106feabf5c69557 2025-08-31T20:11:58+03:00 Georgi Gerganov server : enable /slots by default and make it secure (#15630)
4efd5a83163ff383285b3a4c2106feabf5c69557 274966226f87f301ac132da898280ca3142b60e5 2025-08-31T19:43:30+03:00 Georgi Gerganov metal : fix checks for available FA kernels (#15700)
274966226f87f301ac132da898280ca3142b60e5 9777032dccd67bdc7785aeab7497014a8be8dacc 2025-08-31T08:47:05-07:00 Diego Devesa llama : fix fattn reserve call n_seqs parameter (#15699)
9777032dccd67bdc7785aeab7497014a8be8dacc 7d3c9f2b217acf0ce5db81ae83d3f375f49ab2c7 2025-08-31T06:49:03-07:00 Diego Devesa llama : separate compute buffer reserve from fattn check (#15696)
7d3c9f2b217acf0ce5db81ae83d3f375f49ab2c7 bbbf5ecccb35286521f735239d499eec4279a840 2025-08-31T15:30:20+02:00 Sigbjørn Skjæret ci : explicitly set fa off or on (#15692)
bbbf5ecccb35286521f735239d499eec4279a840 c37052ab4d6d1ae73c0e90bc6e560cc6409e1311 2025-08-31T03:13:27-05:00 Jeff Bolz vulkan: handle large sizes for get_rows (#15686)
c37052ab4d6d1ae73c0e90bc6e560cc6409e1311 5c16b9c87d840e4d5d55fa83c732c6b693346f40 2025-08-31T02:06:43-05:00 Jeff Bolz vulkan: mul_mat_id coopmat2 optimizations (#15546)
5c16b9c87d840e4d5d55fa83c732c6b693346f40 b97c9edc59d4a1b4069991aa670411190f4f3a3e 2025-08-31T08:46:42+02:00 Daniel Bevenius vulkan : remove unused portability_enumeration_ext variable (#15679)
b97c9edc59d4a1b4069991aa670411190f4f3a3e 94e82c7eadeb8fff0db4bfd1ab6d8cf65fa6f2e0 2025-08-31T01:30:54-05:00 Jeff Bolz vulkan: Allow fallback to sysmem memory when vidmem is full (#15649)
94e82c7eadeb8fff0db4bfd1ab6d8cf65fa6f2e0 4d74393bcc956ccd7df68a6a06d1a0575cfa712c 2025-08-31T01:27:57-05:00 Jeff Bolz vulkan: clamp matmul and FA results to the max finite value (#15652)
4d74393bcc956ccd7df68a6a06d1a0575cfa712c dd892555b0681b7f56d38780f6fdfe00a195160f 2025-08-30T18:03:42+02:00 Charles Xu ggml: update kleidiai to v1.13.0 (#15663)
dd892555b0681b7f56d38780f6fdfe00a195160f e81b8e4b7f5ab870836fad26d154a7507b341b36 2025-08-30T08:51:28-07:00 Diego Devesa Update build.md to remove MSVC arm64 notes (#15684)
e81b8e4b7f5ab870836fad26d154a7507b341b36 38ad381f9f5d4dd368a96d844fb19cf501ed9d22 2025-08-30T16:32:10+02:00 Johannes Gäßler llama: use FA + max. GPU layers by default (#15434)
38ad381f9f5d4dd368a96d844fb19cf501ed9d22 696fccf354e9dbdfbce135bc40b44c9dcc64dda9 2025-08-30T16:20:32+02:00 Johannes Gäßler CUDA: use FP32 arithmetic for conv2d (#15683)
696fccf354e9dbdfbce135bc40b44c9dcc64dda9 ef476916bba4b44f44be0c98babc1cb025968e75 2025-08-30T04:11:22-05:00 Jeff Bolz vulkan: Skip syncing for prealloc_y when it is reused (#15544)
ef476916bba4b44f44be0c98babc1cb025968e75 d82f6aa34a216f5df1945cdfe121ba5e6cd80be0 2025-08-30T10:18:35+08:00 Chenguang Li CANN: FIx compiler warnings (#15661)
d82f6aa34a216f5df1945cdfe121ba5e6cd80be0 3d16b29c3bb1ec816ac0e782f20d169097063919 2025-08-30T00:12:53+02:00 Sergey Alirzaev server : removed obsolete doc (#15670)
3d16b29c3bb1ec816ac0e782f20d169097063919 792b44f2ed9668cce7f267ff0ae4950ed9b4a5de 2025-08-29T22:04:08+02:00 Johannes Gäßler scripts: strip "AMD Instinct" from GPU name (#15668)
792b44f2ed9668cce7f267ff0ae4950ed9b4a5de 81017865ee444cf49ce0136f2be1e41a0270ff91 2025-08-29T19:25:40+02:00 ExtReMLapin server : add documentation for `parallel_tool_calls` param (#15647)
81017865ee444cf49ce0136f2be1e41a0270ff91 60e5eee31f1af9bb579ac45380e3857d610020b9 2025-08-29T21:30:06+08:00 Aman Gupta CUDA: fix bug in rms_norm fusion (#15660)
60e5eee31f1af9bb579ac45380e3857d610020b9 009b709d6efd24820ac67765ed339a72dc797814 2025-08-29T14:53:41+02:00 Piotr Wilkin (ilintar) chat : Seed OSS thinking + tool call support (#15552)
009b709d6efd24820ac67765ed339a72dc797814 e8d99dd0b67f2ecc1e45fca8074a3a18c3e036d2 2025-08-29T11:35:58+08:00 Aman Gupta CUDA: fuse adds, fuse add with rms norm (#15631)
e8d99dd0b67f2ecc1e45fca8074a3a18c3e036d2 a8bca68f727844e7dcf24a956003b3c2039ea563 2025-08-28T18:39:31-06:00 Gabe Goodhart nvidia nemotron nano v2 (nemotronh) (#15507)
a8bca68f727844e7dcf24a956003b3c2039ea563 c97dc093912ad014f6d22743ede0d4d7fd82365a 2025-08-28T15:27:36-05:00 Gabe Goodhart fix: Compute the full sum in llama-eval-callback, not just the sum of printed values (#15637)
c97dc093912ad014f6d22743ede0d4d7fd82365a 6c442f42ff25564a0cd6b1435d9abc1b0178eac5 2025-08-29T00:03:03+05:30 mnehete32 CUDA: add conv2d (#15635)
6c442f42ff25564a0cd6b1435d9abc1b0178eac5 73804145ab6c06888e314046abf08f66a0133679 2025-08-28T22:39:27+08:00 Aaron Teo ggml-cpu: fix invalid hsum build in debug s390x (#15634)
73804145ab6c06888e314046abf08f66a0133679 c8d0d14e77c3c45df5cbbddde9c2b4c377ec4e7a 2025-08-28T10:11:36-04:00 compilade ggml : fix SSM_SCAN for n_groups > 1 (#15625)
c8d0d14e77c3c45df5cbbddde9c2b4c377ec4e7a 84ab83cc0b4b7e769451ee48e4c7d1acef91ef25 2025-08-28T17:09:05+03:00 Georgi Gerganov kv-cache : fix find_slot to not search for continuous slot (#15638)
84ab83cc0b4b7e769451ee48e4c7d1acef91ef25 55042b3692cb1467c9ee15c62c4a9fbf180f89e3 2025-08-28T15:49:50+02:00 Sigbjørn Skjæret model : jina-embeddings-v3 support (#13693)
55042b3692cb1467c9ee15c62c4a9fbf180f89e3 8a4280ce431da6b33e5a95ae1fd61472c8c3f8cc 2025-08-28T19:23:22+08:00 Aman Gupta scripts: add sqlite3 check for compare-commits.sh (#15633)
8a4280ce431da6b33e5a95ae1fd61472c8c3f8cc 64387f6e95434b393ac3df285864692b7fd9c4d2 2025-08-28T12:27:02+03:00 Georgi Gerganov kv-cache : remove LLAMA_SET_ROWS checks (#15505)
64387f6e95434b393ac3df285864692b7fd9c4d2 d35a1e8c41f747548775225973a99507896a8c61 2025-08-28T10:56:41+02:00 Aleksei Nikiforov gguf-py: byteswapping improvements (#12851)
d35a1e8c41f747548775225973a99507896a8c61 46d9caa27a0281150e8cf082308c0f9e7576ebe5 2025-08-28T01:48:20-06:00 Joshua Cogliati cli : change log to warning to explain reason for stopping (#15604)
46d9caa27a0281150e8cf082308c0f9e7576ebe5 5a0e3ef6f00c658fbae53797f02d5a360ebf8fec 2025-08-28T09:26:48+02:00 Daniel Bevenius model-conversion : add mmproj conversion target (#15628)
5a0e3ef6f00c658fbae53797f02d5a360ebf8fec fbef0fad7a7c765939f6c9e322fa05cd52cf0c15 2025-08-27T17:32:36-07:00 matiaslin cuda: Add cublasLt_static linking when GGML_STATIC is enabled (#15622)
fbef0fad7a7c765939f6c9e322fa05cd52cf0c15 da54f9f1a2db07aaae390024ac466e7867685d94 2025-08-27T20:58:09+02:00 Johannes Gäßler server: higher timeout for tests (#15621)
da54f9f1a2db07aaae390024ac466e7867685d94 47373271f971aa5a0a6462b286f4a7b5bd4ba644 2025-08-27T15:48:07+03:00 Georgi Gerganov presets : add qwen3-30B-a3b FIM (#15616)
47373271f971aa5a0a6462b286f4a7b5bd4ba644 1bded5a3b3376b2aa3ba2f11ade5910c550f354b 2025-08-27T13:58:54+02:00 uvos HIP: Enable support for ggml_backend_cuda_register_host_buffer (#15615)
1bded5a3b3376b2aa3ba2f11ade5910c550f354b 1e7489745a74996fc36e8fd05b73aa16bc184e0c 2025-08-27T13:55:12+03:00 Georgi Gerganov kv-cache : better estimate of n_kv for multi-sequence batches (#15610)
1e7489745a74996fc36e8fd05b73aa16bc184e0c 1cf123a343ab7ca5586aacb9e0a1d2de7fe33be4 2025-08-27T17:21:41+08:00 Chenguang Li CANN: refactor mask handling and improve performance in FA (#15561)
1cf123a343ab7ca5586aacb9e0a1d2de7fe33be4 fcca2182a18c786c57d02d1d1927204b133f1fdc 2025-08-27T16:44:22+08:00 xctan ggml-cpu : add basic RVV support for vector f32 ops (#15057)
fcca2182a18c786c57d02d1d1927204b133f1fdc 86076f92de1a547ef87c304facca3b4b9fae6c21 2025-08-27T10:28:53+02:00 Daniel Bevenius common : add -m to bash completion for --model [no ci] (#15591)
86076f92de1a547ef87c304facca3b4b9fae6c21 bcbddcd54f0d5c22eab180831fdea6484107112f 2025-08-27T08:36:05+02:00 rmatif OpenCL: add fused group_norm/norm, mul, add (#15314)
87932ec016f0ec81e98a13ce5212851f8c12458a 0115cfb7c1dec0753aecb34f3af4338bf9de8eeb 2025-08-27T14:29:18+08:00 Yunzhe Jia fix merge problem
bcbddcd54f0d5c22eab180831fdea6484107112f 8b696861364360770e9f61a3422d32941a477824 2025-08-26T13:14:38-07:00 Diego Devesa tests : fix test-opt with GGML_BACKEND_DL (#15599)
8b696861364360770e9f61a3422d32941a477824 8ce3ff1d91245e158d98d8062cd64b0dd98dcfe3 2025-08-27T00:27:49+05:30 Akarshan Biswas SYCL: fix rms_norm_mul_add for tensor dim not a multiple of sg_size (#15592)
8ce3ff1d91245e158d98d8062cd64b0dd98dcfe3 44b1efa41acd4df3f56ee0e46f898135ecd1a054 2025-08-26T20:05:50+02:00 fidoriel mtmd : fix mtmd ios build (#15579)
44b1efa41acd4df3f56ee0e46f898135ecd1a054 a6a58d64785cb458ed9de52f391aa38142d38d64 2025-08-26T15:42:49Z Eve tests: add performance test for mul mat id (#15543)
a6a58d64785cb458ed9de52f391aa38142d38d64 0373486dbc0dccbdcb3b5fdd65759d88cec06196 2025-08-26T21:05:25+05:30 shalinib-ibm llamafile: PowerPC Sgemm Optimization (#15558)
0373486dbc0dccbdcb3b5fdd65759d88cec06196 62cef26ac5b6b7acb635d3dc963813b43952dc2b 2025-08-26T17:45:17+03:00 Georgi Gerganov graph : fix assert in memory-less build_attn (#15590)
62cef26ac5b6b7acb635d3dc963813b43952dc2b 8f5afa94c4f929da71f560db7c9f38ef6a783d95 2025-08-26T16:12:29+02:00 Daniel Bevenius model-conversion : add qat-q4 quantization targets (#15588)
8f5afa94c4f929da71f560db7c9f38ef6a783d95 b3964c1e890ef8c947afb36a5124ce6fcb2136d4 2025-08-26T16:01:20+02:00 Johannes Gäßler CUDA: return -1 for nonexistent compiled arch (#15587)
b3964c1e890ef8c947afb36a5124ce6fcb2136d4 79a546220c719e6a70627b243a478ab8d84dc9e1 2025-08-26T14:22:14+03:00 Georgi Gerganov metal : optimize FA vec for large sequences and BS <= 8 (#15566)
79a546220c719e6a70627b243a478ab8d84dc9e1 85cc1ae998e4898d9fa992cb9b8620338cee97bf 2025-08-26T12:54:19+02:00 Xuan-Son Nguyen mtmd : support Kimi VL model (#15458)
85cc1ae998e4898d9fa992cb9b8620338cee97bf 1d8d83deaa48d4a5491820d58ff1c0d8cf9d196c 2025-08-26T12:47:00+03:00 Georgi Gerganov context : print graph stats for memory-less contexts (#15586)
1d8d83deaa48d4a5491820d58ff1c0d8cf9d196c c4e9239064a564de7b94ee2b401ae907235a8fca 2025-08-26T12:46:15+03:00 Georgi Gerganov metal : improve `MUL_MAT_ID` (#15541)
c4e9239064a564de7b94ee2b401ae907235a8fca 39842a7f73012eb42816ca4f26411782bd3da7c5 2025-08-26T16:05:55+08:00 tc-mb model : support MiniCPM-V 4.5 (#15575)
0115cfb7c1dec0753aecb34f3af4338bf9de8eeb 3a617cb18121a85eed17ac5585788810c5d9c1e0 0d5a470223fc90b6b6807921d68011ff06ae7f9e 2025-08-26T15:19:56+08:00 Yunzhe Jia Merge branch 'master' into dev
39842a7f73012eb42816ca4f26411782bd3da7c5 0fd90db5858e325358a5fbdaa4e327ee2a79d0d4 2025-08-26T09:08:08+02:00 Sigbjørn Skjæret gguf-py : remove erroneous FFN_GATE entry (#15583)
0fd90db5858e325358a5fbdaa4e327ee2a79d0d4 4c37636b3ea96f2574eeb7668b93fcc0e64b05dd 2025-08-26T08:51:43+02:00 Sigbjørn Skjæret metal : remove contiguous assertion for src0 in IM2COL (#15577)
4c37636b3ea96f2574eeb7668b93fcc0e64b05dd 34bdbbd7c2b70b848718e95bc48010f6aecd2816 2025-08-26T13:15:33+07:00 Yoshi_likes_e4 Add a warning for special devices (#15563)
34bdbbd7c2b70b848718e95bc48010f6aecd2816 74f52f77f28a5ad6d6075231afcb8d1ad763ca32 2025-08-25T23:42:44-05:00 Jeff Bolz vulkan: Remove splitting for mul_mat_id (#15568)
74f52f77f28a5ad6d6075231afcb8d1ad763ca32 f7207b0415986dd7f48447149da7de3a82338276 2025-08-26T05:21:22+08:00 Qeeweew CUDA: Accelerate MXFP4 table lookup using `__byte_perm` (#15451)
f7207b0415986dd7f48447149da7de3a82338276 4d917cd4f64cc37744e76d084659475819fb0728 2025-08-25T14:18:09-07:00 lhez opencl: fix support ops condition for `rms_norm` (#15560)
4d917cd4f64cc37744e76d084659475819fb0728 886b97a5d693550c2da470c091d9d27bf38398f8 2025-08-25T17:56:59+02:00 Ruben Ortlam vulkan: fix min subgroup 16 condition for mmid subgroup optimization (#15565)
886b97a5d693550c2da470c091d9d27bf38398f8 111f8d06f0b9169059779a35f655b343242ccbb6 2025-08-25T10:47:16-05:00 Jeff Bolz tests: Generate unique input values for count_equal (#15487)
111f8d06f0b9169059779a35f655b343242ccbb6 5eff6ec9b1220b599a43b594b1110487ab6aca08 2025-08-25T11:27:34-04:00 Ihar Hrachyshka metal: fix regression when no metal devices are present (#15531)
5eff6ec9b1220b599a43b594b1110487ab6aca08 dfd9b5f6c7586c88588f06a644c131bec071a0a1 2025-08-25T17:23:40+02:00 Johannes Gäßler CUDA: MoE helper in device code, better tile sizes (#15525)
dfd9b5f6c7586c88588f06a644c131bec071a0a1 5a6bc6b1a6cb665a944426c2055794950e524bf5 2025-08-25T15:00:43+02:00 Daniel Bevenius model-conversion : set pooling type to none in logits.cpp (#15564)
5a6bc6b1a6cb665a944426c2055794950e524bf5 6b64f74b55628e4193f4fb00313f07dbd8556528 2025-08-25T14:25:25+02:00 Daniel Bevenius model-conversion : add model card template for embeddings [no ci] (#15557)
6b64f74b55628e4193f4fb00313f07dbd8556528 0d5a470223fc90b6b6807921d68011ff06ae7f9e 2025-08-25T13:56:43+03:00 Georgi Gerganov batched-bench : fix unified KV cache handling + pp timing (#15562)
3a617cb18121a85eed17ac5585788810c5d9c1e0 c42293848dd9f03eba9a6c1b85a600b398f06541 2025-08-13T10:58:59+08:00 Yunzhe Jia add calrt_decode
c42293848dd9f03eba9a6c1b85a600b398f06541 1cbf442f50a154aac0bf35d7b8b3436a2cdfd6f5 2025-08-06T15:46:06+08:00 Yunzhe Jia sync with calrt API
1cbf442f50a154aac0bf35d7b8b3436a2cdfd6f5 ba67d6c03fed3193987a4ef13050e6e2a4451df4 2025-07-24T15:50:19+08:00 Yunzhe Jia 1.sync with calrt prefill,decode,kv_update op 2.add hw pattern untile function
ba67d6c03fed3193987a4ef13050e6e2a4451df4 8f52c6f8abb2ed9ad967cc0bfb90acb073011193 2025-06-26T17:42:32+08:00 Yunzhe Jia llama-calrt: infer-op: copy data from output buffer to dst-tensor.data
8f52c6f8abb2ed9ad967cc0bfb90acb073011193 d2f325130c4ed77a3dcff2c23a926587fb08e2cc 2025-06-26T15:10:45+08:00 Yunzhe Jia Squashed commit of the following:
d2f325130c4ed77a3dcff2c23a926587fb08e2cc 6391ee7ffd97e723dfbdcc32f001e1b95a63cba6 2025-06-17T11:53:33+08:00 Yunzhe Jia calrt: add input_token in graph; input_token will be copy to calrt_in_buffer
6391ee7ffd97e723dfbdcc32f001e1b95a63cba6 b9850050a5b5147cb2e6720b98ed8c1e8e02eff9 2025-06-13T10:58:06+08:00 Yunzhe Jia update .gitignore to update cal_test.gguf
b9850050a5b5147cb2e6720b98ed8c1e8e02eff9 933b205c32551848589b8339437d778cb4f2a46d 2025-06-06T17:25:52+08:00 Yunzhe Jia calrt: add call chain for using calrt::infer
933b205c32551848589b8339437d778cb4f2a46d 33fea9a8592fd338abe279b89350a3af2e0ff1f7 2025-06-12T17:47:19+08:00 Yunzhe Jia gguf-py: add cal_test.py
33fea9a8592fd338abe279b89350a3af2e0ff1f7 806f05a353d322e97d97e02f910de2b408a8b4ab 2025-06-06T17:25:52+08:00 Yunzhe Jia calrt: add load calbin
806f05a353d322e97d97e02f910de2b408a8b4ab ec9e0301fef6476df83e94842c3b625501c95566 2025-05-30T09:45:37+08:00 Yunzhe Jia add calrt demo