140 KiB
140 KiB
| 1 | fd9bd632f346085920d523dd307a3e4c11cc0a05 | e08e473cf292ba73789769b993bb35bcdfc31689 | 2026-06-01T14:15:35+08:00 | wangbomeng | llama-bench: fix device-info | |
|---|---|---|---|---|---|---|
| 2 | e08e473cf292ba73789769b993bb35bcdfc31689 | f86112d6758298241ab2fa84ad4f0f7b1ace35c6 | 2026-06-01T11:47:01+08:00 | wangbomeng | llama-bench:add device-info | |
| 3 | f86112d6758298241ab2fa84ad4f0f7b1ace35c6 | d1bc743c10080fed1253686ce01749b42611ded4 | 2026-05-29T16:40:38+08:00 | wangbomeng | add dump_pos,fix pos_tensor of pre_by_embeds | |
| 4 | d1bc743c10080fed1253686ce01749b42611ded4 | 2f201160b1960fd7be18b70d5770599d7082dd2f | 2026-05-28T14:23:06+08:00 | wangbomeng | set u_batch = max_seq_len | |
| 5 | 2f201160b1960fd7be18b70d5770599d7082dd2f | f131bf1908b8c5dd1f49d7ae7f616506fc471666 | 2026-05-27T09:58:31+08:00 | wangbomeng | delete useless code | |
| 6 | f131bf1908b8c5dd1f49d7ae7f616506fc471666 | 33d96dae28e17208ef61a71dba40cda3c04f135a | 2026-05-27T09:38:51+08:00 | wangbomeng | fix patch of qwen2.5vl,n_patch of minicpm = 64,fix n_ctx_slot,comment out M-ROPE | |
| 7 | 33d96dae28e17208ef61a71dba40cda3c04f135a | 37f068d87cc2d0a0b40ce978031fc9932fc89077 | 2026-05-22T14:33:45+08:00 | wangbomeng | add llama-build.sh | |
| 8 | 37f068d87cc2d0a0b40ce978031fc9932fc89077 | 13508e5e18bbb1202ae60c2ee5ecbdda1cca817b | 2026-05-21T14:07:00+08:00 | wangbomeng | release | |
| 9 | 13508e5e18bbb1202ae60c2ee5ecbdda1cca817b | b6b7919468126d5ba30a10941825154789e9082f | 2026-05-21T11:43:59+08:00 | wangbomeng | reduce cmake log | |
| 10 | b6b7919468126d5ba30a10941825154789e9082f | 46847c24fc5c52dd57bb4fb17fc4d684149bb4fa | 2026-05-20T16:40:33+08:00 | wangbomeng | reduce cmake log | |
| 11 | 46847c24fc5c52dd57bb4fb17fc4d684149bb4fa | d028722a12c5a463cc97207787cfd03d7a2590b0 | 2026-05-20T16:02:12+08:00 | wangbomeng | Simplify CMakeLists.txt | |
| 12 | d028722a12c5a463cc97207787cfd03d7a2590b0 | 63442fde8dc285817f725bd6c5fae80f478a3813 | 2026-05-20T14:41:05+08:00 | wangbomeng | replace cparam.n_ubatch with n_ubatch() | |
| 13 | 63442fde8dc285817f725bd6c5fae80f478a3813 | fc3f4a9fab88e98eff8eeca8cbc6617333edba2c | 2026-05-20T11:47:42+08:00 | wangbomeng | fix ubatch and cmakelist | |
| 14 | fc3f4a9fab88e98eff8eeca8cbc6617333edba2c | c931ef3163940227c9b6291e04216245cce21429 | 2026-05-19T16:54:16+08:00 | wangbomeng | add dump and rt case generation | |
| 15 | c931ef3163940227c9b6291e04216245cce21429 | a43741244a646d3f8fa3ff01bb9b7d059223d0a5 | 2026-05-18T17:34:37+08:00 | wangbomeng | calrt: fix prefill_by_ids.fix create_buf | |
| 16 | a43741244a646d3f8fa3ff01bb9b7d059223d0a5 | b2003d6c90ef0fa26ab9e930ba3e22b355eb3d39 | 2026-05-15T14:39:53+08:00 | wangbomeng | run llama-passkey successfully, fix llama-bench, copy 3 times input to infer qwen2.5vl | |
| 17 | b2003d6c90ef0fa26ab9e930ba3e22b355eb3d39 | 7800c772d44a7415640ec1669a691232939927cf | 2026-05-13T15:24:24+08:00 | wangbomeng | try passkey and embedding | |
| 18 | 7800c772d44a7415640ec1669a691232939927cf | dde8b8228081769c8d8f1e0751d47fa7875f8423 | 2026-05-13T15:23:54+08:00 | wangbomeng | try passkey and embedding | |
| 19 | dde8b8228081769c8d8f1e0751d47fa7875f8423 | fabcc7dac4b34d83fe430980bb364b81087c7ee9 | 2026-05-12T10:46:08+08:00 | wangbomeng | clip:add minicpm patch; | |
| 20 | fabcc7dac4b34d83fe430980bb364b81087c7ee9 | 1e9787962f20a7e82c71589ac1dd0585454e4bfe | 2026-04-30T16:17:17+08:00 | wangbomeng | calrt: fix encode dump | |
| 21 | 1e9787962f20a7e82c71589ac1dd0585454e4bfe | f584311c716dd078c4b737eebbfda97fe12b7274 1bec0db5a675ddc60fb793be2a746e8f3c8855dc | 2026-04-30T16:06:23+08:00 | wangbomeng | Merge remote-tracking branch 'origin/dev-ben' into dev | |
| 22 | f584311c716dd078c4b737eebbfda97fe12b7274 | a339954cc2a145a80c5ea349e7896211916cbed9 | 2026-04-30T16:05:15+08:00 | wangbomeng | calrt: fix encode dump | |
| 23 | 1bec0db5a675ddc60fb793be2a746e8f3c8855dc | 465df20c3e1f3f58d0f5531c796e0941a49c32b0 | 2026-04-30T16:02:59+08:00 | wangbomeng | bench: support 2 calbins | |
| 24 | 465df20c3e1f3f58d0f5531c796e0941a49c32b0 | a339954cc2a145a80c5ea349e7896211916cbed9 | 2026-04-30T09:08:12+08:00 | wangbomeng | support one calbin | |
| 25 | a339954cc2a145a80c5ea349e7896211916cbed9 | 8e76fc330ad624d1768b412d7894e272dbe696f4 eeeef3f6d6a5aad9296323ca15d9d929745b8932 | 2026-04-29T14:57:55+08:00 | wangbomeng | Merge branch 'dev' into dev-cli | |
| 26 | 8e76fc330ad624d1768b412d7894e272dbe696f4 | 431ad6f1c787f1b47e9e7be14b2e1a7d8565485c | 2026-04-29T14:56:59+08:00 | wangbomeng | finish dev of llama-cli | |
| 27 | eeeef3f6d6a5aad9296323ca15d9d929745b8932 | 431ad6f1c787f1b47e9e7be14b2e1a7d8565485c | 2026-04-28T16:16:19+08:00 | wangbomeng | add unknown time info: prefill and decode | |
| 28 | 431ad6f1c787f1b47e9e7be14b2e1a7d8565485c | efa1876bb8b2a449a55054a8c3745892f2c0f262 | 2026-04-27T16:52:15+08:00 | wangbomeng | update calrt_infer | |
| 29 | efa1876bb8b2a449a55054a8c3745892f2c0f262 | 4a2a3181f1cea170105c771e6ba69d851b82b937 | 2026-04-27T11:35:58+08:00 | wangbomeng | update version print | |
| 30 | 4a2a3181f1cea170105c771e6ba69d851b82b937 | e3ea5541259f35871c3e995331770aaca297e9ec | 2026-04-26T10:56:02+08:00 | wangbomeng | add calrt-version | |
| 31 | e3ea5541259f35871c3e995331770aaca297e9ec | 0b8e43943846a1cd05c26c9186b9ef778ebae6e2 | 2026-04-26T10:55:48+08:00 | wangbomeng | add calrt-version | |
| 32 | 0b8e43943846a1cd05c26c9186b9ef778ebae6e2 | 5eb46fffbd2e260c540fb112314ad67bbb8f56b6 | 2026-04-26T08:43:43+08:00 | wangbomeng | to debug | |
| 33 | 5eb46fffbd2e260c540fb112314ad67bbb8f56b6 | 005112c51e00d998b457337ca3dad53fc46e2d0b | 2026-04-24T16:24:51+08:00 | wangbomeng | clip: add image_to_patches; calrt: vision copy data from bf16 to fp32 | |
| 34 | 005112c51e00d998b457337ca3dad53fc46e2d0b | 509670642e8090a1713f5d73590b549be827aaef | 2026-04-24T16:24:31+08:00 | wangbomeng | clip: add image_to_patches; calrt: vision copy data from bf16 to fp32 | |
| 35 | 509670642e8090a1713f5d73590b549be827aaef | 5d219bfcef239c1e3ddd1baecc0514a9462ff6a8 | 2026-04-24T09:40:34+08:00 | wangbomeng | rm debug code | |
| 36 | 5d219bfcef239c1e3ddd1baecc0514a9462ff6a8 | 6787a53ab9b4897c5a7b51a4062d7b90e6697d35 | 2026-04-24T09:31:32+08:00 | wangbomeng | calrt: recover base = batch_index * dict_len | |
| 37 | 6787a53ab9b4897c5a7b51a4062d7b90e6697d35 | e1a76abf66178ea85656479a5e19aea7785c09f4 | 2026-04-24T09:22:02+08:00 | wangbomeng | calrt:input of multimodel from fp32 to bf16 | |
| 38 | e1a76abf66178ea85656479a5e19aea7785c09f4 | 99dd308adb8488fa869bb669e3335e646a938eff | 2026-04-22T16:29:22+08:00 | wangbomeng | calrt:add CalcoreRT version print | |
| 39 | 99dd308adb8488fa869bb669e3335e646a938eff | 06c7852e99e34c71e24e3ef6001cb54c72970e4d | 2026-04-21T15:50:01+08:00 | wangbomeng | server: fix max_seq_len | |
| 40 | 06c7852e99e34c71e24e3ef6001cb54c72970e4d | 96b4e267e562f44e76ec6c965ee0fa361f0439bf ed62eb33447f993d578e156a3c7e38c91b420ece | 2026-04-21T15:06:01+08:00 | wangbomeng | Merge branch 'dev-ot' into dev | |
| 41 | ed62eb33447f993d578e156a3c7e38c91b420ece | 015e988a271573a7c11e2a4b45084e1219d69d50 | 2026-04-21T15:05:22+08:00 | wangbomeng | try server-test:not success | |
| 42 | 015e988a271573a7c11e2a4b45084e1219d69d50 | 99962021f2dd1994dbbf90d5712f0ca2633f20f8 | 2026-04-17T16:56:08+08:00 | wangbomeng | little change | |
| 43 | 96b4e267e562f44e76ec6c965ee0fa361f0439bf | 99962021f2dd1994dbbf90d5712f0ca2633f20f8 | 2026-04-17T15:33:01+08:00 | wangbomeng | merge dev-ot | |
| 44 | 99962021f2dd1994dbbf90d5712f0ca2633f20f8 | 9af6682ef101c6d006c743c703cf150ac25f466f | 2026-04-17T14:48:33+08:00 | wangbomeng | calrt: add onetoken slice and untile_prefill | |
| 45 | 9af6682ef101c6d006c743c703cf150ac25f466f | e24f775ee26ea5249d5ff6cd23b8a0a17fe1438d | 2026-04-16T10:09:44+08:00 | wangbomeng | args: add -ca | |
| 46 | e24f775ee26ea5249d5ff6cd23b8a0a17fe1438d | a206460e610aef995e36e50b33e8bd41fe477541 | 2026-04-15T10:01:09+08:00 | wangbomeng | calrt: add copy_data_to_ibuf for vision model | |
| 47 | a206460e610aef995e36e50b33e8bd41fe477541 | d8b2aaa00049978cebac15041f960d75b552f97b | 2026-04-14T10:23:43+08:00 | wangbomeng | calrt: support mixture of prefill_by_ids and prefill_by_embeds | |
| 48 | d8b2aaa00049978cebac15041f960d75b552f97b | b6f29ec8140028619efaa50aa6e73146cecf631d | 2026-04-13T11:23:44+08:00 | wangbomeng | server: fix context-shift | |
| 49 | b6f29ec8140028619efaa50aa6e73146cecf631d | 6d55eae7e76b768acfcec045b8e84cded8ae3b55 | 2026-04-13T11:23:31+08:00 | wangbomeng | server: fix context-shift | |
| 50 | 6d55eae7e76b768acfcec045b8e84cded8ae3b55 | af8055f5f033a730e7e1fe80185b18b7e9473966 | 2026-04-10T14:58:56+08:00 | wangbomeng | add annotations | |
| 51 | af8055f5f033a730e7e1fe80185b18b7e9473966 | 6f54682df62b8ec6bb4154b99c47b5becda3291f | 2026-04-10T14:58:19+08:00 | wangbomeng | add annotations | |
| 52 | 6f54682df62b8ec6bb4154b99c47b5becda3291f | 42a181674565411efa5c8b318bc77d6fd084df8a a2d5bf362d6c9a546f9deadf4f8975605a915d33 | 2026-04-10T09:07:20+08:00 | Yunzhe Jia | Merge branch 'dev' of http://192.168.10.26:1000/yunzhe/llama.cpp into dev | |
| 53 | 42a181674565411efa5c8b318bc77d6fd084df8a | bd3a57a11aa008e0b5dc2a30f82fcd3a02587208 | 2026-04-10T09:06:55+08:00 | Yunzhe Jia | fix prompt_cache issue | |
| 54 | a2d5bf362d6c9a546f9deadf4f8975605a915d33 | bd3a57a11aa008e0b5dc2a30f82fcd3a02587208 | 2026-04-09T21:01:46+08:00 | Bomeng Wang | server: comment fixed time | |
| 55 | bd3a57a11aa008e0b5dc2a30f82fcd3a02587208 | fcfcdf80b01664a08fb12df879a05df3cc0eba70 74d437ab1456831573def7ca385a74d0ca460c37 | 2026-04-09T19:42:57+08:00 | Yunzhe Jia | Merge branch 'dev' of http://192.168.10.26:1000/yunzhe/llama.cpp into dev | |
| 56 | fcfcdf80b01664a08fb12df879a05df3cc0eba70 | 0cd44929b442860dc0e5f88976108be82350f9dc | 2026-04-09T19:41:52+08:00 | Yunzhe Jia | tmp fix one run >4K problem | |
| 57 | 74d437ab1456831573def7ca385a74d0ca460c37 | 5813c943005d1ede551e67ee98e35aefd210ff22 0cd44929b442860dc0e5f88976108be82350f9dc | 2026-04-09T17:44:26+08:00 | wangbomeng | Merge branch 'dev' of http://192.168.10.26:1000/yunzhe/llama.cpp into dev | |
| 58 | 5813c943005d1ede551e67ee98e35aefd210ff22 | 1f0d5bb0453f93ffa51faf68237c89251c2e0c40 | 2026-04-09T17:38:57+08:00 | wangbomeng | add --device-info | |
| 59 | 1f0d5bb0453f93ffa51faf68237c89251c2e0c40 | b8153b6b8f244b223c9f4c2940ae1f212634519e | 2026-04-09T17:38:37+08:00 | wangbomeng | add --device-info | |
| 60 | 0cd44929b442860dc0e5f88976108be82350f9dc | b8153b6b8f244b223c9f4c2940ae1f212634519e | 2026-04-09T15:08:50+08:00 | Bomeng Wang | rm calculet0.txt | |
| 61 | b8153b6b8f244b223c9f4c2940ae1f212634519e | 82842cfc3fa3d5c004c4540aeff8a81f38509bee | 2026-04-09T15:07:02+08:00 | wangbomeng | server: fix limit tokens to max_seq_len | |
| 62 | 82842cfc3fa3d5c004c4540aeff8a81f38509bee | 622a22991089c6debd5f4b57738f3df3a0bda8b5 | 2026-04-09T15:06:26+08:00 | wangbomeng | server: fix limit tokens to max_seq_len | |
| 63 | 622a22991089c6debd5f4b57738f3df3a0bda8b5 | 5f47a738ba56a37d0ff281a16212f41979568e35 | 2026-04-09T10:36:31+08:00 | wangbomeng | server: comment circle print | |
| 64 | 5f47a738ba56a37d0ff281a16212f41979568e35 | ecf01a17651cd7b1e8b85fd6075e83831463ee23 207ca38c751f7e6c251833eb11e89a2a0bb0fd07 | 2026-04-09T09:48:20+08:00 | Yunzhe Jia | Merge branch 'dev' of http://192.168.10.26:1000/yunzhe/llama.cpp into dev | |
| 65 | ecf01a17651cd7b1e8b85fd6075e83831463ee23 | 99d2078e89305035d87d966cee7987c7d50b3925 | 2026-04-09T09:47:55+08:00 | Yunzhe Jia | fix n_parallel problem | |
| 66 | 207ca38c751f7e6c251833eb11e89a2a0bb0fd07 | 99d2078e89305035d87d966cee7987c7d50b3925 | 2026-04-08T19:14:37+08:00 | wangbomeng | delet extra printf | |
| 67 | 99d2078e89305035d87d966cee7987c7d50b3925 | 9626239f5a9e568c9975d67dd6745fef90279a87 | 2026-04-08T19:01:16+08:00 | Yunzhe Jia | fix buffer resize problem | |
| 68 | 9626239f5a9e568c9975d67dd6745fef90279a87 | da724f3e2a8af2c2537e3edcff41e9415ac66fef | 2026-04-08T17:47:04+08:00 | wangbomeng | calrt: fix MapBuf | |
| 69 | da724f3e2a8af2c2537e3edcff41e9415ac66fef | 18814f9bf1a423ebe8f32d6043c9cbc5b21b0218 | 2026-04-08T16:58:32+08:00 | Bomeng Wang | calrt: add MapBuf | |
| 70 | 18814f9bf1a423ebe8f32d6043c9cbc5b21b0218 | bbee06d6d851e3f84f75b578047967d7e0e4a8dc | 2026-04-08T13:55:52+08:00 | wangbomeng | server : reset inference time | |
| 71 | bbee06d6d851e3f84f75b578047967d7e0e4a8dc | e126c21ed7b793b648d63533ea7ee30885f5a82a | 2026-04-08T11:29:36+08:00 | wangbomeng | calrt: add test time print | |
| 72 | e126c21ed7b793b648d63533ea7ee30885f5a82a | 5603e050af07173589f3b8850121263d86da01fd | 2026-04-01T10:07:12+08:00 | wangbomeng | sever: fix commit id | |
| 73 | 5603e050af07173589f3b8850121263d86da01fd | 1e8a16cd0e3ad3c9a0f8746852a0a38c6e52322e | 2026-04-01T05:57:55+08:00 | wangbomeng | calrt: add t_incopy and t_outcopy | |
| 74 | 1e8a16cd0e3ad3c9a0f8746852a0a38c6e52322e | 893e52bda0fee99bbda1521ea733a760bc4201f1 | 2026-04-01T10:14:22+08:00 | wangbomeng | calrt: fix slice and add infer/copy time | |
| 75 | 893e52bda0fee99bbda1521ea733a760bc4201f1 | 398ecf71f5f574037ce33f84dd1576fa164909ad | 2026-03-30T11:35:40+08:00 | Bomeng Wang | delete unnecessary commit id | |
| 76 | 398ecf71f5f574037ce33f84dd1576fa164909ad | 6d5e83902bdd3142a8ff0d3db19f02a8619e95a0 | 2026-03-27T02:01:23+08:00 | wangbomeng | rm llama-server_old.cpp | |
| 77 | 6d5e83902bdd3142a8ff0d3db19f02a8619e95a0 | e4eaab700333490e80ebefc8d023f6c1adfcc312 | 2026-03-27T00:57:11+08:00 | wangbomeng | server: printf calrt commit ID | |
| 78 | e4eaab700333490e80ebefc8d023f6c1adfcc312 | aeacc23a883400db0ebffb50e23355ada054da66 | 2026-03-25T09:03:55+08:00 | wangbomeng | calrt: prefil to prefill | |
| 79 | aeacc23a883400db0ebffb50e23355ada054da66 | cbaa7492663630132adeddccd9fec5e44ffa3336 | 2026-03-25T08:49:22+08:00 | wangbomeng | calrt: add slice only on decode | |
| 80 | cbaa7492663630132adeddccd9fec5e44ffa3336 | 3c08ebf0e442cd730ddffd959ec676f9caf31c82 | 2026-03-25T03:21:02+08:00 | wangbomeng | reduce warning | |
| 81 | 3c08ebf0e442cd730ddffd959ec676f9caf31c82 | 613bc2b9a9d7af92efbe42d876ffcdb244f7a00e | 2026-03-24T02:43:03+08:00 | wangbomeng | calrt: comment LOG_ERROR in untile_decode_cpy | |
| 82 | 613bc2b9a9d7af92efbe42d876ffcdb244f7a00e | 4e194ecc6c4b8ebe4c72d93f6055e3605dbfcefa | 2026-03-24T02:30:12+08:00 | wangbomeng | calrt: fix max_seq_len judgment | |
| 83 | 4e194ecc6c4b8ebe4c72d93f6055e3605dbfcefa | 16cbf81a731f5839a2f6b0eb9d8539826353748b | 2026-03-24T01:59:03+08:00 | wangbomeng | calrt: fix ubatch.embd cpy | |
| 84 | 16cbf81a731f5839a2f6b0eb9d8539826353748b | 8b4e17d990c23025148c4abadefe1010a0dd0734 | 2026-03-23T09:38:21+08:00 | wangbomeng | calrt: fix model_name of untile_cpy | |
| 85 | 8b4e17d990c23025148c4abadefe1010a0dd0734 | 6dacdd2cf9574214ca272a86674e7bd7ba21c4f0 41e6636ea1fb3884e41fb2023f92b0e7262ef09b | 2026-03-23T14:50:27+08:00 | wangbomeng | merge origin dev | |
| 86 | 6dacdd2cf9574214ca272a86674e7bd7ba21c4f0 | 3e6ad64467771224f072e5bad90e270951ba4cdf | 2026-03-23T14:42:28+08:00 | wangbomeng | calrt: add multimodal | |
| 87 | 3e6ad64467771224f072e5bad90e270951ba4cdf | b37b7d9756feb3dac2db526eeab38b572a095d47 | 2026-03-23T14:36:41+08:00 | wangbomeng | calrt: add multimodal | |
| 88 | 41e6636ea1fb3884e41fb2023f92b0e7262ef09b | d0a1b2c758440720d42fa108b3444f54593daa73 | 2026-03-12T16:36:07+08:00 | Bomeng Wang | server: correct the max_seq_len judgment | |
| 89 | d0a1b2c758440720d42fa108b3444f54593daa73 | b37b7d9756feb3dac2db526eeab38b572a095d47 | 2026-03-12T16:10:28+08:00 | Bomeng Wang | calrt: comment out dump | |
| 90 | b37b7d9756feb3dac2db526eeab38b572a095d47 | 07817cefc14fa359dcecad0630defd3610f8f5c8 7ddafbdcb9426ae3af016925b8b596f11e8742d0 | 2026-03-10T16:32:31+08:00 | Yunzhe Jia | Merge branch 'dev' of http://192.168.10.26:1000/yunzhe/llama.cpp into dev | |
| 91 | 07817cefc14fa359dcecad0630defd3610f8f5c8 | b2c45d8ddefb7ec09435231c8ec5b736fabf9c91 | 2026-03-10T16:32:07+08:00 | Yunzhe Jia | fix kv issue | |
| 92 | 7ddafbdcb9426ae3af016925b8b596f11e8742d0 | 059009eeaf20a569abfbac5eb37dad3bb9376428 | 2026-03-10T07:13:04+08:00 | wangbomeng | calrt: commented out cal_ctx->encode(batch) | |
| 93 | 059009eeaf20a569abfbac5eb37dad3bb9376428 | 1b073661d1311b5300173993b9f31ee7241d8606 | 2026-03-10T07:04:22+08:00 | wangbomeng | calrt: add multimodel | |
| 94 | 1b073661d1311b5300173993b9f31ee7241d8606 | 6295273c5866b9249bacdedbfc3a31877e6e6a85 b2c45d8ddefb7ec09435231c8ec5b736fabf9c91 | 2026-03-10T06:58:35+08:00 | wangbomeng | Merge branch 'dev' of http://192.168.20.229:1000/yunzhe/llama.cpp into dev | |
| 95 | 6295273c5866b9249bacdedbfc3a31877e6e6a85 | c6ea3f0d2468e3b8eab5de80bacee7fe4c9dd3d7 | 2026-03-10T06:54:41+08:00 | wangbomeng | arg: update hf_repo url to https://download.calculet.tech:9443 | |
| 96 | b2c45d8ddefb7ec09435231c8ec5b736fabf9c91 | c6ea3f0d2468e3b8eab5de80bacee7fe4c9dd3d7 | 2026-03-09T15:03:26+08:00 | Bomeng Wang | clart: past_kv_len = n_tokens | |
| 97 | c6ea3f0d2468e3b8eab5de80bacee7fe4c9dd3d7 | f8fba66b657c51a1df1efc7267bfea9f6140cebf | 2026-03-09T03:26:47+08:00 | wangbomeng | CMakeLists: STATIC to SHARED | |
| 98 | f8fba66b657c51a1df1efc7267bfea9f6140cebf | db4a61d2234c2f457b42ecc3f7219a1e1a35508a | 2026-03-06T15:06:36+08:00 | Yunzhe Jia | fix calrt_install include path | |
| 99 | db4a61d2234c2f457b42ecc3f7219a1e1a35508a | e672e02ca1a582f9e3a9d011d9e1b4fea4942a25 | 2026-03-06T06:59:58+08:00 | Yunzhe Jia | adapt to host-rt install structure | |
| 100 | e672e02ca1a582f9e3a9d011d9e1b4fea4942a25 | 27b82f64252779ad160a3fa76bd378c39421de36 7a3a9a0e76bb5f530beafcfe52e87e388e93117a | 2026-03-06T11:47:09+08:00 | Yunzhe Jia | Merge branch 'dev' of http://192.168.10.26:1000/yunzhe/llama.cpp into dev | |
| 101 | 27b82f64252779ad160a3fa76bd378c39421de36 | 0bd95719fed2f0247c8d0199dd897d24157dfae6 | 2026-03-06T11:42:45+08:00 | Yunzhe Jia | adapt to calrt_objs target | |
| 102 | 7a3a9a0e76bb5f530beafcfe52e87e388e93117a | 583c387efaf7bc030574e554088de79d09a27fbd | 2026-03-05T07:24:59+08:00 | wangbomeng | calrt_infer: fix past_kv_len | |
| 103 | 583c387efaf7bc030574e554088de79d09a27fbd | 0edc14a60a2d5596f71d728c655e3523da924d89 | 2026-02-27T02:24:56+08:00 | wangbomeng | caserver: lim generated tokens to n_ctx_per_seq | |
| 104 | 0edc14a60a2d5596f71d728c655e3523da924d89 | aa0a17d719326a63e0d6fea60aa0ced44e7abc33 | 2026-02-27T01:57:39+08:00 | wangbomeng | caserver: limit generated tokens to n_ctx_per_seq | |
| 105 | aa0a17d719326a63e0d6fea60aa0ced44e7abc33 | fa332e773da681f3e77d6ffe83a87edb557f758b | 2026-02-27T01:40:11+08:00 | wangbomeng | calrt: add bf16_to_fp32 | |
| 106 | fa332e773da681f3e77d6ffe83a87edb557f758b | aa54a7c637f2c92d924a5f35386975b1c27de898 | 2026-02-27T01:31:42+08:00 | wangbomeng | Add bf16_to_fp32 | |
| 107 | aa54a7c637f2c92d924a5f35386975b1c27de898 | 84f2c0b5f334a7ab77347c6779b6027a951d0ff0 | 2026-02-27T01:30:36+08:00 | wangbomeng | Add bf16_to_fp32 | |
| 108 | 84f2c0b5f334a7ab77347c6779b6027a951d0ff0 | 0bd95719fed2f0247c8d0199dd897d24157dfae6 | 2026-02-09T01:46:36+08:00 | wangbomeng | add bf16_to_fp32 in untile_decode/prefill_cpy | |
| 109 | 0bd95719fed2f0247c8d0199dd897d24157dfae6 | 365eb0b719e30b0f9e348d854f11c9c3f954a96e | 2026-02-07T10:25:06+08:00 | Yunzhe Jia | fix get_model_by_name | |
| 110 | 365eb0b719e30b0f9e348d854f11c9c3f954a96e | 886cd1fb3b217efcf51c46209fcb694022346797 | 2026-02-07T09:05:17+08:00 | Yunzhe Jia | comment out pos buffer file | |
| 111 | 886cd1fb3b217efcf51c46209fcb694022346797 | 9328f21378275f2354a19c3af907332b216ab492 | 2026-02-06T17:36:54+08:00 | Yunzhe Jia | fix compile problem | |
| 112 | 9328f21378275f2354a19c3af907332b216ab492 | 49fea70a20f550bfdb59d0ffe041b54919c22447 | 2026-01-28T15:32:36+08:00 | Yunzhe Jia | add prefill-only mode | |
| 113 | 49fea70a20f550bfdb59d0ffe041b54919c22447 | 74a118df31b6a4acc8876b2a2db90d2395cc6ec3 | 2026-01-28T09:11:16+08:00 | Yunzhe Jia | adapt to new calbin test_case | |
| 114 | 74a118df31b6a4acc8876b2a2db90d2395cc6ec3 | 98e8f9acfe87cd93646482cb2d942b8a132f0852 | 2026-01-13T14:32:47+08:00 | Yunzhe Jia | sync with calrt update | |
| 115 | 98e8f9acfe87cd93646482cb2d942b8a132f0852 | 8c8152a04036bb0d4756a4e08e54f514dae4e64d | 2025-12-10T00:20:57+08:00 | Yunzhe Jia | add timestamp | |
| 116 | 8c8152a04036bb0d4756a4e08e54f514dae4e64d | 5d2387931528fbe04aa8d66de935147efb65ca4d | 2025-12-09T14:40:04+08:00 | Yunzhe Jia | adapt to calrt csr | |
| 117 | 5d2387931528fbe04aa8d66de935147efb65ca4d | e6285a748657add8d974b78ca920c5b41753ee12 | 2025-12-08T16:40:34+08:00 | Yunzhe Jia | add timestamp for one decode process | |
| 118 | e6285a748657add8d974b78ca920c5b41753ee12 | 6b1ecdbbe3cc72ed8888be38f9e934cfd79b9fbb | 2025-11-27T16:58:35+08:00 | Yunzhe Jia | adapt to calrt | |
| 119 | 6b1ecdbbe3cc72ed8888be38f9e934cfd79b9fbb | 240d9bb75241c91896afe125f2fc74698a7395f3 | 2025-11-25T17:06:14+08:00 | Yunzhe Jia | add kv_tensor for pld test | |
| 120 | 240d9bb75241c91896afe125f2fc74698a7395f3 | 7eeb241aad429a68fb8cfa3ba85d000fb2348cd2 | 2025-11-24T12:03:00+08:00 | Yunzhe Jia | adapt to calrt modification | |
| 121 | 7eeb241aad429a68fb8cfa3ba85d000fb2348cd2 | dfb6250031a25058dbc3757e8a7ec75d90dcb48a | 2025-11-21T09:20:01+08:00 | Yunzhe Jia | fix byte_size error | |
| 122 | dfb6250031a25058dbc3757e8a7ec75d90dcb48a | e31bce25e85dc7fdf0a0e69fd0e58ba4a2ffaf3e | 2025-11-18T10:28:00+08:00 | Yunzhe Jia | add elf in CMakelist | |
| 123 | e31bce25e85dc7fdf0a0e69fd0e58ba4a2ffaf3e | 6444e227c36df16199c40d8cead2244fe014f377 | 2025-11-07T11:52:17+08:00 | Yunzhe Jia | dump src tensor | |
| 124 | 6444e227c36df16199c40d8cead2244fe014f377 | d81d7b190ff5f21325167936496dfe5ab48b922e | 2025-11-07T09:19:11+08:00 | Yunzhe Jia | test golden case | |
| 125 | d81d7b190ff5f21325167936496dfe5ab48b922e | e492f5dc8cec17529f53ef2bbdf7b502107f8148 1f5accb8d0056e6099cd5b772b1cb787dd590a13 | 2025-11-04T14:43:32+08:00 | Yunzhe Jia | Merge branch 'master' into dev | |
| 126 | e492f5dc8cec17529f53ef2bbdf7b502107f8148 | 2e05afd22b3d77c7013b11eee88e88b17188f21a | 2025-11-04T14:09:59+08:00 | Yunzhe Jia | redo untile logic | |
| 127 | 1f5accb8d0056e6099cd5b772b1cb787dd590a13 | 2759ccdb4adc8568add4316780d5e675519b0775 | 2025-11-04T05:04:59Z | Noah | Fix garbled output with REPACK at high thread counts (#16956) | |
| 128 | 2759ccdb4adc8568add4316780d5e675519b0775 | c5023daf607c578d6344c628eb7da18ac3d92d32 | 2025-11-04T10:53:48+08:00 | Aman Gupta | CUDA: avoid mul + bias fusion when doing fusion (#16935) | |
| 129 | c5023daf607c578d6344c628eb7da18ac3d92d32 | e7da30b584dc1f2ee0414c4a1298ce64eef97e8d | 2025-11-03T11:47:57-08:00 | lhez | opencl: support imrope (#16914) | |
| 130 | e7da30b584dc1f2ee0414c4a1298ce64eef97e8d | ed8aa63320393512bdcfe4b05b5ae01ba91888e1 | 2025-11-03T18:53:26+01:00 | Aleksander Grygier | fix: Viewing multiple PDF attachments (#16974) | |
| 131 | ed8aa63320393512bdcfe4b05b5ae01ba91888e1 | 48bd26501b08a3f0bff1249db47f313641f7bebb | 2025-11-03T18:01:59+01:00 | Daniel Bevenius | model-conversion : pass config to from_pretrained (#16963) | |
| 132 | 48bd26501b08a3f0bff1249db47f313641f7bebb | 622cd010ff4a65bef67edbf2f9bf4707c01f98f7 | 2025-11-03T15:38:23+02:00 | Georgi Gerganov | server : add props.model_alias (#16943) | |
| 133 | 622cd010ff4a65bef67edbf2f9bf4707c01f98f7 | 070ff4d5356083d60b807bb34d36b31c3653a29e | 2025-11-03T14:29:11+01:00 | theo77186 | ggml: CUDA: add head size 72 for flash-attn (#16962) | |
| 134 | 070ff4d5356083d60b807bb34d36b31c3653a29e | bf7b0c9725ed0c406c5debaea022ec7258430634 | 2025-11-03T11:11:18+01:00 | Xuan-Son Nguyen | mtmd: add --image-min/max-tokens (#16921) | |
| 135 | bf7b0c9725ed0c406c5debaea022ec7258430634 | fcfce040e816c542f374ad51461b3561d73c4bc9 | 2025-11-03T10:25:55+01:00 | Xuan-Son Nguyen | mtmd: pad mask for qwen2.5vl (#16954) | |
| 136 | fcfce040e816c542f374ad51461b3561d73c4bc9 | ee3a5a10adf9e83722d1914dddc56a0623ececaf | 2025-11-03T14:40:02+08:00 | Jinyang He | ggml : LoongArch fixes (#16958) | |
| 137 | ee3a5a10adf9e83722d1914dddc56a0623ececaf | 7e994168b1ccc12337ba8de939c4fd466107c1fb | 2025-11-03T05:33:56Z | Olivier Chafik | sync: minja (glm 4.6 & minmax m2 templates) (#16949) | |
| 138 | 7e994168b1ccc12337ba8de939c4fd466107c1fb | bcfa87622ae46be6345a8e3dfdbdc5ba5414042b | 2025-11-03T03:35:33+02:00 | shani-f | SYCL: optimized repeat_back kernel (3× fewer asm instructions, 2× faster)Feature/sycl repeat back opt (#16869) | |
| 139 | bcfa87622ae46be6345a8e3dfdbdc5ba5414042b | a2054e3a8ff0da3978a4acc18c349ff58554d336 | 2025-11-03T00:41:08+01:00 | Sascha Rogmann | feat(webui): improve LaTeX rendering with currency detection (#16508) | |
| 140 | a2054e3a8ff0da3978a4acc18c349ff58554d336 | dd5286805004db1f9ac3176a1cbbfe373bdda0f8 | 2025-11-03T04:40:30+05:30 | Shagun Bera | test-backend-ops : fix segfault in moe-expert-reduce test in support mode and coverage (#16936) | |
| 141 | dd5286805004db1f9ac3176a1cbbfe373bdda0f8 | 6b9a52422bac0f50dd8f1f8386744fa3ce9783bf | 2025-11-02T23:11:21+01:00 | Sigbjørn Skjæret | ci : disable failing riscv cross build (#16952) | |
| 142 | 6b9a52422bac0f50dd8f1f8386744fa3ce9783bf | 2f966b8ed87514e74bb96592217226cb6a6974dd | 2025-11-02T13:08:04-08:00 | Zhiyong Wang | model: add Janus Pro for image understanding (#16906) | |
| 143 | 2f966b8ed87514e74bb96592217226cb6a6974dd | cd5e3b57541ecc52421130742f4d89acbcf77cd4 | 2025-11-02T22:21:48+02:00 | Georgi Gerganov | clip : use FA (#16837) | |
| 144 | cd5e3b57541ecc52421130742f4d89acbcf77cd4 | 87c9efc3b297b8a498716b1db3d061842e6fc85b | 2025-11-02T18:14:04+02:00 | Georgi Gerganov | server : support unified cache across slots (#16736) | |
| 145 | 87c9efc3b297b8a498716b1db3d061842e6fc85b | 76af40aaaad78c42faecd8016a88362c788b84b0 | 2025-11-02T08:56:28-06:00 | Aldehir Rojas | common : move gpt-oss reasoning processing to init params (#16937) | |
| 146 | 76af40aaaad78c42faecd8016a88362c788b84b0 | 7db35a7958a943be1693879f42d166f152613979 | 2025-11-02T10:28:37+01:00 | Adrian Lundberg | docs: remove llama_sampler_accept reference in sampling sample usage (#16920) | |
| 147 | 7db35a7958a943be1693879f42d166f152613979 | a864132ba546b6385922226480ee4e392aaa065c | 2025-11-02T08:42:57+05:30 | mnehete32 | CUDA: add FLOOR, CEIL, ROUND, TRUNC unary ops (#16917) | |
| 148 | a864132ba546b6385922226480ee4e392aaa065c | d38d9f0877a5872daa3c5f06fb9a86376bf15d50 | 2025-11-02T08:48:46+08:00 | Aaron Teo | devops: fix failing s390x docker build (#16918) | |
| 149 | d38d9f0877a5872daa3c5f06fb9a86376bf15d50 | 7fd205a8e8832ead273f62c5fd81d2b8aa910535 | 2025-11-02T08:48:23+08:00 | Aaron Teo | ggml: add s390x cpu-feats (#16774) | |
| 150 | 7fd205a8e8832ead273f62c5fd81d2b8aa910535 | 2f68ce7cfd20e9e7098514bf730e5389b7bba908 | 2025-11-02T00:15:31+02:00 | Georgi Gerganov | scripts : add script to bench models (#16894) | |
| 151 | 2f68ce7cfd20e9e7098514bf730e5389b7bba908 | e4a71599e5846110159955dec0008eb4aa24222b | 2025-11-01T19:49:51+01:00 | Pascal | webui: auto-refresh /props on inference start to resync model metadata (#16784) | |
| 152 | e4a71599e5846110159955dec0008eb4aa24222b | dd5e8cab512c7752392b6e51a6f118f348fb3f16 | 2025-11-01T17:14:54+01:00 | Pascal | webui: add HTML/JS preview support to MarkdownContent with sandboxed iframe (#16757) | |
| 153 | dd5e8cab512c7752392b6e51a6f118f348fb3f16 | cf659bbb8ef9eb048e5153a27cf787fd83c05560 | 2025-11-01T16:52:17+01:00 | Adrien Gallouët | vendor : update cpp-httplib to 0.27.0 (#16846) | |
| 154 | cf659bbb8ef9eb048e5153a27cf787fd83c05560 | d8b860a219c2415faac8cc0e50b48b4aa11e3b64 | 2025-11-01T15:51:36+01:00 | Xuan-Son Nguyen | mtmd: refactor preprocessing + support max/min pixels (#16878) | |
| 155 | d8b860a219c2415faac8cc0e50b48b4aa11e3b64 | 1ae74882f8f6755e44dff8f23f3abdc5b53ab7c1 | 2025-11-01T15:35:57+01:00 | Aleksander Grygier | Add a setting to display message generation statistics (#16901) | |
| 156 | 1ae74882f8f6755e44dff8f23f3abdc5b53ab7c1 | 961660b8c395afb8903f61ace69396a158ea0cb4 | 2025-11-01T15:02:57+01:00 | Jaromír Hradílek | webui: recognize AsciiDoc files as valid text files (#16850) | |
| 157 | 961660b8c395afb8903f61ace69396a158ea0cb4 | 74fef4129fa58f6277c243777a4894371479dbad | 2025-11-01T11:01:42+01:00 | Sigbjørn Skjæret | common : allow --system-prompt-file for diffusion-cli (#16903) | |
| 158 | 74fef4129fa58f6277c243777a4894371479dbad | 5d8bb900bc7daa84bfa7bb1d25ab7e32394919f3 | 2025-11-01T08:55:25+01:00 | Sigbjørn Skjæret | codeowners : update after refactor (#16905) | |
| 159 | 5d8bb900bc7daa84bfa7bb1d25ab7e32394919f3 | 2e76e013600cb0d51ccf158571ca1d0502952a07 | 2025-11-01T00:52:14-05:00 | Jeff Bolz | vulkan: Fix multi_add invalid descriptor usage (#16899) | |
| 160 | 2e76e013600cb0d51ccf158571ca1d0502952a07 | d3dc9dd898be805c23a408cc36daed5b3bf29221 | 2025-11-01T00:45:28-05:00 | Jeff Bolz | vulkan: fuse mul_mat+add and mul_mat_id+add_id (#16868) | |
| 161 | d3dc9dd898be805c23a408cc36daed5b3bf29221 | bea04522ff1a0d8559ccfd353aa018dcfbb608cc | 2025-11-01T06:13:26+01:00 | Oliver Simons | CUDA: Remove unneded bias/gate dims in fused mmvq (#16858) | |
| 162 | bea04522ff1a0d8559ccfd353aa018dcfbb608cc | 0de0a01576772032008a689afc4d7c80685074c4 | 2025-10-31T23:40:23+01:00 | Piotr Wilkin (ilintar) | refactor : llama-model.cpp (#16252) | |
| 163 | 0de0a01576772032008a689afc4d7c80685074c4 | e58d585604bbbbbc24f8149effe444621b5191c6 | 2025-10-31T21:20:47+01:00 | Piotr Wilkin (ilintar) | model : Minimax M2 (#16831) | |
| 164 | e58d585604bbbbbc24f8149effe444621b5191c6 | 31c511a968348281e11d590446bb815048a1e912 | 2025-10-31T21:20:07+01:00 | Giuseppe Scrivano | model : add Granite Hybrid nano types (#16896) | |
| 165 | 31c511a968348281e11d590446bb815048a1e912 | 6d39015a744b47bb7643ea73f412e6d64677f305 | 2025-10-31T15:57:19+01:00 | Johannes Gäßler | CUDA: Volta tensor core support for MMF (#16843) | |
| 166 | 6d39015a744b47bb7643ea73f412e6d64677f305 | 4146d6a1a6228711a487a1e3e9ddd120f8d027d7 | 2025-10-31T16:25:50+02:00 | Georgi Gerganov | sync : ggml | |
| 167 | 4146d6a1a6228711a487a1e3e9ddd120f8d027d7 | 8da3c0e200a586f768ada6f38745acb01380174c | 2025-10-31T20:05:07+08:00 | Aman Gupta | CUDA: add expert reduce kernel (#16857) | |
| 168 | 8da3c0e200a586f768ada6f38745acb01380174c | c22473b580807929fd9e3a3344a48e8cfbe6c88f | 2025-10-31T13:50:33+02:00 | Georgi Gerganov | batch : fix consistency checks for the input positions (#16890) | |
| 169 | c22473b580807929fd9e3a3344a48e8cfbe6c88f | 0f715b4e759acceccb9f437cfd2a988fff85514a | 2025-10-31T10:54:19+02:00 | Georgi Gerganov | server : don't print user inputs to console (#16871) | |
| 170 | 0f715b4e759acceccb9f437cfd2a988fff85514a | d2d931f173b8a736b08999436e9259aafddec718 | 2025-10-31T09:51:26+01:00 | Daniel Bevenius | server : fix typos in server.cpp comments [no ci] (#16883) | |
| 171 | d2d931f173b8a736b08999436e9259aafddec718 | 2976b0374d36609b0429dd6ce48807e2ad39a7c2 | 2025-10-31T02:34:47-05:00 | Jeff Bolz | vulkan: disable spirv-opt for rope shaders (#16872) | |
| 172 | 2976b0374d36609b0429dd6ce48807e2ad39a7c2 | d2a2673dd1c86a01ab010e18b13b8bb959968c48 | 2025-10-31T16:18:59+09:00 | Masato Nakasaka | vulkan: Fix crash when FP16 mul_mat accumulation is not supported (#16796) | |
| 173 | d2a2673dd1c86a01ab010e18b13b8bb959968c48 | 13002a08960e51a76c4d696165b5d7638d2f2b99 | 2025-10-31T08:14:49+01:00 | Ruben Ortlam | vulkan: fix shmem overrun in mmq id shader (#16873) | |
| 174 | 2e05afd22b3d77c7013b11eee88e88b17188f21a | c20c0a5c0c44179f5267a262546624854b1203d1 | 2025-10-31T14:06:06+08:00 | Yunzhe Jia | add pcie support | |
| 175 | 13002a08960e51a76c4d696165b5d7638d2f2b99 | 6eb208d17ea29bb60295d9a2b5e7122dfb8f4b55 | 2025-10-31T12:46:31+08:00 | l3utterfly | ggml-hexagon: respect input size when getting/setting tensor data (#16836) | |
| 176 | 6eb208d17ea29bb60295d9a2b5e7122dfb8f4b55 | 9984cbb61d12491d604484fb38b678fa15064061 | 2025-10-31T00:34:27+01:00 | Sigbjørn Skjæret | ci : enable free-disk-space on cuda docker build (#16877) | |
| 177 | 9984cbb61d12491d604484fb38b678fa15064061 | ce18efeaf1234bd08f25bc08f88ef95cf5d9e51f | 2025-10-30T16:00:20-07:00 | lhez | opencl: fix boundary handling for mul_mm (#16875) | |
| 178 | ce18efeaf1234bd08f25bc08f88ef95cf5d9e51f | 16724b5b6836a2d4b8936a5824d2ff27c52b4517 | 2025-10-30T23:15:03+01:00 | RodriMora | convert : update transformers requirements (#16866) | |
| 179 | 16724b5b6836a2d4b8936a5824d2ff27c52b4517 | b52edd25586fabb70f0c21b274473b307cf14499 | 2025-10-30T14:22:23-04:00 | chansikpark | server : bump request URI max length to 32768 (#16862) | |
| 180 | b52edd25586fabb70f0c21b274473b307cf14499 | 517b7170e1a4d733583c4b07c5b7a49acc05911c | 2025-10-30T18:42:57+02:00 | Georgi Gerganov | server : remove n_past (#16818) | |
| 181 | 517b7170e1a4d733583c4b07c5b7a49acc05911c | 835e918d8428f5119927d7150bf5a26176dedda0 | 2025-10-30T09:06:13-07:00 | Max Krasnyansky | cpu: introduce chunking for repack matmuls and enable matmul-id chunking on ARM64 (#16833) | |
| 182 | 835e918d8428f5119927d7150bf5a26176dedda0 | d261223d24e97f2df50220e4a5b7f0adb69bba81 | 2025-10-30T21:17:31+05:30 | Shagun Bera | common: fix typo in cli help text (#16864) | |
| 183 | d261223d24e97f2df50220e4a5b7f0adb69bba81 | dcca0d3ab840ebe9b2ccd4719033d408eeb758d7 | 2025-10-30T23:19:14+08:00 | JJJYmmm | model: add support for qwen3vl series (#16780) | |
| 184 | dcca0d3ab840ebe9b2ccd4719033d408eeb758d7 | bacddc049a00786df44e682262f6e298742bfbc3 | 2025-10-30T05:26:05-07:00 | Max Krasnyansky | cpu: introduce chunking for flash attention (#16829) | |
| 185 | bacddc049a00786df44e682262f6e298742bfbc3 | 229bf686287d18f82c44e89888cc662145ecfdb4 | 2025-10-30T07:18:50-04:00 | Tianyue-Zhao | model: Add support for CogVLM model (#15002) | |
| 186 | 229bf686287d18f82c44e89888cc662145ecfdb4 | d7395115baf395b75a73a17b0b796e746e468da9 | 2025-10-30T08:56:28+01:00 | Sigbjørn Skjæret | cuda : fix argsort with 64k+ rows (#16849) | |
| 187 | d7395115baf395b75a73a17b0b796e746e468da9 | 052df28b0e3ca0398e5928c61c7de40254317894 | 2025-10-30T14:30:58+08:00 | Jan Boon | llama : use std::abs instead of abs (#16853) | |
| 188 | 052df28b0e3ca0398e5928c61c7de40254317894 | 8b11deea4663f29d3e042ce1056ba643264cd5f1 | 2025-10-30T01:27:41-05:00 | Jeff Bolz | vulkan: Handle argsort with a large number of rows (#16851) | |
| 189 | 8b11deea4663f29d3e042ce1056ba643264cd5f1 | b9ce94017729465895402cbcfffb51fa926c15e3 | 2025-10-30T04:34:15+01:00 | Oliver Simons | Hide latency of bias and gate-loading (#16847) | |
| 190 | b9ce94017729465895402cbcfffb51fa926c15e3 | 3464bdac37027c5e9661621fc75ffcef3c19c6ef | 2025-10-29T15:13:10-05:00 | Jeff Bolz | vulkan: Fuse rope+set_rows (#16769) | |
| 191 | 3464bdac37027c5e9661621fc75ffcef3c19c6ef | e3af5563bd049141e036b50f843196db33d23e97 | 2025-10-29T20:11:39+01:00 | Xuan-Son Nguyen | llama: fix ASAN error with M-RoPE (#16848) | |
| 192 | e3af5563bd049141e036b50f843196db33d23e97 | 10fcc41290e233788f5a4215314156e8e023eb92 | 2025-10-29T18:09:18+01:00 | Xuan-Son Nguyen | llama: store mrope data in KV cell (#16825) | |
| 193 | 10fcc41290e233788f5a4215314156e8e023eb92 | bcf5bda6f5df559565d11d7c8e8295c1159a85ec | 2025-10-29T08:44:29-05:00 | Jeff Bolz | vulkan: Update topk_moe fusion to handle gpt's late softmax (#16656) | |
| 194 | bcf5bda6f5df559565d11d7c8e8295c1159a85ec | 3eb2be1ca5f37480aeb16102970d9e65f43347fe | 2025-10-29T14:39:03+01:00 | Ruben Ortlam | Vulkan MMQ Integer Dot Refactor and K-Quant support (#16536) | |
| 195 | 3eb2be1ca5f37480aeb16102970d9e65f43347fe | e41bcce8f0b53032a1fed275cd253e931c041cf6 | 2025-10-29T06:29:12-07:00 | Max Krasnyansky | Hexagon Op queue & dispatch optimizations (#16820) | |
| 196 | e41bcce8f0b53032a1fed275cd253e931c041cf6 | 144a4ce824b6bd0e48d62009d10cae1daf5308db | 2025-10-29T21:11:53+08:00 | Aman Gupta | CUDA: use fastdiv in set-rows (#16834) | |
| 197 | 144a4ce824b6bd0e48d62009d10cae1daf5308db | f549b0007dbdd683215820f7229ce180a12b191d | 2025-10-29T14:09:50+01:00 | Sigbjørn Skjæret | vendor : sync minja (#16500) | |
| 198 | f549b0007dbdd683215820f7229ce180a12b191d | 9a3ea685b937c0f0cbfda2e50004ea54bf187512 | 2025-10-29T03:53:04-05:00 | Jeff Bolz | vulkan: Call ggml_vk_buffer_write_2d from ggml_vk_buffer_copy (#16793) | |
| 199 | 9a3ea685b937c0f0cbfda2e50004ea54bf187512 | 338074c383c81366320d176d83b94b0a567ee0c2 | 2025-10-29T15:55:06+08:00 | Aman Gupta | CUDA: Fix bug in topk-moe for gpt-oss (#16821) | |
| 200 | 338074c383c81366320d176d83b94b0a567ee0c2 | 851553ea6b24cb39fd5fd188b437d777cb411de8 | 2025-10-29T08:14:39+02:00 | YaelLogic | sycl: add RMS_NORM_BACK operation support (#16808) | |
| 201 | 851553ea6b24cb39fd5fd188b437d777cb411de8 | 85a7d8677bf2200981e52f744a21d5267964ffcf | 2025-10-28T21:10:28+02:00 | YaelGitAccount | cuda: add SET operation support (#16804) | |
| 202 | 85a7d8677bf2200981e52f744a21d5267964ffcf | a8ca18b4b815a2abdbecb958ee5f4c542d69aac7 | 2025-10-28T20:19:44+02:00 | Georgi Gerganov | memory : remove KV cache size padding (#16812) | |
| 203 | a8ca18b4b815a2abdbecb958ee5f4c542d69aac7 | 8284efc35c909217ee1b9a06903245d808ac2283 | 2025-10-28T19:41:43+02:00 | Georgi Gerganov | llama-bench : clarify benchmarked parts of the computation (#16823) | |
| 204 | 8284efc35c909217ee1b9a06903245d808ac2283 | 1c1409e13169d0ced4b1b4d39fb5b268b7525091 | 2025-10-28T23:16:20+08:00 | l3utterfly | initialise buffer.device in ggml_hexagon_session (#16816) | |
| 205 | 1c1409e13169d0ced4b1b4d39fb5b268b7525091 | 7a0e900e3615fa46c074a7fdf900b47d3c0a1c7e | 2025-10-28T03:51:41-07:00 | Sam Malayek | embedding: add raw option for --embd-output-format (#16541) | |
| 206 | 7a0e900e3615fa46c074a7fdf900b47d3c0a1c7e | 280d97be9660e7a5feaa28a6e7a299bc73dd83fc | 2025-10-28T11:23:54+01:00 | Johannes Gäßler | llama: consistent ctx <-> buf order for KV cache (#16746) | |
| 207 | 280d97be9660e7a5feaa28a6e7a299bc73dd83fc | 3479efd112b3910d2d008ad08fe4cb4895605903 | 2025-10-28T03:37:52-05:00 | Aldehir Rojas | grammar : support array references in json schema (#16792) | |
| 208 | 3479efd112b3910d2d008ad08fe4cb4895605903 | 463bbf20bfbe0da10ac58984d4d62bed5a49362a | 2025-10-28T10:54:53+08:00 | Chenguang Li | CANN: Improve device ID handling and aclnnArange checks (#16752) | |
| 209 | 463bbf20bfbe0da10ac58984d4d62bed5a49362a | ad8d36beffd791db10c94eb9e964afb891e3ca55 | 2025-10-28T10:31:21+08:00 | Aman Gupta | CUDA: add unused vars to mmvf and mmvq (#16807) | |
| 210 | ad8d36beffd791db10c94eb9e964afb891e3ca55 | c053e18a66dd95dc340aa61317877c2a41d4e3cf | 2025-10-28T03:50:33+02:00 | tamarPal | sycl: add SSM_CONV operation support (#16800) | |
| 211 | c053e18a66dd95dc340aa61317877c2a41d4e3cf | e1ab0848037c9f9bfe68b3e1cee9ee375e1018a3 | 2025-10-27T18:54:01-04:00 | Yuri Khrustalev | chat: Add LFM2 tool handling (#16763) | |
| 212 | e1ab0848037c9f9bfe68b3e1cee9ee375e1018a3 | 5a4ff43e7dd049e35942bc3d12361dab2f155544 | 2025-10-27T23:12:16+01:00 | Xuan-Son Nguyen | mtmd : fix idefics3 preprocessing (#16806) | |
| 213 | 5a4ff43e7dd049e35942bc3d12361dab2f155544 | 10640e31aab0819f31c1e1f2d008b019ee737232 | 2025-10-27T13:51:28-07:00 | Diego Devesa | llama : disable pipeline parallelism if compute buffer allocation fails (#16748) | |
| 214 | 10640e31aab0819f31c1e1f2d008b019ee737232 | 80d28f104c0c3e61c11d6af073642b246a9fc19c | 2025-10-27T21:50:22+01:00 | Acly | ggml : fix interpolate with align-corners and ne=1 (#16700) | |
| 215 | 80d28f104c0c3e61c11d6af073642b246a9fc19c | c55d53acec864f64afa1ba92972203dce1bf88f5 | 2025-10-27T21:39:49+01:00 | Johannes Gäßler | HIP: fix AMDGPU_TARGETS, update documentation (#16803) | |
| 216 | c55d53acec864f64afa1ba92972203dce1bf88f5 | 945501f5ea4b8ca56b181ecb035e9ee3fb31f432 | 2025-10-27T16:02:58+01:00 | Xuan-Son Nguyen | model : add LightOnOCR-1B model (#16764) | |
| 217 | 945501f5ea4b8ca56b181ecb035e9ee3fb31f432 | 75cbdd3fce38ea12d50cd19e73a069aa5dbbd5fa | 2025-10-27T09:17:31+01:00 | Johannes Gäßler | llama: fix leaked buffers for mmap + split files (#16765) | |
| 218 | 75cbdd3fce38ea12d50cd19e73a069aa5dbbd5fa | 2b9bd9bf4e759c05db629ec1c391dc8aeaa71887 | 2025-10-27T09:25:10+08:00 | Aman Gupta | test-backend-ops: print failed tests at the end (#16785) | |
| 219 | 2b9bd9bf4e759c05db629ec1c391dc8aeaa71887 | 59fc1ec8e83b14354c1a3a8acf8c5c2cbf9af42f | 2025-10-27T03:20:24+02:00 | tamarPal | sycl: add ROLL operation support (#16665) | |
| 220 | 59fc1ec8e83b14354c1a3a8acf8c5c2cbf9af42f | 75d33b9302f84a5b89f82205d2bcd8def5a64e0a | 2025-10-27T03:19:50+02:00 | shani-f | sycl: add REPEAT_BACK operation support (#16734) | |
| 221 | 75d33b9302f84a5b89f82205d2bcd8def5a64e0a | 3470a5c891dcc94363e492a3760af92b6b07241c | 2025-10-27T09:06:16+08:00 | Aman Gupta | CUDA: support for weight clamp in top-k norm (#16702) | |
| 222 | 3470a5c891dcc94363e492a3760af92b6b07241c | bd562fe4f7bd55625511d5f9d639c4fb1db1d440 | 2025-10-26T23:19:03+01:00 | Acly | ggml-alloc : make gallocr prefer chunks that allow memory reuse (#16788) | |
| 223 | bd562fe4f7bd55625511d5f9d639c4fb1db1d440 | bbac6a26b2bd7f7c1f0831cb1e7b52734c66673b | 2025-10-26T21:31:41+01:00 | Sigbjørn Skjæret | cuda : use fast copy when src and dst are of different type and contiguous (#16789) | |
| 224 | bbac6a26b2bd7f7c1f0831cb1e7b52734c66673b | 73a48c9790d320476b3e5ef75bda09f2f8269e6e | 2025-10-27T02:13:31+08:00 | leejet | ggml: fix cuda kernel launch configuration for k_compute_batched_ptrs to support large batch (#16744) | |
| 225 | 73a48c9790d320476b3e5ef75bda09f2f8269e6e | f696428ce8e4d16c17acbffeaa7feac3b0fb9061 | 2025-10-26T17:21:23+01:00 | Sigbjørn Skjæret | convert : enable expert group selection for all models with it (#16691) | |
| 226 | f696428ce8e4d16c17acbffeaa7feac3b0fb9061 | 7cce4f8158f0c4c88d8dadd4c23d33938127b897 | 2025-10-26T17:20:32+01:00 | Sigbjørn Skjæret | graph : add clamping to ffn_moe_weights_sum to avoid div-by-zero (#16655) | |
| 227 | 7cce4f8158f0c4c88d8dadd4c23d33938127b897 | 8d8862829cd770fc9c0c7a726ed162de824ff5ea | 2025-10-26T16:08:52+01:00 | Sigbjørn Skjæret | model : set res->t_embd in SmallThinker models (#16782) | |
| 228 | 8d8862829cd770fc9c0c7a726ed162de824ff5ea | f77c13b91f4d25754b6a0b857f98a6bc922a0aa7 | 2025-10-26T14:01:20+02:00 | amirai21 | docs : add Jamba to Text-only models list (#16778) | |
| 229 | f77c13b91f4d25754b6a0b857f98a6bc922a0aa7 | 3cfa9c3f125763305b4226bc032f1954f08990dc | 2025-10-26T19:28:04+08:00 | Aman Gupta | CUDA: General GEMV fusion (#16715) | |
| 230 | 3cfa9c3f125763305b4226bc032f1954f08990dc | 5d195f17bc60eacc15cfb929f9403cf29ccdf419 | 2025-10-26T06:37:38+02:00 | Gilad S. | vulkan: deduplicate Microsoft Direct3D12 devices (#16689) | |
| 231 | 5d195f17bc60eacc15cfb929f9403cf29ccdf419 | 226f295f4dd92ad714533adc5497afed5fa88bb8 | 2025-10-25T20:41:36+02:00 | Galunid | convert : handle mmproj filename/path properly (#16760) | |
| 232 | 226f295f4dd92ad714533adc5497afed5fa88bb8 | f90b4a8efe4466215c51155a5c22c1ae6207da23 | 2025-10-25T19:26:27+09:00 | Shunta Saito | model : set res->t_embd in PLaMo2 models (#16766) | |
| 233 | f90b4a8efe4466215c51155a5c22c1ae6207da23 | 8423d019318b446640bb620e4ce80066d8530f05 | 2025-10-25T10:59:54+02:00 | Giuseppe Scrivano | vulkan: delete dead code (#16732) | |
| 234 | 8423d019318b446640bb620e4ce80066d8530f05 | 5cca2542ac3f3f86831d32bce744d08fc2b353b0 | 2025-10-25T00:04:12-05:00 | Jeff Bolz | vulkan: Optimize SSM_SCAN (#16645) | |
| 235 | 5cca2542ac3f3f86831d32bce744d08fc2b353b0 | 55945d2ef51b93821d4b6f4a9b994393344a90db | 2025-10-24T20:52:00-04:00 | compilade | convert : avoid dequantizing mxfp4 for GPT-OSS (#16756) | |
| 236 | 55945d2ef51b93821d4b6f4a9b994393344a90db | 0bcb40b48c6fc6f17ba9672625e526ab2574344b | 2025-10-25T03:39:37+08:00 | leejet | ggml: fix CUDA grid launch condition for large block_nums.y in binbcast (#16742) | |
| 237 | 0bcb40b48c6fc6f17ba9672625e526ab2574344b | 69e9ff010309a1155d704cf9320bdb3aaf4160ca | 2025-10-24T20:46:19+08:00 | Aman Gupta | CUDA: use CUB for arbitary size argsort (#16754) | |
| 238 | 69e9ff010309a1155d704cf9320bdb3aaf4160ca | 5a91109a5d7dab5d7adc40bedb397ede99a705b1 | 2025-10-24T14:10:29+02:00 | Florian Badie | webui: support q URL parameter (#16728) | |
| 239 | 5a91109a5d7dab5d7adc40bedb397ede99a705b1 | f8f071faddf32ea09f4234edb6e809b380a9ee26 | 2025-10-24T12:02:02+02:00 | Daniel Bevenius | model-conversion : add trust_remote_code for orig model run [no ci] (#16751) | |
| 240 | f8f071faddf32ea09f4234edb6e809b380a9ee26 | 0bf47a1dbba4d36f2aff4e8c34b06210ba34e688 | 2025-10-23T16:31:41-04:00 | compilade | convert : handle pre-quantized models (#14810) | |
| 241 | 0bf47a1dbba4d36f2aff4e8c34b06210ba34e688 | dd62dcfab97e420949519fd0eac9fca7bf97e635 | 2025-10-23T21:30:17+02:00 | Johannes Gäßler | server: add memory breakdown print (#16740) | |
| 242 | dd62dcfab97e420949519fd0eac9fca7bf97e635 | d0660f237a5c31771a3d6d1030ebe3e0c409ba92 | 2025-10-23T15:54:46+02:00 | Julien Denize | convert : Make mistral-common dependency optional (#16738) | |
| 243 | d0660f237a5c31771a3d6d1030ebe3e0c409ba92 | fe6a9882acf5c02f96624ed8f80144100d7006cb | 2025-10-23T15:00:49+02:00 | Xuan-Son Nguyen | mtmd-cli : allow using --jinja (#16718) | |
| 244 | fe6a9882acf5c02f96624ed8f80144100d7006cb | 061f0eff02dc9a82f7bd850db3bd70b8a0b5e87a | 2025-10-23T17:07:31+05:30 | Prajwal B Mehendarkar | Manually link -lbsd to resolve flock symbol on AIX (#16610) | |
| 245 | 061f0eff02dc9a82f7bd850db3bd70b8a0b5e87a | 8cf6b42d467d05fa7d9776d2bcc69974ecce6900 | 2025-10-23T19:14:06+08:00 | Aman Gupta | ggml-cuda: use passed ops instead of hardcoded ops (#16712) | |
| 246 | 8cf6b42d467d05fa7d9776d2bcc69974ecce6900 | 9de9672adb0f4ca4e39483ac3ffed52b3f70a55d | 2025-10-23T11:32:24+02:00 | matteo | server : send partial stop string when <EOG> is reached (#15007) | |
| 247 | 9de9672adb0f4ca4e39483ac3ffed52b3f70a55d | 63d2fc46e17a06be5b4b5823a5ada088317f1f0a | 2025-10-22T20:05:15-05:00 | Matthew Michel | sycl: use async memory allocation to fix crashes during graph recording (#16644) | |
| 248 | 63d2fc46e17a06be5b4b5823a5ada088317f1f0a | a2e0088d9242bd9e57f8b852b05a6e47843b5a45 | 2025-10-22T13:47:09-07:00 | Max Krasnyansky | Add experimental ggml-hexagon backend for the Hexagon NPU (#16547) | |
| 249 | 9b9201f65a22c02cee8e300f58f480a588591227 | 19a5a3edfd306516cc419679d69d6435943b6816 | 2025-10-22T16:58:23+02:00 | Pascal | webui: introduce OpenAI-compatible model selector in JSON payload (#16562) | |
| 250 | 19a5a3edfd306516cc419679d69d6435943b6816 | d8eaa26e4d9228df3aa46a930db60c8eaab67c1b | 2025-10-22T05:14:14-05:00 | sirus20x6 | ggml : Leverage the existing GGML_F32_VEC helpers to vectorize ggml_vec_set_f32 for faster fills (#16522) | |
| 251 | d8eaa26e4d9228df3aa46a930db60c8eaab67c1b | 9285325ce0174631c3cd6121d56084adc4ef2d8f | 2025-10-22T12:01:22+02:00 | Acly | tests : fix test-thread-safety when compiling with multiple backends (#16699) | |
| 252 | 9285325ce0174631c3cd6121d56084adc4ef2d8f | 03792ad93609fc67e41041c6347d9aa14e5e0d74 | 2025-10-22T12:33:08+08:00 | Aman Gupta | CUDA: fix bug in topk-moe softmax (#16711) | |
| 253 | 03792ad93609fc67e41041c6347d9aa14e5e0d74 | 51d1a8c997bd2629ef211a30208058ea87a30982 | 2025-10-21T22:40:38+08:00 | Aman Gupta | CUDA: topk-moe: add optional parameter for gpt-oss (#16649) | |
| 254 | 51d1a8c997bd2629ef211a30208058ea87a30982 | 4926419c4d74a1cf724e7163d937eb72f36e7b26 | 2025-10-21T15:27:53+02:00 | Johannes Gäßler | CUDA: better error for FA kernel with 0 occupancy (#16643) | |
| 255 | 4926419c4d74a1cf724e7163d937eb72f36e7b26 | 6ea37f57391d27736c35cd3c20c1f990b7952b74 | 2025-10-21T16:43:14+08:00 | Aman Gupta | ggml: add ggml_can_fuse_subgraph (#16662) | |
| 256 | 6ea37f57391d27736c35cd3c20c1f990b7952b74 | fb349848f387f355450c3187556e71e6d32c145f | 2025-10-20T22:26:17-07:00 | lhez | opencl: fix warnings and clean up profiling (#16688) | |
| 257 | fb349848f387f355450c3187556e71e6d32c145f | 6de8ed75196c7cd98c1f34bbf3a7452451ba8ac2 | 2025-10-20T22:16:08-05:00 | Jeff Bolz | vulkan: Handle FA with all -inf mask values (#16447) | |
| 258 | 6de8ed75196c7cd98c1f34bbf3a7452451ba8ac2 | 84bf3c677857279037adf67cdcfd89eaa4ca9281 | 2025-10-21T01:21:12+03:00 | YehuditE | sycl : add PAD_REFLECT_D1 operator support (#16145) | |
| 259 | 84bf3c677857279037adf67cdcfd89eaa4ca9281 | c9c1972e2c2cc6a771fcc145bfa138700179f961 | 2025-10-20T21:38:20+02:00 | Sigbjørn Skjæret | model : add BailingMoeV2 support (#16063) | |
| 260 | c9c1972e2c2cc6a771fcc145bfa138700179f961 | b617cfd2896edd592a36ebbc041817eb030a1005 | 2025-10-20T19:49:02+02:00 | Aleksander Grygier | Handle legacy 'context' attachments (#16687) | |
| 261 | b617cfd2896edd592a36ebbc041817eb030a1005 | 79068501fac9a74cca7129a8e5a8281b410a853e | 2025-10-20T05:53:50-07:00 | Diego Devesa | ggml-alloc : fix leak when reusing a tensor with a larger size (#16679) | |
| 262 | 79068501fac9a74cca7129a8e5a8281b410a853e | 0e4a0cf2fae667d3efcf52f2f52398779d986b1d | 2025-10-20T14:21:12+02:00 | Aleksander Grygier | Prevent premature submission on IME input (#16673) | |
| 263 | 0e4a0cf2fae667d3efcf52f2f52398779d986b1d | 13f2cfad4170c096c51a02c24a6a158cb47f1480 | 2025-10-20T13:29:14+02:00 | Aleksander Grygier | Import/Export UX improvements (#16619) | |
| 264 | 13f2cfad4170c096c51a02c24a6a158cb47f1480 | 06332e28672356b964d6dfc2ba4657e20581cd43 | 2025-10-20T12:41:13+02:00 | Aleksander Grygier | Enable per-conversation loading states to allow having parallel conversations (#16327) | |
| 265 | 06332e28672356b964d6dfc2ba4657e20581cd43 | 72d53e6c4decee8b339e49aed8cc0e234b9639dc | 2025-10-20T16:27:09+08:00 | takuya kodama | llama-batch: fix build fails with `-Werror=missing-braces` (#16614) | |
| 266 | 72d53e6c4decee8b339e49aed8cc0e234b9639dc | 2330de7b847ca84eac766df372c604c26db72747 | 2025-10-20T10:20:04+02:00 | Ron Evans | readme: update bindings (#16651) | |
| 267 | 2330de7b847ca84eac766df372c604c26db72747 | 7062dd8460685d6700ed7621e50a22c6f3400ca3 | 2025-10-20T11:08:32+03:00 | safranowith | SYCL: Add support for FLOOR,CEIL,ROUND and TRUNC unary operators (#16613) | |
| 268 | 7062dd8460685d6700ed7621e50a22c6f3400ca3 | 0398752dd450dfabdd1b9e289f6364c2600f6ab5 | 2025-10-20T15:44:21+08:00 | takuya kodama | llama-context: only warn on pooling_type when user specified (#16674) | |
| 269 | c20c0a5c0c44179f5267a262546624854b1203d1 | 62425b3a7e8b169a3bbe6ce8c7324513a7fcee8c | 2025-10-20T14:41:08+08:00 | Yunzhe Jia | kv: turn on common-prefix mtmd: fix output size bug | |
| 270 | 0398752dd450dfabdd1b9e289f6364c2600f6ab5 | 4f73d0a95120687e2c527739f771330a5271259a | 2025-10-19T23:54:31+02:00 | Giuseppe Scrivano | model : add Granite Hybrid types (#16635) | |
| 271 | 4f73d0a95120687e2c527739f771330a5271259a | cec5edbcaec69bbf6d5851cabce4ac148be41701 | 2025-10-20T05:06:39+08:00 | Aaron Teo | ci : fix binaries release failure for s390x (binaries may not work yet) (#16664) | |
| 272 | cec5edbcaec69bbf6d5851cabce4ac148be41701 | fcb235b46618921cbd826acd49b553b5302233aa | 2025-10-19T14:03:25+02:00 | Sigbjørn Skjæret | ci : avoid manual updates of docs/ops.md (#16663) | |
| 273 | fcb235b46618921cbd826acd49b553b5302233aa | 55754bebd5d570960cde9c0ba991a0b2991f6b1e | 2025-10-19T18:37:47+08:00 | Aaron Teo | ci: include s390x release binaries (#16648) | |
| 274 | 55754bebd5d570960cde9c0ba991a0b2991f6b1e | ee09828cb057460b369576410601a3a09279e23c | 2025-10-19T15:37:12+08:00 | Aman Gupta | CODEOWNERS: update for ggml-cuda/mmf (#16660) | |
| 275 | ee09828cb057460b369576410601a3a09279e23c | e56abd2098dd2e2b0804691b93c13b48ae421627 | 2025-10-18T14:47:32+02:00 | Johannes Gäßler | HIP: fix GPU_TARGETS (#16642) | |
| 276 | e56abd2098dd2e2b0804691b93c13b48ae421627 | 38355c6c8e43204e11a22daa7483082c0ff01e71 | 2025-10-18T05:22:57-05:00 | Jeff Bolz | vulkan: Implement topk_moe fused shader, ported from CUDA (#16641) | |
| 277 | 38355c6c8e43204e11a22daa7483082c0ff01e71 | 81387858f1fbcc1acedbd308486e1016618ca8f8 | 2025-10-18T17:52:53+08:00 | Aman Gupta | CUDA: use registers instead of smem in topk-moe (#16647) | |
| 278 | 81387858f1fbcc1acedbd308486e1016618ca8f8 | 66b0dbcb2d462e7b70ba5a69ee8c3899ac2efb1c | 2025-10-17T17:55:32-07:00 | Shawn Gu | opencl: transposed gemm/gemv moe kernel with mxfp4,f32 (#16602) | |
| 279 | 66b0dbcb2d462e7b70ba5a69ee8c3899ac2efb1c | 41386cf365d894134ee0813d15e2f5d76f6a4d8e | 2025-10-17T17:41:09+02:00 | Johannes Gäßler | llama-model: fix insonsistent ctxs <-> bufs order (#16581) | |
| 280 | 41386cf365d894134ee0813d15e2f5d76f6a4d8e | 3d4e86bbeb15f487d6da6174ba6191b7c212cc25 | 2025-10-17T18:02:52+03:00 | Radoslav Gerganov | rpc : report actual free memory (#16616) | |
| 281 | 3d4e86bbeb15f487d6da6174ba6191b7c212cc25 | 342c728d031d50673feded797520a44127d73379 | 2025-10-17T14:23:47+02:00 | Giuseppe Scrivano | vulkan: Add State Space Model (SSM) Operations Support (#16463) | |
| 282 | 342c728d031d50673feded797520a44127d73379 | ababae7e1ec3e9cfdab0322ee55ea3389e82a4d5 | 2025-10-17T18:01:23+08:00 | muggle-stack | ggml : fix SpaceMit IME array out-of-bounds in task assignment (#16629) | |
| 283 | ababae7e1ec3e9cfdab0322ee55ea3389e82a4d5 | b19491599d4d42c606601d75e95c1d1de3291f8e | 2025-10-17T10:35:03+02:00 | Pascal | webui: reorganize settings layout (#16607) | |
| 284 | b19491599d4d42c606601d75e95c1d1de3291f8e | 9ad4f1931ee0f3b41d9355245ef744786aaae0aa | 2025-10-17T02:31:04-05:00 | Jeff Bolz | vulkan: fix debug build (add_rms_len/data not found) (#16624) | |
| 285 | 9ad4f1931ee0f3b41d9355245ef744786aaae0aa | 79967ec596c0dacfd2251b085a57e79df292b1cc | 2025-10-17T02:33:58-04:00 | Ilia Ilmer | metal : add `CONV_TRANSPOSE_2D` (#16542) | |
| 286 | 79967ec596c0dacfd2251b085a57e79df292b1cc | ceff6bb253dd306f5404d7ccb3f11fadafe71b52 | 2025-10-17T06:59:31+01:00 | Olivier Chafik | grammar : use int64_t to avoid int overflows in int schema to grammar conversion logic (#16626) | |
| 287 | ceff6bb253dd306f5404d7ccb3f11fadafe71b52 | 1bb4f43380944e94c9a86e305789ba103f5e62bd | 2025-10-17T05:36:40+03:00 | GittyBurstein | SYCL SET operator optimized for F32 tensors (#16350) | |
| 288 | 1bb4f43380944e94c9a86e305789ba103f5e62bd | 683fa6ba4ed3a23b939d3e11e6dc860bd47a0ccf | 2025-10-16T19:00:31+02:00 | Xuan-Son Nguyen | mtmd : support home-cooked Mistral Small Omni (#14928) | |
| 289 | 683fa6ba4ed3a23b939d3e11e6dc860bd47a0ccf | b22572e97dc51757d3ebe917a5a283385010ec68 | 2025-10-16T16:28:41+02:00 | Pascal | fix: added a normalization step for MathJax-style \[\] and \(\) delimiters (#16599) | |
| 290 | b22572e97dc51757d3ebe917a5a283385010ec68 | 7a50cf388a530127cbbdd2a507ef81a451c9d819 | 2025-10-16T16:26:21+03:00 | GittyBurstein | sycl : add ARANGE operator (#16362) | |
| 291 | 62425b3a7e8b169a3bbe6ce8c7324513a7fcee8c | 76a63a2998286c1649de2496bccb7d8a46549895 | 2025-10-16T17:34:39+08:00 | Yunzhe Jia | kv: let seq_rm free whole seq since current hw-op cannot support common-prefix | |
| 292 | 7a50cf388a530127cbbdd2a507ef81a451c9d819 | 6f5d924637a15abedb111cbbffd7da5f31c81855 | 2025-10-16T16:41:11+08:00 | Chenguang Li | CANN: format code using .clang-format (#15863) | |
| 293 | 76a63a2998286c1649de2496bccb7d8a46549895 | b67217078aa748b06e1b2269d88dd18c0aca2c26 | 2025-10-16T16:31:15+08:00 | Yunzhe Jia | kv: fix common-prefix bug by implementing llama_memory_seq_rm | |
| 294 | 6f5d924637a15abedb111cbbffd7da5f31c81855 | adc9b60f190c1016a09f439862fa1cbb302262ac | 2025-10-16T01:11:33-04:00 | takasurazeem | common : Update the docs on -t --threads (#16236) | |
| 295 | adc9b60f190c1016a09f439862fa1cbb302262ac | ee50ee1eadff58777ae746827b04de7ba0befc55 | 2025-10-16T13:10:32+08:00 | takuya kodama | ggml-cpu: replace putenv with setenv for const-correctness (#16573) | |
| 296 | ee50ee1eadff58777ae746827b04de7ba0befc55 | 7adc79c03234de9a20661fd6dbf2d02c32ca7acb | 2025-10-16T07:21:28+03:00 | yael-works | SYCL: Add GGML_OP_MEAN operator support (#16009) | |
| 297 | 7adc79c03234de9a20661fd6dbf2d02c32ca7acb | 466c1911ab736f0b7366127edee99f8ee5687417 | 2025-10-15T22:43:08+02:00 | Aleksei Nikiforov | gguf-py : add support for endian conversion of BF16 data (#16594) | |
| 298 | 466c1911ab736f0b7366127edee99f8ee5687417 | 0cb7a0683b0529172472d74d21f05470a607f297 | 2025-10-15T22:24:51+03:00 | safranowith | cpu : add FLOOR, CEIL, ROUND and TRUNC unary operators (#16083) | |
| 299 | 0cb7a0683b0529172472d74d21f05470a607f297 | d93f8439b08c4f35e13a41a7366901fdbe770fc8 | 2025-10-15T10:51:04-07:00 | lhez | opencl: add q8_0 mm support (#16469) | |
| 300 | d93f8439b08c4f35e13a41a7366901fdbe770fc8 | f9fb33f2630b4b4ba9081ce9c0c921f8cd8ba4eb | 2025-10-15T10:48:28-07:00 | lhez | opencl: fix FA for f32 (#16584) | |
| 301 | f9fb33f2630b4b4ba9081ce9c0c921f8cd8ba4eb | f4ce81c45e7bd910e36bf44c253fc5255c49b1e4 | 2025-10-15T16:22:20+02:00 | Aleksander Grygier | Add server-driven parameter defaults and syncing (#16515) | |
| 302 | f4ce81c45e7bd910e36bf44c253fc5255c49b1e4 | 17304cbcc1dd24de7741cbe57925d58e90a98ac1 | 2025-10-15T23:05:56+09:00 | Sam/Samuel | metal: optimise `GGML_OP_SUM` (#16559) | |
| 303 | 17304cbcc1dd24de7741cbe57925d58e90a98ac1 | 3e3cb19f6449f9168a128eaeae01f8f41b049acc | 2025-10-15T16:53:12+03:00 | Georgi Gerganov | server : fix img token logs (#16595) | |
| 304 | 3e3cb19f6449f9168a128eaeae01f8f41b049acc | 5acd455460f457942d8dd02e3dd9b1eebfce99fe | 2025-10-15T14:48:08+02:00 | Xuan-Son Nguyen | llama-quant: add support for mmproj (#16592) | |
| 305 | 5acd455460f457942d8dd02e3dd9b1eebfce99fe | 554fd578a5ed78a10f371f5850c6a69aa83df15a | 2025-10-15T13:54:15+02:00 | Julius Tischbein | CUDA: Changing the CUDA scheduling strategy to spin (#16585) | |
| 306 | 554fd578a5ed78a10f371f5850c6a69aa83df15a | fa882fd2b1bcb663de23af06fdc391489d05b007 | 2025-10-15T12:51:27+03:00 | Georgi Gerganov | server : fix mtmd checkpoints (#16591) | |
| 307 | fa882fd2b1bcb663de23af06fdc391489d05b007 | ffa059034c1e41f3e58363ef3c46d2fcf854bc4d | 2025-10-14T20:33:05+03:00 | Georgi Gerganov | metal : avoid using Metal's gpuAddress property (#16576) | |
| 308 | ffa059034c1e41f3e58363ef3c46d2fcf854bc4d | 120bf7046d85a893f064c12abe58bfeebd735f84 | 2025-10-14T19:18:05+02:00 | SavicStefan | vulkan: Add ACC_TYPE_VEC2 implementation (#16203) | |
| 309 | 120bf7046d85a893f064c12abe58bfeebd735f84 | 4258e0cfe72c72ad2787be1e9f93253e89219455 | 2025-10-14T22:48:08+08:00 | Aman Gupta | CUDA + openCL: fix bug in accessing rms_norm->src while doing fusion (#16577) | |
| 310 | 4258e0cfe72c72ad2787be1e9f93253e89219455 | 7ea15bb64c81e3813eb0babf9a57e1bc5697f569 | 2025-10-14T08:53:37-05:00 | Jeff Bolz | vulkan: Support FA with K/V in F32 (#16543) | |
| 311 | 7ea15bb64c81e3813eb0babf9a57e1bc5697f569 | 9c7185dd28416cf67f5e3b268381f311b5e3da56 | 2025-10-14T07:51:36-05:00 | Jeff Bolz | vulkan: Improve build time for MSVC (#16545) | |
| 312 | 9c7185dd28416cf67f5e3b268381f311b5e3da56 | 1ee9d0b415cdf5240418c110a18b419f4002b154 | 2025-10-14T14:22:47+02:00 | Johannes Gäßler | CUDA: enable FA for FP32 KV cache (#16546) | |
| 313 | 1ee9d0b415cdf5240418c110a18b419f4002b154 | 48e2fa9fb7c2de1e53808fdb65ec33f916020fc4 | 2025-10-14T19:16:21+08:00 | Aman Gupta | CUDA: use fastdiv + ggml_cuda_mad for mmvf (#16557) | |
| 314 | 48e2fa9fb7c2de1e53808fdb65ec33f916020fc4 | 5b6913c47b6bc71a6f927805a45387d5657d8b89 | 2025-10-14T19:15:15+08:00 | Aman Gupta | CUDA: add fp kernel for larger batch size MoE (#16512) | |
| 315 | 5b6913c47b6bc71a6f927805a45387d5657d8b89 | bc07349a7f87ba6eb31ed4b0ea9d9a7352185213 | 2025-10-14T09:53:49Z | Anav Prasad | cuda : remove legacy copy-op pointer indirection code (#16485) | |
| 316 | bc07349a7f87ba6eb31ed4b0ea9d9a7352185213 | e60f241eacec42d3bd7c9edd37d236ebf35132a8 | 2025-10-14T08:48:50+03:00 | Georgi Gerganov | server : dynamic token limit for prompt cache (#16560) | |
| 317 | e60f241eacec42d3bd7c9edd37d236ebf35132a8 | e38b7c6e9e4453e3b3e96d76e38bc2ccb6bce458 | 2025-10-13T23:07:57+03:00 | Georgi Gerganov | metal : FA support F32 K and V and head size = 32 (#16531) | |
| 318 | e38b7c6e9e4453e3b3e96d76e38bc2ccb6bce458 | 5016b7286240d29f8f640039989b84ea3a854344 | 2025-10-13T22:42:37+03:00 | Georgi Gerganov | graph : support cacheless embeddings with FA and iSWA (#16528) | |
| 319 | 5016b7286240d29f8f640039989b84ea3a854344 | 7049736b2dd9011bf819e298b844ebbc4b5afdc9 | 2025-10-13T11:50:37-07:00 | lhez | opencl: fix build targeting CL 2 (#16554) | |
| 320 | 7049736b2dd9011bf819e298b844ebbc4b5afdc9 | 01d2bdc2bc61b676706830305b286b08b9885a41 | 2025-10-13T16:29:45+02:00 | Johannes Gäßler | CUDA: fix numerical issues in tile FA kernel (#16540) | |
| 321 | 01d2bdc2bc61b676706830305b286b08b9885a41 | 56fc38b9655fbe1869d8bd6cfb269418196cea69 | 2025-10-13T20:48:47+08:00 | Jie Fu (傅杰) | ggml : fix build broken with -march=armv9-a on MacOS (#16520) | |
| 322 | 56fc38b9655fbe1869d8bd6cfb269418196cea69 | 1fb9504eb744969a990bfe4cfcf1d3d7a479541c | 2025-10-13T17:01:24+08:00 | Chenguang Li | CANN: fix CPU memory leak in CANN backend (#16549) | |
| 323 | 1fb9504eb744969a990bfe4cfcf1d3d7a479541c | 3f750f8d760ab5a61491e6a9409072dfeee4b4d7 | 2025-10-13T10:55:32+02:00 | Pascal | fix: add remark plugin to render raw HTML as literal text (#16505) | |
| 324 | b67217078aa748b06e1b2269d88dd18c0aca2c26 | 98c8269abefdfa8fde47dfb2769ceebc8b704e86 | 2025-10-13T11:48:14+08:00 | Yunzhe Jia | add different path for unified and seperate compilation | |
| 325 | 3f750f8d760ab5a61491e6a9409072dfeee4b4d7 | c515fc577166042234241c6bd0da9b08dcbe2bb9 | 2025-10-13T16:25:02+08:00 | Sam/Samuel | metal: add support for opt_step_sgd (#16539) | |
| 326 | c515fc577166042234241c6bd0da9b08dcbe2bb9 | f9bc66c3ebcfddb5f09e4b21253623caeb8e414a | 2025-10-13T11:22:27+03:00 | Georgi Gerganov | ggml : fix scalar path for computing norm (#16558) | |
| 327 | f9bc66c3ebcfddb5f09e4b21253623caeb8e414a | a31cf36ad946a13b3a646bf0dadf2a481e89f944 | 2025-10-13T08:52:22+08:00 | hipudding | CANN: Update several operators to support FP16 data format (#16251) | |
| 328 | a31cf36ad946a13b3a646bf0dadf2a481e89f944 | 81d54bbfd599811b354c39f04550888168be7780 | 2025-10-13T02:43:14+08:00 | Sam/Samuel | metal : add opt_step_adamw and op_sum (#16529) | |
| 329 | 81d54bbfd599811b354c39f04550888168be7780 | c7be9febcbafa9af7d1b9443f86475c59c9c5f87 | 2025-10-12T18:06:41+02:00 | Pascal | webui: remove client-side context pre-check and rely on backend for limits (#16506) | |
| 330 | c7be9febcbafa9af7d1b9443f86475c59c9c5f87 | 8415f61e23d04427cd0d912fbb9d33b85f849456 | 2025-10-12T21:53:35+08:00 | Neo Zhang Jianyu | [SYCL] fix UT fault cases: count-equal, argsort, pad OPs (#16521) | |
| 331 | 8415f61e23d04427cd0d912fbb9d33b85f849456 | 2c301e91abb92d03c1a682b4b540ba835562a74b | 2025-10-12T15:48:03+02:00 | Mathieu Baudier | ci : add Vulkan on Ubuntu with default packages build (#16532) | |
| 332 | 2c301e91abb92d03c1a682b4b540ba835562a74b | 4b2dae383df708e2afc49c4859a81cd074f5ac10 | 2025-10-12T08:18:47-05:00 | Aldehir Rojas | common : handle unicode during partial json parsing (#16526) | |
| 333 | 4b2dae383df708e2afc49c4859a81cd074f5ac10 | 41aac5c69b5fb281bc1f486afb053f78101bb39e | 2025-10-12T09:29:13+03:00 | Georgi Gerganov | common : update presets (#16504) | |
| 334 | 41aac5c69b5fb281bc1f486afb053f78101bb39e | a2fba89a426ff8005d303c73f0436e7e67368b70 | 2025-10-12T00:25:37-05:00 | sirus20x6 | ggml : Fix FP16 ELU positive branch (#16519) | |
| 335 | a2fba89a426ff8005d303c73f0436e7e67368b70 | 20cc625edc2264aae2779e71bef1593e6a4e8c43 | 2025-10-12T07:19:06+02:00 | Daniel Bevenius | hparams : add check for layer index in is_recurrent (#16511) | |
| 336 | 20cc625edc2264aae2779e71bef1593e6a4e8c43 | 11f0af5504252e453d57406a935480c909e3ff37 | 2025-10-12T00:15:00-05:00 | sirus20x6 | ggml: Correct SVE implementation in ggml_vec_dot_f16_unroll (#16518) | |
| 337 | 11f0af5504252e453d57406a935480c909e3ff37 | a3cb04744fb5c591985f53b749fef5407d07a145 | 2025-10-11T20:54:32+02:00 | Johannes Gäßler | CUDA: faster tile FA, add oob checks, more HSs (#16492) | |
| 338 | a3cb04744fb5c591985f53b749fef5407d07a145 | 4a8fbe0a5eb75f339782ebcf29c17848122184d3 | 2025-10-11T16:54:10+03:00 | Georgi Gerganov | metal : fix mul-mm condition + fix mul-mv permuted kernels (#16494) | |
| 339 | 4a8fbe0a5eb75f339782ebcf29c17848122184d3 | 31d0ff1869aa2ea31f4e96d5877d0343e9a2171b | 2025-10-11T15:50:49+02:00 | Pascal | feat: render user content as markdown option (#16358) | |
| 340 | 31d0ff1869aa2ea31f4e96d5877d0343e9a2171b | 97870e64975b26c5e06a3540a8dc0ff601351e86 | 2025-10-11T21:39:04+08:00 | Yann Follet | server / ranking : add sorting and management of top_n (#16403) | |
| 341 | 97870e64975b26c5e06a3540a8dc0ff601351e86 | 477a66b03501cf3bd067f8968b77ca4d053ff1bd | 2025-10-11T04:02:26-07:00 | Diego Devesa | cuda : avoid initializing unused devices (#16510) | |
| 342 | 477a66b03501cf3bd067f8968b77ca4d053ff1bd | e60f01d941bc5b7fae62dd57fee4cec76ec0ea6e | 2025-10-11T11:33:41+03:00 | amirai21 | convert : correctly handle LLaMA tokenizer for Jamba (#16470) | |
| 343 | e60f01d941bc5b7fae62dd57fee4cec76ec0ea6e | 81086cd6a3ca1252f0dc0f938171648399179c53 | 2025-10-10T22:15:05+03:00 | Georgi Gerganov | server : fix division by zero when reporting stats (#16501) | |
| 344 | 81086cd6a3ca1252f0dc0f938171648399179c53 | 68ee98ae181a5c83a5cc6261daeee69a1f588c15 | 2025-10-10T17:17:31+03:00 | Georgi Gerganov | vocab : mark EOT token for Granite models (#16499) | |
| 345 | 68ee98ae181a5c83a5cc6261daeee69a1f588c15 | cdb6da468cc33323955a523738d2e1675aeb5e9a | 2025-10-10T17:11:07+03:00 | Radoslav Gerganov | server : return HTTP 400 if prompt exceeds context length (#16486) | |
| 346 | cdb6da468cc33323955a523738d2e1675aeb5e9a | 6d69ab3f262eca3f0c6ad0ce075d2c80b9924d0e | 2025-10-10T13:22:27+03:00 | Radoslav Gerganov | server : log requests to /v1/completions (#16495) | |
| 347 | 6d69ab3f262eca3f0c6ad0ce075d2c80b9924d0e | 1faa13a1187051af66b0fd9f0d6effe4c77f0b3e | 2025-10-10T13:45:46+05:30 | Prajwal B Mehendarkar | cmake : Dont define XOPENSOURCE on AIX (#16481) | |
| 348 | 1faa13a1187051af66b0fd9f0d6effe4c77f0b3e | 1deee0f8d494981c32597dca8b5f8696d399b0f2 | 2025-10-09T22:54:57+02:00 | Pascal | webui: updated the chat service to only include max_tokens in the req… (#16489) | |
| 349 | 1deee0f8d494981c32597dca8b5f8696d399b0f2 | d00cbea63c671cd85a57adaa50abf60b3b87d86f | 2025-10-09T22:11:15+03:00 | duduta | cpu : optimize the ggml NORM operation (#15953) | |
| 350 | d00cbea63c671cd85a57adaa50abf60b3b87d86f | 8328fd4bae76fc027f8ca0e9a05acd3788dabe3f | 2025-10-09T18:54:51+03:00 | Georgi Gerganov | server : host-memory prompt caching (#16391) | |
| 351 | 8328fd4bae76fc027f8ca0e9a05acd3788dabe3f | 56b4795842d852152222ca7a2d4304008facf1b9 | 2025-10-09T17:36:29+02:00 | Pascal | No markdown in cot (#16483) | |
| 352 | 56b4795842d852152222ca7a2d4304008facf1b9 | 2c0d875ae6c6043fbbafd2831e160955e9ca6af1 | 2025-10-09T14:35:22+02:00 | Daniel Bevenius | model-conversion : add support for SentenceTransformers (#16387) | |
| 353 | 2c0d875ae6c6043fbbafd2831e160955e9ca6af1 | aa4711d369b0d4adb6802b98ad6ea362f838710e | 2025-10-09T09:13:18+01:00 | sudhiarm | ci: add ARM64 Kleidiai build and test support (#16462) | |
| 354 | aa4711d369b0d4adb6802b98ad6ea362f838710e | d80d6d2400b8faa80654c723cb5bdf9fc8f4db06 | 2025-10-09T15:50:25+08:00 | Chenguang Li | CANN: Improve ACL graph matching (#16166) | |
| 355 | d80d6d2400b8faa80654c723cb5bdf9fc8f4db06 | b2602137557b2b28a39e03612717d85ead9a6f5a | 2025-10-09T09:29:17+02:00 | Charles Xu | kleidiai: kernel interface refactoring (#16460) | |
| 356 | b2602137557b2b28a39e03612717d85ead9a6f5a | e08db4259521de493b7aeb49dadf29ebd1ee966a | 2025-10-09T15:25:11+08:00 | Neo Zhang Jianyu | [SYCL] refactor soft_max, add soft_max_back (#16472) | |
| 357 | e08db4259521de493b7aeb49dadf29ebd1ee966a | 12bbc3fa50b6df03318a4451c9a2210200a0b28d | 2025-10-09T08:39:18+02:00 | Saba Fallah | model: EmbeddingGemma Adding Support for SentenceTransformers Dense Modules (#16367) | |
| 358 | 12bbc3fa50b6df03318a4451c9a2210200a0b28d | 9d0882840e6c3fb62965d03af0e22880ea90e012 | 2025-10-08T22:18:41+02:00 | Pascal | refactor: centralize CoT parsing in backend for streaming mode (#16394) | |
| 359 | 9d0882840e6c3fb62965d03af0e22880ea90e012 | d2ee056e1df0fdf646270fb5621e9f92084b59a7 | 2025-10-08T20:21:46+02:00 | ai-fonsi | Disable CUDA host buffers on integrated GPUs (#16308) | |
| 360 | d2ee056e1df0fdf646270fb5621e9f92084b59a7 | b2c08c9ec4cd59ed88c1ebdd94f109af5ccc978e | 2025-10-08T17:20:18+09:00 | issixx | server : fix cancel pending task (#16467) | |
| 361 | b2c08c9ec4cd59ed88c1ebdd94f109af5ccc978e | 7fdd16b432d247121fe5fe7b21f8805f85266c85 | 2025-10-08T10:57:53+03:00 | Georgi Gerganov | metal : mark FA blocks (#16372) | |
| 362 | 7fdd16b432d247121fe5fe7b21f8805f85266c85 | 74b8fc17f92ada295a648e3c5eb28f46bca7d892 | 2025-10-08T10:57:29+03:00 | Georgi Gerganov | server : improve context checkpoint logic (#16440) | |
| 363 | 74b8fc17f92ada295a648e3c5eb28f46bca7d892 | aeaf8a36f06b5810f5ae4bbefe26edb33925cf5e | 2025-10-07T13:48:56-07:00 | Reese Levine | ggml webgpu: profiling, CI updates, reworking of command submission (#16452) | |
| 364 | aeaf8a36f06b5810f5ae4bbefe26edb33925cf5e | df1b612e29ba97a2e67db339b1e8c7465702b7e8 | 2025-10-07T20:03:35+02:00 | Tarek Dakhran | llama : support LiquidAI LFM2-MoE hybrid model (#16464) | |
| 365 | df1b612e29ba97a2e67db339b1e8c7465702b7e8 | 4e0388aa8a1f4ef1065701dc9c3947aea0a1b9a5 | 2025-10-07T15:57:14+03:00 | Georgi Gerganov | server : add `/v1/health` endpoint (#16461) | |
| 366 | 4e0388aa8a1f4ef1065701dc9c3947aea0a1b9a5 | ef4c5b87ea2556ff8ca99cca3abdf48bdbca22f2 | 2025-10-07T11:11:08+02:00 | Sascha Rogmann | webui : added download action (#13552) (#16282) | |
| 367 | ef4c5b87ea2556ff8ca99cca3abdf48bdbca22f2 | c61ae20d05bd4fdd8551311325a2845336449426 | 2025-10-07T10:32:32+03:00 | Georgi Gerganov | presets : fix pooling param for embedding models (#16455) | |
| 368 | c61ae20d05bd4fdd8551311325a2845336449426 | 0123ff38f53d34752f29239a29d0e40a6dc4110f | 2025-10-07T09:59:13+03:00 | Radoslav Gerganov | rpc : update documentation (#16441) | |
| 369 | 0123ff38f53d34752f29239a29d0e40a6dc4110f | 0a319bb75ed29d968e2a9b544011b09ccb932915 | 2025-10-07T08:24:17+03:00 | Georgi Gerganov | memory : use sequential equal splits for recurrent modules (#16442) | |
| 370 | 0a319bb75ed29d968e2a9b544011b09ccb932915 | 1d6092fc72f4d10f4486ac95edfd414bc08b62b8 | 2025-10-07T08:23:30+03:00 | Georgi Gerganov | metal : add support for non-padded FA KV (#16148) | |
| 371 | 1d6092fc72f4d10f4486ac95edfd414bc08b62b8 | 8ae32dc9ecd7aeebf3a5b43557e0552a0a04cd4f | 2025-10-07T08:22:35+03:00 | Georgi Gerganov | tests : add -INF blocks to the KQ mask in the FA tests (#16380) | |
| 372 | 8ae32dc9ecd7aeebf3a5b43557e0552a0a04cd4f | 3df2244df40c67dfd6ad548b40ccc507a066af2b | 2025-10-07T08:21:40+03:00 | Georgi Gerganov | metal : various optimizations + refactoring (#16446) | |
| 373 | 3df2244df40c67dfd6ad548b40ccc507a066af2b | c08002a1988348403a5fd59b1fa3de3a10a6f92f | 2025-10-06T12:55:53-05:00 | Gadflyii | llama : add --no-host to disable host buffers (#16310) | |
| 374 | c08002a1988348403a5fd59b1fa3de3a10a6f92f | 3a002afafa8e06555f11aed88b02d055d8a166f3 | 2025-10-06T10:59:40-06:00 | Gabe Goodhart | chat : Granite Docling stopping (#16438) | |
| 375 | 3a002afafa8e06555f11aed88b02d055d8a166f3 | a23b9bdbd3b64ce172f9962249f432d01aea7437 | 2025-10-06T17:40:21+02:00 | Sigbjørn Skjæret | ci : refactor sdk caching to minimize storage (#16414) | |
| 376 | a23b9bdbd3b64ce172f9962249f432d01aea7437 | 04e632a4aab8e6bfff0f8bc216b36ceb1e199ff9 | 2025-10-06T16:05:27+03:00 | Georgi Gerganov | ggml : fix unaligned access in AMX code (#16315) | |
| 377 | 04e632a4aab8e6bfff0f8bc216b36ceb1e199ff9 | a80ff183abe4e5a76316257ffa597da41b3b6fa0 | 2025-10-06T14:56:59+02:00 | Daniel Bevenius | ci : remove missing reranker model files (#16444) | |
| 378 | a80ff183abe4e5a76316257ffa597da41b3b6fa0 | 1d49ca37594fb49db6aa9518ba7c512e5ccd0108 | 2025-10-06T14:17:12+02:00 | Daniel Bevenius | ggml-cpu : fix leftover handling in ggml_vec_scale_f32 for SVE (#16443) | |
| 379 | 1d49ca37594fb49db6aa9518ba7c512e5ccd0108 | c5fef0fcea3b978a2318b1af170209ecec7c37b4 | 2025-10-06T09:29:56Z | Yuannan | nix : removed metal for nix (#16118) | |
| 380 | c5fef0fcea3b978a2318b1af170209ecec7c37b4 | ca71fb9b368e3db96e028f80c4c9df6b6b370edd | 2025-10-06T03:53:31-04:00 | Oleksandr Kuvshynov | server: update readme to mention n_past_max metric (#16436) | |
| 381 | ca71fb9b368e3db96e028f80c4c9df6b6b370edd | 35266573b968e1c947b367782fb4b3eddbb4f3c0 | 2025-10-05T06:57:47-06:00 | Gabe Goodhart | model : Granite docling + Idefics3 preprocessing (SmolVLM) (#16206) | |
| 382 | 35266573b968e1c947b367782fb4b3eddbb4f3c0 | 86df2c9ae4f2f1ee63d2558a9dc797b98524639b | 2025-10-04T20:59:31-07:00 | Reese Levine | ggml webgpu: actually add softmax, fix rms_norm offset (#16400) | |
| 383 | 86df2c9ae4f2f1ee63d2558a9dc797b98524639b | f39283960b58a92ecc0c72567711318b20e22b55 | 2025-10-04T20:04:27Z | Eve | vulkan: use a more appropriate amount of threads when generating shaders (#16418) | |
| 384 | f39283960b58a92ecc0c72567711318b20e22b55 | 898acba6816ad23b6a9491347d30e7570bffadfd | 2025-10-04T16:22:45+03:00 | Radoslav Gerganov | rpc : check src buffer when copying tensor (#16421) | |
| 385 | 898acba6816ad23b6a9491347d30e7570bffadfd | e29acf74fea996014380d59d31aa504ae8964258 | 2025-10-04T12:49:16+03:00 | Radoslav Gerganov | rpc : add support for multiple devices (#16276) | |
| 386 | e29acf74fea996014380d59d31aa504ae8964258 | 128d522c04286e019666bd6ee4d18e3fbf8772e2 | 2025-10-04T11:42:56+02:00 | Acly | vulkan : incremental shader builds (#16341) | |
| 387 | 128d522c04286e019666bd6ee4d18e3fbf8772e2 | f6dcda390004b627ef30af378d0c01ad2519289e | 2025-10-03T20:51:48+02:00 | Pascal | chat : support Magistral thinking (#16413) | |
| 388 | f6dcda390004b627ef30af378d0c01ad2519289e | 606a73f53175077429484b23dcf799f69a31d0bd | 2025-10-03T13:34:51-05:00 | ddh0 | server : context checkpointing for hybrid and recurrent models (#16382) | |
| 389 | 606a73f53175077429484b23dcf799f69a31d0bd | 946f71ed9ade07e319859b5ce656144140e066fb | 2025-10-03T19:18:56+03:00 | Georgi Gerganov | metal : fix loop bound in ggml_mem_ranges (#16412) | |
| 390 | 946f71ed9ade07e319859b5ce656144140e066fb | 638d330246954e88dffc22ce01fec15e6894e544 | 2025-10-03T14:40:25+02:00 | Sigbjørn Skjæret | llama : fix shapes for bert/mpt q/k norm (#16409) | |
| 391 | 638d330246954e88dffc22ce01fec15e6894e544 | 84c8e305e8010a1a3d43bdd0a25f737ac67809a4 | 2025-10-03T13:49:08+02:00 | Acly | ggml : fix graph reallocation with multiple chunks (#16396) | |
| 392 | 84c8e305e8010a1a3d43bdd0a25f737ac67809a4 | 2aaf0a2a2056d75d0dd53ab8a181473760e6ab22 | 2025-10-03T12:51:40+02:00 | Aleksander Grygier | Fix missing messages on sibling navigation (#16408) | |
| 393 | 2aaf0a2a2056d75d0dd53ab8a181473760e6ab22 | 0e1f83855609d73beaf05d818640b6cfd39d287b | 2025-10-03T05:50:46-05:00 | Jeff Bolz | vulkan: Replace uses of maxMemoryAllocationSize and VK_WHOLE_SIZE (#16354) | |
| 394 | 0e1f83855609d73beaf05d818640b6cfd39d287b | ad126479c25cf983a0f994a08ba0911cf49ed62b | 2025-10-03T04:52:46-05:00 | Jeff Bolz | vulkan: Fix FA coopmat1 invalid array indexing (#16365) | |
| 395 | ad126479c25cf983a0f994a08ba0911cf49ed62b | 77233277c912d495d1069543ca540c21a2f9e5b4 | 2025-10-03T11:45:16+02:00 | Daniel Bevenius | ci : change macos-13 to macos-15-intel (#16401) | |
| 396 | 77233277c912d495d1069543ca540c21a2f9e5b4 | e308efda8e54e3f07578937a45a5d83624eb7970 | 2025-10-03T11:30:39+02:00 | Aleksander Grygier | Capture model name only after first token (streaming) or completed request (#16405) | |
| 397 | e308efda8e54e3f07578937a45a5d83624eb7970 | 136bda78c5679b266362b39c58338fff46fd2592 | 2025-10-03T03:33:08-05:00 | Jeff Bolz | vulkan: in flash attention, bounds check against nem1 (don't rely on GGML_KQ_MASK_PAD) (#16316) | |
| 398 | 136bda78c5679b266362b39c58338fff46fd2592 | 5113efd34ceda709292de26c72716c49e024fb32 | 2025-10-03T09:11:34+02:00 | Aleksander Grygier | webui : Fix messages payload sent to chat completions (#16402) | |
| 399 | 5113efd34ceda709292de26c72716c49e024fb32 | d64c8104f090b27b1f99e8da5995ffcfa6b726e2 | 2025-10-03T08:01:31+02:00 | Pascal | fix: track viewportHeight via window.innerHeight to avoid unwanted scrolling (#16356) | |
| 400 | d64c8104f090b27b1f99e8da5995ffcfa6b726e2 | ef07a4090672a3438d7f64f197795d7dc1c18957 | 2025-10-02T20:10:12+02:00 | Sigbjørn Skjæret | test-barrier : do not use more threads than physically available (#16389) | |
| 401 | ef07a4090672a3438d7f64f197795d7dc1c18957 | 34fcc5a4ace8c69476ef2ea3857f39a60334acc4 | 2025-10-02T11:00:31-07:00 | Reese Levine | ggml webgpu: add support for soft_max, optimize rms_norm (#16357) | |
| 402 | 34fcc5a4ace8c69476ef2ea3857f39a60334acc4 | 91a2a5655658bb9ab77894716b82fae7ecb4b4d1 | 2025-10-02T19:43:22+02:00 | Piotr Wilkin (ilintar) | model : Apertus model implementation (#15852) | |
| 403 | 91a2a5655658bb9ab77894716b82fae7ecb4b4d1 | 72ee736c447be4ededb51ab97904b4d33c90c261 | 2025-10-02T21:29:56+08:00 | R0CKSTAR | musa: update compile flags (#16265) | |
| 404 | 72ee736c447be4ededb51ab97904b4d33c90c261 | f09aefaa84d7f4d5df3f400f67944b94fef5b795 | 2025-10-02T13:51:36+02:00 | Sigbjørn Skjæret | ci : fix ubuntu-latest-cmake-rpc (disable ccache) (#16388) | |
| 405 | f09aefaa84d7f4d5df3f400f67944b94fef5b795 | bbd32bc0384fbfcf07369617de58856b1e0e95a3 | 2025-10-02T08:10:07Z | Eve | ci: update vulkan ci (#16294) | |
| 406 | bbd32bc0384fbfcf07369617de58856b1e0e95a3 | 2be72c2b121ee99f33927149265ce6073ade9e59 | 2025-10-02T10:35:43+03:00 | Georgi Gerganov | ci : fix clean-up of old logs (#16381) | |
| 407 | 2be72c2b121ee99f33927149265ce6073ade9e59 | 95ce0985449c52fb9d6849b95563f7cf933ea0e3 | 2025-10-02T15:16:25+08:00 | Neo Zhang Jianyu | SYCL: Update to oneAPI 2025.2 (#16371) | |
| 408 | 95ce0985449c52fb9d6849b95563f7cf933ea0e3 | c8dedc9999eccf7821a9fe5b29f10e8d075e2217 | 2025-10-02T05:52:59+02:00 | uvos | HIP: add IMbackK to codeowner (#16375) | |
| 409 | c8dedc9999eccf7821a9fe5b29f10e8d075e2217 | e95fec640f43623911a2cd5bda8b19b1898c530c | 2025-10-01T23:32:39+02:00 | uvos | CI: reenable cdna in rocm docker builds (#16376) | |
| 410 | e95fec640f43623911a2cd5bda8b19b1898c530c | ded67b94446ef4f7fd988dbde7a12deef9870c13 | 2025-10-01T23:09:25+02:00 | uvos | HIP: Disable ROCWMMA fattn on CDNA when compiled against ROCWMMA 2.0.0 (#16221) | |
| 411 | ded67b94446ef4f7fd988dbde7a12deef9870c13 | 1fe4e38cc20af058ed320bd46cac934991190056 | 2025-10-02T06:08:15+09:00 | Shunta Saito | llama : parameter conversion and loading fixes for PLaMo2 variants (#16075) | |
| 412 | 1fe4e38cc20af058ed320bd46cac934991190056 | 4201deae9c2ae4732db8957b6ce0808d02ec597c | 2025-10-01T20:18:03+02:00 | uvos | ci: Properly install rocwmma for hip builds (#16305) | |
| 413 | 4201deae9c2ae4732db8957b6ce0808d02ec597c | 764799279f801c696503bacca490b4358587d94c | 2025-10-01T19:22:18+02:00 | Adrien Gallouët | common: introduce http.h for httplib-based client (#16373) | |
| 414 | 764799279f801c696503bacca490b4358587d94c | 2a9b63383a448ec18c754dfdc6e95cb853940a52 | 2025-10-01T18:18:10+02:00 | Aleksander Grygier | Conversation action dialogs as singletons from Chat Sidebar + apply conditional rendering for Actions Dropdown for Chat Conversation Items (#16369) | |
| 415 | 2a9b63383a448ec18c754dfdc6e95cb853940a52 | 1104ca1a1c926b832274694a2773a17066982ad0 | 2025-10-01T15:54:42+02:00 | Aleksander Grygier | Improve code block color theming (#16325) | |
| 416 | 1104ca1a1c926b832274694a2773a17066982ad0 | 4f1575921cac9b489fe8f8bbf20aff985e7da45e | 2025-10-01T14:09:52+02:00 | Sigbjørn Skjæret | ci : use registry cache for docker builds (#16366) | |
| 417 | 132d673554e65282e92505f4f77401ab971528bb | aa9538a63aef35f0224b2502f13b19d650a8ce04 | 2025-10-01T07:56:36Z | Eve | vulkan: make ggml_vk_default_dispatcher support older vulkan headers (#16345) | |
| 418 | aa9538a63aef35f0224b2502f13b19d650a8ce04 | e74c92e84236b2bab3f3c77bee4ead94928be360 | 2025-10-01T07:40:26+02:00 | Aleksander Grygier | webui: Remove running `llama-server` within WebUI `dev.sh` script (#16363) | |
| 419 | e74c92e84236b2bab3f3c77bee4ead94928be360 | b2ba81dbe07b6dbea9c96b13346c66973dede32c | 2025-09-30T16:24:36-04:00 | Bartowski | model : support GLM 4.6 (make a few NextN/MTP tensors not required) (#16359) | |
| 420 | b2ba81dbe07b6dbea9c96b13346c66973dede32c | bf6f3b3a1965d70e07ca94aab7b01268fe483e96 | 2025-09-30T21:41:42+02:00 | Sigbjørn Skjæret | ci : fix ccache key for ubuntu-cpu-cmake (#16355) | |
| 421 | bf6f3b3a1965d70e07ca94aab7b01268fe483e96 | 7c156df4148eb524b22f7f363bfd2df00f264e0b | 2025-09-30T19:52:41+02:00 | Adrien Gallouët | common : disable progress bar without a tty (#16352) | |
| 422 | 7c156df4148eb524b22f7f363bfd2df00f264e0b | 16b0ca0d2e63fc1a0a43795f8552f9cb61d9f7a5 | 2025-09-30T10:45:45-07:00 | lhez | opencl: support pad_ext (#15888) | |
| 423 | 16b0ca0d2e63fc1a0a43795f8552f9cb61d9f7a5 | 8d78cd2613ccdeb3cc86f59bc8f9ddd31cfbd3ed | 2025-09-30T19:18:54+02:00 | Pascal | Chatapi ignore empty sampling (#16330) | |
| 424 | 8d78cd2613ccdeb3cc86f59bc8f9ddd31cfbd3ed | d1c84a662daa91be975863913a59975b11458141 | 2025-09-30T09:57:51-07:00 | Reese Levine | ggml webgpu: support for rope,div,sub,glu,scale,cont operators (#16187) | |
| 425 | d1c84a662daa91be975863913a59975b11458141 | 364a7a6d4a786e98947c8a90430ea581213c0ba9 | 2025-09-30T09:55:13-07:00 | lhez | opencl: support ne3 in get_rows (#15866) | |
| 426 | 364a7a6d4a786e98947c8a90430ea581213c0ba9 | 2df5bcf357dba0c49b4df1d684b2ffc9e88b7054 | 2025-09-30T16:39:44+02:00 | Adrien Gallouët | common : remove common_has_curl() (#16351) | |
| 427 | 2df5bcf357dba0c49b4df1d684b2ffc9e88b7054 | 075c01567bb7e93965ae60b7e119182c3e68f3e9 | 2025-09-30T15:38:01+02:00 | Sigbjørn Skjæret | ci : disable ccache for android (#16348) | |
| 428 | 075c01567bb7e93965ae60b7e119182c3e68f3e9 | a014310374a16f9204f2bcc1b458fc1eda67e469 | 2025-09-30T13:42:39+03:00 | Georgi Gerganov | ggml : bump version to 0.9.4 (ggml/1363) | |
| 429 | 98c8269abefdfa8fde47dfb2769ceebc8b704e86 | 2790ecc304e384d9075c55d0628d8bf440025dc4 | 2025-09-30T17:42:57+08:00 | Yunzhe Jia | server: adapt to calrt | |
| 430 | 2790ecc304e384d9075c55d0628d8bf440025dc4 | f528e97d894b4d93934a0711a00253eea980e799 | 2025-09-30T17:37:58+08:00 | Yunzhe Jia | adapt to calrt | |
| 431 | f528e97d894b4d93934a0711a00253eea980e799 | dcbe998a6d8f13b6c9cb36bbe7b355ced2ac3842 | 2025-09-11T14:13:35+08:00 | Yunzhe Jia | add calrt mtmd support | |
| 432 | a014310374a16f9204f2bcc1b458fc1eda67e469 | 35fb82497ec6c5904b0adb7e1c881a76c1c692db | 2025-09-30T08:13:22Z | anavp-nvidia | cuda : Enable CUDA Graph usage for Nemotron Nano v2 (NemotronH) (#16328) | |
| 433 | 35fb82497ec6c5904b0adb7e1c881a76c1c692db | 3c62aed89fbe3e15f6f82035e805a0a1add26306 | 2025-09-30T11:03:23+03:00 | Georgi Gerganov | metal : dynamic simdgroups for MV kernels (#16340) | |
| 434 | 3c62aed89fbe3e15f6f82035e805a0a1add26306 | f1eb1cb1eba042b2d583234e80f65e2e225d8995 | 2025-09-30T09:36:33+02:00 | Adrien Gallouët | common : simplify etag tracking by removing json (#16342) | |
| 435 | f1eb1cb1eba042b2d583234e80f65e2e225d8995 | de41f2b7bffab7582944b213ce12b605f8cf6e0f | 2025-09-30T09:07:20+02:00 | Charles Xu | kleidiai : fix work size and threads sync for fp16 (#16246) | |
| 436 | de41f2b7bffab7582944b213ce12b605f8cf6e0f | a74a0d69f34f52fa10d4f0a7ce749fb3490d0774 | 2025-09-29T22:30:16-07:00 | lhez | codeowners: add codeowners for opencl backend (#16344) | |
| 437 | a74a0d69f34f52fa10d4f0a7ce749fb3490d0774 | 5f7e166cbf7b9ca928c7fad990098ef32358ac75 | 2025-09-29T19:26:34-05:00 | Jeff Bolz | tests: override test_set_rows::max_nmse_err to allow for occasional rounding differences (#16295) | |
| 438 | 5f7e166cbf7b9ca928c7fad990098ef32358ac75 | d72f5f7ba260b546190338b0b76f2f152581424f | 2025-09-29T18:49:47+02:00 | Pascal | Fix thinking blocks with quotes + add handling `[THINK]...[/THINK]` blocks (#16326) | |
| 439 | d72f5f7ba260b546190338b0b76f2f152581424f | b77e6c18e1a6fac5705ed95f03af5436d67484c1 | 2025-09-29T17:51:48+03:00 | Georgi Gerganov | ci : add AMD runners and workflows (#16249) | |
| 440 | b77e6c18e1a6fac5705ed95f03af5436d67484c1 | 2ddd3f2356c313385fafc19a9f0ce678c8fe03ee | 2025-09-29T22:50:44+08:00 | alex-spacemit | ggml: riscv: add riscv spacemit backend (#15288) | |
| 441 | 2ddd3f2356c313385fafc19a9f0ce678c8fe03ee | 4d3d455d3c8719eb8f206de328d1b9ba191efd7c | 2025-09-29T16:50:52+03:00 | Georgi Gerganov | sync : ggml | |
| 442 | 4d3d455d3c8719eb8f206de328d1b9ba191efd7c | c9b1c06467aca8d30fafcab51292bcb285df5b0d | 2025-09-29T16:49:11+03:00 | Georgi Gerganov | sync : whisper.cpp (ggml/1359) | |
| 443 | c9b1c06467aca8d30fafcab51292bcb285df5b0d | b6ae75afb49b23db3dfbc2b01e8aabfb047e6880 | 2025-09-26T17:34:42+02:00 | Daniel Bevenius | ggml : remove -dev suffix from release version (ggml/1355) | |
| 444 | b6ae75afb49b23db3dfbc2b01e8aabfb047e6880 | b6dff20e2fe352093039e2359370c6bb2b505e0b | 2025-09-25T14:39:05+02:00 | Daniel Bevenius | ggml : bump version to 0.9.3 (ggml/1353) | |
| 445 | b6dff20e2fe352093039e2359370c6bb2b505e0b | 2db78c75e4ef7497313fda6dbbb3fcaf9ca0752d | 2025-09-20T16:44:23+03:00 | Georgi Gerganov | ggml : prepare for development of 0.9.2-dev | |
| 446 | 2db78c75e4ef7497313fda6dbbb3fcaf9ca0752d | 02463ab27b1379ff5e3d936ce8b3bfd356872ea6 | 2025-09-20T16:44:23+03:00 | Georgi Gerganov | ggml : bump version to 0.9.1 | |
| 447 | 02463ab27b1379ff5e3d936ce8b3bfd356872ea6 | adc76347d73b3d915e946efa5de8d0ad9f3904c2 | 2025-09-29T13:17:09+02:00 | Rafal Lewczuk | ggml-backend : add root cause in error message if loading backend library fails (#16172) | |
| 448 | adc76347d73b3d915e946efa5de8d0ad9f3904c2 | 3a2bdcda0b31e51db954551e0cd49424133a84f3 | 2025-09-29T11:09:00+02:00 | Sigbjørn Skjæret | ggml : check cuda and metal argsort limits and add test (#16323) | |
| 449 | 3a2bdcda0b31e51db954551e0cd49424133a84f3 | 66bb7985c3fcefda7a74aae9f8321f70eb1646c4 | 2025-09-29T10:37:20+02:00 | Aleksander Grygier | Improve Mobile UI for dialogs and action dropdowns (#16222) | |
| 450 | 66bb7985c3fcefda7a74aae9f8321f70eb1646c4 | 2f61c0f5bf8a620ca4c3872408803ab38cfb9613 | 2025-09-29T09:08:41+02:00 | Pascal | fix: preserved zero values in chat settings inputs and textareas by switching to nullish coalescing for field values and default placeholders (#16312) | |
| 451 | 2f61c0f5bf8a620ca4c3872408803ab38cfb9613 | 3ffd0fae473c954bb3e67526b31262048fb508d4 | 2025-09-29T12:33:12+05:30 | Vinkal | llama-cli: prevent spurious assistant token (#16202) | |
| 452 | 3ffd0fae473c954bb3e67526b31262048fb508d4 | a4a0aa5ea2a88e4858996199fefd5439f17b481c | 2025-09-29T01:30:45-05:00 | ddh0 | perplexity : show more kl-divergence data (#16321) | |
| 453 | a4a0aa5ea2a88e4858996199fefd5439f17b481c | 92cd103f627015a95f2107f1c27dc218c7b8ec64 | 2025-09-29T08:41:28+03:00 | Georgi Gerganov | ggml : fix dependencies for ggml_set_rows (#16318) | |
| 454 | 92cd103f627015a95f2107f1c27dc218c7b8ec64 | b887d2f3413ac231e3cb5925260c39902af4a70c | 2025-09-28T23:50:37-05:00 | Jeff Bolz | vulkan: Fix validation failure in quantized flash attention (#16292) | |
| 455 | b887d2f3413ac231e3cb5925260c39902af4a70c | bd0af02fc96c2057726f33c0f0daf7bb8f3e462a | 2025-09-28T23:15:03+02:00 | Sigbjørn Skjæret | ggml : fix GGML_F32_VEC_FMA argument order in ggml_vec_mad1_f32 (#16307) | |
| 456 | bd0af02fc96c2057726f33c0f0daf7bb8f3e462a | d9e0e7c8194dfd7d23bf3a86608c9ece68d77c93 | 2025-09-28T14:13:50-04:00 | crat0z | common : fix reasoning before forced tool call via tool_choice = required (#16264) | |
| 457 | d9e0e7c8194dfd7d23bf3a86608c9ece68d77c93 | 0124ac989f7e7bf08803788f66dbe4106bdcdd58 | 2025-09-28T22:38:15+08:00 | R0CKSTAR | ci : fix musa docker build (#16306) | |
| 458 | 0124ac989f7e7bf08803788f66dbe4106bdcdd58 | 2811c65286ae954bec87049f75b86dc022006dcc | 2025-09-28T19:25:58+08:00 | Aaron Teo | devops: switch to using ubuntu-22.04-s390x image (#16302) | |
| 459 | 2811c65286ae954bec87049f75b86dc022006dcc | d8359f5fde480da030bf75c7711573c7c4d993ba | 2025-09-28T12:04:46+01:00 | Imad Saddik | Fixed a few typos in the README of the LLaMA.cpp HTTP Server [no ci] (#16297) | |
| 460 | d8359f5fde480da030bf75c7711573c7c4d993ba | 6a2c6145a0b91b40eb3c3dba7b20ccc4b270490f | 2025-09-28T01:38:37-05:00 | Jeff Bolz | vulkan: 64-bit im2col (#16135) | |
| 461 | 6a2c6145a0b91b40eb3c3dba7b20ccc4b270490f | 3b53634fe35771e2e318227aa81585726bae7234 | 2025-09-28T09:34:44+03:00 | Georgi Gerganov | metal : extend mat-mat multiplication support (#16225) | |
| 462 | 3b53634fe35771e2e318227aa81585726bae7234 | 1384abf8b8d5894d32fada453ccf4d196ffba7de | 2025-09-28T09:34:05+03:00 | Georgi Gerganov | metal : fuse non-sequential nodes (#16102) | |
| 463 | 1384abf8b8d5894d32fada453ccf4d196ffba7de | e6d65fb02d553bd79cad94e517cdca18b687788d | 2025-09-27T20:36:34-05:00 | Jeff Bolz | vulkan: handle mat_mul with A matrix > 4GB (#16176) | |
| 464 | e6d65fb02d553bd79cad94e517cdca18b687788d | 8656f5de688cddcaea1d6174535eb60ee23ef6a0 | 2025-09-27T16:43:39-04:00 | Jeff Bolz | vulkan: support arbitrary KV dimension in flash attention (#16160) | |
| 465 | 8656f5de688cddcaea1d6174535eb60ee23ef6a0 | 4807e8f96a61b2adccebd5e57444c94d18de7264 | 2025-09-27T22:41:03+02:00 | Acly | vulkan : make the vulkan.hpp dynamic dispatcher instance private (#16224) | |
| 466 | 4807e8f96a61b2adccebd5e57444c94d18de7264 | c0bfc57af421f8fd63c946c13b7666aed82560e2 | 2025-09-27T19:56:40+02:00 | Aleksander Grygier | Show message actions by default (#16289) | |
| 467 | c0bfc57af421f8fd63c946c13b7666aed82560e2 | 75a3a6c2cd0002ba40e2dcc92007bc9fdbc69f1a | 2025-09-28T00:49:32+08:00 | Aman Gupta | CUDA: mul_mat_id for mmf for bs <= 64 for f16 and bs <= 32 for f32 (#16277) | |
| 468 | 75a3a6c2cd0002ba40e2dcc92007bc9fdbc69f1a | 0499b29c6f64c705faaf5860dc4600fca23671f4 | 2025-09-27T18:45:07+02:00 | Johannes Gäßler | CUDA: refactor and deduplicate vector FA kernels (#16208) | |
| 469 | 0499b29c6f64c705faaf5860dc4600fca23671f4 | 234e2ff8ed09716fb553437596779399bee31b11 | 2025-09-27T19:26:46+03:00 | Dmytro Minochkin | vulkan: throw system error instead of SIGABRT during init on older devices (#16156) | |
| 470 | 234e2ff8ed09716fb553437596779399bee31b11 | 3f81b4e91c1d5f098148af117e3f13cf4b077f52 | 2025-09-27T18:17:08+02:00 | Adrien Gallouët | server : remove old LLAMA_SERVER_SSL (#16290) | |
| 471 | 3f81b4e91c1d5f098148af117e3f13cf4b077f52 | ace6a54565444b6377bee8e7ac693238e7766279 | 2025-09-27T06:36:11-04:00 | Jeff Bolz | vulkan: support GET_ROWS for k-quants (#16235) | |
| 472 | ace6a54565444b6377bee8e7ac693238e7766279 | 72b24d96c6888c609d562779a23787304ae4609c | 2025-09-27T11:12:46+02:00 | Adrien Gallouët | build : add LLAMA_OPENSSL option (#16287) | |
| 473 | 72b24d96c6888c609d562779a23787304ae4609c | 624207e676ab5eb3ce7af631902bb45fb73a8359 | 2025-09-27T02:58:29+05:30 | Vinkal | model : make minicpm embedding_scale, residual_scale and logit_scale optional with legacy defaults (#16273) | |
| 474 | 624207e676ab5eb3ce7af631902bb45fb73a8359 | 807e8c6d310952f2f5656afc63dab9d7083dcb5c | 2025-09-27T02:03:33+08:00 | Aaron Teo | devops: add s390x & ppc64le CI (#15925) | |
| 475 | 807e8c6d310952f2f5656afc63dab9d7083dcb5c | 1a189278944d030211f336e103e96b65f976c361 | 2025-09-26T19:25:29+02:00 | Aleksander Grygier | Enhance text file detection logic for file attachments (#16199) | |
| 476 | 1a189278944d030211f336e103e96b65f976c361 | e0539eb6aed346d4b25a6ea019044e88771e7690 | 2025-09-26T18:35:42+02:00 | Aleksander Grygier | Allow viewing conversations even when llama server is down (#16255) | |
| 477 | e0539eb6aed346d4b25a6ea019044e88771e7690 | 5d0a40f390732cbf85d8a3b7b0fc3cbebffe780a | 2025-09-26T11:36:48-04:00 | Isaac McFadyen | webui: switch to hash-based routing (alternative of #16079) (#16157) | |
| 478 | 5d0a40f390732cbf85d8a3b7b0fc3cbebffe780a | d12a9836597b1ae4440d64d5a6ed727d27ac0702 | 2025-09-26T15:59:07+02:00 | Aleksander Grygier | Always show message actions for mobile UI + improvements for user message sizing (#16076) | |
| 479 | d12a9836597b1ae4440d64d5a6ed727d27ac0702 | cc1cfa277b3aae1f6cc9180472072336597a78d4 | 2025-09-26T16:09:34+03:00 | Radoslav Gerganov | codeowners : add rgerganov as owner of RPC [no ci] (#16279) | |
| 480 | cc1cfa277b3aae1f6cc9180472072336597a78d4 | 54dbc37053f7d75ea5b0631d5ee88f19391e4314 | 2025-09-26T15:00:44+02:00 | Aleksei Nikiforov | mtmd : fix uninitialized variable in bicubic_resize (#16275) | |
| 481 | 54dbc37053f7d75ea5b0631d5ee88f19391e4314 | b995a10760cb93d23d617d76ecb82a5f95b5e0d3 | 2025-09-26T14:14:28+03:00 | Georgi Gerganov | metal : report OOM errors (#16274) | |
| 482 | b995a10760cb93d23d617d76ecb82a5f95b5e0d3 | 4710dd31bbcef79d04f85a3a6a8c7d9439c5c79a | 2025-09-26T13:12:19+02:00 | Adrien Gallouët | common : use cpp-httplib as a cURL alternative for downloads (#16185) | |
| 483 | 4710dd31bbcef79d04f85a3a6a8c7d9439c5c79a | 9b26511857ac09ae69ab485168fe2d3ee5fb1d6e | 2025-09-26T12:39:35+02:00 | Adrien Gallouët | build : fix build-ios-device (#16257) | |
| 484 | 9b26511857ac09ae69ab485168fe2d3ee5fb1d6e | 00217cd41388328c93e9e9644921c4319bb03bcc | 2025-09-26T18:27:25+08:00 | Aaron Teo | ggml-cpu: implement MXFP4 SIMD for s390x (#16193) | |
| 485 | 00217cd41388328c93e9e9644921c4319bb03bcc | 3b337b01a1a85c2f5b49376e8c0bbdb3f521528e | 2025-09-26T13:19:23+03:00 | Radoslav Gerganov | ci : create git tags for released docker images (#16008) | |
| 486 | 3b337b01a1a85c2f5b49376e8c0bbdb3f521528e | a86a580a6692edd1da076d5422f944c344b4fe5e | 2025-09-26T07:53:36+02:00 | Daniel Bevenius | codeowners : add danbev as owner of build-xcframework.sh [no ci] (#16268) | |
| 487 | a86a580a6692edd1da076d5422f944c344b4fe5e | 0f7c69689f4e681948a6005adea9bee9c08ff903 | 2025-09-26T08:56:38+08:00 | R0CKSTAR | musa: upgrade musa sdk to 4.3.0 (#16240) | |
| 488 | 0f7c69689f4e681948a6005adea9bee9c08ff903 | 835b2b915c52bcabcd688d025eacff9a07b65f52 | 2025-09-26T08:56:10+08:00 | R0CKSTAR | musa: fix build warnings (#15611) | |
| 489 | 835b2b915c52bcabcd688d025eacff9a07b65f52 | b05a9d650f4da1e70e7e2cbe8fe44e61b39656db | 2025-09-25T19:50:28+02:00 | Sigbjørn Skjæret | model : add GroveMoE support (#15510) | |
| 490 | b05a9d650f4da1e70e7e2cbe8fe44e61b39656db | 27052978e487957b3d39e3bd8fc8ee4aa304bff9 | 2025-09-25T23:38:10+08:00 | Aaron Teo | vendors: update miniaudio version (#16212) | |
| 491 | 27052978e487957b3d39e3bd8fc8ee4aa304bff9 | 077c94d0caf87fbd3cf3288dbb5c0fd9670294cf | 2025-09-25T18:20:34+03:00 | rtaluyev | readme : update bindings (#16144) | |
| 492 | 077c94d0caf87fbd3cf3288dbb5c0fd9670294cf | aa3ee0eb0b80efca126cedf9bcb4fb5864b46ce3 | 2025-09-25T22:35:05+08:00 | Aman Gupta | CUDA: add a fused top-K MoE kernel (#16130) | |
| 493 | aa3ee0eb0b80efca126cedf9bcb4fb5864b46ce3 | d0991da39d3c39b3980c24cdfccb9a4c95a46870 | 2025-09-25T12:02:36+02:00 | Daniel Bevenius | model-conversion : add embedding prompt file support (#15871) | |
| 494 | d0991da39d3c39b3980c24cdfccb9a4c95a46870 | aa719c2f886c445b78113bf1e5849f1fce4124a7 | 2025-09-25T11:36:47+02:00 | Daniel Bevenius | server : add support for external server for tests (#16243) | |
| 495 | aa719c2f886c445b78113bf1e5849f1fce4124a7 | 4cdd0bb4537f9617e9efcfef6b9454fcefe2ff08 | 2025-09-25T17:22:55+08:00 | junchao-zhao | ggml : fix loongarch lsx compilation error (#15864) | |
| 496 | 4cdd0bb4537f9617e9efcfef6b9454fcefe2ff08 | b5bd037832bcb8ed3086dfe26ce9090bea989af1 | 2025-09-25T11:12:27+02:00 | Johannes Gäßler | docs: fix typo [no ci] (#16244) | |
| 497 | b5bd037832bcb8ed3086dfe26ce9090bea989af1 | dfcd53f7ecb9bb897a9d752d09c59d10be47237a | 2025-09-25T03:53:09-05:00 | Douglas Hanley | llama : add support for qwen3 reranker (#15824) | |
| 498 | dfcd53f7ecb9bb897a9d752d09c59d10be47237a | 4ea00794b8c995b6deaf4bac159c1778dc27419a | 2025-09-25T11:30:16+03:00 | Georgi Gerganov | metal : fuse NORM + MUL + ADD, support non-multiples of 4 (#16220) | |
| 499 | 4ea00794b8c995b6deaf4bac159c1778dc27419a | 02a6a82ae7c7ddd1819ae26b0cc36675879aecee | 2025-09-25T11:29:42+03:00 | Georgi Gerganov | metal : relax reorder conditions (#16216) | |
| 500 | 02a6a82ae7c7ddd1819ae26b0cc36675879aecee | c498fc82fe5b83fc8c6e1627286bdc1f93caddbf | 2025-09-25T11:29:08+03:00 | Georgi Gerganov | metal : restore im2col perf (#16219) | |
| 501 | c498fc82fe5b83fc8c6e1627286bdc1f93caddbf | e7a5130a20cf45a3358308356c249734ca982143 | 2025-09-25T10:20:02+03:00 | Radoslav Gerganov | rpc : use ggml logging facilities | |
| 502 | e7a5130a20cf45a3358308356c249734ca982143 | bee378e0988b44bbe93b0768208080951b312363 | 2025-09-25T13:06:30+08:00 | Aaron Teo | codeowners: add ownership of zdnn backend [no ci] (#16232) | |
| 503 | bee378e0988b44bbe93b0768208080951b312363 | 5fb557653b8756ac2b6c6a102b1e44abcadf552f | 2025-09-25T05:06:06Z | Eve | ci: run the x64 and arm ci on the github machines instead (#16183) | |
| 504 | 5fb557653b8756ac2b6c6a102b1e44abcadf552f | 4ae88d07d026e66b41e85afece74e88af54f4e66 | 2025-09-25T11:36:30+08:00 | Aaron Teo | devops: fix s390x docker release failure (#16231) | |
| 505 | 4ae88d07d026e66b41e85afece74e88af54f4e66 | e789095502b337690c7616db32d7c679a5bd2533 | 2025-09-25T00:25:04+08:00 | Aaron Teo | codeowners: add ownership of zdnn backend [no ci] (#16229) | |
| 506 | e789095502b337690c7616db32d7c679a5bd2533 | f2a789e33490deb483a2694b066b37e45524bb79 | 2025-09-24T16:53:48+02:00 | Johannes Gäßler | llama: print memory breakdown on exit (#15860) | |
| 507 | f2a789e33490deb483a2694b066b37e45524bb79 | 3a599719673c850647e3bb911ed6d91109bb91d2 | 2025-09-24T16:17:49+02:00 | Acly | ggml : split graph allocations according to backend max buffer size (#15815) | |
| 508 | 3a599719673c850647e3bb911ed6d91109bb91d2 | 63b54c81a620981be020184ab99e63a8e50e47cb | 2025-09-24T13:42:26+02:00 | Tarek Dakhran | model : add label for LiquidAI LFM2-2.6B model (#16204) | |
| 509 | 152729f8848b692e1ae53c197ccca92ef10a523b | c0c59c1157b5aeded285a3b25d2463c866f583d3 | 2025-09-24T08:53:47+02:00 | Uilian Ries | common : add missing chrono header for common.cpp (#16211) | |
| 510 | c0c59c1157b5aeded285a3b25d2463c866f583d3 | 7735706b939847df2c6c00b44c36f95a20137c61 | 2025-09-24T08:53:20+02:00 | Sigbjørn Skjæret | codeowners : match all requirements files (#16214) | |
| 511 | 7735706b939847df2c6c00b44c36f95a20137c61 | 4d9ea03d170cf504a40bf3a85788af84cccaee80 | 2025-09-24T14:46:52+08:00 | Jie Fu (傅杰) | model-conversion : run-org-model.py fails to run on mac m1 (#16213) | |
| 512 | 4d9ea03d170cf504a40bf3a85788af84cccaee80 | 8ba548dae251f8f2e3834ed5226b76b6e4f4a485 | 2025-09-24T08:10:09+02:00 | Daniel Bevenius | codeowners : use slash prefix for root files [no ci] (#16210) | |
| 513 | 8ba548dae251f8f2e3834ed5226b76b6e4f4a485 | f505bd83ca7a43c4585ff3d59135e77eae9c793b | 2025-09-24T12:19:23+08:00 | Jie Fu (傅杰) | model-conversion : fix the make targets in the README.md (#16209) | |
| 514 | f505bd83ca7a43c4585ff3d59135e77eae9c793b | 0889589dbe8c67dd518c58a57afbb02dde2dccbe | 2025-09-23T20:41:40+03:00 | Georgi Gerganov | ci : disable AMD workflows + update NVIDIA workflows (#16200) | |
| 515 | 0889589dbe8c67dd518c58a57afbb02dde2dccbe | 4e29084ba4104c4ea529fd3163bb6e76f64383df | 2025-09-23T13:44:25+03:00 | Georgi Gerganov | ci : enable Vulkan workflow on Mac (#16194) | |
| 516 | 4e29084ba4104c4ea529fd3163bb6e76f64383df | f6b4af3d04763b1e0130f5b5fce19c4bc6f83f1c | 2025-09-23T01:58:12-07:00 | Xiangyan Sun | ggml-cpu: Respect cpumask settings (#16164) | |
| 517 | f6b4af3d04763b1e0130f5b5fce19c4bc6f83f1c | 264f1b51872c125e23fa0ac1da5e2a1170de9a08 | 2025-09-23T10:25:20+02:00 | Sigbjørn Skjæret | ggml : fix uninitialized is_on_grid in quantize_row_iq3_xxs_impl (#15928) | |
| 518 | 264f1b51872c125e23fa0ac1da5e2a1170de9a08 | 0bc7cc715472fe28822e57f036f0746592ed2c04 | 2025-09-23T14:53:05+08:00 | Aaron Teo | zdnn: refactor codebase + add docs (#16178) | |
| 519 | 0bc7cc715472fe28822e57f036f0746592ed2c04 | 4b9f4cb0f89a88de4bdf97727d0457b0c648804c | 2025-09-23T08:13:22+02:00 | Daniel Bevenius | codeowners : add @danbev to model-conversion example [no ci] (#16190) | |
| 520 | 4b9f4cb0f89a88de4bdf97727d0457b0c648804c | 85e72271ba1ce78adf34fd8997803c991e617ca6 | 2025-09-23T13:59:34+08:00 | Aaron Teo | devops: add s390x containers (#15915) | |
| 521 | 85e72271ba1ce78adf34fd8997803c991e617ca6 | 1d0125bcf1cbd7195ad0faf826a20bc7cec7d3f4 | 2025-09-23T05:59:03+02:00 | Daniel Bevenius | ggml-cpu : fix typo in gemm comments [no ci] (#16189) | |
| 522 | 1d0125bcf1cbd7195ad0faf826a20bc7cec7d3f4 | 351f3da39c85f59d581fc184f09283da7f099a3b | 2025-09-22T12:40:10-06:00 | Gabe Goodhart | feat: Add conversion support in GraniteHybrid for non-hybrid (all attn) (#16177) | |
| 523 | 351f3da39c85f59d581fc184f09283da7f099a3b | 3ecb2f671a2f49d56357f99d135a94e841759178 | 2025-09-23T01:57:46+08:00 | Haiyue Wang | clang-tidy : disable warning about performance enum size (#16127) | |
| 524 | 3ecb2f671a2f49d56357f99d135a94e841759178 | 432cf4304c5379bfbd1f3feed65ec205955b2f4b | 2025-09-22T19:13:00+02:00 | Sigbjørn Skjæret | ggml : implement set_rows with i32 index (#16159) | |
| 525 | 432cf4304c5379bfbd1f3feed65ec205955b2f4b | 37a23c17bdc9c99c9c6ad41168e4ced3724b72cd | 2025-09-22T18:20:21+03:00 | Georgi Gerganov | codeowners : update + cleanup (#16174) | |
| 526 | 37a23c17bdc9c99c9c6ad41168e4ced3724b72cd | 138c87ce8bd558b2cc134ada7316a3dad8eb67ac | 2025-09-22T14:13:51+02:00 | Adrien Gallouët | common : enable `--offline` mode without curl support (#16137) | |
| 527 | 138c87ce8bd558b2cc134ada7316a3dad8eb67ac | c6db9a10278f40b4b8d3f6931728f2cce2356daa | 2025-09-22T10:53:13+02:00 | Quentin Bramas | webui : fix handling incomplete chunks (#16107) | |
| 528 | c6db9a10278f40b4b8d3f6931728f2cce2356daa | d05affbab7d1364fa7ac06c03cd33f03235ae840 | 2025-09-22T10:49:58+02:00 | GideonSerf | embedding : fix typos in README (#16171) | |
| 529 | d05affbab7d1364fa7ac06c03cd33f03235ae840 | 4f324a556caa5be0be2261604ef4aab0faf36eb8 | 2025-09-22T16:48:42+08:00 | Haiyue Wang | common : remove unused local variables (#16140) | |
| 530 | 4f324a556caa5be0be2261604ef4aab0faf36eb8 | a71ae3ba7a857394103f12e30b387c48242c84f2 | 2025-09-22T11:12:37+03:00 | Georgi Gerganov | ggml : extend ggml_can_fuse to work with non-sequential nodes (#16123) | |
| 531 | a71ae3ba7a857394103f12e30b387c48242c84f2 | 05a2458121f9cdcc98ea6ffeeab6f23023136266 | 2025-09-22T11:12:09+03:00 | Georgi Gerganov | ggml : add ggml_op_is_empty (#16122) | |
| 532 | 05a2458121f9cdcc98ea6ffeeab6f23023136266 | 96fdca043be8fa733bbd59868a75517f92633376 | 2025-09-22T15:10:58+07:00 | Xuan-Son Nguyen | codeowners : update ownership for @ngxson and @allozuar (#16128) | |
| 533 | 96fdca043be8fa733bbd59868a75517f92633376 | b2d980fce063fa3591c59ad50b946c8da66c294f | 2025-09-22T17:04:01+09:00 | Shin-myoung-serp | Vulkan: add conv_transpose_2d operation (#16022) | |
| 534 | b2d980fce063fa3591c59ad50b946c8da66c294f | 5c6106a696af2b00ce01d14ba525979d5a32b199 | 2025-09-22T09:59:05+02:00 | Sigbjørn Skjæret | codeowners : claim responsibility for ci, models, gguf-py and convert (#16124) | |
| 535 | 5c6106a696af2b00ce01d14ba525979d5a32b199 | ec65fb52f0cc890e5085a6c5995ab08a156265fb | 2025-09-22T10:58:02+03:00 | Georgi Gerganov | contrib : update roles (#16113) | |
| 536 | ec65fb52f0cc890e5085a6c5995ab08a156265fb | 1d660d2fae42ea2e1d3569638e722bf7a37b6b19 | 2025-09-22T10:16:05+03:00 | Georgi Gerganov | ci : remove vulkaninfo calls (#16169) | |
| 537 | 1d660d2fae42ea2e1d3569638e722bf7a37b6b19 | a20d810d79adfbf82e0eb703af6f27a0e2d1a539 | 2025-09-22T09:11:39+03:00 | Georgi Gerganov | ci : use smaller model (#16168) | |
| 538 | a20d810d79adfbf82e0eb703af6f27a0e2d1a539 | 4d0a7cbc617e384fc355077a304c883b5c7d4fb6 | 2025-09-22T00:37:17-05:00 | Jeff Bolz | vulkan: add RTE variants of exp shader (#16165) | |
| 539 | 4d0a7cbc617e384fc355077a304c883b5c7d4fb6 | 9073a73d82a916cea0809de225ef5175c3a86e91 | 2025-09-22T08:31:40+03:00 | Georgi Gerganov | ci : adjust params for less runtime (#16167) | |
| 540 | 9073a73d82a916cea0809de225ef5175c3a86e91 | 51f5a45fbe575dcd54bdd2a339ef8e8424d1c12a | 2025-09-22T07:22:43+02:00 | Ruben Ortlam | vulkan: vec dot matrix multiplication fix (#16151) | |
| 541 | 51f5a45fbe575dcd54bdd2a339ef8e8424d1c12a | c4510dc9374e17dcb8726902ab5216067a92b3d3 | 2025-09-21T16:42:10-07:00 | lhez | opencl: fix concat crash on win arm64 with Adreno (#15944) | |
| 542 | c4510dc9374e17dcb8726902ab5216067a92b3d3 | da30ab5f8696cabb2d4620cdc0aa41a298c54fd6 | 2025-09-21T14:48:44-07:00 | lhez | opencl: initial `q8_0` mv support (#15732) | |
| 543 | da30ab5f8696cabb2d4620cdc0aa41a298c54fd6 | 28baac9c9f491c872e2c37762d3bd90446b005e9 | 2025-09-21T19:00:27+03:00 | Georgi Gerganov | ci : add label for the RISC-V runner (#16150) | |
| 544 | 28baac9c9f491c872e2c37762d3bd90446b005e9 | 1eeb523c3e0c7ffbd59469f5463dcbdecba3535e | 2025-09-21T16:50:45+03:00 | Georgi Gerganov | ci : migrate ggml ci to self-hosted runners (#16116) | |
| 545 | 1eeb523c3e0c7ffbd59469f5463dcbdecba3535e | 5bb4a3edec297e74b0f7bd4ed5d0fdd12e28d858 | 2025-09-21T08:31:55+02:00 | Giuseppe Scrivano | vulkan: optimize UMA buffer operations and fix driver hangs (#16059) | |
| 546 | 5bb4a3edec297e74b0f7bd4ed5d0fdd12e28d858 | 7f766929ca8e8e01dcceb1c526ee584f7e5e1408 | 2025-09-21T01:23:37-05:00 | Jeff Bolz | vulkan: fix validation error about VK_PIPELINE_CREATE_CAPTURE_STATISTICS_BIT_KHR (#16086) | |
| 547 | 7f766929ca8e8e01dcceb1c526ee584f7e5e1408 | 405921dcefdd4e90ed948a4bf179007c2fa92b2d | 2025-09-20T12:55:47+03:00 | Georgi Gerganov | sync : ggml | |
| 548 | 405921dcefdd4e90ed948a4bf179007c2fa92b2d | fa6383ca7e7ccb8ca3bdfeb37e348ddc4113aa26 | 2025-09-16T06:16:52+02:00 | Daniel Bevenius | ggml : introduce semantic versioning (ggml/1336) | |
| 549 | fa6383ca7e7ccb8ca3bdfeb37e348ddc4113aa26 | 803dac2e48ef3ba26a504eb27c4e77ec2d21f7d0 | 2025-09-10T17:21:11+02:00 | Gregor Jasny | CUDA : conditionally add cuda architectures (ggml/1341) | |
| 550 | 803dac2e48ef3ba26a504eb27c4e77ec2d21f7d0 | 459c0c2c1a400f960d7b8e8d94d31a8426f80986 | 2025-09-20T10:42:56+02:00 | Ruben Ortlam | vulkan: use vec dot for matrix matrix multiplications (#16056) | |
| 551 | 459c0c2c1a400f960d7b8e8d94d31a8426f80986 | be79d9fdd95ab8955527c4aaa67b90e8b9516718 | 2025-09-20T07:56:30+02:00 | Benni | server: fix SSE and OpenAI compatibility for error messages when streaming (#16109) | |
| 552 | be79d9fdd95ab8955527c4aaa67b90e8b9516718 | f432d8d83e7407073634c5e4fd81a3d23a10827f | 2025-09-19T15:15:21-07:00 | ssweens | llama-bench: add --devices and --list-devices support (#16039) | |
| 553 | f432d8d83e7407073634c5e4fd81a3d23a10827f | 4067f07fc5aa5722b87db303b561597004696f6c | 2025-09-20T00:57:30+09:00 | shun095 | chat: Fix streaming parser for granite models (#15682) | |
| 554 | 4067f07fc5aa5722b87db303b561597004696f6c | 4b8560ab56fdd9819358b47c338bbc8ec357c57e | 2025-09-19T09:52:27+02:00 | Aleksander Grygier | feat: Improve mobile UI for Settings Dialog (#16084) | |
| 555 | 4b8560ab56fdd9819358b47c338bbc8ec357c57e | 0dd58b6877f3dc106593d6bc68d98305f553c566 | 2025-09-19T13:02:51+07:00 | Xuan-Son Nguyen | chat : fix build on arm64 (#16101) | |
| 556 | 0dd58b6877f3dc106593d6bc68d98305f553c566 | 69ffd891631befa9e6b485fd646a16dab4f2c007 | 2025-09-19T11:31:56+07:00 | Xuan-Son Nguyen | ggml : refactor forward_dup for cpu backend (#16062) | |
| 557 | 69ffd891631befa9e6b485fd646a16dab4f2c007 | 246c0d9c795fb25da8268625d597580155a3672f | 2025-09-18T23:07:26+02:00 | Adrien Gallouët | ggml-amx : fix ggml_amx_init() on generic Linux (#16049) | |
| 558 | 246c0d9c795fb25da8268625d597580155a3672f | 3edd87cd055a45d885fa914d879d36d33ecfc3e1 | 2025-09-18T23:07:18+02:00 | Adrien Gallouët | cmake : fix static linking for OpenMP on Unix-like systems (#16031) | |
| 559 | 3edd87cd055a45d885fa914d879d36d33ecfc3e1 | c0b45097c33e2667a94444f08cc9e36bec0a5e2e | 2025-09-18T12:03:34-07:00 | Shawn Gu | opencl: optimize mxfp4 kernels (#16037) | |
| 560 | c0b45097c33e2667a94444f08cc9e36bec0a5e2e | 38dbdf4c057515ccea9bec0ca2518f86d5e4d28e | 2025-09-18T13:46:17-05:00 | Jeff Bolz | rename optimize_graph to graph_optimize (#16082) | |
| 561 | 38dbdf4c057515ccea9bec0ca2518f86d5e4d28e | 368560a1e3b9a3bc83af741b0b2bc9e46fb420d2 | 2025-09-18T11:26:03-07:00 | Bowen Han | CUDA: Optimize PAD_REFLECT_1D (#15957) | |
| 562 | 368560a1e3b9a3bc83af741b0b2bc9e46fb420d2 | 4ca088b036313c2d8e682f4cfeb7c29edd85d0b9 | 2025-09-18T19:28:32+02:00 | Johannes Gäßler | CUDA: fix compilation on CC 6.0 (#16091) | |
| 563 | 4ca088b036313c2d8e682f4cfeb7c29edd85d0b9 | 703f9e32c4eb3166f8d63007c26e31a1466c21af | 2025-09-18T16:22:50+01:00 | Eric Curtin | Add resumable downloads for llama-server model loading (#15963) | |
| 564 | 703f9e32c4eb3166f8d63007c26e31a1466c21af | ad6bd9083bc346afd4ecd2fbb83e0306c0141c99 | 2025-09-18T16:28:41+03:00 | Georgi Gerganov | metal : use function constants for mul_mv_ext kernels (#16074) | |
| 565 | ad6bd9083bc346afd4ecd2fbb83e0306c0141c99 | 2b6b55a59f590a1e1eb2dcd09d5b8b6feb9cc748 | 2025-09-18T13:28:22+02:00 | Sigbjørn Skjæret | cuda : add missing F32<->I32 entries in ggml_cuda_cpy_fn (#16060) | |
| 566 | 2b6b55a59f590a1e1eb2dcd09d5b8b6feb9cc748 | e58174cecbc45bf79bf653cd2c984395940c6ef4 | 2025-09-18T13:36:57+03:00 | Radoslav Gerganov | server : include usage statistics only when user request them (#16052) | |
| 567 | e58174cecbc45bf79bf653cd2c984395940c6ef4 | b213fce89bee8cb56b587b91e15a4278f8ed0180 | 2025-09-18T12:47:56+03:00 | Georgi Gerganov | llama : bump max seq limit from 64 to 256 (#15916) | |
| 568 | b213fce89bee8cb56b587b91e15a4278f8ed0180 | e00f3fd8fff2cf5a8c8c9f475034bd089c8bcce4 | 2025-09-18T12:33:45+03:00 | Georgi Gerganov | metal : improve F32, F16 and BF16 mat-vec multiplication (#16057) | |
| 569 | e00f3fd8fff2cf5a8c8c9f475034bd089c8bcce4 | f2f28380ea68939c0481df3e4216b698824a59df | 2025-09-18T15:06:48+08:00 | Jhen-Jie Hong | metal : avoid call free for non-owned buffer (#16067) | |
| 570 | f2f28380ea68939c0481df3e4216b698824a59df | 62c3b645c56ad5288aa401901f043b050edac5a2 | 2025-09-18T10:03:24+03:00 | Georgi Gerganov | metal : handle nil cv during pipeline creation (#16065) | |
| 571 | 62c3b645c56ad5288aa401901f043b050edac5a2 | d304f459d8619399eb232b1e3689379306f439d3 | 2025-09-18T09:26:33+08:00 | Chenguang Li | CANN: Remove print (#16044) | |
| 572 | d304f459d8619399eb232b1e3689379306f439d3 | 0320ac5264279d74f8ee91bafa6c90e9ab9bbb91 | 2025-09-17T13:09:40-07:00 | Reese Levine | GGML WebGPU: Support for ADD, MUL, RMS_NORM, GET_ROWS operators (#16018) | |
| 573 | 0320ac5264279d74f8ee91bafa6c90e9ab9bbb91 | a7a98e0fffed794396b3fbad4dcdbbc184963645 | 2025-09-17T20:38:12+03:00 | Georgi Gerganov | metal : refactor + optimize v2 (#15995) | |
| 574 | a7a98e0fffed794396b3fbad4dcdbbc184963645 | 8f8f2274ee3601fecf6e2d57b52f701c81bede21 | 2025-09-17T19:29:13+02:00 | Aleksander Grygier | SvelteKit-based WebUI (#14839) | |
| 575 | 8f8f2274ee3601fecf6e2d57b52f701c81bede21 | c959b676be29e93f8dbc3bd6056ceba812a9eb72 | 2025-09-18T00:18:21+07:00 | Xuan-Son Nguyen | convert : add Llama4ForCausalLM (#16042) | |
| 576 | c959b676be29e93f8dbc3bd6056ceba812a9eb72 | cd08fc3ecc0264b4414b68af3874a6c689ed60c1 | 2025-09-17T15:32:42+02:00 | Johannes Gäßler | CUDA: fix FA occupancy, optimize tile kernel (#15982) | |
| 577 | cd08fc3ecc0264b4414b68af3874a6c689ed60c1 | cb5bb6cc05119c24e7711ca2956cd0e6d409d396 | 2025-09-17T01:08:02-07:00 | David Ribeiro Alves | common : Fix corrupted memory error on json grammar initialization (#16038) | |
| 578 | cb5bb6cc05119c24e7711ca2956cd0e6d409d396 | a91d035b901e8a9edf810f63d130ee49adf27be2 | 2025-09-17T07:35:37Z | Eve | vulkan: automatically remove unsupported devices (#15976) | |
| 579 | a91d035b901e8a9edf810f63d130ee49adf27be2 | 745cbcf2fe1eb88f8db615ac622f0b944d924ad6 | 2025-09-17T09:34:09+02:00 | Daniel Bevenius | ci : revert back to macos-13 for macOS-latest-cmake-x64 (#16040) | |
| 580 | 745cbcf2fe1eb88f8db615ac622f0b944d924ad6 | 1cbd80f8cf80a817715b1ccc5680fe2a3c5172c8 | 2025-09-17T15:30:55+08:00 | Jie Fu (傅杰) | llama-quant : fix the verification of attention layers for encoder-decoder models (#16023) | |
| 581 | 1cbd80f8cf80a817715b1ccc5680fe2a3c5172c8 | 85286f354813056f6c835046c0acfa3bf6ba9432 | 2025-09-17T15:29:00+08:00 | Jie Fu (傅杰) | examples : support encoder-decoder models in the simple example (#16002) | |
| 582 | 85286f354813056f6c835046c0acfa3bf6ba9432 | d5fabe3682de515fd09d6c981f7a0d1b75614455 | 2025-09-17T00:01:58-07:00 | Shane A | model : add OLMo3 support (#16015) | |
| 583 | d5fabe3682de515fd09d6c981f7a0d1b75614455 | 8ff206097c2bf3ca1c7aa95f9d6db779fc7bdd68 | 2025-09-17T14:33:08+08:00 | Chenguang Li | CANN: Optimize ggml_cann_set_device (#15935) | |
| 584 | 8ff206097c2bf3ca1c7aa95f9d6db779fc7bdd68 | 77475530b8bbea3bf578632507e1284cdfe2c8c0 | 2025-09-16T16:17:08+02:00 | jacekpoplawski | llama-bench: add --n-cpu-moe support (#15952) | |
| 585 | 77475530b8bbea3bf578632507e1284cdfe2c8c0 | 3913f8730ec6d6245480affc30ae3049107956f4 | 2025-09-16T15:27:52+02:00 | Daniel Bevenius | ci : use macos-latest for arm64 webgpu build (#16029) | |
| 586 | 3913f8730ec6d6245480affc30ae3049107956f4 | 76888d202ed2b835ae19ea9f9db6baf39e419297 | 2025-09-16T15:25:57+02:00 | Daniel Bevenius | ggml : fix padding in timestep embedding kernels (#15932) | |
| 587 | 76888d202ed2b835ae19ea9f9db6baf39e419297 | f1fbffb5c0b34b2a68febb7da3fd0f8333f1ed4c | 2025-09-16T13:41:38+02:00 | Daniel Bevenius | ci : upload xcframework artifact from ios-xcode-build job (#16010) | |
| 588 | f1fbffb5c0b34b2a68febb7da3fd0f8333f1ed4c | 51abc96bdc52ba8cd6ad78dcf12ed9a041d7b442 | 2025-09-15T23:59:19-07:00 | Bowen Han | fix: apply clang-format to CUDA macros (#16017) | |
| 589 | 51abc96bdc52ba8cd6ad78dcf12ed9a041d7b442 | 07808ebb07e2b1aa19032705e332679ddf967614 | 2025-09-16T05:57:16+02:00 | Daniel Bevenius | ci : update macos-latest* jobs to use macos-latest (#15938) | |
| 590 | 07808ebb07e2b1aa19032705e332679ddf967614 | 6d758839ff741d4966ca92b7f801b7a8b5b96364 | 2025-09-15T22:54:44-04:00 | Yuri Khrustalev | cmake : Do not install tools on iOS targets (#15903) | |
| 591 | 6d758839ff741d4966ca92b7f801b7a8b5b96364 | 3d4053f77f0f78ee2b791088c02af653ebee42dd | 2025-09-16T10:38:28+08:00 | Aman Gupta | Add LLaDA-7b-MoE diffusion model (#16003) | |
| 592 | 3d4053f77f0f78ee2b791088c02af653ebee42dd | dc381aa9a6dc45f00673471d34b8bddd30e77570 | 2025-09-15T16:28:31-06:00 | Jake Karnes | CUDA: fix im2col_3d to respect non-contiguous inputs (views) (#15956) | |
| 593 | dc381aa9a6dc45f00673471d34b8bddd30e77570 | 10d197409bd9537ff302ad09966fe406882fef9d | 2025-09-15T14:38:52-07:00 | Diego Devesa | docker : enable rocWMMA in ROCm images, add gfx1151 (#15997) | |
| 594 | 10d197409bd9537ff302ad09966fe406882fef9d | b907255f4bd169b0dc7dca9553b4c54af5170865 | 2025-09-15T14:38:42-07:00 | Diego Devesa | releases : switch to rocWMMA develop branch, add gfx1151 (#15992) | |
| 595 | b907255f4bd169b0dc7dca9553b4c54af5170865 | 28c39da7c645185ade5436767929d7ec33006033 | 2025-09-15T19:51:35+03:00 | yael-works | SYCL: Add COUNT_EQUAL operator support (#15991) | |
| 596 | 28c39da7c645185ade5436767929d7ec33006033 | 106220562aca42b6738b8f51acfce0db1b8a2fb6 | 2025-09-15T13:08:30+03:00 | Nikolay Popov | llama-run: Fix model download on Windows (#15988) | |
| 597 | 106220562aca42b6738b8f51acfce0db1b8a2fb6 | a68f31edd71cc39141113f05f7133a3e9ece8c61 | 2025-09-15T17:35:11+08:00 | Aman Gupta | CUDA: some micro-optimizations in mmf.cuh for mul_mat_id (#15926) | |
| 598 | a68f31edd71cc39141113f05f7133a3e9ece8c61 | b8e09f08b9a91c0401bc67d17a17c90756420346 | 2025-09-15T02:54:57-05:00 | ddh0 | fix KLD percentile output (#15999) | |
| 599 | b8e09f08b9a91c0401bc67d17a17c90756420346 | 6c019cb04e86e2dacfe62ce7666c64e9717dde1f | 2025-09-14T23:00:59+02:00 | Sigbjørn Skjæret | model : add grok-2 support (#15539) | |
| 600 | 6c019cb04e86e2dacfe62ce7666c64e9717dde1f | 9dcd200d57bc6f05a59a6a8df361d5d183af4124 | 2025-09-14T21:17:04+02:00 | Sigbjørn Skjæret | server : only attempt to enable thinking if using jinja (#15967) | |
| 601 | 9dcd200d57bc6f05a59a6a8df361d5d183af4124 | 0fa154e3502e940df914f03b41475a2b80b985b0 | 2025-09-14T22:02:32+03:00 | Georgi Gerganov | metal : remove memory pools (#15966) | |
| 602 | 0fa154e3502e940df914f03b41475a2b80b985b0 | 261e6a20ffdb79c4875e674b4f6b514bc73cff8f | 2025-09-15T04:43:54+10:00 | Adam | rocm.Dockerfile: added gfx1200,gfx1201 architectures to support AMD Radeon RX 9000 series (#15994) | |
| 603 | 261e6a20ffdb79c4875e674b4f6b514bc73cff8f | a0e13dcbe5bae7025660349ef3e4ead060e507f2 | 2025-09-14T16:56:28+02:00 | Ruben Ortlam | Vulkan: Clean up mul_mm shader (#15987) | |
| 604 | a0e13dcbe5bae7025660349ef3e4ead060e507f2 | a14bd350141fb42b8bf2dd2342cebc27bfdce399 | 2025-09-14T22:20:35+08:00 | lcy | build: fix the build failures of Windows HIP release job (#15984) | |
| 605 | a14bd350141fb42b8bf2dd2342cebc27bfdce399 | 918b26f197f55d5d562446dfc876d0e637929d07 | 2025-09-14T15:33:22+03:00 | Georgi Gerganov | metal : fix kernel requirements (#15983) | |
| 606 | 918b26f197f55d5d562446dfc876d0e637929d07 | 9ecb88434644c865232bb665d2f6f05049fc6456 | 2025-09-14T12:28:18+03:00 | Radoslav Gerganov | rpc : fix regression when --device is used (#15981) | |
| 607 | 9ecb88434644c865232bb665d2f6f05049fc6456 | d1c6f11f47bae063a68a6be8e4830c060a11b7bd | 2025-09-14T02:21:59-07:00 | Diego Devesa | releases : update ROCM, add gfx1200, gfx1201, gfx1151 (#15972) | |
| 608 | d1c6f11f47bae063a68a6be8e4830c060a11b7bd | 6380d6a3e709cb02a8695afdd96b40e674477332 | 2025-09-14T12:10:07+03:00 | Radoslav Gerganov | doc : update documentation for --tensor-split (#15980) | |
| 609 | 6380d6a3e709cb02a8695afdd96b40e674477332 | aa0c461efe3603639af1a1defed2438d9c16ca0f | 2025-09-14T13:37:03+08:00 | Aaron Teo | ggml-zdnn: rm user mapped buffers (#15965) | |
| 610 | aa0c461efe3603639af1a1defed2438d9c16ca0f | b9c9c9f789cd57fb0b28b25223305613cd90fa10 | 2025-09-13T16:29:43+01:00 | Jeff Bolz | vulkan: fix failing dequant shaders (#15862) | |
| 611 | b9c9c9f789cd57fb0b28b25223305613cd90fa10 | 50f4281a6f5c3a5d68bdeb12f904fa01e0e2ba91 | 2025-09-13T16:23:30+01:00 | Jeff Bolz | vulkan: initialize vulkan-hpp to allow using extension function pointers (#15705) | |
| 612 | 50f4281a6f5c3a5d68bdeb12f904fa01e0e2ba91 | 55758b00cae1451a0d789c50a5eb8c9bee42b9a0 | 2025-09-13T07:49:49-07:00 | Diego Devesa | llama : allow using iGPUs with --device (#15951) | |
| 613 | 55758b00cae1451a0d789c50a5eb8c9bee42b9a0 | f161463a54d9f93d41246286aa4a9569a91d804d | 2025-09-13T16:24:22+03:00 | Georgi Gerganov | metal : refactor kernel loading (#15964) | |
| 614 | f161463a54d9f93d41246286aa4a9569a91d804d | 84d7b2fca11d1be118ce776f6d72a486c4883b74 | 2025-09-13T13:54:28+03:00 | Georgi Gerganov | metal : allow ops to run concurrently (#15929) | |
| 615 | 84d7b2fca11d1be118ce776f6d72a486c4883b74 | 40be51152d4dc2d47444a4ed378285139859895b | 2025-09-13T12:45:04+03:00 | Georgi Gerganov | metal : fix memory leaks (#15962) | |
| 616 | 40be51152d4dc2d47444a4ed378285139859895b | 4bf5549269d99bac936a65892da2312cc71b2421 | 2025-09-13T02:39:52+08:00 | Aaron Teo | ggml-zdnn: fix #15414, activate FP16 and BF16 acceleration and incorrect zTensor free (#15839) | |
| 617 | 4bf5549269d99bac936a65892da2312cc71b2421 | f4e664f838cc65d89fa845c48c372e43852112e4 | 2025-09-12T16:31:50+01:00 | Eric Curtin | Add docker protocol support for llama-server model loading (#15790) | |
| 618 | f4e664f838cc65d89fa845c48c372e43852112e4 | f088b6a84f6aed0abb619dbb9d375e726fc888a6 | 2025-09-12T23:16:32+08:00 | Haiyue Wang | context : remove redundant explicit casting to the same type (#15948) | |
| 619 | f088b6a84f6aed0abb619dbb9d375e726fc888a6 | 304ac5693d1e2124f83e0584bc5eea6311d3d3b4 | 2025-09-12T17:02:55+03:00 | Georgi Gerganov | server : adjust prompt similarity thold + add logs (#15913) | |
| 620 | 304ac5693d1e2124f83e0584bc5eea6311d3d3b4 | 6c88ad8fa741a2182a2dcf8c5353ae4b5c66e656 | 2025-09-12T13:24:21+02:00 | Ruben Ortlam | Vulkan iGPU device selection overhaul and PCI ID API support (#15947) | |
| 621 | 6c88ad8fa741a2182a2dcf8c5353ae4b5c66e656 | 704d90c987cdf00751567b2088c4e54742aa2d3f | 2025-09-12T09:06:20+02:00 | Mathieu Baudier | vulkan: Make device memory check more portable (#15939) | |
| 622 | 360d6533db39e11577afe9b0aece20c6b5ddaf1f | 0e6ff0046f4a2983b2c77950aa75960fe4b4f0e2 | 2025-09-11T13:47:38-07:00 | Diego Devesa | ggml-backend : add GGML_BACKEND_DEVICE_TYPE_IGPU device type (#15797) | |
| 623 | 0e6ff0046f4a2983b2c77950aa75960fe4b4f0e2 | df082f56309073ecf885eceaa21b86e8a487e61b | 2025-09-11T21:19:58+02:00 | Johannes Gäßler | CUDA: larger SRAM reads for tile FA, AMD FP16 dot (#15927) | |
| 624 | df082f56309073ecf885eceaa21b86e8a487e61b | 24a6734daf6932ff29ba8c1ff0245c51d76f783e | 2025-09-11T12:12:34-05:00 | ddh0 | nitpick : correct MB to MiB (#15934) | |
| 625 | 24a6734daf6932ff29ba8c1ff0245c51d76f783e | 2b3efea9a4d91216850856fbb77075db26f6a6eb | 2025-09-11T15:39:12+02:00 | Daniel Bevenius | ggml-cpu : add check for ARM MATMUL_INT8/i8mm support (#15922) | |
| 626 | 2b3efea9a4d91216850856fbb77075db26f6a6eb | c0389dba43d50695f9d3f57dd1f1a14cbefc100c | 2025-09-11T12:45:40+02:00 | Charles Xu | kleidiai: fix GGML_ASSERT(*cur_backend_id != -1) failed (#15614) | |
| 627 | c0389dba43d50695f9d3f57dd1f1a14cbefc100c | 00681dfc16ba4cebb9c7fbd2cf2656e06a0692a4 | 2025-09-11T15:59:37+08:00 | hipudding | CANN: Disable acl_graph for prefill stage (#15933) | |
| 628 | 00681dfc16ba4cebb9c7fbd2cf2656e06a0692a4 | 4f658855fa8f2e42b7ed9a5b298fa39a2e39b096 | 2025-09-10T22:04:03+02:00 | Oliver Simons | CUDA: Add `fastdiv` to `k_bin_bcast*`, giving 1-3% E2E performance (#15872) | |
| 629 | 4f658855fa8f2e42b7ed9a5b298fa39a2e39b096 | 6ab397e12ba8e9f776341cdae68f7ffb2f8d2cde | 2025-09-11T02:51:51+08:00 | Jie Fu (傅杰) | llama : support T5 models with unequal number of encoder-decoder layers (#15909) | |
| 630 | 6ab397e12ba8e9f776341cdae68f7ffb2f8d2cde | 9de447d94e1ae9d1a36e5a2e5bf47483352c0d9c | 2025-09-10T19:08:59+02:00 | Sigbjørn Skjæret | graph : support non-contiguous Q in build_attn_mha (#15908) | |
| 631 | 9de447d94e1ae9d1a36e5a2e5bf47483352c0d9c | 0f0a3c2851134d49955f3c85afbb0b1bb47c3e07 | 2025-09-10T17:31:40+02:00 | Daniel Bevenius | ggml-cpu : fix padding in ggml_timestep_embedding (#15917) | |
| 632 | 0f0a3c2851134d49955f3c85afbb0b1bb47c3e07 | 33daece86b65607451d0d4378d2d04ba6a20ad55 | 2025-09-10T17:52:35+03:00 | Georgi Gerganov | metal : make the backend async (#15906) | |
| 633 | 33daece86b65607451d0d4378d2d04ba6a20ad55 | e7b6d83b524bbc24a1343d862de6dba8e8eddbd6 | 2025-09-10T15:39:57+02:00 | Daniel Bevenius | ci : add caching for ROCm installation in release workflow (#15924) | |
| 634 | e7b6d83b524bbc24a1343d862de6dba8e8eddbd6 | 2cfef4d117d67ab1dec002915b48a15d11ee1973 | 2025-09-10T14:17:09+02:00 | Daniel Bevenius | tests : filter out no-ops from coverage report (#15900) | |
| 635 | 2cfef4d117d67ab1dec002915b48a15d11ee1973 | 09e72a037c77b6823fde9e1e4cf28e815b9c41ab | 2025-09-10T12:51:28+01:00 | j-k | media : add transparent icon svg and png [no ci] (#15891) | |
| 636 | 09e72a037c77b6823fde9e1e4cf28e815b9c41ab | 10d8b2b6b0ac2cae252a80b4daea5da55ab63c2f | 2025-09-10T07:28:47-04:00 | Jesse | gitignore : Ignore vim swap files in tests (#15901) | |
| 637 | 10d8b2b6b0ac2cae252a80b4daea5da55ab63c2f | 28b5f190ef1dbea5edf82dbc8b4407b721fadd13 | 2025-09-10T18:42:00+08:00 | Chenguang Li | CANN: Add ROPE sin/cos cache for reuse (#15912) | |
| 638 | 28b5f190ef1dbea5edf82dbc8b4407b721fadd13 | 86587da03bd78df8f4e7d8b111a0c1d2494d6ed0 | 2025-09-10T15:29:12+08:00 | Chenguang Li | CANN: implement LRU cache for ACL graphs (#15814) | |
| 639 | 86587da03bd78df8f4e7d8b111a0c1d2494d6ed0 | ff02caf9eed261423289d1531a56536fbf57bfc2 | 2025-09-10T05:33:58+02:00 | Daniel Bevenius | llama : check returned fn ptrs from ggml_backend_reg_get_proc_address (#15893) | |
| 640 | ff02caf9eed261423289d1531a56536fbf57bfc2 | ae355f6f7108540297d8b7f7ae71d20fe610a0b7 | 2025-09-10T05:23:19+02:00 | Daniel Bevenius | ci : cache ROCm installation in windows-latest-cmake-hip (#15887) | |
| 641 | ae355f6f7108540297d8b7f7ae71d20fe610a0b7 | 4f63cd705c7b6f457f36c63fdc053e07f6f3cc6b | 2025-09-09T22:26:03+02:00 | Ruben Ortlam | vulkan: throw the oom error instead of no memory type found (#15905) | |
| 642 | 4f63cd705c7b6f457f36c63fdc053e07f6f3cc6b | 17bc5a815f0bebc1844c99796760cd7df5e9b8d9 | 2025-09-09T07:41:15-05:00 | Jeff Bolz | vulkan: Fix OOB accesses in soft_max_back (#15861) | |
| 643 | 17bc5a815f0bebc1844c99796760cd7df5e9b8d9 | ed54e32558ffe0f2c3b1d31f3227211fae05bd49 | 2025-09-09T14:04:43+02:00 | Johannes Gäßler | HIP: use v_dot2_f32_f16 instruction for FA (#15884) | |
| 644 | ed54e32558ffe0f2c3b1d31f3227211fae05bd49 | a972faebed5fdc4a3d2a844d92d476058c02e02d | 2025-09-09T15:01:15+03:00 | lksj92hs | Workaround for subgroup arithmetic failing on MoltenVK with AMD GPUs (issue 15846) (#15886) | |
| 645 | a972faebed5fdc4a3d2a844d92d476058c02e02d | 550cf726e133fd0a069d991287fd3a2a3e3e1cbd | 2025-09-09T14:38:02+08:00 | Aman Gupta | CUDA: Add mul_mat_id support for the mmf kernel (#15767) | |
| 646 | 550cf726e133fd0a069d991287fd3a2a3e3e1cbd | c252ce67c4b99f056eeb18d42a289e28fee03475 | 2025-09-09T08:11:01+02:00 | Johannes Gäßler | CUDA: fix GET_ROWS for large tensors (#15882) | |
| 647 | c252ce67c4b99f056eeb18d42a289e28fee03475 | 70cd37dbbebdb7a2f84f08207f18eabb0b291a55 | 2025-09-09T08:42:10+03:00 | Georgi Gerganov | contrib : add notes about merging PRs (#15881) | |
| 648 | 70cd37dbbebdb7a2f84f08207f18eabb0b291a55 | acc1b008cfd95e63d5f99a370dbffb98e5a99d2c | 2025-09-09T06:06:52+02:00 | Daniel Bevenius | requirements : update transformers/torch for Embedding Gemma (#15828) | |
| 649 | acc1b008cfd95e63d5f99a370dbffb98e5a99d2c | 7057faf64b514e991e2f70147f82bb13d544b1c0 | 2025-09-09T06:05:55+02:00 | Piotr Wilkin (ilintar) | model-conversion : add extra debugging support for model conversion (#15877) | |
| 650 | 7057faf64b514e991e2f70147f82bb13d544b1c0 | fe1c92cd7bb491e9c5767c9de413f2b7dc1e832b | 2025-09-08T16:14:32-05:00 | Aldehir Rojas | json : support `enum` values within `allOf` (#15830) | |
| 651 | fe1c92cd7bb491e9c5767c9de413f2b7dc1e832b | e68aa10d8f3d26fdad5b912540362d79de5460e3 | 2025-09-08T19:57:01+01:00 | j-k | media : add llama1 icon (#15878) | |
| 652 | e68aa10d8f3d26fdad5b912540362d79de5460e3 | 0a16bf52e6874369cb4fd2bdc4863ef984b688e7 | 2025-09-08T13:10:07-05:00 | Jeff Bolz | vulkan: sort graph to allow more parallel execution (#15850) | |
| 653 | 0a16bf52e6874369cb4fd2bdc4863ef984b688e7 | 88021565f08e0b7c4e07ac089a15ec16fae9166c | 2025-09-09T01:23:46+08:00 | Aman Gupta | CUDA: generate_cu_files.py - add missing mxfp4 (#15880) | |
| 654 | 88021565f08e0b7c4e07ac089a15ec16fae9166c | 56920f56651908d5cce7a310dabf54ac4f6fbb7f | 2025-09-08T10:59:48-04:00 | Jesse | chat : Deepseek V3.1 reasoning and tool calling support (OpenAI Style) (#15533) | |
| 655 | 56920f56651908d5cce7a310dabf54ac4f6fbb7f | b0d52998b962bd2681c34bf52af993af79f178b8 | 2025-09-08T21:50:05+07:00 | Xuan-Son Nguyen | server : bring back timings_per_token (#15879) | |
| 656 | b0d52998b962bd2681c34bf52af993af79f178b8 | f28d4f4ac963f182ea9d0fe9e269f3f5f3782aaf | 2025-09-08T13:56:51+03:00 | Georgi Gerganov | cuda : fix supports_op condition for get_rows when number of blocks is too large (#15868) | |
| 657 | f28d4f4ac963f182ea9d0fe9e269f3f5f3782aaf | 9fcb29f22f5c33c04c7f0daebb24057899d67a1a | 2025-09-08T13:34:56+03:00 | Georgi Gerganov | metal : refactor + optimize (#15857) | |
| 658 | 9fcb29f22f5c33c04c7f0daebb24057899d67a1a | 5ef22d281de9c5eaaf616874bc490b89241128cb | 2025-09-08T17:33:01+07:00 | Xuan-Son Nguyen | ggml: allow casting between f32 and i32 (#15783) | |
| 659 | 5ef22d281de9c5eaaf616874bc490b89241128cb | 233d773d02c37982badddf3994e9953a175f34da | 2025-09-08T11:55:44+02:00 | Sigbjørn Skjæret | CUDA: non-contiguous src0 not supported for PAD (#15869) | |
| 660 | 233d773d02c37982badddf3994e9953a175f34da | a885dcff11a7b73f9377812d6151f6b15d307de0 | 2025-09-08T09:44:34+02:00 | Daniel Bevenius | convert : force setting sliding_window from original config (#15867) | |
| 661 | a885dcff11a7b73f9377812d6151f6b15d307de0 | 663027fd5490438ce9c27ea866a560e1e268d11f | 2025-09-08T10:27:07+03:00 | Georgi Gerganov | batched-bench : fix llama_synchronize usage during prompt processing (#15835) | |
| 662 | 663027fd5490438ce9c27ea866a560e1e268d11f | cf0e3ba1500bd23635b444f64ba23cbdb56c92ef | 2025-09-08T10:26:36+03:00 | Georgi Gerganov | context : fix n_outputs during reserve (#15858) | |
| 663 | cf0e3ba1500bd23635b444f64ba23cbdb56c92ef | d413dca00360a7e4cb71441dacecfa32556fcc31 | 2025-09-08T10:25:33+03:00 | Georgi Gerganov | model : avoid ggml_cont_3d for fused QKV weights (#15662) | |
| 664 | d413dca00360a7e4cb71441dacecfa32556fcc31 | 85ca66a74676e6d5df4433016488e039a4b464ae | 2025-09-07T23:23:41-05:00 | Jeff Bolz | tests: large sizes for get_rows (#15687) | |
| 665 | 85ca66a74676e6d5df4433016488e039a4b464ae | 3976dfbe00f02a62c0deca32c46138e4f0ca81d8 | 2025-09-08T10:03:29+08:00 | Chenguang Li | CANN: Stream sync between devices for acl_graph (#15809) | |
| 666 | 3976dfbe00f02a62c0deca32c46138e4f0ca81d8 | d36e61c580bf7fc7879c443c542312a42b718e11 | 2025-09-07T13:50:26-05:00 | Jeff Bolz | vulkan: support im2col_3d (#15795) | |
| 667 | d36e61c580bf7fc7879c443c542312a42b718e11 | c97b5e5854b47b18a248d77edb693c63018a0865 | 2025-09-08T02:18:28+08:00 | Aaron Teo | ggml-cpu: clean up s390x SIMD (#15855) | |
| 668 | c97b5e5854b47b18a248d77edb693c63018a0865 | 267e99867f09bec8bcc2e424ad9bcddd6cccf9d0 | 2025-09-07T12:00:49-05:00 | Jeff Bolz | vulkan: Support pad_ext (#15794) | |
| 669 | 267e99867f09bec8bcc2e424ad9bcddd6cccf9d0 | 3b15924d71237a43bb5ad71f5b885ee66a821342 | 2025-09-07T11:53:07-05:00 | Jeff Bolz | vulkan: Use larger loads in scalar/coopmat1 matmul (#15729) | |
| 670 | 3b15924d71237a43bb5ad71f5b885ee66a821342 | 79bc429262268ad2ac8a364cfe6c2d6b9c5f008a | 2025-09-07T10:19:45+02:00 | Daniel Bevenius | ggml WebGPU: remove userdata from request adapter callback (#15527) | |
| 671 | 79bc429262268ad2ac8a364cfe6c2d6b9c5f008a | c4df49a42d396bdf7344501813e7de53bc9e7bb3 | 2025-09-07T00:26:28+02:00 | Johannes Gäßler | CUDA: faster tile FA (Pascal/AMD), headsize 256 (#15769) | |
| 672 | c4df49a42d396bdf7344501813e7de53bc9e7bb3 | 3c3635d2f20424d557b5b0605a2a356214ffe048 | 2025-09-06T16:08:43+02:00 | Charles Xu | kleidiai: generalize compute_forward_kv_cache to compute_forward_fp16 (#15817) | |
| 673 | 3c3635d2f20424d557b5b0605a2a356214ffe048 | 61bdfd5298a78593be649a1035ee2a120b13c4f0 | 2025-09-06T19:45:24+07:00 | Xuan-Son Nguyen | server : speed up tests (#15836) | |
| 674 | 61bdfd5298a78593be649a1035ee2a120b13c4f0 | 01806e77714ae8a78130d432945b959a0956c56f | 2025-09-06T18:35:04+07:00 | Xuan-Son Nguyen | server : implement prompt processing progress report in stream mode (#15827) | |
| 675 | 186415d59552bd5c90549cd8e9be3cc287621fd9 | fd621880f3fd908424e675a41715a2dc760247a2 | 2025-09-06T11:27:28+08:00 | Aaron Teo | ggml-cpu: drop support for nnpa intrinsics (#15821) | |
| 676 | fd621880f3fd908424e675a41715a2dc760247a2 | 4281c7b315f8a904549fe527039b976e08098d1a | 2025-09-05T17:32:39-06:00 | Gabe Goodhart | aLoRA Support (#15327) | |
| 677 | 4281c7b315f8a904549fe527039b976e08098d1a | 5fac79cbc77b6d12c9feb5f34fc63586b35fd561 | 2025-09-06T01:21:15+02:00 | Sigbjørn Skjæret | ci : exempt correct research label (#15825) | |
| 678 | 5fac79cbc77b6d12c9feb5f34fc63586b35fd561 | 408ff524b40baf4f51a81d42a9828200dd4fcb6b | 2025-09-05T14:31:24-06:00 | Gabe Goodhart | Thinking model disabled assistant prefill (#15404) | |
| 679 | 408ff524b40baf4f51a81d42a9828200dd4fcb6b | 5143fa895e7725c5bd2135daf7d8f793d98fa91c | 2025-09-05T19:43:59+01:00 | Eric Curtin | Implement --log-colors with always/never/auto (#15792) | |
| 680 | 5143fa895e7725c5bd2135daf7d8f793d98fa91c | 3a550b5ca4565c9e28f63880d47840feb27d0ff6 | 2025-09-05T16:07:02+02:00 | Johannes Gäßler | CUDA: fastdiv, launch bounds for mmvq + q8_1 quant (#15802) | |
| 681 | 3a550b5ca4565c9e28f63880d47840feb27d0ff6 | a81283820a466f2ace06ce4d4bc9512761f9365f | 2025-09-05T14:49:21+02:00 | Daniel Bevenius | tests : add --list-ops and --show-coverage options (#15745) | |
| 682 | a81283820a466f2ace06ce4d4bc9512761f9365f | c610b6c11b1ef7d678671dcf15acd7187a7ad8f3 | 2025-09-05T11:34:28+02:00 | Erik Scholz | gguf: gguf_writer refactor (#15691) | |
| 683 | c610b6c11b1ef7d678671dcf15acd7187a7ad8f3 | 5d6688de08e73acc2532d668380801ed79d704eb | 2025-09-05T10:39:22+03:00 | Georgi Gerganov | kv-cache : fix SWA checks + disable cacheless iSWA (#15811) | |
| 684 | dcbe998a6d8f13b6c9cb36bbe7b355ced2ac3842 | 87932ec016f0ec81e98a13ce5212851f8c12458a | 2025-09-05T14:34:07+08:00 | Yunzhe Jia | add calrt API used in server side | |
| 685 | 5d6688de08e73acc2532d668380801ed79d704eb | 4fd1242bef6cb2325b4ff1c1a80f3b54b64508a6 | 2025-09-05T04:36:23+02:00 | Daniel Bevenius | model-conversion : add --embeddings flag to modelcard.template [no ci] (#15801) | |
| 686 | 4fd1242bef6cb2325b4ff1c1a80f3b54b64508a6 | b2426e469e2fdb6c44216d56baa4cfff4f39ae00 | 2025-09-05T01:24:08+02:00 | ExtReMLapin | chat : fixed crash when Hermes 2 <tool_call> had a newline before it (#15639) | |
| 687 | b2426e469e2fdb6c44216d56baa4cfff4f39ae00 | 9e2b1e83c68a38ea0c64f726dd979439bd02189b | 2025-09-05T01:22:22+02:00 | Piotr Wilkin (ilintar) | chat : nemotron thinking & toolcalling support (#15676) | |
| 688 | 9e2b1e83c68a38ea0c64f726dd979439bd02189b | fb15d649ed14ab447eeab911e0c9d21e35fb243e | 2025-09-05T01:05:12+02:00 | Piotr Wilkin (ilintar) | scripts : add Jinja tester PySide6 simple app (#15756) | |
| 689 | fb15d649ed14ab447eeab911e0c9d21e35fb243e | 856ed0947f27b4ec3ad269fceda0402fbab263d3 | 2025-09-04T18:10:29+02:00 | Daniel Bevenius | llama : add support for EmbeddingGemma 300m (#15798) | |
| 690 | 856ed0947f27b4ec3ad269fceda0402fbab263d3 | d1e2adba65208d6de3d7f6f23b00c562ff5bb777 | 2025-09-04T09:53:22-06:00 | Gabe Goodhart | metal : Add template specialization for mul_mm_id w/ ne20 == 10 (#15799) | |
| 691 | d1e2adba65208d6de3d7f6f23b00c562ff5bb777 | c1c354e44c06d259679bb5bb7a8fa9f0b28480e4 | 2025-09-04T15:40:44+02:00 | Daniel Bevenius | llama : set n_outputs to 1 to avoid 0 outputs mean-pooling (#15791) | |
| 692 | c1c354e44c06d259679bb5bb7a8fa9f0b28480e4 | a68d9144262f1d0ef4f6ba7ad4a7e73e977ba78c | 2025-09-04T20:20:14+08:00 | Chenguang Li | CANN: Refactor ND to NZ workspace to be per-device (#15763) | |
| 693 | a68d9144262f1d0ef4f6ba7ad4a7e73e977ba78c | badb80cadbc40e047b30c43611aba575fc8d6845 | 2025-09-04T11:50:23+02:00 | Xuan-Son Nguyen | server: add exceed_context_size_error type (#15780) | |
| 694 | badb80cadbc40e047b30c43611aba575fc8d6845 | 0a1b3982cd0bd18730d50a693053b88c13fd04a6 | 2025-09-04T10:49:44+01:00 | Eric Curtin | Document the new max GPU layers default in help (#15771) | |
| 695 | 0a1b3982cd0bd18730d50a693053b88c13fd04a6 | 5421f63ab08ca1e1a093662a5ccd0117e461185f | 2025-09-04T16:38:49+08:00 | leejet | ggml: add ops for WAN video model (cuda && cpu) (#15669) | |
| 696 | 5421f63ab08ca1e1a093662a5ccd0117e461185f | 820bc9853100708011036e10f40b923968dd9b66 | 2025-09-04T15:12:30+08:00 | hipudding | CANN: Fix precision issue on 310I DUO multi-devices (#15784) | |
| 697 | 820bc9853100708011036e10f40b923968dd9b66 | 239b60e8986bbcb944f57311a02ac994431bf652 | 2025-09-04T08:30:28+02:00 | rmatif | opencl: add hs=40 to FA (#15758) | |
| 698 | 239b60e8986bbcb944f57311a02ac994431bf652 | dff7551bfdbdd6e57c13e523d7dcca317640e907 | 2025-09-04T11:03:02+08:00 | Chenguang Li | CANN: fix acl_rstd allocation size in ggml_cann_rms_norm (#15760) | |
| 699 | dff7551bfdbdd6e57c13e523d7dcca317640e907 | 0fce7a1248b74148c1eb0d368b7e18e8bcb96809 | 2025-09-03T22:55:10+02:00 | Ruben Ortlam | vulkan: fix mmv subgroup16 selection (#15775) | |
| 700 | 0fce7a1248b74148c1eb0d368b7e18e8bcb96809 | 8227695d7a3e5b357cb37fad263f00a8ca6db710 | 2025-09-03T13:33:15-05:00 | Jeff Bolz | vulkan: don't use std::string in load_shaders, to improve compile time (#15724) | |
| 701 | 8227695d7a3e5b357cb37fad263f00a8ca6db710 | 0014fb4add3a7d000c14b763538045c6170f57d9 | 2025-09-03T20:24:50+02:00 | Daniel Bevenius | vulkan : update ggml_vk_instance_validation_ext_available (#15666) | |
| 702 | 0014fb4add3a7d000c14b763538045c6170f57d9 | 661ae31c9c68201577e70278285b349a5a662caf | 2025-09-04T03:22:55+09:00 | Shin-myoung-serp | ggml vulkan: add hardsigmoid and hardswish operations (#15762) | |
| 703 | 661ae31c9c68201577e70278285b349a5a662caf | 407c23786dd0d3a503e9429eead96e611d3950c9 | 2025-09-03T19:59:16+02:00 | Oliver Simons | CUDA: Optimize `rms_norm_f32` kernel and its fused variants, giving 1-6% perf E2E (#15715) | |
| 704 | 407c23786dd0d3a503e9429eead96e611d3950c9 | cdedb70a998cea7052560fe0b0615a839443564d | 2025-09-03T18:28:36+02:00 | Daniel Bevenius | model-conversion : fix pyright errors (#15770) | |
| 705 | cdedb70a998cea7052560fe0b0615a839443564d | 2c8dac72eb6acd4e20c0da251535dfc46d35178b | 2025-09-03T18:16:26+03:00 | Georgi Gerganov | sampling : optimize dist sampler (#15704) | |
| 706 | 2c8dac72eb6acd4e20c0da251535dfc46d35178b | 40a751ea9a94364da73537b86502a808ebe1fc3a | 2025-09-03T13:35:49+02:00 | Daniel Bevenius | llama : fix incorrect model type for Gemma 270M (#15764) | |
| 707 | 40a751ea9a94364da73537b86502a808ebe1fc3a | 5eae9348835037046f33fafd852df7c952c95209 | 2025-09-03T12:50:47+02:00 | Daniel Bevenius | model-conversion : remove hardcoded /bin/bash shebangs [no ci] (#15765) | |
| 708 | 5eae9348835037046f33fafd852df7c952c95209 | 05c0380f2ae5c7193445e03ebc7b6de9ce49f1a6 | 2025-09-03T16:46:01+08:00 | hipudding | CANN: Add RoPE contiguous check for 310I DUP device (#15735) | |
| 709 | 05c0380f2ae5c7193445e03ebc7b6de9ce49f1a6 | 8c3fdf44ecf08335942f2ba558955f55e88c7991 | 2025-09-03T16:16:21+08:00 | xctan | ggml-cpu : optimize RVV kernels (#15720) | |
| 710 | 8c3fdf44ecf08335942f2ba558955f55e88c7991 | f6da8cb86a28f0319b40d9d2a957a26a7d875f8c | 2025-09-03T09:48:35+02:00 | Daniel Bevenius | model-conversion : add missing curl script [no ci] (#15761) | |
| 711 | f6da8cb86a28f0319b40d9d2a957a26a7d875f8c | 8a2234ea0c89f212190c176d741b7742f0082582 | 2025-09-03T14:08:22+08:00 | hipudding | CANN: Mask unsupported TRANSPOSE_1D operator (#15733) | |
| 712 | 8a2234ea0c89f212190c176d741b7742f0082582 | 3de008208b9b8a33f49f979097a99b4d59e6e521 | 2025-09-03T10:43:53+08:00 | Chenguang Li | CANN: Fix type float_t to float (#15736) | |
| 713 | 3de008208b9b8a33f49f979097a99b4d59e6e521 | 69db8a52e6dd0db81ec05c581150cc1e43b8ac46 | 2025-09-03T03:27:30+08:00 | SnA1lGo | fix: resolve unsigned int initialization warning for n_dims/size in gguf.cpp (#15754) | |
| 714 | 69db8a52e6dd0db81ec05c581150cc1e43b8ac46 | c466abe1587bde458c806e2134e37750f2edf8fb | 2025-09-02T19:40:37+02:00 | Oliver Simons | chore: Update `.clang-format` to use `BinPackArguments=true` (#15744) | |
| 715 | c466abe1587bde458c806e2134e37750f2edf8fb | 0a2a3841e8ebc570da343e8cf58a21c1010b41e7 | 2025-09-02T18:17:26+02:00 | Johannes Gäßler | llama: -fa 1/0/-1 aliases for -fa on/off/auto (#15746) | |
| 716 | 0a2a3841e8ebc570da343e8cf58a21c1010b41e7 | 9961d244f2df6baf40af2f1ddc0927f8d91578c8 | 2025-09-02T16:02:26+02:00 | Ruben Ortlam | vulkan: fix shaders gen when no integer dot is available (#15740) | |
| 717 | 9961d244f2df6baf40af2f1ddc0927f8d91578c8 | 25f1045f07cf0daf667d63e35618842e3174a8c7 | 2025-09-02T17:12:37+08:00 | hipudding | CANN: Resolve soft_max precision issue (#15730) | |
| 718 | 25f1045f07cf0daf667d63e35618842e3174a8c7 | 97669e40735d08db65ef094a8faae8e8411a97db | 2025-09-02T01:37:01-05:00 | Jeff Bolz | vulkan: Fix macro parameter order for f32 matmul shaders (#15716) | |
| 719 | 97669e40735d08db65ef094a8faae8e8411a97db | 2f853687b3bce15e143a22f678d1715060fd606c | 2025-09-02T08:26:53+02:00 | rmatif | opencl: add attn sinks support for FA kernels (#15706) | |
| 720 | 2f853687b3bce15e143a22f678d1715060fd606c | ef2af57ddf04ab367f6ba6e8ed100fc56785e4b7 | 2025-09-02T14:07:48+08:00 | Chenguang Li | CANN: Support eager execution mode under ACL graph compilation (#15712) | |
| 721 | ef2af57ddf04ab367f6ba6e8ed100fc56785e4b7 | 5d804a4938d896f9089687a8b99911cdb43b0b94 | 2025-09-02T14:05:23+08:00 | hipudding | CANN: Support ext_factor in rope (#15710) | |
| 722 | 5d804a4938d896f9089687a8b99911cdb43b0b94 | d4d8dbe383e8b9600cbe8b42016e3a4529b51219 | 2025-09-02T01:14:55+02:00 | Johannes Gäßler | ggml-backend: raise GGML_MAX_SPLIT_INPUTS (#15722) | |
| 723 | d4d8dbe383e8b9600cbe8b42016e3a4529b51219 | 35a42edac84690990a75726898d975cd08d220c0 | 2025-09-01T22:17:42+03:00 | Gilad S. | vulkan: use memory budget extension to read memory usage (#15545) | |
| 724 | 35a42edac84690990a75726898d975cd08d220c0 | fec7911f8febb22c27ce1acb12441800da24cc06 | 2025-09-01T14:01:10-05:00 | Jeff Bolz | vulkan: add missing clamps in new mul_mat_id paths (#15702) | |
| 725 | fec7911f8febb22c27ce1acb12441800da24cc06 | 078ce23ea77988f2fe1a42afb18d58bc084d55fa | 2025-09-01T20:58:35+02:00 | Ruben Ortlam | vulkan: disable large mmv subgroups on older Nvidia GPUs (#15717) | |
| 726 | 078ce23ea77988f2fe1a42afb18d58bc084d55fa | a0c2b207c596d1092a08615de61ab56a7d63515f | 2025-09-02T03:13:49+09:00 | s-goto-11 | ggml: SVE support for exponential functions (#15145) | |
| 727 | a0c2b207c596d1092a08615de61ab56a7d63515f | 4b20d8b7e31718d3fe8b4f12d220a9d19e4f1997 | 2025-09-01T23:43:16+05:30 | Prashant Vithule | ggml: aarch64: Implement SVE F16 kernels for vector functions (#15115) | |
| 728 | 4b20d8b7e31718d3fe8b4f12d220a9d19e4f1997 | 02c1813517412f3e00aa6ca7c0273fea64edb492 | 2025-09-01T23:53:31+08:00 | Jie Fu (傅杰) | convert : remove redundant code (#15708) | |
| 729 | 02c1813517412f3e00aa6ca7c0273fea64edb492 | 77dee9de97be75b7143a213bc48893e0c0b29af7 | 2025-09-01T16:19:07+02:00 | Ruben Ortlam | Vulkan: Add Integer Dot Product mul_mat_vec shader for legacy quants (#14903) | |
| 730 | 77dee9de97be75b7143a213bc48893e0c0b29af7 | 4795c91c32fec7165a1364763d4d4f0c93abf933 | 2025-09-01T14:28:49+02:00 | Daniel Bevenius | ggml : WebGPU add TRANSPOSE and RESHAPE to supported ops (#15695) | |
| 731 | 4795c91c32fec7165a1364763d4d4f0c93abf933 | b66df9d9c942254d03209186ef24ed7c994a576e | 2025-09-01T15:34:59+08:00 | Jie Fu (傅杰) | docs : add Hunyuan to models section (#15707) | |
| 732 | b66df9d9c942254d03209186ef24ed7c994a576e | b9382c3877c6067feccf182efe9449a2d1cb24c7 | 2025-09-01T06:55:06+05:30 | Akarshan Biswas | CUDA: fix build error from ambiguous __half conversions in conv2d (#15690) | |
| 733 | b9382c3877c6067feccf182efe9449a2d1cb24c7 | 3dc7397a2799bdc07bccf637ab7ae5a1e786d1a4 | 2025-09-01T08:57:23+08:00 | hipudding | CANN: Optimize MUL_MAT_ID (#15658) | |
| 734 | 3dc7397a2799bdc07bccf637ab7ae5a1e786d1a4 | e92d53b29e393fc4c0f9f1f7c3fe651be8d36faa | 2025-09-01T08:57:00+08:00 | hipudding | CANN: fix RoPE cache issue on multi-device (#15629) | |
| 735 | e92d53b29e393fc4c0f9f1f7c3fe651be8d36faa | 0d161f021aa33ec0e90cce96f5d1a88925557327 | 2025-08-31T20:41:02+03:00 | Georgi Gerganov | sampling : optimize samplers by reusing bucket sort (#15665) | |
| 736 | 0d161f021aa33ec0e90cce96f5d1a88925557327 | 4efd5a83163ff383285b3a4c2106feabf5c69557 | 2025-08-31T20:11:58+03:00 | Georgi Gerganov | server : enable /slots by default and make it secure (#15630) | |
| 737 | 4efd5a83163ff383285b3a4c2106feabf5c69557 | 274966226f87f301ac132da898280ca3142b60e5 | 2025-08-31T19:43:30+03:00 | Georgi Gerganov | metal : fix checks for available FA kernels (#15700) | |
| 738 | 274966226f87f301ac132da898280ca3142b60e5 | 9777032dccd67bdc7785aeab7497014a8be8dacc | 2025-08-31T08:47:05-07:00 | Diego Devesa | llama : fix fattn reserve call n_seqs parameter (#15699) | |
| 739 | 9777032dccd67bdc7785aeab7497014a8be8dacc | 7d3c9f2b217acf0ce5db81ae83d3f375f49ab2c7 | 2025-08-31T06:49:03-07:00 | Diego Devesa | llama : separate compute buffer reserve from fattn check (#15696) | |
| 740 | 7d3c9f2b217acf0ce5db81ae83d3f375f49ab2c7 | bbbf5ecccb35286521f735239d499eec4279a840 | 2025-08-31T15:30:20+02:00 | Sigbjørn Skjæret | ci : explicitly set fa off or on (#15692) | |
| 741 | bbbf5ecccb35286521f735239d499eec4279a840 | c37052ab4d6d1ae73c0e90bc6e560cc6409e1311 | 2025-08-31T03:13:27-05:00 | Jeff Bolz | vulkan: handle large sizes for get_rows (#15686) | |
| 742 | c37052ab4d6d1ae73c0e90bc6e560cc6409e1311 | 5c16b9c87d840e4d5d55fa83c732c6b693346f40 | 2025-08-31T02:06:43-05:00 | Jeff Bolz | vulkan: mul_mat_id coopmat2 optimizations (#15546) | |
| 743 | 5c16b9c87d840e4d5d55fa83c732c6b693346f40 | b97c9edc59d4a1b4069991aa670411190f4f3a3e | 2025-08-31T08:46:42+02:00 | Daniel Bevenius | vulkan : remove unused portability_enumeration_ext variable (#15679) | |
| 744 | b97c9edc59d4a1b4069991aa670411190f4f3a3e | 94e82c7eadeb8fff0db4bfd1ab6d8cf65fa6f2e0 | 2025-08-31T01:30:54-05:00 | Jeff Bolz | vulkan: Allow fallback to sysmem memory when vidmem is full (#15649) | |
| 745 | 94e82c7eadeb8fff0db4bfd1ab6d8cf65fa6f2e0 | 4d74393bcc956ccd7df68a6a06d1a0575cfa712c | 2025-08-31T01:27:57-05:00 | Jeff Bolz | vulkan: clamp matmul and FA results to the max finite value (#15652) | |
| 746 | 4d74393bcc956ccd7df68a6a06d1a0575cfa712c | dd892555b0681b7f56d38780f6fdfe00a195160f | 2025-08-30T18:03:42+02:00 | Charles Xu | ggml: update kleidiai to v1.13.0 (#15663) | |
| 747 | dd892555b0681b7f56d38780f6fdfe00a195160f | e81b8e4b7f5ab870836fad26d154a7507b341b36 | 2025-08-30T08:51:28-07:00 | Diego Devesa | Update build.md to remove MSVC arm64 notes (#15684) | |
| 748 | e81b8e4b7f5ab870836fad26d154a7507b341b36 | 38ad381f9f5d4dd368a96d844fb19cf501ed9d22 | 2025-08-30T16:32:10+02:00 | Johannes Gäßler | llama: use FA + max. GPU layers by default (#15434) | |
| 749 | 38ad381f9f5d4dd368a96d844fb19cf501ed9d22 | 696fccf354e9dbdfbce135bc40b44c9dcc64dda9 | 2025-08-30T16:20:32+02:00 | Johannes Gäßler | CUDA: use FP32 arithmetic for conv2d (#15683) | |
| 750 | 696fccf354e9dbdfbce135bc40b44c9dcc64dda9 | ef476916bba4b44f44be0c98babc1cb025968e75 | 2025-08-30T04:11:22-05:00 | Jeff Bolz | vulkan: Skip syncing for prealloc_y when it is reused (#15544) | |
| 751 | ef476916bba4b44f44be0c98babc1cb025968e75 | d82f6aa34a216f5df1945cdfe121ba5e6cd80be0 | 2025-08-30T10:18:35+08:00 | Chenguang Li | CANN: FIx compiler warnings (#15661) | |
| 752 | d82f6aa34a216f5df1945cdfe121ba5e6cd80be0 | 3d16b29c3bb1ec816ac0e782f20d169097063919 | 2025-08-30T00:12:53+02:00 | Sergey Alirzaev | server : removed obsolete doc (#15670) | |
| 753 | 792b44f2ed9668cce7f267ff0ae4950ed9b4a5de | 81017865ee444cf49ce0136f2be1e41a0270ff91 | 2025-08-29T19:25:40+02:00 | ExtReMLapin | server : add documentation for `parallel_tool_calls` param (#15647) | |
| 754 | 81017865ee444cf49ce0136f2be1e41a0270ff91 | 60e5eee31f1af9bb579ac45380e3857d610020b9 | 2025-08-29T21:30:06+08:00 | Aman Gupta | CUDA: fix bug in rms_norm fusion (#15660) | |
| 755 | 60e5eee31f1af9bb579ac45380e3857d610020b9 | 009b709d6efd24820ac67765ed339a72dc797814 | 2025-08-29T14:53:41+02:00 | Piotr Wilkin (ilintar) | chat : Seed OSS thinking + tool call support (#15552) | |
| 756 | 009b709d6efd24820ac67765ed339a72dc797814 | e8d99dd0b67f2ecc1e45fca8074a3a18c3e036d2 | 2025-08-29T11:35:58+08:00 | Aman Gupta | CUDA: fuse adds, fuse add with rms norm (#15631) | |
| 757 | e8d99dd0b67f2ecc1e45fca8074a3a18c3e036d2 | a8bca68f727844e7dcf24a956003b3c2039ea563 | 2025-08-28T18:39:31-06:00 | Gabe Goodhart | nvidia nemotron nano v2 (nemotronh) (#15507) | |
| 758 | a8bca68f727844e7dcf24a956003b3c2039ea563 | c97dc093912ad014f6d22743ede0d4d7fd82365a | 2025-08-28T15:27:36-05:00 | Gabe Goodhart | fix: Compute the full sum in llama-eval-callback, not just the sum of printed values (#15637) | |
| 759 | c97dc093912ad014f6d22743ede0d4d7fd82365a | 6c442f42ff25564a0cd6b1435d9abc1b0178eac5 | 2025-08-29T00:03:03+05:30 | mnehete32 | CUDA: add conv2d (#15635) | |
| 760 | 6c442f42ff25564a0cd6b1435d9abc1b0178eac5 | 73804145ab6c06888e314046abf08f66a0133679 | 2025-08-28T22:39:27+08:00 | Aaron Teo | ggml-cpu: fix invalid hsum build in debug s390x (#15634) | |
| 761 | 73804145ab6c06888e314046abf08f66a0133679 | c8d0d14e77c3c45df5cbbddde9c2b4c377ec4e7a | 2025-08-28T10:11:36-04:00 | compilade | ggml : fix SSM_SCAN for n_groups > 1 (#15625) | |
| 762 | c8d0d14e77c3c45df5cbbddde9c2b4c377ec4e7a | 84ab83cc0b4b7e769451ee48e4c7d1acef91ef25 | 2025-08-28T17:09:05+03:00 | Georgi Gerganov | kv-cache : fix find_slot to not search for continuous slot (#15638) | |
| 763 | 84ab83cc0b4b7e769451ee48e4c7d1acef91ef25 | 55042b3692cb1467c9ee15c62c4a9fbf180f89e3 | 2025-08-28T15:49:50+02:00 | Sigbjørn Skjæret | model : jina-embeddings-v3 support (#13693) | |
| 764 | 55042b3692cb1467c9ee15c62c4a9fbf180f89e3 | 8a4280ce431da6b33e5a95ae1fd61472c8c3f8cc | 2025-08-28T19:23:22+08:00 | Aman Gupta | scripts: add sqlite3 check for compare-commits.sh (#15633) | |
| 765 | 8a4280ce431da6b33e5a95ae1fd61472c8c3f8cc | 64387f6e95434b393ac3df285864692b7fd9c4d2 | 2025-08-28T12:27:02+03:00 | Georgi Gerganov | kv-cache : remove LLAMA_SET_ROWS checks (#15505) | |
| 766 | 64387f6e95434b393ac3df285864692b7fd9c4d2 | d35a1e8c41f747548775225973a99507896a8c61 | 2025-08-28T10:56:41+02:00 | Aleksei Nikiforov | gguf-py: byteswapping improvements (#12851) | |
| 767 | d35a1e8c41f747548775225973a99507896a8c61 | 46d9caa27a0281150e8cf082308c0f9e7576ebe5 | 2025-08-28T01:48:20-06:00 | Joshua Cogliati | cli : change log to warning to explain reason for stopping (#15604) | |
| 768 | 46d9caa27a0281150e8cf082308c0f9e7576ebe5 | 5a0e3ef6f00c658fbae53797f02d5a360ebf8fec | 2025-08-28T09:26:48+02:00 | Daniel Bevenius | model-conversion : add mmproj conversion target (#15628) | |
| 769 | 5a0e3ef6f00c658fbae53797f02d5a360ebf8fec | fbef0fad7a7c765939f6c9e322fa05cd52cf0c15 | 2025-08-27T17:32:36-07:00 | matiaslin | cuda: Add cublasLt_static linking when GGML_STATIC is enabled (#15622) | |
| 770 | fbef0fad7a7c765939f6c9e322fa05cd52cf0c15 | da54f9f1a2db07aaae390024ac466e7867685d94 | 2025-08-27T20:58:09+02:00 | Johannes Gäßler | server: higher timeout for tests (#15621) | |
| 771 | da54f9f1a2db07aaae390024ac466e7867685d94 | 47373271f971aa5a0a6462b286f4a7b5bd4ba644 | 2025-08-27T15:48:07+03:00 | Georgi Gerganov | presets : add qwen3-30B-a3b FIM (#15616) | |
| 772 | 47373271f971aa5a0a6462b286f4a7b5bd4ba644 | 1bded5a3b3376b2aa3ba2f11ade5910c550f354b | 2025-08-27T13:58:54+02:00 | uvos | HIP: Enable support for ggml_backend_cuda_register_host_buffer (#15615) | |
| 773 | 1bded5a3b3376b2aa3ba2f11ade5910c550f354b | 1e7489745a74996fc36e8fd05b73aa16bc184e0c | 2025-08-27T13:55:12+03:00 | Georgi Gerganov | kv-cache : better estimate of n_kv for multi-sequence batches (#15610) | |
| 774 | 1e7489745a74996fc36e8fd05b73aa16bc184e0c | 1cf123a343ab7ca5586aacb9e0a1d2de7fe33be4 | 2025-08-27T17:21:41+08:00 | Chenguang Li | CANN: refactor mask handling and improve performance in FA (#15561) | |
| 775 | 1cf123a343ab7ca5586aacb9e0a1d2de7fe33be4 | fcca2182a18c786c57d02d1d1927204b133f1fdc | 2025-08-27T16:44:22+08:00 | xctan | ggml-cpu : add basic RVV support for vector f32 ops (#15057) | |
| 776 | fcca2182a18c786c57d02d1d1927204b133f1fdc | 86076f92de1a547ef87c304facca3b4b9fae6c21 | 2025-08-27T10:28:53+02:00 | Daniel Bevenius | common : add -m to bash completion for --model [no ci] (#15591) | |
| 777 | 86076f92de1a547ef87c304facca3b4b9fae6c21 | bcbddcd54f0d5c22eab180831fdea6484107112f | 2025-08-27T08:36:05+02:00 | rmatif | OpenCL: add fused group_norm/norm, mul, add (#15314) | |
| 778 | 87932ec016f0ec81e98a13ce5212851f8c12458a | 0115cfb7c1dec0753aecb34f3af4338bf9de8eeb | 2025-08-27T14:29:18+08:00 | Yunzhe Jia | fix merge problem | |
| 779 | bcbddcd54f0d5c22eab180831fdea6484107112f | 8b696861364360770e9f61a3422d32941a477824 | 2025-08-26T13:14:38-07:00 | Diego Devesa | tests : fix test-opt with GGML_BACKEND_DL (#15599) | |
| 780 | 8b696861364360770e9f61a3422d32941a477824 | 8ce3ff1d91245e158d98d8062cd64b0dd98dcfe3 | 2025-08-27T00:27:49+05:30 | Akarshan Biswas | SYCL: fix rms_norm_mul_add for tensor dim not a multiple of sg_size (#15592) | |
| 781 | 8ce3ff1d91245e158d98d8062cd64b0dd98dcfe3 | 44b1efa41acd4df3f56ee0e46f898135ecd1a054 | 2025-08-26T20:05:50+02:00 | fidoriel | mtmd : fix mtmd ios build (#15579) | |
| 782 | 44b1efa41acd4df3f56ee0e46f898135ecd1a054 | a6a58d64785cb458ed9de52f391aa38142d38d64 | 2025-08-26T15:42:49Z | Eve | tests: add performance test for mul mat id (#15543) | |
| 783 | a6a58d64785cb458ed9de52f391aa38142d38d64 | 0373486dbc0dccbdcb3b5fdd65759d88cec06196 | 2025-08-26T21:05:25+05:30 | shalinib-ibm | llamafile: PowerPC Sgemm Optimization (#15558) | |
| 784 | 0373486dbc0dccbdcb3b5fdd65759d88cec06196 | 62cef26ac5b6b7acb635d3dc963813b43952dc2b | 2025-08-26T17:45:17+03:00 | Georgi Gerganov | graph : fix assert in memory-less build_attn (#15590) | |
| 785 | 62cef26ac5b6b7acb635d3dc963813b43952dc2b | 8f5afa94c4f929da71f560db7c9f38ef6a783d95 | 2025-08-26T16:12:29+02:00 | Daniel Bevenius | model-conversion : add qat-q4 quantization targets (#15588) | |
| 786 | 8f5afa94c4f929da71f560db7c9f38ef6a783d95 | b3964c1e890ef8c947afb36a5124ce6fcb2136d4 | 2025-08-26T16:01:20+02:00 | Johannes Gäßler | CUDA: return -1 for nonexistent compiled arch (#15587) | |
| 787 | b3964c1e890ef8c947afb36a5124ce6fcb2136d4 | 79a546220c719e6a70627b243a478ab8d84dc9e1 | 2025-08-26T14:22:14+03:00 | Georgi Gerganov | metal : optimize FA vec for large sequences and BS <= 8 (#15566) | |
| 788 | 79a546220c719e6a70627b243a478ab8d84dc9e1 | 85cc1ae998e4898d9fa992cb9b8620338cee97bf | 2025-08-26T12:54:19+02:00 | Xuan-Son Nguyen | mtmd : support Kimi VL model (#15458) | |
| 789 | 85cc1ae998e4898d9fa992cb9b8620338cee97bf | 1d8d83deaa48d4a5491820d58ff1c0d8cf9d196c | 2025-08-26T12:47:00+03:00 | Georgi Gerganov | context : print graph stats for memory-less contexts (#15586) | |
| 790 | 1d8d83deaa48d4a5491820d58ff1c0d8cf9d196c | c4e9239064a564de7b94ee2b401ae907235a8fca | 2025-08-26T12:46:15+03:00 | Georgi Gerganov | metal : improve `MUL_MAT_ID` (#15541) | |
| 791 | c4e9239064a564de7b94ee2b401ae907235a8fca | 39842a7f73012eb42816ca4f26411782bd3da7c5 | 2025-08-26T16:05:55+08:00 | tc-mb | model : support MiniCPM-V 4.5 (#15575) | |
| 792 | 0115cfb7c1dec0753aecb34f3af4338bf9de8eeb | 3a617cb18121a85eed17ac5585788810c5d9c1e0 0d5a470223fc90b6b6807921d68011ff06ae7f9e | 2025-08-26T15:19:56+08:00 | Yunzhe Jia | Merge branch 'master' into dev | |
| 793 | 39842a7f73012eb42816ca4f26411782bd3da7c5 | 0fd90db5858e325358a5fbdaa4e327ee2a79d0d4 | 2025-08-26T09:08:08+02:00 | Sigbjørn Skjæret | gguf-py : remove erroneous FFN_GATE entry (#15583) | |
| 794 | 0fd90db5858e325358a5fbdaa4e327ee2a79d0d4 | 4c37636b3ea96f2574eeb7668b93fcc0e64b05dd | 2025-08-26T08:51:43+02:00 | Sigbjørn Skjæret | metal : remove contiguous assertion for src0 in IM2COL (#15577) | |
| 795 | 4c37636b3ea96f2574eeb7668b93fcc0e64b05dd | 34bdbbd7c2b70b848718e95bc48010f6aecd2816 | 2025-08-26T13:15:33+07:00 | Yoshi_likes_e4 | Add a warning for special devices (#15563) | |
| 796 | 34bdbbd7c2b70b848718e95bc48010f6aecd2816 | 74f52f77f28a5ad6d6075231afcb8d1ad763ca32 | 2025-08-25T23:42:44-05:00 | Jeff Bolz | vulkan: Remove splitting for mul_mat_id (#15568) | |
| 797 | 74f52f77f28a5ad6d6075231afcb8d1ad763ca32 | f7207b0415986dd7f48447149da7de3a82338276 | 2025-08-26T05:21:22+08:00 | Qeeweew | CUDA: Accelerate MXFP4 table lookup using `__byte_perm` (#15451) | |
| 798 | f7207b0415986dd7f48447149da7de3a82338276 | 4d917cd4f64cc37744e76d084659475819fb0728 | 2025-08-25T14:18:09-07:00 | lhez | opencl: fix support ops condition for `rms_norm` (#15560) | |
| 799 | 4d917cd4f64cc37744e76d084659475819fb0728 | 886b97a5d693550c2da470c091d9d27bf38398f8 | 2025-08-25T17:56:59+02:00 | Ruben Ortlam | vulkan: fix min subgroup 16 condition for mmid subgroup optimization (#15565) | |
| 800 | 886b97a5d693550c2da470c091d9d27bf38398f8 | 111f8d06f0b9169059779a35f655b343242ccbb6 | 2025-08-25T10:47:16-05:00 | Jeff Bolz | tests: Generate unique input values for count_equal (#15487) | |
| 801 | 111f8d06f0b9169059779a35f655b343242ccbb6 | 5eff6ec9b1220b599a43b594b1110487ab6aca08 | 2025-08-25T11:27:34-04:00 | Ihar Hrachyshka | metal: fix regression when no metal devices are present (#15531) | |
| 802 | 5eff6ec9b1220b599a43b594b1110487ab6aca08 | dfd9b5f6c7586c88588f06a644c131bec071a0a1 | 2025-08-25T17:23:40+02:00 | Johannes Gäßler | CUDA: MoE helper in device code, better tile sizes (#15525) | |
| 803 | dfd9b5f6c7586c88588f06a644c131bec071a0a1 | 5a6bc6b1a6cb665a944426c2055794950e524bf5 | 2025-08-25T15:00:43+02:00 | Daniel Bevenius | model-conversion : set pooling type to none in logits.cpp (#15564) | |
| 804 | 5a6bc6b1a6cb665a944426c2055794950e524bf5 | 6b64f74b55628e4193f4fb00313f07dbd8556528 | 2025-08-25T14:25:25+02:00 | Daniel Bevenius | model-conversion : add model card template for embeddings [no ci] (#15557) | |
| 805 | 6b64f74b55628e4193f4fb00313f07dbd8556528 | 0d5a470223fc90b6b6807921d68011ff06ae7f9e | 2025-08-25T13:56:43+03:00 | Georgi Gerganov | batched-bench : fix unified KV cache handling + pp timing (#15562) | |
| 806 | 3a617cb18121a85eed17ac5585788810c5d9c1e0 | c42293848dd9f03eba9a6c1b85a600b398f06541 | 2025-08-13T10:58:59+08:00 | Yunzhe Jia | add calrt_decode | |
| 807 | c42293848dd9f03eba9a6c1b85a600b398f06541 | 1cbf442f50a154aac0bf35d7b8b3436a2cdfd6f5 | 2025-08-06T15:46:06+08:00 | Yunzhe Jia | sync with calrt API | |
| 808 | 1cbf442f50a154aac0bf35d7b8b3436a2cdfd6f5 | ba67d6c03fed3193987a4ef13050e6e2a4451df4 | 2025-07-24T15:50:19+08:00 | Yunzhe Jia | 1.sync with calrt prefill,decode,kv_update op 2.add hw pattern untile function | |
| 809 | ba67d6c03fed3193987a4ef13050e6e2a4451df4 | 8f52c6f8abb2ed9ad967cc0bfb90acb073011193 | 2025-06-26T17:42:32+08:00 | Yunzhe Jia | llama-calrt: | infer-op: copy data from output buffer to dst-tensor.data |
| 810 | 8f52c6f8abb2ed9ad967cc0bfb90acb073011193 | d2f325130c4ed77a3dcff2c23a926587fb08e2cc | 2025-06-26T15:10:45+08:00 | Yunzhe Jia | Squashed commit of the following: | |
| 811 | d2f325130c4ed77a3dcff2c23a926587fb08e2cc | 6391ee7ffd97e723dfbdcc32f001e1b95a63cba6 | 2025-06-17T11:53:33+08:00 | Yunzhe Jia | calrt: add input_token in graph; input_token will be copy to calrt_in_buffer | |
| 812 | 6391ee7ffd97e723dfbdcc32f001e1b95a63cba6 | b9850050a5b5147cb2e6720b98ed8c1e8e02eff9 | 2025-06-13T10:58:06+08:00 | Yunzhe Jia | update .gitignore to update cal_test.gguf | |
| 813 | b9850050a5b5147cb2e6720b98ed8c1e8e02eff9 | 933b205c32551848589b8339437d778cb4f2a46d | 2025-06-06T17:25:52+08:00 | Yunzhe Jia | calrt: add call chain for using calrt::infer | |
| 814 | 933b205c32551848589b8339437d778cb4f2a46d | 33fea9a8592fd338abe279b89350a3af2e0ff1f7 | 2025-06-12T17:47:19+08:00 | Yunzhe Jia | gguf-py: add cal_test.py | |
| 815 | 33fea9a8592fd338abe279b89350a3af2e0ff1f7 | 806f05a353d322e97d97e02f910de2b408a8b4ab | 2025-06-06T17:25:52+08:00 | Yunzhe Jia | calrt: add load calbin | |
| 816 | 806f05a353d322e97d97e02f910de2b408a8b4ab | ec9e0301fef6476df83e94842c3b625501c95566 | 2025-05-30T09:45:37+08:00 | Yunzhe Jia | add calrt demo |